VIDRAFT POCKET-Darwin-180B-GGUF: โมเดล MoE บนแล็ปท็อป
VIDRAFT เปิดตัว POCKET-Darwin-180B-GGUF โมเดล MoE 180 พันล้านพารามิเตอร์ที่บีบอัดเหลือ 4-bit ให้รันบนแล็ปท็อปเกมing ที่มี RAM 32GB และ VRAM 8GB ได้

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
- VIDRAFT เปิดตัว POCKET-Darwin-180B-GGUF โมเดล MoE ขนาด 180 พันล้านพารามิเตอร์
- บีบอัดด้วยการทำ quantization 4-bit ลดขนาดจัดเก็บจาก 360GB เหลือ 111GB
- ใช้เทคนิค llama.cpp SSD streaming เพื่อดึงน้ำหนักโมเดลเฉพาะส่วนที่จำเป็นต่อ token นั้น
- ทำงานบนฮาร์ดแวร์ผู้บริโภค เช่น แล็ปท็อปเกมมิ่งที่มี RAM 32GB และ VRAM 8GB
วงการปัญญาประดิษฐ์ต้องฮือฮาอีกครั้งเมื่อ VIDRAFT ได้ปล่อยโมเดล POCKET-Darwin-180B-GGUF ซึ่งเป็นรุ่นที่ถูกบีบอัดและปรับแต่งให้อยู่ในรูปแบบ GGUF แบบ 4-bit โดยต่อยอดมาจากรากฐานของโมเดล Darwin-180B-RSI ที่สร้างขึ้นบนโครงสร้าง Qwen3.8-Flash-Next ต้นฉบับเดิมนั้นมีขนาดใหญ่ถึง 360GB ในความแม่นยำระดับ BF16 ซึ่งโดยปกติแล้วต้องพึ่งพาเซิร์ฟเวอร์หลายการ์ดจอในการประมวลผล แต่เวอร์ชัน POCKET นี้ถูกออกแบบมาเพื่อแก้ปัญหาข้อจำกัดด้านฮาร์ดแวร์โดยเฉพาะตามกลยุทธ์ RSI สำหรับความสามารถและ POCKET สำหรับการนำไปใช้งานจริง
หัวใจสำคัญที่ทำให้โมเดลขนาดมหึมานี้สามารถย่อส่วนลงมาทำงานบนเครื่องคอมพิวเตอร์ทั่วไปได้ มาจากการผสาน 3 เทคนิคหลักเข้าด้วยกัน ได้แก่ สถาปัตยกรรม Sparse Mixture-of-Experts (MoE) การทำ 4-bit quantization และระบบสตรีมมิ่งน้ำหนักผ่าน SSD ด้วย llama.cpp โมเดลรุ่นนี้ประกอบด้วยเครือข่ายย่อยหรือ expert ทั้งหมด 512 ชุด แต่ในแต่ละ token จะมีการเรียกใช้งาน expert เพียงแค่ 10 ชุดเท่านั้น ส่งผลให้ภาระการประมวลผลจริงเทียบเท่ากับโมเดลที่มีพารามิเตอร์แอคทีฟเพียงประมาณ 3 พันล้านพารามิเตอร์เท่านั้น แม้ว่าจำนวนพารามิเตอร์รวมทั้งหมดจะสูงถึง 180 พันล้านก็ตาม

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
ในด้านของการจัดเก็บข้อมูล การแปลงน้ำหนักจาก BF16 เป็น 4-bit integer ช่วยลดพื้นที่จัดเก็บในดิสก์จาก 360GB ลงเหลือเพียง 111GB เท่านั้น โดยที่โครงสร้างการจัดเส้นทางของ MoE ยังคงถูกรักษาไว้ครบถ้วน นอกจากนี้ระบบยังใช้ความสามารถของ llama.cpp ในการสตรีมน้ำหนักโมเดลจาก SSD ตามความต้องการ แทนที่จะโหลดข้อมูลทั้งหมด 111GB เข้าสู่หน่วยความจำหลักในคราวเดียว ทำให้ SSD ทำหน้าที่เสมือนเป็นส่วนขยายของหน่วยความจำ ซึ่งเป็นกุญแจสำคัญที่ทำให้การกำหนดค่าฮาร์ดแวร์ระดับแล็ปท็อปเกมมิ่งที่มี VRAM 8GB และ RAM 32GB สามารถใช้งานโมเดลนี้ได้สำเร็จ
ทาง VIDRAFT ได้เผยแพร่ผลการทดสอบความแม่นยำของตนเองผ่านชุดคำถาม MMLU-Pro จำนวน 2,000 ข้อ ซึ่งพบว่าไม่มีการลดลงของความแม่นยำที่วัดผลได้ภายใต้ระเบียบวิธีประเมินของพวกเขาเอง อย่างไรก็ตามผลลัพธ์ดังกล่าวเป็นการรายงานจากผู้พัฒนาเอง และการทดสอบอิสระยังคงเป็นสิ่งที่แนะนำเสมอสำหรับกรณีการใช้งานจริง โมเดลตัวนี้เปิดให้ใช้งานสาธารณะแล้วบน Hugging Face และ ModelScope ในรูปแบบ GGUF โดยผู้ใช้จำเป็นต้องมีบิวด์ llama.cpp เวอร์ชันล่าสุดและพื้นที่ว่างในเครื่องประมาณ 111GB พร้อมทั้งคำสั่งดาวน์โหลดผ่าน Hugging Face CLI
การนำโมเดลขนาดใหญ่ระดับ 180 พันล้านพารามิเตอร์มารันบนฮาร์ดแวร์ระดับคอนซูเมอร์ถือเป็นก้าวสำคัญที่สะท้อนทิศทางของ Edge AI ในอนาคต การผสมผสานระหว่าง Sparse MoE และเทคนิคการดึงข้อมูลจากดิสก์ทีละส่วน (Demand-paged weight streaming) ช่วยปลดล็อกข้อจำกัดด้านงบประมาณฮาร์ดแวร์สำหรับองค์กรที่ต้องการความเป็นส่วนตัวของข้อมูลขั้นสูงสุดโดยไม่ต้องพึ่งพาระบบคลาวด์ภายนอก
สำหรับผู้ที่สนใจใช้งาน สามารถตรวจสอบชื่อไฟล์ที่แน่นอน ความยาวบริบทที่แนะนำ และเทมเพลตการสนทนาได้จากหน้าโมเดลการ์ดบนแพลตฟอร์ม Hugging Face เพื่อการตั้งค่าธงคำสั่งที่ถูกต้องเหมาะสมที่สุดกับการใช้งานเฉพาะด้านของแต่ละท่าน
ที่มา: Dev.to
พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้
ความคิดเห็น
แสดงความคิดเห็น