Thinking Machines Lab เปิดตัว Inkling-Small โมเดล MoE แบบ Open Weights 276B
โมเดลขนาดเล็กแต่มัลติโมเดลสมบูรณ์แบบ รันได้บนฮาร์ดแวร์ประหยัดพลังงาน พร้อมรองรับทั้งข้อความ รูปภาพ และเสียง

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
- Inkling-Small เป็นโมเดล MoE 276B พารามิเตอร์รวม โดยมี Active พารามิเตอร์ 12B
- เวอร์ชัน NVFP4 ต้องการ VRAM เพียง 180 GB รันได้บน B300 เดี่ยวๆ หรือ H200 สองตัว
- รองรับอินพุตหลายรูปแบบทั้งข้อความ ภาพ และเสียง WAV 16 kHz
- เปิดให้ใช้งานผ่าน Tinker และรันไทม์ยอดนิยมอย่าง vLLM และ SGLang
Thinking Machines Lab ได้ฤกษ์เปิดตัวโมเดลปัญญาประดิษฐ์ตัวใหม่ล่าสุดในชื่อ Inkling-Small ซึ่งเป็นโมเดล Multimodal Mixture of Experts (MoE) แบบ Open Weights ที่มีจำนวนพารามิเตอร์รวมสูงถึง 276 พันล้านพารามิเตอร์ แต่ใช้งานพารามิเตอร์จริงต่อโทเค็นเพียง 12 พันล้านพารามิเตอร์เท่านั้น โดยจุดเด่นสำคัญอยู่ที่การจัดการโมเดลผ่านเช็คพอยต์แบบควอนไทเซชัน ช่วยให้องค์กรระดับกลางและสตาร์ทอัพสามารถโฮสต์โมเดลขนาดใหญ่เช่นนี้ได้ด้วยต้นทุนฮาร์ดแวร์ที่เข้าถึงได้ง่ายขึ้นมาก เมื่อเทียบกับโมเดลระดับแนวหน้าทั่วไปในตลาดปัจจุบัน
ในแง่ของความต้องการทรัพยากรฮาร์ดแวร์ เช็คพอยต์แบบ BF16 ดั้งเดิมจำเป็นต้องใช้หน่วยความจำ VRAM รวมกันอย่างน้อย 600 GB ซึ่งเทียบเท่ากับการใช้งานการ์ดจอ NVIDIA B300 จำนวน 4 ตัว หรือ NVIDIA H200 จำนวน 8 ตัว อย่างไรก็ตาม เช็คพอยต์แบบ NVFP4 สามารถลดความต้องการลงมาเหลือเพียง 180 GB เท่านั้น ทำให้สามารถรันแบบ W4A4 บนการ์ดจอ B300 เดี่ยวที่มีสถาปัตยกรรม SM100+ ขึ้นไป หรือรันแบบ W4A16 บนการ์ดจอ H200 จำนวน 2 ตัวได้อย่างราบรื่น นอกจากนี้ตัวโมเดลยังรองรับรันไทม์หลากหลายรูปแบบ อาทิ SGLang, vLLM, TokenSpeed, Unsloth และ Hugging Face

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
สถาปัตยกรรมภายในของ Inkling-Small ประกอบด้วยเลเยอร์ Decoder-only แบบทรานส์ฟอร์เมอร์จำนวน 42 เลเยอร์ ใช้โครงสร้างแบ็คโบน MoE แบบสพาร์ส (Sparse) โดยทุกๆ โทเค็นจะถูกส่งผ่านผู้เชี่ยวชาญ (Experts) จำนวน 6 ตัวจากทั้งหมด 256 ตัว พร้อมด้วยผู้เชี่ยวชาญแบบแชร์ร่วมกันอีก 2 ตัวที่ทำงานทุกโทเค็น ส่วนกลไก Attention ผสมผสานระหว่างเลเยอร์แบบท้องถิ่นและแบบ global เข้าด้วยกัน ตัวโมเดลไม่มี Encoder แยกต่างหากแต่รองรับมัลติโมเดลโดยกำเนิด ภาพถ่ายจะถูกแบ่งเป็นแพตช์ขนาด 40x40 พิกเซลและแปลงผ่าน hMLP สี่เลเยอร์ ส่วนเสียงจะอยู่ในรูป dMel spectrogram ก่อนจะผ่านเลเยอร์ฝังตัวน้ำหนักเบาเพื่อประมวลผลร่วมกับข้อความ
กระบวนการฝึกฝนของ Inkling-Small เริ่มต้นขึ้นหลังจากรุ่นพี่ขนาดใหญ่กว่าเสร็จสิ้น ทำให้ทีมวิจัยสามารถปรับปรุงส่วนผสมของข้อมูล Pre-training และสูตรการเรียนรู้ของเครื่องได้ดียิ่งขึ้น ทีมงานได้ทำการ Post-trained เช็คพอยต์รุ่นก่อนหน้าโดยใช้การกลั่นความรู้แบบ on-policy ร่วมกับรุ่นใหญ่เป็นครูผู้สอน ก่อนจะนำไปสเกลต่อในการทำ Reinforcement Learning สำหรับการเขียนโค้ดต่ออีกสองสัปดาห์เต็ม แม้ผลคะแนนการประเมินในบางด้าน เช่น SimpleQA Verified จะลดลงเหลือ 20.6% และ Tau 3 Banking อยู่ที่ 15.5% แต่คะแนนด้านมัลติโมเดลกลับทำได้ใกล้เคียงกับรุ่นใหญ่ในต้นทุนที่ต่ำกว่ามาก เช่น MMMU Pro ได้ 74.0%, CharXiv RQ ได้ 77.4% และ VoiceBench สูงถึง 90.1%
การเปิดตัว Inkling-Small สะท้อนให้เห็นถึงความพยายามของห้องปฏิบัติการวิจัยในการย่อส่วนโมเดลทรงพลังให้เข้ามาใกล้กลุ่มผู้ใช้งานในระดับองค์กรขนาดกลางและสตาร์ทอัพมากขึ้น การลดขนาด VRAM ให้เหลือเพียง 180 GB ผ่านการทำ Quantization แบบ NVFP4 ถือเป็นก้าวสำคัญที่ช่วยปลดล็อกให้ภาคธุรกิจที่มีข้อจำกัดด้านงบประมาณฮาร์ดแวร์ สามารถเข้าถึงเทคโนโลยี MoE ขนาดใหญ่ระดับหลายแสนล้านพารามิเตอร์ได้บนเซิร์ฟเวอร์การ์ดจอเดี่ยวหรือการ์ดจำนวนน้อยลงอย่างมีนัยสำคัญ
ด้านความปลอดภัยและการพยากรณ์ข้อมูล Inkling-Small ทำคะแนน ForecastBench (ไม่ใช้การค้นหา) ได้ดัชนี Brier ที่ 61.3 ± 0.46 ซึ่งแซงหน้ารุ่นพี่ และในด้านความปลอดภัยทำคะแนน StrongREJECT ได้ 98.4% ทาง Thinking Machines Lab ระบุว่าโมเดลนี้มีความปลอดภัยในระดับมาตรฐาน แต่อย่างไรก็ตามทางห้องปฏิบัติการยังคงแนะนำให้องค์กรที่นำไปใช้งานสำหรับผู้บริโภคทั่วไปควรติดตั้งระบบกลั่นกรองเพิ่มเติม เช่น Llama Guard ไว้ที่ชั้นปลายทางเสมอ ทั้งนี้ โมเดลทั้งสองเวอร์ชันพร้อมให้ใช้งานแล้วบนแพลตฟอร์ม Tinker พร้อมส่วนลดในช่วงเวลาจำกัด
ที่มา: MarkTechPost
พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้
ความคิดเห็น
แสดงความคิดเห็น