AMD เปิดตัว Instella-MoE-16B-A3B โมเดล Open LLM สถาปัตยกรรม MoE 16 พันล้านพารามิเตอร์
AMD เปิดตัวโมเดลภาษาขนาดใหญ่รุ่นใหม่ Instella-MoE-16B-A3B แบบโอเพนซอร์ส ชูจุดเด่น 2.8 พันล้านพารามิเตอร์ทำงานจริง พร้อมเทคนิคเร่งความเร็วด้วย GPU Instinct

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
- Instella-MoE เป็นโมเดล Mixture-of-Experts ขนาด 16 พันล้านพารามิเตอร์ ทำงานจริง 2.8 พันล้านพารามิเตอร์
- ใช้สถาปัตยกรรมพิเศษ Gated MLA และ FarSkip-Collective ช่วยเร่งความเร็วการประมวลผล
- ชุดข้อมูลฝึกอบรมครอบคลุม 7.1 ล้านล้านโทเค็น และขยายความยาวบริบทได้ถึง 64,000 โทเค็น
- ตัวโมเดลพื้นฐานทำคะแนนเฉลี่ย 76.7 สูงสุดในกลุ่มโมเดลแบบเปิดทั้งหมด
บริษัท AMD ได้เปิดตัว Instella-MoE-16B-A3B ซึ่งเป็นโมเดลภาษาขนาดใหญ่ (LLM) แบบ Mixture-of-Experts (MoE) ที่เปิดให้ใช้งานแบบโอเพนซอร์สเต็มรูปแบบ โดยโมเดลนี้ผ่านการฝึกอบรมบนฮาร์ดแวร์ GPU Instinct ของ AMD ตัวโมเดลมาพร้อมพารามิเตอร์รวม 16 พันล้านพารามิเตอร์ แต่จะใช้งานจริงเพียง 2.8 พันล้านพารามิเตอร์ต่อการประมวลผลหนึ่งครั้ง
ในด้านลิขสิทธิ์ น้ำหนักของโมเดล (weights) จะถูกเผยแพร่ภายใต้ใบอนุญาต ResearchRAIL สำหรับการใช้งานด้านการวิจัยและวิชาการเท่านั้น จึงไม่ใช่โมเดลสำหรับนำไปใช้งานเชิงพาณิชย์ได้ทันที อย่างไรก็ตาม โค้ดเบสสำหรับการฝึกอบรม (training codebase) นั้นใช้ใบอนุญาตแบบ MIT ซึ่งเปิดกว้างให้นำกลับมาใช้ประโยชน์ได้มากกว่า

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
โครงสร้างภายในของ Instella-MoE เป็นแบบ decoder-only ประกอบด้วย 27 เลเยอร์ ขนาด hidden size ที่ 2048, 16 ออตเทนชันเฮด (attention heads) และขนาดคำศัพท์ (vocabulary) 128,896 โทเค็น แต่ละเลเยอร์ของ MoE จะใช้ shared experts จำนวน 2 ตัว ร่วมกับ routed experts อีก 6 ตัวที่ถูกคัดเลือกมาจากทั้งหมด 64 ตัว พร้อมทั้งใช้เป้าหมายการทำนายแบบ Multi-Token Prediction ในช่วง pre-training และ mid-training
สิ่งที่น่าสนใจคือการตัดสินใจเลือกใช้โครงสร้างสำคัญ 2 ส่วน ได้แก่ Gated MLA ซึ่งเพิ่มเกตเอาต์พุตที่ผ่านการเรียนรู้เข้าไปใน Multi-head Latent Attention ช่วยให้การประมวลผลแม่นยำขึ้น และ FarSkip-Collective ที่ส่งผ่าน activation ที่ล้าสมัยหรือไม่สมบูรณ์เข้าสู่เลเยอร์ MoE และ attention เพื่อช่วยซ้อนทับการสื่อสารแบบขนานของ expert เข้ากับการคำนวณ ส่งผลให้ AMD รายงานว่ามีความเร็วในการ pre-training เพิ่มขึ้น 12.7% และลดเวลา time to first token ลงได้สูงสุด 39.2% เมื่อให้บริการด้วยระบบ expert parallelism
สถาปัตยกรรม Mixture-of-Experts (MoE) ถือเป็นแนวทางสำคัญในการพัฒนาโมเดลภาษาขนาดใหญ่ยุคใหม่ เพราะช่วยให้โมเดลมีขนาดพารามิเตอร์รวมสูงเพื่อเก็บความรู้ได้มาก แต่ใช้ทรัพยากรการประมวลผลจริงน้อยลงในแต่ละขั้นตอน (Active Parameters ต่ำ) การที่ AMD พัฒนาโมเดลนี้พร้อมปรับแต่งฮาร์ดแวร์ Instinct ควบคู่กัน สะท้อนถึงความพยายามเจาะตลาดโครงสร้างพื้นฐาน AI ที่ต้องการทั้งประสิทธิภาพและความคุ้มค่าในการประมวลผลระดับองค์กร
กระบวนการฝึกอบรมเริ่มต้นด้วย pre-training บนชุดข้อมูลขนาด 7.1 ล้านล้านโทเค็นจากคลังข้อมูลเปิด เช่น Nemotron-CC-v2, MegaMath, FineMath, RefineCode และ TxT360 ตามด้วย mid-training และการขยายหน้าต่างบริบทจาก 4,000 ไปจนถึง 64,000 โทเค็นด้วยเทคนิค YaRN
ในส่วนของการทดสอบประสิทธิภาพ โมเดลพื้นฐานทำคะแนนเฉลี่ยได้ 76.7 ซึ่งถือว่าสูงที่สุดในกลุ่มโมเดลแบบเปิดทั้งหมด เหนือกว่า Moonlight-16B-A3B (76.2) และ OLMo-3-7B (70.1) รวมถึงทำคะแนนบน WinoGrande ได้ 86.5 และ HumanEval+ ที่ 65.7
ที่มา: MarkTechPost
พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้
ความคิดเห็น
แสดงความคิดเห็น