ข้ามไปเนื้อหาหลัก

AMD เปิดตัว Instella-MoE-16B-A3B โมเดล Open LLM สถาปัตยกรรม MoE 16 พันล้านพารามิเตอร์

AMD เปิดตัวโมเดลภาษาขนาดใหญ่รุ่นใหม่ Instella-MoE-16B-A3B แบบโอเพนซอร์ส ชูจุดเด่น 2.8 พันล้านพารามิเตอร์ทำงานจริง พร้อมเทคนิคเร่งความเร็วด้วย GPU Instinct

เรียบเรียงโดย AI
Inewgen
02 Aug 2026ที่มา: MarkTechPost3 นาทีอ่าน (0 ครั้ง)อัปเดตล่าสุด 29 Aug 2026
แชร์
AMD เปิดตัว Instella-MoE-16B-A3B โมเดล Open LLM สถาปัตยกรรม MoE 16 พันล้านพารามิเตอร์

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

ขนาดตัวอักษร
  • Instella-MoE เป็นโมเดล Mixture-of-Experts ขนาด 16 พันล้านพารามิเตอร์ ทำงานจริง 2.8 พันล้านพารามิเตอร์
  • ใช้สถาปัตยกรรมพิเศษ Gated MLA และ FarSkip-Collective ช่วยเร่งความเร็วการประมวลผล
  • ชุดข้อมูลฝึกอบรมครอบคลุม 7.1 ล้านล้านโทเค็น และขยายความยาวบริบทได้ถึง 64,000 โทเค็น
  • ตัวโมเดลพื้นฐานทำคะแนนเฉลี่ย 76.7 สูงสุดในกลุ่มโมเดลแบบเปิดทั้งหมด

บริษัท AMD ได้เปิดตัว Instella-MoE-16B-A3B ซึ่งเป็นโมเดลภาษาขนาดใหญ่ (LLM) แบบ Mixture-of-Experts (MoE) ที่เปิดให้ใช้งานแบบโอเพนซอร์สเต็มรูปแบบ โดยโมเดลนี้ผ่านการฝึกอบรมบนฮาร์ดแวร์ GPU Instinct ของ AMD ตัวโมเดลมาพร้อมพารามิเตอร์รวม 16 พันล้านพารามิเตอร์ แต่จะใช้งานจริงเพียง 2.8 พันล้านพารามิเตอร์ต่อการประมวลผลหนึ่งครั้ง

ในด้านลิขสิทธิ์ น้ำหนักของโมเดล (weights) จะถูกเผยแพร่ภายใต้ใบอนุญาต ResearchRAIL สำหรับการใช้งานด้านการวิจัยและวิชาการเท่านั้น จึงไม่ใช่โมเดลสำหรับนำไปใช้งานเชิงพาณิชย์ได้ทันที อย่างไรก็ตาม โค้ดเบสสำหรับการฝึกอบรม (training codebase) นั้นใช้ใบอนุญาตแบบ MIT ซึ่งเปิดกว้างให้นำกลับมาใช้ประโยชน์ได้มากกว่า

Artificial intelligence neural network diagram

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

โครงสร้างภายในของ Instella-MoE เป็นแบบ decoder-only ประกอบด้วย 27 เลเยอร์ ขนาด hidden size ที่ 2048, 16 ออตเทนชันเฮด (attention heads) และขนาดคำศัพท์ (vocabulary) 128,896 โทเค็น แต่ละเลเยอร์ของ MoE จะใช้ shared experts จำนวน 2 ตัว ร่วมกับ routed experts อีก 6 ตัวที่ถูกคัดเลือกมาจากทั้งหมด 64 ตัว พร้อมทั้งใช้เป้าหมายการทำนายแบบ Multi-Token Prediction ในช่วง pre-training และ mid-training

ไม่อยากพลาดข่าวใหม่?

สมัครรับสรุปข่าวสารใหม่ทางอีเมล ไม่บ่อยจนรำคาญ

โฆษณา

12.7%ความเร็ว Pre-training ที่เพิ่มขึ้น
39.2%ลดเวลา Time to First Token

สิ่งที่น่าสนใจคือการตัดสินใจเลือกใช้โครงสร้างสำคัญ 2 ส่วน ได้แก่ Gated MLA ซึ่งเพิ่มเกตเอาต์พุตที่ผ่านการเรียนรู้เข้าไปใน Multi-head Latent Attention ช่วยให้การประมวลผลแม่นยำขึ้น และ FarSkip-Collective ที่ส่งผ่าน activation ที่ล้าสมัยหรือไม่สมบูรณ์เข้าสู่เลเยอร์ MoE และ attention เพื่อช่วยซ้อนทับการสื่อสารแบบขนานของ expert เข้ากับการคำนวณ ส่งผลให้ AMD รายงานว่ามีความเร็วในการ pre-training เพิ่มขึ้น 12.7% และลดเวลา time to first token ลงได้สูงสุด 39.2% เมื่อให้บริการด้วยระบบ expert parallelism

สถาปัตยกรรม Mixture-of-Experts (MoE) ถือเป็นแนวทางสำคัญในการพัฒนาโมเดลภาษาขนาดใหญ่ยุคใหม่ เพราะช่วยให้โมเดลมีขนาดพารามิเตอร์รวมสูงเพื่อเก็บความรู้ได้มาก แต่ใช้ทรัพยากรการประมวลผลจริงน้อยลงในแต่ละขั้นตอน (Active Parameters ต่ำ) การที่ AMD พัฒนาโมเดลนี้พร้อมปรับแต่งฮาร์ดแวร์ Instinct ควบคู่กัน สะท้อนถึงความพยายามเจาะตลาดโครงสร้างพื้นฐาน AI ที่ต้องการทั้งประสิทธิภาพและความคุ้มค่าในการประมวลผลระดับองค์กร

กระบวนการฝึกอบรมเริ่มต้นด้วย pre-training บนชุดข้อมูลขนาด 7.1 ล้านล้านโทเค็นจากคลังข้อมูลเปิด เช่น Nemotron-CC-v2, MegaMath, FineMath, RefineCode และ TxT360 ตามด้วย mid-training และการขยายหน้าต่างบริบทจาก 4,000 ไปจนถึง 64,000 โทเค็นด้วยเทคนิค YaRN

ในส่วนของการทดสอบประสิทธิภาพ โมเดลพื้นฐานทำคะแนนเฉลี่ยได้ 76.7 ซึ่งถือว่าสูงที่สุดในกลุ่มโมเดลแบบเปิดทั้งหมด เหนือกว่า Moonlight-16B-A3B (76.2) และ OLMo-3-7B (70.1) รวมถึงทำคะแนนบน WinoGrande ได้ 86.5 และ HumanEval+ ที่ 65.7

ที่มา: MarkTechPost

ความคิดเห็น

แสดงความคิดเห็น
0/2000

พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้