Step 5 Preview โมเดล MoE 600B พารามิเตอร์จาก StepFun
StepFun เปิดตัว Step 5 Preview โมเดล MoE 600,000 ล้านพารามิเตอร์ ทำงานแบบ Active 27,000 ล้านพารามิเตอร์ พร้อมรองรับ Context สูงสุด 1 ล้านโทเค็น

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
- Step 5 Preview เป็นโมเดล Mixture-of-Experts ขนาด 600 พันล้านพารามิเตอร์
- เปิดใช้งานจริงประมาณ 27 พันล้านพารามิเตอร์ต่อโทเค็น หรือคิดเป็น 4.5%
- รองรับ Context ยาวถึง 1 ล้านโทเค็นสำหรับงานเอเจนต์ระยะยาว
- กำหนดเปิดตัวชุดน้ำหนักแบบ Open Weights ในวันที่ 15 ตุลาคม 2026
StepFun บริษัทพัฒนาปัญญาประดิษฐ์ ได้ประกาศเปิดตัวโมเดลใหม่ในชื่อ Step 5 Preview ซึ่งออกแบบมาเพื่อรองรับงานเอเจนต์ที่มีความซับซ้อนและใช้ระยะเวลานาน โมเดลนี้ถูกพัฒนาขึ้นด้วยสถาปัตยกรรมแบบ sparse Mixture-of-Experts (MoE) โดยมีพารามิเตอร์รวมทั้งหมดประมาณ 600,000 ล้านพารามิเตอร์ แต่จะเปิดใช้งานจริงหรือ Active เพียงราว 27,000 ล้านพารามิเตอร์ต่อหนึ่งโทเค็นเท่านั้น ซึ่งเทียบเท่ากับสัดส่วนประมาณ 4.5% ของพารามิเตอร์ทั้งหมด
ในด้านโครงสร้างภายใน ทีมวิจัยไม่ได้ใช้วิธีขยายเครือข่ายให้กว้างขึ้น แต่เลือกที่จะซ้อนชั้นประมวลผล Transformer เรียงกันถึง 92 ชั้นในรูปแบบโครงสร้างแบบลึกและแคบ การออกแบบในลักษณะนี้ช่วยเพิ่มเส้นทางสำหรับการอนุมานแบบหลายขั้นตอน ช่วยให้โมเดลสามารถค้นหาข้อมูล รันโค้ด และอ่านค่าผลลัพธ์จากเครื่องมือต่างๆ ได้อย่างมีประสิทธิภาพในช่วงการประมวลผลล่วงหน้าที่มีความยาวมากๆ
กระบวนการฝึกฝนของโมเดลนี้พึ่งพาเทคนิคการเรียนรู้แบบเสริมแรงระยะยาวบนนโยบายปัจจุบัน (on-policy, long-horizon reinforcement learning) นอกจากนี้ ทาง StepFun ยังระบุถึงการใช้งานเทคนิคการจัดเรียงการฝึกและอินเฟอเรนซ์แบบ bit-wise ร่วมกับการทำ routing ของ MoE รวมไปถึงเทคนิคอื่นๆ เช่น MTP-3 speculative decoding, FP8 MoE และการถ่ายโอนแคช KV ซึ่งช่วยเร่งความเร็วแบบ end-to-end สำหรับงานระยะยาวได้มากกว่า 3 เท่า

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
สถาปัตยกรรมแบบ Mixture-of-Experts (MoE) ถือเป็นแนวทางสำคัญในการเพิ่มประสิทธิภาพของโมเดลภาษาขนาดใหญ่ โดยการแบ่งเครือข่ายย่อย (Experts) ออกเป็นส่วนๆ และเลือกเปิดใช้งานเฉพาะส่วนที่จำเป็นต่ออินพุตแต่ละตัว (Active parameters) ทำให้สามารถเพิ่มขนาดพารามิเตอร์รวมของโมเดลให้ใหญ่มากๆ ได้โดยไม่สูญเสียความเร็วในการประมวลผลเทียบเท่ากับการรันโมเดลทึบขนาดเท่ากันทั้งหมด
สำหรับการใช้งานจริง ผู้สนใจสามารถเรียกใช้งานผ่านทาง Hosted API และบนแพลตฟอร์มของ StepFun ได้ทันที ในขณะที่ผู้ที่ต้องการโฮสต์ด้วยตัวเองจะต้องรอการปล่อยชุดน้ำหนักแบบเปิด (Open Weights) ซึ่งทางบริษัทมีกำหนดการปล่อยออกมาในวันที่ 15 ตุลาคม 2026 นี้ โดยคำนวณคร่าวๆ ว่าโมเดลขนาด 600 พันล้านพารามิเตอร์ในรูปแบบ BF16 จะต้องการพื้นที่หน่วยความจำประมาณ 1.2 เทราไบต์ ก่อนที่จะรวมหน่วยความจำสำหรับ KV cache
ที่มา: MarkTechPost
พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้
ความคิดเห็น
แสดงความคิดเห็น