ข้ามไปเนื้อหาหลัก

Step 5 Preview โมเดล MoE 600B พารามิเตอร์จาก StepFun

StepFun เปิดตัว Step 5 Preview โมเดล MoE 600,000 ล้านพารามิเตอร์ ทำงานแบบ Active 27,000 ล้านพารามิเตอร์ พร้อมรองรับ Context สูงสุด 1 ล้านโทเค็น

เรียบเรียงโดย AI
Inewgen
สด21 Sep 2026ที่มา: MarkTechPost2 นาทีอ่าน (0 ครั้ง)
แชร์
Step 5 Preview โมเดล MoE 600B พารามิเตอร์จาก StepFun

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

ขนาดตัวอักษร
  • Step 5 Preview เป็นโมเดล Mixture-of-Experts ขนาด 600 พันล้านพารามิเตอร์
  • เปิดใช้งานจริงประมาณ 27 พันล้านพารามิเตอร์ต่อโทเค็น หรือคิดเป็น 4.5%
  • รองรับ Context ยาวถึง 1 ล้านโทเค็นสำหรับงานเอเจนต์ระยะยาว
  • กำหนดเปิดตัวชุดน้ำหนักแบบ Open Weights ในวันที่ 15 ตุลาคม 2026

StepFun บริษัทพัฒนาปัญญาประดิษฐ์ ได้ประกาศเปิดตัวโมเดลใหม่ในชื่อ Step 5 Preview ซึ่งออกแบบมาเพื่อรองรับงานเอเจนต์ที่มีความซับซ้อนและใช้ระยะเวลานาน โมเดลนี้ถูกพัฒนาขึ้นด้วยสถาปัตยกรรมแบบ sparse Mixture-of-Experts (MoE) โดยมีพารามิเตอร์รวมทั้งหมดประมาณ 600,000 ล้านพารามิเตอร์ แต่จะเปิดใช้งานจริงหรือ Active เพียงราว 27,000 ล้านพารามิเตอร์ต่อหนึ่งโทเค็นเท่านั้น ซึ่งเทียบเท่ากับสัดส่วนประมาณ 4.5% ของพารามิเตอร์ทั้งหมด

ในด้านโครงสร้างภายใน ทีมวิจัยไม่ได้ใช้วิธีขยายเครือข่ายให้กว้างขึ้น แต่เลือกที่จะซ้อนชั้นประมวลผล Transformer เรียงกันถึง 92 ชั้นในรูปแบบโครงสร้างแบบลึกและแคบ การออกแบบในลักษณะนี้ช่วยเพิ่มเส้นทางสำหรับการอนุมานแบบหลายขั้นตอน ช่วยให้โมเดลสามารถค้นหาข้อมูล รันโค้ด และอ่านค่าผลลัพธ์จากเครื่องมือต่างๆ ได้อย่างมีประสิทธิภาพในช่วงการประมวลผลล่วงหน้าที่มีความยาวมากๆ

600Bพารามิเตอร์รวม
27Bพารามิเตอร์ Active
1MContext Tokens

กระบวนการฝึกฝนของโมเดลนี้พึ่งพาเทคนิคการเรียนรู้แบบเสริมแรงระยะยาวบนนโยบายปัจจุบัน (on-policy, long-horizon reinforcement learning) นอกจากนี้ ทาง StepFun ยังระบุถึงการใช้งานเทคนิคการจัดเรียงการฝึกและอินเฟอเรนซ์แบบ bit-wise ร่วมกับการทำ routing ของ MoE รวมไปถึงเทคนิคอื่นๆ เช่น MTP-3 speculative decoding, FP8 MoE และการถ่ายโอนแคช KV ซึ่งช่วยเร่งความเร็วแบบ end-to-end สำหรับงานระยะยาวได้มากกว่า 3 เท่า

technology research computer hardware workspace no logo

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

สถาปัตยกรรมแบบ Mixture-of-Experts (MoE) ถือเป็นแนวทางสำคัญในการเพิ่มประสิทธิภาพของโมเดลภาษาขนาดใหญ่ โดยการแบ่งเครือข่ายย่อย (Experts) ออกเป็นส่วนๆ และเลือกเปิดใช้งานเฉพาะส่วนที่จำเป็นต่ออินพุตแต่ละตัว (Active parameters) ทำให้สามารถเพิ่มขนาดพารามิเตอร์รวมของโมเดลให้ใหญ่มากๆ ได้โดยไม่สูญเสียความเร็วในการประมวลผลเทียบเท่ากับการรันโมเดลทึบขนาดเท่ากันทั้งหมด

สำหรับการใช้งานจริง ผู้สนใจสามารถเรียกใช้งานผ่านทาง Hosted API และบนแพลตฟอร์มของ StepFun ได้ทันที ในขณะที่ผู้ที่ต้องการโฮสต์ด้วยตัวเองจะต้องรอการปล่อยชุดน้ำหนักแบบเปิด (Open Weights) ซึ่งทางบริษัทมีกำหนดการปล่อยออกมาในวันที่ 15 ตุลาคม 2026 นี้ โดยคำนวณคร่าวๆ ว่าโมเดลขนาด 600 พันล้านพารามิเตอร์ในรูปแบบ BF16 จะต้องการพื้นที่หน่วยความจำประมาณ 1.2 เทราไบต์ ก่อนที่จะรวมหน่วยความจำสำหรับ KV cache

ที่มา: MarkTechPost

ความคิดเห็น

แสดงความคิดเห็น
0/2000

พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้