Alibaba เปิดตัว Qwen3.8-Flash-Next โมเดล MoE 125B
Alibaba เปิดตัว Qwen3.8-Flash-Next โมเดล Multimodal MoE ขนาด 125 พันล้านพารามิเตอร์ ทำงานจริงเพียง 6 พันล้านพารามิเตอร์ต่อโทเค็น พร้อมเผยโครงสร้างสถาปัตยกรรมล่วงหน้าก่อนเข้าสู่ยุค Qwen4

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
- Alibaba เปิดตัว Qwen3.8-Flash-Next โมเดล Multimodal MoE ขนาด 125B พร้อมพารามิเตอร์ใช้งานจริง 6B
- โครงสร้างการทำงานใช้ MoE 512 ผู้เชี่ยวชาญ และรองรับบริบทเนทีฟสูงสุด 262,144 โทเค็น
- ต้นทุนการฝึกอบรมลดลงเหลือราว 1 ใน 9 เมื่อเทียบกับรุ่น Qwen3.7-Plus
- โหมดการคิดทำงานเป็นค่าเริ่มต้น พร้อมรองรับเฟรมเวิร์กยอดนิยมอย่าง vLLM และ SGLang
ทีมพัฒนา Qwen จาก Alibaba ได้สร้างความฮือฮาให้กับวงการปัญญาประดิษฐ์อีกครั้งด้วยการปล่อยโมเดลรุ่นใหม่ล่าสุดในชื่อ Qwen3.8-Flash-Next ซึ่งถือเป็นตัวอย่างล่วงหน้าของสถาปัตยกรรม Qwen4 ที่กำลังจะมาถึง โมเดลนี้ถูกออกแบบมาเพื่อเน้นประสิทธิภาพและความคุ้มค่าในการประมวลผลขั้นสูง โดยขนาดไฟล์บนดิสก์พุ่งสูงถึง 180 พันล้านพารามิเตอร์ เนื่องจากประกอบด้วยโมเดลหลักขนาด 125 พันล้านพารามิเตอร์ พารามิเตอร์ N-gram embedding อีก 51 พันล้าน และโมดูลทำนายหลายโทเค็นขนาด 4 พันล้านพารามิเตอร์
แม้ขนาดโมเดลจะใหญ่โต แต่การเปิดใช้งานจริงกลับใช้พารามิเตอร์เพียง 6 พันล้านพารามิเตอร์ต่อหนึ่งโทเค็นเท่านั้น เนื่องจากการใช้กลไก Sparse activation ที่ช่วยลดภาระการคำนวณอย่างมหาศาลโดยไม่กระทบต่อขนาดการจัดเก็บข้อมูล โมเดลตัวนี้มีความต้องการฮาร์ดแวร์ระดับสูงในการรันบนระบบ โดยจุดตรวจสอบแบบ FP8 มีขนาดอยู่ที่ 172.78 GiB และ BF16 มีขนาดสูงถึง 335.28 GiB ซึ่งตามสูตรของ vLLM กำหนดให้ใช้ค่า TP2 เป็นขั้นต่ำสำหรับการรันบนชิป GB300 และแนะนำให้ใช้ TP4 ในขณะที่โหนด 8×H200 จำเป็นต้องใช้ TEP8

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
สถาปัตยกรรมเบื้องหลังความสำเร็จนี้ขับเคลื่อนด้วย 4 ปัจจัยสำคัญ โดยเลเยอร์ MoE บรรจุผู้เชี่ยวชาญ (experts) มากถึง 512 ตัว โดยจะเปิดใช้งานแบบ routed จำนวน 10 ตัว และแบบ shared อีก 1 ตัว ที่ขนาดมิติระดับกลางของผู้เชี่ยวชาญเท่ากับ 640 นอกจากนี้ตัวโมเดลยังรองรับความยาวบริบทพื้นฐาน (Native context) ที่ 262,144 โทเค็น และสามารถขยายเพิ่มได้สูงสุดถึง 1,000,000 โทเค็นผ่านเทคโนโลยี YaRN
ในด้านผลการทดสอบประสิทธิภาพ Qwen3.8-Flash-Next ทำคะแนนบน DeepSWE 1.1 ได้ 58.7, บน SWE-bench Pro ได้ 62.5, SWE-bench Multilingual ได้ 81.0 และ LiveCodeBench v6 ทำได้ถึง 91.9 ส่วนงานด้านเอเจนต์ (Agentic tasks) ทำคะแนนบน CoWorkBench ได้ 73.9, JobBench ที่ 55.7 และ Toolathlon Verified ที่ 73.5 ด้านผลงานมัลติมีเดียทำคะแนนบน AndroidWorld ได้ 84.5, LVBench ที่ 76.6, RealWorldQA ที่ 88.5 และ MathVision (เมื่อใช้ร่วมกับ code interpreter) สูงถึง 95.7
การที่โมเดลตระกูล Flash เลือกใช้สถาปัตยกรรม MoE (Mixture of Experts) ควบคู่กับ Sparse activation ถือเป็นแนวทางหลักของวงการ LLM ยุคปัจจุบันในการแก้ปัญหาคอขวดด้านพลังงานและการประมวลผล การที่โมเดลขนาดใหญ่ระดับร้อยพันล้านพารามิเตอร์เลือกเปิดใช้งานพารามิเตอร์จริงเพียงเล็กน้อยต่อหนึ่งโทเค็น ช่วยให้ความเร็วในการตอบสนองสูงขึ้นอย่างก้าวกระโดดโดยยังคงรักษาความฉลาดของโมเดลไว้ได้ ซึ่งเทคนิคนี้กำลังกลายเป็นมาตรฐานใหม่ก่อนก้าวไปสู่เจเนอเรชันถัดไป
อย่างไรก็ตาม โมเดลไม่ได้เป็นผู้ชนะในทุกสนาม โดยในหัวข้อการทดสอบ Frontier reasoning อย่าง HLE นั้น Claude Opus 4.6 (Max) ทำคะแนนนำอยู่ที่ 40.0 ขณะที่ Qwen ทำได้ 35.9 และในหมวด NL2Repo-Bench ทาง DeepSeek-V4-Flash-0731 นำอยู่ด้วยคะแนน 54.2 เทียบกับ 48.1 ของ Qwen นอกจากนี้ Alibaba ยังระบุว่าต้นทุนในการฝึกอบรมโมเดลรุ่นนี้ลดลงเหลือเพียงประมาณ 1 ใน 9 ของรุ่น Qwen3.7-Plus เท่านั้น พร้อมทั้งทำความเร็วในการเสิร์ฟข้อมูลผ่านเคอร์เนล QSA ได้สูงถึง 7.6 เท่าสำหรับการ prefill และ 4.9 เท่าสำหรับการ decode ที่ 1 ล้านโทเค็น
สำหรับการใช้งานจริง โมเดลนี้รองรับการให้บริการผ่านเฟรมเวิร์กหลากหลาย เช่น vLLM, SGLang, TokenSpeed, transformers serve และ llama.cpp สำหรับการแปลงไฟล์ GGUF รวมถึงรองรับการปรับแต่งโมเดล (Fine-tuning) ผ่าน Unsloth, Swift และ LLaMA-Factory อีกทั้งยังถูกนำไปขับเคลื่อนโหมด "Standard" บนแพลตฟอร์ม QwenWork และทำงานร่วมกับ Qwen Code เรียบร้อยแล้ว โดยโหมดการคิด (Thinking mode) จะถูกเปิดใช้งานเป็นค่าเริ่มต้นพร้อมระดับความเข้มข้นที่ปรับได้
ที่มา: MarkTechPost
พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้
ความคิดเห็น
แสดงความคิดเห็น