ข้ามไปเนื้อหาหลัก

Alibaba เปิดตัว Qwen3.8-Flash-Next โมเดล MoE 125B

Alibaba เปิดตัว Qwen3.8-Flash-Next โมเดล Multimodal MoE ขนาด 125 พันล้านพารามิเตอร์ ทำงานจริงเพียง 6 พันล้านพารามิเตอร์ต่อโทเค็น พร้อมเผยโครงสร้างสถาปัตยกรรมล่วงหน้าก่อนเข้าสู่ยุค Qwen4

เรียบเรียงโดย AI
Inewgen
27 Aug 2026ที่มา: MarkTechPost4 นาทีอ่าน (0 ครั้ง)
แชร์
Alibaba เปิดตัว Qwen3.8-Flash-Next โมเดล MoE 125B

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

ขนาดตัวอักษร
  • Alibaba เปิดตัว Qwen3.8-Flash-Next โมเดล Multimodal MoE ขนาด 125B พร้อมพารามิเตอร์ใช้งานจริง 6B
  • โครงสร้างการทำงานใช้ MoE 512 ผู้เชี่ยวชาญ และรองรับบริบทเนทีฟสูงสุด 262,144 โทเค็น
  • ต้นทุนการฝึกอบรมลดลงเหลือราว 1 ใน 9 เมื่อเทียบกับรุ่น Qwen3.7-Plus
  • โหมดการคิดทำงานเป็นค่าเริ่มต้น พร้อมรองรับเฟรมเวิร์กยอดนิยมอย่าง vLLM และ SGLang

ทีมพัฒนา Qwen จาก Alibaba ได้สร้างความฮือฮาให้กับวงการปัญญาประดิษฐ์อีกครั้งด้วยการปล่อยโมเดลรุ่นใหม่ล่าสุดในชื่อ Qwen3.8-Flash-Next ซึ่งถือเป็นตัวอย่างล่วงหน้าของสถาปัตยกรรม Qwen4 ที่กำลังจะมาถึง โมเดลนี้ถูกออกแบบมาเพื่อเน้นประสิทธิภาพและความคุ้มค่าในการประมวลผลขั้นสูง โดยขนาดไฟล์บนดิสก์พุ่งสูงถึง 180 พันล้านพารามิเตอร์ เนื่องจากประกอบด้วยโมเดลหลักขนาด 125 พันล้านพารามิเตอร์ พารามิเตอร์ N-gram embedding อีก 51 พันล้าน และโมดูลทำนายหลายโทเค็นขนาด 4 พันล้านพารามิเตอร์

แม้ขนาดโมเดลจะใหญ่โต แต่การเปิดใช้งานจริงกลับใช้พารามิเตอร์เพียง 6 พันล้านพารามิเตอร์ต่อหนึ่งโทเค็นเท่านั้น เนื่องจากการใช้กลไก Sparse activation ที่ช่วยลดภาระการคำนวณอย่างมหาศาลโดยไม่กระทบต่อขนาดการจัดเก็บข้อมูล โมเดลตัวนี้มีความต้องการฮาร์ดแวร์ระดับสูงในการรันบนระบบ โดยจุดตรวจสอบแบบ FP8 มีขนาดอยู่ที่ 172.78 GiB และ BF16 มีขนาดสูงถึง 335.28 GiB ซึ่งตามสูตรของ vLLM กำหนดให้ใช้ค่า TP2 เป็นขั้นต่ำสำหรับการรันบนชิป GB300 และแนะนำให้ใช้ TP4 ในขณะที่โหนด 8×H200 จำเป็นต้องใช้ TEP8

computer processor microchip hardware

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

สถาปัตยกรรมเบื้องหลังความสำเร็จนี้ขับเคลื่อนด้วย 4 ปัจจัยสำคัญ โดยเลเยอร์ MoE บรรจุผู้เชี่ยวชาญ (experts) มากถึง 512 ตัว โดยจะเปิดใช้งานแบบ routed จำนวน 10 ตัว และแบบ shared อีก 1 ตัว ที่ขนาดมิติระดับกลางของผู้เชี่ยวชาญเท่ากับ 640 นอกจากนี้ตัวโมเดลยังรองรับความยาวบริบทพื้นฐาน (Native context) ที่ 262,144 โทเค็น และสามารถขยายเพิ่มได้สูงสุดถึง 1,000,000 โทเค็นผ่านเทคโนโลยี YaRN

180Bพารามิเตอร์รวมบนดิสก์
6Bพารามิเตอร์ใช้งานต่อโทเค็น
512จำนวนผู้เชี่ยวชาญใน MoE

ในด้านผลการทดสอบประสิทธิภาพ Qwen3.8-Flash-Next ทำคะแนนบน DeepSWE 1.1 ได้ 58.7, บน SWE-bench Pro ได้ 62.5, SWE-bench Multilingual ได้ 81.0 และ LiveCodeBench v6 ทำได้ถึง 91.9 ส่วนงานด้านเอเจนต์ (Agentic tasks) ทำคะแนนบน CoWorkBench ได้ 73.9, JobBench ที่ 55.7 และ Toolathlon Verified ที่ 73.5 ด้านผลงานมัลติมีเดียทำคะแนนบน AndroidWorld ได้ 84.5, LVBench ที่ 76.6, RealWorldQA ที่ 88.5 และ MathVision (เมื่อใช้ร่วมกับ code interpreter) สูงถึง 95.7

ไม่อยากพลาดข่าวใหม่?

สมัครรับสรุปข่าวสารใหม่ทางอีเมล ไม่บ่อยจนรำคาญ

โฆษณา

การที่โมเดลตระกูล Flash เลือกใช้สถาปัตยกรรม MoE (Mixture of Experts) ควบคู่กับ Sparse activation ถือเป็นแนวทางหลักของวงการ LLM ยุคปัจจุบันในการแก้ปัญหาคอขวดด้านพลังงานและการประมวลผล การที่โมเดลขนาดใหญ่ระดับร้อยพันล้านพารามิเตอร์เลือกเปิดใช้งานพารามิเตอร์จริงเพียงเล็กน้อยต่อหนึ่งโทเค็น ช่วยให้ความเร็วในการตอบสนองสูงขึ้นอย่างก้าวกระโดดโดยยังคงรักษาความฉลาดของโมเดลไว้ได้ ซึ่งเทคนิคนี้กำลังกลายเป็นมาตรฐานใหม่ก่อนก้าวไปสู่เจเนอเรชันถัดไป

อย่างไรก็ตาม โมเดลไม่ได้เป็นผู้ชนะในทุกสนาม โดยในหัวข้อการทดสอบ Frontier reasoning อย่าง HLE นั้น Claude Opus 4.6 (Max) ทำคะแนนนำอยู่ที่ 40.0 ขณะที่ Qwen ทำได้ 35.9 และในหมวด NL2Repo-Bench ทาง DeepSeek-V4-Flash-0731 นำอยู่ด้วยคะแนน 54.2 เทียบกับ 48.1 ของ Qwen นอกจากนี้ Alibaba ยังระบุว่าต้นทุนในการฝึกอบรมโมเดลรุ่นนี้ลดลงเหลือเพียงประมาณ 1 ใน 9 ของรุ่น Qwen3.7-Plus เท่านั้น พร้อมทั้งทำความเร็วในการเสิร์ฟข้อมูลผ่านเคอร์เนล QSA ได้สูงถึง 7.6 เท่าสำหรับการ prefill และ 4.9 เท่าสำหรับการ decode ที่ 1 ล้านโทเค็น

สำหรับการใช้งานจริง โมเดลนี้รองรับการให้บริการผ่านเฟรมเวิร์กหลากหลาย เช่น vLLM, SGLang, TokenSpeed, transformers serve และ llama.cpp สำหรับการแปลงไฟล์ GGUF รวมถึงรองรับการปรับแต่งโมเดล (Fine-tuning) ผ่าน Unsloth, Swift และ LLaMA-Factory อีกทั้งยังถูกนำไปขับเคลื่อนโหมด "Standard" บนแพลตฟอร์ม QwenWork และทำงานร่วมกับ Qwen Code เรียบร้อยแล้ว โดยโหมดการคิด (Thinking mode) จะถูกเปิดใช้งานเป็นค่าเริ่มต้นพร้อมระดับความเข้มข้นที่ปรับได้

ที่มา: MarkTechPost

ความคิดเห็น

แสดงความคิดเห็น
0/2000

พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้