GLM-5.3-Flash ปะทะ Qwen3.8-Flash-Next: สถาปัตยกรรม AI
Z.ai และ Qwen สองห้องทดลอง AI จีน พัฒนาระบบไฮบริดใหม่ชนกันเองโดยบังเอิญ ด้วยอัตราส่วน 3:1 และ 4 บิดรีซีดิวาล พร้อมเปิดสถิติและดีเทลเชิงลึก

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
- Z.ai และ Qwen ออกแบบสถาปัตยกรรม AI ใหม่คล้ายกันโดยไม่ได้นัดหมาย
- ใช้ไฮบริดระหว่าง linear และ full attention อัตราส่วน 3:1
- แทนที่ residual stream แบบเดิมด้วย 4 บิดขนานพร้อมเกตควบคุม
วงการปัญญาประดิษฐ์ฝั่งประเทศจีนกำลังสร้างความประหลาดใจครั้งใหญ่ เมื่อสถาบันวิจัยชั้นนำสองแห่งได้แก่ Z.ai และทีมพัฒนา Qwen ได้พัฒนาโมเดลปัญญาประดิษฐ์รุ่นใหม่ล่าสุดอย่างอิสระ แต่กลับได้โครงสร้างการทำงานที่ถอดแบบกันมาแทบทุกกระเบียดนิ้ว ไม่ว่าจะเป็นสัดส่วนการผสมผสานและการเลือกใช้เทคนิคระดับลึก
โมเดล GLM-5.3-Flash จากค่าย Z.ai ถือเป็นโมเดลแบบเนทีฟมัลติโมเดลรุ่นแรกในตระกูล GLM-5 เผยแพร่ภายใต้สัญญาอนุญาตแบบ MIT บนแพลตฟอร์ม Hugging Face โดยผ่านการทดสอบแบบไม่เปิดเผยชื่อในฐานะ Ox Alpha บน OpenRouter และก้าวขึ้นเป็นโมเดลยอดนิยมประจำสัปดาห์ทันที
ทางด้าน Qwen3.8-Flash-Next ทำหน้าที่เป็นตัวแทนพรีวิวสถาปัตยกรรมยุคถัดไป โดยโมเดลการ์ดระบุขนาดพารามิเตอร์หลักไว้ที่ 125 พันล้านพารามิเตอร์ พร้อมตารางเอ็นแกรมเอ็มเบดดิ้งเสริมอีก 51 พันล้านพารามิเตอร์ และเปิดใช้งานจริง 6 พันล้านพารามิเตอร์ต่อหนึ่งโทเค็น

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
ในส่วนของโครงสร้างเลเยอร์ GLM-5.3-Flash ใช้การซ้อนทับทั้งหมด 45 เลเยอร์ แบ่งเป็น linear-attention จำนวน 34 เลเยอร์ และ full-attention จำนวน 11 เลเยอร์ ขณะที่ Qwen3.8-Flash-Next ใช้ 48 เลเยอร์ในบล็อกวนซ้ำประกอบด้วย Gated DeltaNet จำนวน 3 เลเยอร์ และ Qwen Sparse Attention จำนวน 1 เลเยอร์ ซึ่งทั้งสองค่ายลงตัวที่อัตราส่วน 3:1 เท่ากันพอดี
"Two labs, two implementations, one identical conclusion: four gated streams beat one."
นักวิจัย AI
การบรรจบกันของสถาปัตยกรรม AI ระหว่างสองค่ายใหญ่ในจีนสะท้อนให้เห็นว่า นักวิจัยต่างพบข้อจำกัดของ Transformer แบบดั้งเดิมในจุดเดียวกัน การหันมาใช้ linear attention ร่วมกับ sparse retrieval ช่วยลดภาระของ KV cache ได้มหาศาล ทำให้โมเดลขนาดใหญ่รันได้เร็วขึ้นโดยไม่สูญเสียความแม่นยำในบริบท ยาวๆ
ความแตกต่างที่ชัดเจนเพียงจุดเดียวคือการใช้ Rotary Position Embeddings (RoPE) ในเลเยอร์ full-attention โดย GLM-5.3-Flash เลือกถอดออกและให้ข้อมูลตำแหน่งไหลผ่านเลเยอร์รีเคอร์เรนต์แทน ในขณะที่ Qwen ยังคงเก็บ RoPE ไว้ เนื่องจากพบว่ารุ่นที่ไม่มี RoPE มักมีปัญหาเรื่องการหยุดสร้างข้อความหลังผ่านกระบวนการปรับแต่ง RLHF
ที่มา: MarkTechPost
พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้
ความคิดเห็น
แสดงความคิดเห็น