ข้ามไปเนื้อหาหลัก

Z.ai เปิดตัว GLM-5.3-Flash โมเดล MoE 320B รองรับ 1M Token

Z.ai เปิดตัว GLM-5.3-Flash โมเดล MoE ขนาด 320B (ใช้งานจริง 18B) พร้อมรองรับบริบท 1M token และเปิดให้ใช้งานผ่าน Hugging Face รวมถึง API แล้ว

เรียบเรียงโดย AI
Inewgen
27 Aug 2026ที่มา: MarkTechPost3 นาทีอ่าน (0 ครั้ง)
แชร์
Z.ai เปิดตัว GLM-5.3-Flash โมเดล MoE 320B รองรับ 1M Token

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

ขนาดตัวอักษร
  • Z.ai เปิดตัว GLM-5.3-Flash โมเดล MoE ขนาด 320B-A18B แบบ native multimodal
  • รองรับ context window ยาวนานถึง 1 ล้าน token สำหรับการประมวลผลข้อมูลมหาศาล
  • เปิดให้ดาวน์โหลดน้ำหนักโมเดลบน Hugging Face ภายใต้สัญญาอนุญาตแบบ MIT และมี API พร้อมให้บริการ
  • ทำคะแนนบน Artificial Analysis Intelligence Index ได้ 57 คะแนน พร้อมราคาเริ่มต้นที่เข้าถึงได้

Z.ai ได้ประกาศเปิดตัวโมเดลปัญญาประดิษฐ์ตัวใหม่ล่าสุดในชื่อ GLM-5.3-Flash ซึ่งถูกพัฒนาขึ้นจากฐานข้อมูล multimodal corpus ขนาดใหญ่ถึง 30 ล้านล้าน token โมเดลนี้ถูกออกแบบมาเพื่อตอบสนองความต้องการด้านประสิทธิภาพสูงและความคุ้มค่าในการใช้งานระดับองค์กร โดยเปิดให้ผู้สนใจสามารถเข้าถึงตัวโมเดลได้ทันทีผ่านช่องทางหลักสองช่องทางด้วยกัน

น้ำหนักของโมเดลถูกปล่อยขึ้นสู่แพลตฟอร์ม Hugging Face เป็นที่เรียบร้อยแล้วภายใต้สัญญาอนุญาตแบบ MIT เพื่อให้นักพัฒนาสามารถนำไปปรับแต่งและใช้งานได้อย่างอิสระ นอกจากนี้ยังมีระบบ API ที่พร้อมให้บริการและมีการกำหนดราคาค่าใช้งานอย่างชัดเจนสำหรับนักพัฒนาที่ต้องการความสะดวกรวดเร็วในการเชื่อมต่อระบบ

artificial intelligence data code screen

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

320Bขนาดพารามิเตอร์รวม
18Bพารามิเตอร์ที่ใช้งานจริง
1MContext Token สูงสุด

ในด้านสถาปัตยกรรม GLM-5.3-Flash เป็นโมเดลประเภท Mixture of Experts (MoE) ที่มีพารามิเตอร์รวมทั้งหมด 320 พันล้านพารามิเตอร์ แต่มีการใช้งานจริงต่อโทเค็นอยู่ที่ 18 พันล้านพารามิเตอร์ จุดเด่นสำคัญคือความสามารถในการจัดการกับบริบทขนาดยาวถึง 1 ล้าน token และได้รับการฝึกฝนมาแบบ natively multimodal เพื่อรองรับข้อมูลหลากหลายรูปแบบในเวลาเดียวกัน

ไม่อยากพลาดข่าวใหม่?

สมัครรับสรุปข่าวสารใหม่ทางอีเมล ไม่บ่อยจนรำคาญ

โฆษณา

สถาปัตยกรรมแบบ Mixture of Experts (MoE) ช่วยให้โมเดลขนาดใหญ่สามารถประมวลผลได้อย่างรวดเร็วและประหยัดทรัพยากรมากขึ้น เนื่องจากระบบจะเปิดใช้งานเฉพาะเครือข่ายย่อย (experts) ที่จำเป็นสำหรับงานแต่ละประเภทเท่านั้น แทนที่จะปลุกพารามิเตอร์ทั้งหมดขึ้นมาทำงานพร้อมกัน การที่ GLM-5.3-Flash รองรับ context สูงถึง 1 ล้าน token จึงเหมาะอย่างยิ่งสำหรับการวิเคราะห์เอกสารยาวๆ หรือชุดข้อมูลโปรแกรมขนาดใหญ่ในคราวเดียว

สำหรับการประเมินสมรรถนะอิสระโดย Artificial Analysis พบว่าโมเดลทำคะแนนบน Intelligence Index ได้ 57 คะแนน โดยมีความเร็วในการสร้างเอาต์พุตอยู่ที่ 48.7 token ต่อวินาที และมีค่า Time to First Token (TTFT) อยู่ที่ 1.52 วินาทีบน API ของ Z.ai แม้ว่าความสามารถด้านการมองเห็น (vision) อาจจะยังทำได้ตามหลังคู่แข่งบางรายในตลาด แต่จุดเด่นด้านความคุ้มค่าต่อต้นทุนถือว่าทำออกมาได้น่าสนใจ

ในส่วนของโครงสร้างราคามาตรฐาน API มีอัตราค่าบริการอยู่ที่ 0.15 ดอลลาร์ต่อล้านอินพุตโทเค็น, 0.03 ดอลลาร์ต่อล้านแคชอินพุตโทเค็น และ 0.50 ดอลลาร์ต่อล้านเอาต์พุตโทเค็น นอกจากนี้ยังมีแพ็กเกจ GLM Coding Plan รองรับผู้ใช้งานในระดับ Lite, Pro และ Max โดยให้โควตาการใช้งานมากกว่ารุ่น GLM-5.3 ถึง 3 เท่า พร้อมทั้งรองรับการรันโมเดลบนเซิร์ฟเวอร์ท้องถิ่นผ่านเครื่องมืออย่าง SGLang, vLLM, TokenSpeed และ KTransformers

ที่มา: MarkTechPost

ความคิดเห็น

แสดงความคิดเห็น
0/2000

พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้