Alibaba Qwen เปิดตัว Qwen3.8-Omni-Flash โมเดลเอเจนต์มัลติมีเดีย
Alibaba เปิดตัว Qwen3.8-Omni-Flash โมเดลออมนีโมเดลรองรับบริบท 1 ล้านโทเค็น พร้อมความสามารถประมวลผลเสียงและวิดีโอแบบเอเจนต์

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
- Alibaba เปิดตัว Qwen3.8-Omni-Flash รองรับบริบท 1 ล้านโทเค็น
- ประมวลผลวิดีโอและเสียงด้วยระบบเอเจนต์ เลือกดูเฉพาะส่วนที่จำเป็น
- ทำคะแนนบน OmniVideoBench เพิ่มขึ้นเป็น 67.8 พร้อมประหยัดโทเค็น 45.7%
- เปิดให้ใช้งานผ่าน API บน QwenCloud และ Alibaba Cloud Model Studio แล้ว
ทีมวิจัย Alibaba Qwen ได้ประกาศเปิดตัวโมเดลใหม่ล่าสุด Qwen3.8-Omni-Flash ซึ่งเป็นโมเดลออมนีโมเดลตัวแรกของค่ายที่ออกแบบมาเพื่อความสามารถแบบเอเจนต์โดยเฉพาะ โดยโมเดลนี้มีความโดดเด่นในด้านความเข้าใจเสียงและวิดีโอแบบเนทีฟ การใช้เหตุผล รวมถึงการเรียกใช้งานเครื่องมือต่างๆ ในโมเดลเดียวจบ
ในด้านการใช้งานจริง โมเดลนี้เปิดให้บริการผ่าน API โฮสต์แล้ววันนี้บนแพลตฟอร์ม QwenCloud, Alibaba Cloud Model Studio และ Qwen Studio โดยสร้างขึ้นบนสถาปัตยกรรมพื้นฐาน Qwen3.8-Flash-Next อย่างไรก็ตาม ทางทีมงานยังไม่มีการประกาศเปิดโอเพนเวท (open weights) ในช่วงเปิดตัว ทำให้ยังไม่สามารถนำไปโฮสต์เองได้ในขณะนี้
จุดเด่นสำคัญคือหน้าต่างบริบท (context window) ขนาดใหญ่ถึง 1 ล้านโทเค็น โดยข้อมูลจาก QwenCloud ระบุว่ารองรับอินพุตสูงสุด 991,000 โทเค็น และเอาต์พุตสูงสุด 131,000 โทเค็น พร้อมความยาวในการใช้เหตุผลสูงสุด 262,000 โทเค็น ทั้งนี้ เอาต์พุตของโมเดลจะเป็นข้อความเท่านั้น หากนักพัฒนาต้องการเสียงพูดสังเคราะห์ เอกสารแนะนำให้ใช้รุ่น Qwen3.5-Omni แทน ส่วนกระบวนการคิด (thinking) จะถูกเปิดใช้งานเป็นค่าเริ่มต้นโดยตั้งค่าระดับเหตุผลเป็น xhigh

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
ในด้านสถาปัตยกรรมการประมวลผลวิดีโอ โมเดลทั่วไปมักอ่านไฟล์วิดีโอตั้งแต่ต้นจนจบแม้คำตอบจะอยู่เพียงช่วงสั้นๆ แต่ทีมวิจัย Qwen เลือกใช้แนวทางที่แตกต่างออกไปโดยให้เอเจนต์เริ่มต้นจากคำถาม ตัดสินใจว่าจะดูหรือฟังส่วนไหน แล้วรวบรวมหลักฐานผ่านกระบวนการแบบหยาบไปละเอียดหลายรอบ ส่งผลให้ทรัพยากรการคำนวณตกไปอยู่เฉพาะส่วนที่สำคัญจริงๆ
ผลการทดสอบบน OmniVideoBench ระบุว่าความแม่นยำเพิ่มขึ้นจาก 63.4 เป็น 67.8 ขณะที่การใช้โทเค็นลดลงจาก 145,736 เหลือ 79,117 โทเค็น หรือลดลงประมาณ 45.7% นอกจากนี้ ผลงานด้านเสียงและวิดีโอมีประสิทธิภาพใกล้เคียงกับ Gemini 3.8 Flash พร้อมทั้งเคลมว่าประสิทธิภาพด้านเสียงโดยรวมสูงกว่าเล็กน้อย
"Meet Qwen3.8-Omni-Flash, Qwen's first omni-modal model built around agentic capabilities! Native audio-video understanding, reasoning, and tool use come together in one model"
Qwen Research Team
ในแง่ของโครงสร้างต้นทุน QwenCloud กำหนดราคาอินพุตไว้ที่ 0.15 ดอลลาร์ต่อ 1 ล้านโทเค็น และเอาต์พุต 0.47 ดอลลาร์ต่อ 1 ล้านโทเค็น ส่วนค่าแคชฮิตแบบปริยายอยู่ที่ 0.016 ดอลลาร์ต่อ 1 ล้านโทเค็น ซึ่งช่วยลดต้นทุนลงอย่างมากเมื่อเทียบกับ Qwen3.5-Omni-Plus โดยต้นทุนอินพุตเสียงลดลงกว่า 98% ต่อชั่วโมง และอินพุตเสียงร่วมกับวิดีโอลดลงกว่า 93% ต่อชั่วโมง
การเปิดตัว Qwen3.8-Omni-Flash สะท้อนให้เห็นถึงความพยายามของ Alibaba ในการแก้ปัญหาคอขวดด้านประสิทธิภาพของโมเดลวิเคราะห์วิดีโอขนาดใหญ่ โดยเปลี่ยนจากการประดิษฐ์สถาปัตยกรรมแบบตรงไปตรงมา มาเป็นการใช้เอเจนต์ควบคุมความสนใจ (Attention Mechanism) เฉพาะจุดที่มีสาระสำคัญ ซึ่งไม่เพียงแต่ช่วยลดค่าใช้จ่ายด้านโทเค็นได้อย่างมหาศาล แต่ยังเปิดทางให้โมเดลขนาดใหญ่สามารถประมวลผลสื่อประสม (Multimodal) ความยาวหลายชั่วโมงได้อย่างมีประสิทธิภาพในระดับปฏิบัติการจริง
ที่มา: MarkTechPost
พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้
ความคิดเห็น
แสดงความคิดเห็น