Alibaba เปิดตัว Qwen-Audio-3.1-Realtime โมเดลเสียงแบบฟูลดูเพล็กซ์
Alibaba เปิดตัว Qwen-Audio-3.1-Realtime โมเดลเสียงแบบฟูลดูเพล็กซ์ รองรับบริบท 262K โทเค็น พร้อมรุ่นคู่หู ASR-Flash-Filetrans วันที่ 28 กันยายน 2026

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
- Alibaba เปิดตัวโมเดลเสียง Qwen-Audio-3.1-Realtime ทำงานแบบฟูลดูเพล็กซ์ผ่าน Managed API บน QwenCloud
- รองรับ context ยาว 262K โทเค็น พร้อมความสามารถค้นหาเว็บและเรียกใช้งานฟังก์ชัน
- เปิดตัวรุ่น Qwen-Audio-3.1-ASR-Flash-Filetrans สำหรับถอดเสียงไฟล์ยาวออฟไลน์
- คะแนนประเมินบน Full-Duplex-Bench v3.0 ลดอัตราคำฟุ่มเฟือยลงเหลือ 0.2960
Alibaba ได้สร้างความตื่นเต้นให้วงการปัญญาประดิษฐ์อีกครั้งด้วยการเปิดตัวโมเดลเสียงรุ่นใหม่ล่าสุดอย่าง Qwen-Audio-3.1-Realtime ซึ่งเป็นโมเดลเสียงแบบฟูลดูเพล็กซ์ที่ได้รับการฝึกฝนให้มีความสามารถในการคิด การกระทำ และการตัดสินใจว่าจะพูดตอนไหน โดยขณะนี้เปิดให้ใช้งานในรูปแบบ Managed API ผ่านระบบ WebSocket บน QwenCloud เรียบร้อยแล้ว แม้ว่าจะยังไม่มีการประกาศเปิดโอเพ่นเวท (Open Weights) ออกมาในขณะนี้ก็ตาม
โมเดลตัวนี้รองรับข้อมูลเข้าและออกได้ทั้งในรูปแบบข้อความและเสียง โดยมีขีดจำกัดบริบทสูงถึง 262,000 โทเค็น แบ่งเป็นอินพุตสูงสุด 245,000 โทเค็น และเอาต์พุตสูงสุด 16,000 โทเค็น สำหรับข้อจำกัดเริ่มต้นอยู่ที่ 60 คำขอและ 100,000 โทเค็นต่อนาที ในด้านโครงสร้างการทำงาน ระบบนี้ใช้โมเดล 2 ตัวที่ใช้ Audio Encoder และ LLM ดีไซน์เดียวกัน ทำหน้าที่ทั้งตัดสินใจแบบฟูลดูเพล็กซ์ แปลงเสียงเป็นข้อความ และเรนเดอร์เสียงพูดสตรีมมิ่งตามบริบทการสนทนา

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
ในด้านโครงสร้างการฝึกฝน โมเดลนี้ถูกแบ่งออกเป็น 3 เลเยอร์หลัก ได้แก่ Think, Act และ Speak and Coordinate โดยใช้กระบวนการ Core-Cocktail SFT เพื่อเชื่อมโยงโมเดลเสียงเข้ากับ LLM ต้นทางด้วยข้อมูลจับคู่ระดับล้านชั่วโมง ตามด้วย Multimodality OPD และการฝึกโดเมนผู้เชี่ยวชาญเฉพาะด้านด้วยอัลกอริทึม GRPO ก่อนจะรวมเข้าด้วยกันเป็นโมเดลเดียวที่พร้อมใช้งานจริง
นอกจากรุ่นหลักแล้ว ทางบริษัทยังได้เปิดตัวรุ่นคู่หูอย่าง Qwen-Audio-3.1-ASR-Flash-Filetrans ซึ่งออกแบบมาเพื่อการถอดเสียงไฟล์เสียงขนาดยาวแบบออฟไลน์โดยเฉพาะ รองรับคำศัพท์เฉพาะ (Hot words) การแยกผู้พูด การใส่เครื่องหมายวรรคตอน และการจดจำภาษาท้องถิ่นของจีนรวมถึงหลายภาษาทั่วโลก ในราคาค่าบริการอินพุต 0.15 ดอลลาร์ และเอาต์พุต 0.47 ดอลลาร์ต่อ 1 ล้านโทเค็น
การพัฒนาโมเดลเสียงแบบฟูลดูเพล็กซ์ในปัจจุบันถือเป็นก้าวสำคัญที่ช่วยให้ AI สามารถโต้ตอบได้อย่างเป็นธรรมชาติใกล้เคียงมนุษย์มากขึ้น เนื่องจากระบบต้องประมวลผลทั้งการฟังและการคิดไปพร้อมๆ กันโดยไม่รอให้คู่สนทนาพูดจบ การที่ Alibaba นำสถาปัตยกรรมแบบ Think-Act-Speak มาใช้ช่วยแก้ปัญหาเรื่องการตัดสินใจจังหวะเวลาในการพูด (Turn-taking) ซึ่งเป็นจุดท้าทายที่สุดของระบบสนทนาด้วยเสียงเรียลไทม์
อย่างไรก็ตาม ผลการทดสอบบน Full-Duplex-Bench v1.5 แสดงให้เห็นว่าอัตราการตอบสนองต่อคนที่กำลังคุยกับคนอื่นลดลงจาก 0.13 เหลือ 0.03 และอัตราคำฟุ่มเฟือยบน v3.0 ลดลงจาก 0.7590 เหลือ 0.2960 แต่ก็มีข้อแลกเปลี่ยนคืออัตราการกลับมาพูดโดยไม่ตั้งใจหลังถูกขัดจังหวะเพิ่มขึ้นจาก 0.035 เป็น 0.130 และมีเวลาหน่วงในการหยุดเมื่อถูกขัดจังหวะอยู่ที่ 1.116วินาที เทียบกับ 0.383 วินาทีของ GPT-Realtime-2
ที่มา: MarkTechPost
พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้
ความคิดเห็น
แสดงความคิดเห็น