ข้ามไปเนื้อหาหลัก

Alibaba เปิดตัว Qwen3.8-LiveTranslate แปลสดลดดีเลย์เหลือ 2.3 วินาที

Alibaba Qwen Team ปล่อยโมเดลแปลภาษารอบทิศทาง Qwen3.8-LiveTranslate รองรับ 60 ภาษา ลดเวลาดีเลย์เฉลี่ยเหลือ 2.3 วินาที พร้อมใช้งานผ่าน API บน Alibaba Cloud

เรียบเรียงโดย AI
Inewgen
สด20 Sep 20262 นาทีอ่าน (0 ครั้ง)
แชร์
Alibaba เปิดตัว Qwen3.8-LiveTranslate แปลสดลดดีเลย์เหลือ 2.3 วินาที

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

ขนาดตัวอักษร
  • Alibaba เปิดตัว Qwen3.8-LiveTranslate โมเดลแปลภาษารอบทิศทางแบบเรียลไทม์
  • ลดเวลาความหน่วงเฉลี่ย (LAAL) ลงเหลือ 2.3 วินาที รองรับการใช้งานผ่าน WebSocket API
  • รองรับการแปลถึง 60 ภาษา โดยสามารถพูดเสียงออกได้ 29 ภาษา

ทีมพัฒนา Qwen จาก Alibaba ได้ประกาศเปิดตัวโมเดลปัญญาประดิษฐ์สำหรับการแปลภาษาแบบเรียลไทม์ตัวใหม่ล่าสุดในชื่อ Qwen3.8-LiveTranslate ซึ่งถูกออกแบบมาเพื่อแก้โจทย์ความท้าทายคลาสสิกของการแปลภาษาพร้อมกัน ที่ต้องเลือกระหว่างการรอให้ผู้พูดกล่าวจบประโยคเพื่อให้ได้บริบทที่ครบถ้วน กับการแปลเร็วเพื่อลดระยะเวลาการรอคอยของผู้ฟัง โมเดลนี้จึงเลือกใช้สถาปัตยกรรมแบบ Interleave เพื่อสร้างสมดุลใหม่ให้กับลูปการทำงานดังกล่าว

โมเดลใหม่นี้ต่อยอดมาจากสถาปัตยกรรม Qwen-Omni โดยผสานรวมข้อมูล multimodal ขนาดใหญ่ การจัดเรียงข้ามภาษาและข้ามโมดอลเข้าด้วยกัน รวมถึงการเสริมประสิทธิภาพด้านการมองเห็น ทำให้ตัวระบบสามารถรับอินพุตได้ทั้งเสียงพูดและภาพประกอบทางเลือก เช่น การเคลื่อนไหวริมฝีปาก ท่าทาง หรือข้อความบนหน้าจอ เพื่อช่วยเพิ่มความแม่นยำในการแปลในสถานที่ที่มีเสียงดังรบกวนหรือเมื่อเจอคำที่มีความหมายกำกวม โดยในเอกสารแนะนำให้ส่งภาพไม่เกิน 2 ภาพต่อวินาที

artificial intelligence cloud computing server rack

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

2.3sเวลาดีเลย์เฉลี่ย (LAAL)
60ภาษาที่รองรับ
29ภาษาที่สังเคราะห์เสียงได้

ในด้านขอบเขตการใช้งาน Qwen3.8-LiveTranslate สามารถเข้าใจภาษาได้ทั้งหมด 60 ภาษา และสามารถแปลกลับมาเป็นเสียงพูดพร้อมข้อความได้ 29 ภาษา ขณะที่อีก 31 ภาษาที่เหลือจะให้ผลลัพธ์เป็นข้อความเท่านั้น โดยกลุ่มภาษาที่รองรับการออกเสียง ได้แก่ จีน อังกฤษ อาหรับ เยอรมัน ฝรั่งเศส สเปน ญี่ปุ่น เกาหลี และฮินดี เป็นต้น นอกจากนี้ ทีมงานยังสามารถตั้งค่า hotwords ได้สูงสุดถึง 1,000 คำ เพื่อแมตช์คำศัพท์เฉพาะทางในต้นทางให้ตรงกับคำแปลปลายทางที่กำหนดไว้ตายตัว

การใช้สถาปัตยกรรมแบบ Interleave ในโมเดลแปลภาษารอบทิศทางถือเป็นก้าวสำคัญที่ช่วยแก้ปัญหาคอขวดของการประมวลผลแบบเดิม ซึ่งมักทำให้เกิดอาการสะดุดหรือดีเลย์สะสม การที่ AI สามารถประมวลผลทั้งสัญญาณเสียงและภาพไปพร้อมกัน (Multimodal Fusion) ช่วยให้บริบททางภาพช่วยลดความผิดพลาดในการแปลคำพ้องเสียงหรือคำเฉพาะในสถานการณ์จริงได้ดีขึ้นอย่างมีนัยสำคัญ

สำหรับการเชื่อมต่อ นักพัฒนาสามารถใช้งานผ่าน WebSocket Realtime API ภายใต้รหัสโมเดล qwen3.8-livetranslate-flash-realtime โดยระบบจะใช้ค่าเริ่มต้นการตรวจจับผู้พูดแบบ speaker_detection และกำหนดค่าเสียงเริ่มต้นในชื่อ Tina ด้วยสตรีมเสียงอินพุตแบบ 16 kHz PCM และเอาต์พุต 24 kHz PCM พร้อมหน้าต่างบริบท (Context Window) ขนาด 53,248โทเค็น แบ่งเป็นอินพุต 49,152 โทเค็น และเอาต์พุต 4,096 โทเค็น โดยมีอัตราการใช้งานเริ่มต้นที่ 10 คำขอและ 100,000 โทเค็นต่อนาที

ที่มา: MarkTechPost

ความคิดเห็น

แสดงความคิดเห็น
0/2000

พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้