ข้ามไปเนื้อหาหลัก

PolyAI เปิดตัว Dialog-RSN-1 โมเดลเสียงแบบ Native ที่ผสานการสนทนาและการประมวลผล

PolyAI เปิดตัว Dialog-RSN-1 โมเดลสนทนารุ่นใหม่ที่ออกแบบมาเพื่อการประมวลผลเสียงโดยตรง ผสานความสามารถด้าน Turn-taking, การจดจำเสียงพูด, Function Calling และการตอบสนองไว้ในหนึ่งเดียว

เรียบเรียงโดย AI
Inewgen
31 Jul 2026ที่มา: MarkTechPost3 นาทีอ่าน (0 ครั้ง)อัปเดตล่าสุด 04 Aug 2026
แชร์
PolyAI เปิดตัว Dialog-RSN-1 โมเดลเสียงแบบ Native ที่ผสานการสนทนาและการประมวลผล

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

ขนาดตัวอักษร
  • PolyAI เปิดตัว Dialog-RSN-1 โมเดลเสียงแบบ Native สำหรับการสนทนา
  • รองรับเฉพาะลูกค้าปัจจุบันและลูกค้าใหม่ที่ขอสิทธิ์เข้าถึงล่วงหน้า ยังไม่มี Open weights หรือ Public API
  • ทำคะแนนสูงสุดบนเกณฑ์มาตรฐานภายในอย่าง Dialog-Eval
  • มุ่งเน้นรองรับภาษาอังกฤษเป็นหลักในเวอร์ชันนี้

บริษัท PolyAI ได้ประกาศเปิดตัวโมเดลสนทนารุ่นใหม่ในชื่อ Dialog-RSN-1 ซึ่งเป็นโมเดลประเภท Audio-Native Dialog Model ที่มีความสามารถในการประมวลผลเสียงพูดโดยตรง ผสานกระบวนการเปลี่ยนตาพูด (Turn-taking), การจดจำเสียงพูด (Speech Recognition), การเรียกใช้งานฟังก์ชัน (Function Calling) และการสร้างคำตอบเข้าด้วยกัน โดยในขณะนี้ยังไม่มีการเปิดเผยโมเดลแบบ Open weights หรือเปิดให้ใช้งานผ่าน Public API สาธารณะแต่อย่างใด ลูกค้าปัจจุบันสามารถเปิดใช้งานได้ทันที ส่วนลูกค้าใหม่สามารถยื่นขอสิทธิ์เข้าถึงล่วงหน้าได้

ในปัจจุบัน สถาปัตยกรรมของระบบเสียงมักแบ่งออกเป็นสองแบบหลัก ซึ่งแต่ละแบบมีข้อจำกัดที่แตกต่างกัน ระบบแบบ Cascaded stack จะส่งเฉพาะผลลัพธ์ที่ดีที่สุดของระบบ ASR ไปยัง LLM ทำให้สูญเสียข้อมูลสำคัญอย่างโทนเสียง ความลังเล และความไม่แน่นอนของการจดจำเสียงก่อนที่ LLM จะได้รับข้อมูล ในขณะที่โมเดลแบบ Speech-to-speech เช่น GPT Realtime และ Gemini Live จะเก็บข้อมูลเสียงไว้ทั้งหมดแต่ฝังเสียงพูดไว้ในตัวโมเดล ทำให้จำกัดการควบคุมการออกเสียง นอกจากนี้ยังมีปัญหาเรื่องการใช้ทรัพยากร GPU ตลอดเวลาสำหรับการโทรแบบ Full-duplex

voice assistant architecture data flow

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

การพัฒนาโมเดลเสียงในปัจจุบันมักต้องเลือกระหว่างความแม่นยำในการตีความข้อความกับความลื่นไหลในการตอบโต้แบบเรียลไทม์ แนวทางของ PolyAI ที่ใช้โมเดลวิเคราะห์เสียงเฉพาะขาเข้า (Input only) แล้วส่งต่อการสร้างเสียงไปยังระบบ TTS แยกต่างหาก ช่วยลดภาระการประมวลผลและเพิ่มความแม่นยำในการตัดสินใจจังหวะการพูดคุย ซึ่งเป็นความท้าทายสำคัญในการสร้างเสียงสนทนาของปัญญาประดิษฐ์ให้เป็นธรรมชาติเหมือนมนุษย์

สำหรับแนวทางการทำงานของ Dialog-RSN-1 จะรับรู้เสียงเฉพาะที่ขาเข้าเท่านั้น โดยโมเดลเดียวจะทำหน้าที่วิเคราะห์เสียงดิบและส่งมอบการสร้างเสียงไปยังระบบ TTS ที่สามารถควบคุมผ่าน Prompt ได้แยกต่างหาก ระบบจะทำงานผ่านการเรียกใช้งานตามความต้องการ (On-demand) แทนที่จะเป็นการสตรีมมิ่งตลอดเวลา โดยอาศัยระบบ VAD ที่มีความแม่นยำสูงร่วมกับตัวจับเวลาเพื่อตัดสินใจช่วงเวลาที่เหมาะสมในการรันโมเดล และโทเค็นแรกของการตอบกลับจะเป็นตัวกำหนดว่าตัวแทนสนทนาควรจะพูดตอบกลับหรือไม่

3.9อัตราการยอมรับเฉลี่ยของ Speculative drafter
6.9%อัตราความผิดพลาดของคำ (WER) สำหรับ gpt-4o-transcribe เมื่อใช้บริบทเดียวกัน

ในด้านการฝึกอบรม ทาง PolyAI ได้ทำการฝึกอบรมโมเดล Multimodal แบบ Open-weight เพิ่มเติมด้วยกระบวนการ Supervised และ Reinforcement finetuning จากข้อมูลภายในองค์กร โดยประเมินโมเดลพื้นฐานหลายตัว เช่น Gemma, GPT-OSS, Qwen และ Mistral พร้อมทั้งปรับแต่งความหน่วงให้ต่ำกว่า 300 มิลลิวินาทีบน GPU A100 รวมถึงการถอดเสียงพูดที่จะทำงานเป็นลำดับสุดท้ายหลังจากการตอบสนองหรือการเรียกใช้เครื่องมือเสร็จสิ้น

ที่มา: MarkTechPost

ความคิดเห็น

แสดงความคิดเห็น
0/2000

พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้