ข้ามไปเนื้อหาหลัก

Kyutai เปิดตัว Voice of Reason โมเดลเสียงแก้โจทย์เลข

Kyutai เปิดตัว Voice of Reason โมเดล Speech-Native ที่แก้โจทย์คณิตศาสตร์ผ่านการฝึกด้วย Reinforcement Learning และทำคะแนนสูงถึง 77.1%

เรียบเรียงโดย AI
Inewgen
23 Sep 2026ที่มา: MarkTechPost2 นาทีอ่าน (0 ครั้ง)
แชร์
Kyutai เปิดตัว Voice of Reason โมเดลเสียงแก้โจทย์เลข

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

ขนาดตัวอักษร
  • Kyutai เปิดตัวโมเดล Speech-Native แก้โจทย์คณิตศาสตร์ด้วย RL
  • ใช้สถาปัตยกรรมสลับข้อความ 13 โทเค็นและเสียง 26 โทเค็น
  • ทำคะแนนบนชุดทดสอบ GSM8K สูงสุดถึง 77.1%
  • ฝึกฝนบนชิป H100 จำนวน 16 ตัวด้วยการอัปเดต 1,500 ครั้ง

บริษัทวิจัย AI อย่าง Kyutai ได้ประกาศเปิดตัวโมเดลปัญญาประดิษฐ์ตัวใหม่ในชื่อ Voice of Reason ซึ่งเป็นโมเดลแบบ Speech-Native รุ่นแรกที่นำเทคนิค Reinforcement Learning มาใช้ในการแก้โจทย์ปัญหาทางคณิตศาสตร์ด้วยเสียงโดยตรง เพื่อก้าวข้ามข้อจำกัดของระบบแบบเดิมที่ต้องแปลงเสียงเป็นข้อความก่อน

ในปัจจุบัน ระบบแบบ Cascaded pipelines ซึ่งประกอบด้วยการแปลงเสียงพูดเป็นข้อความ ตามด้วยโมเดลภาษาขนาดใหญ่ และแปลงข้อความกลับเป็นเสียงนั้นยังคงทำคะแนนด้านการให้เหตุผลได้ดีกว่า แต่กระบวนการหลายขั้นตอนเหล่านี้มักสร้างความล่าช้า และทำให้สูญเสียข้อมูลสำคัญเกี่ยวกับน้ำเสียงหรืออารมณ์ไป โมเดลแบบ Speech-Native จึงถูกพัฒนาขึ้นมาเพื่อแก้ไขจุดอ่อนนี้โดยการสร้างเสียงออกมาเป็นระยะเพื่อให้เกิดการโต้ตอบได้ทันที

77.1%คะแนนสูงสุดบน GSM8K
1,500รอบการอัปเดต RL

สำหรับการทำงานภายใน โมเดล GLM-4-Voice พื้นฐานทำคะแนนบนชุดทดสอบ GSM8K ได้ 27.3% ก่อนที่วิธี STITCH จะช่วยเพิ่มขึ้นเป็น 58.7% โดยโมเดลใหม่นี้ใช้วิธีการสลับเอาต์พุตเป็นช่วงๆ คือข้อความ 13 โทเค็น สลับด้วยเสียง 26 โทเค็นวนซ้ำกันไป

ai research laboratory computer hardware technology

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

ในด้านกระบวนการฝึกฝน ทีมงานได้ใช้กลุ่มเป้าหมายร่วมกับวัตถุประสงค์ REINFORCE ซึ่งมีความคล้ายคลึงกับวิธี GRPO แต่ได้ตัดส่วนของ PPO clipping และ KL regularization ออกไป โดยใช้หน่วยประมวลผลกราฟิก H100 จำนวน 16 ตัว และดำเนินการอัปเดตโมเดลด้วย Reinforcement Learning ทั้งหมด 1,500 ครั้ง

ไม่อยากพลาดข่าวใหม่?

สมัครรับสรุปข่าวสารใหม่ทางอีเมล ไม่บ่อยจนรำคาญ

โฆษณา

การที่ Kyutai เลือกใช้สถาปัตยกรรม Speech-Native แทนการต่อท่อระบบเดิม (Cascaded) สะท้อนถึงความพยายามของวงการ AI ในการลด Latency หรือความหน่วงในการตอบสนอง ซึ่งเป็นหัวใจสำคัญของการสร้างผู้ช่วยเสียงอัจฉริยะที่สามารถคิดและโต้ตอบได้อย่างเป็นธรรมชาติราวกับมนุษย์ การนำ Reinforcement Learning เข้ามาช่วยในส่วนของกระบวนการคิดคำนวณด้วยเสียงจึงถือเป็นก้าวสำคัญที่ท้าทายขีดจำกัดเดิมของโมเดลเสียง

ทั้งนี้ ผลการประเมินระบุว่าการถอดรหัสแบบไม่ใช้ top-k ให้ผลลัพธ์สูงถึง 70.3% และ 77.1% โดยน้ำหนักโมเดลที่ปล่อยออกมาพร้อมให้ใช้งานสำหรับการโฮสต์เองบนฮาร์ดแวร์ H100 เดี่ยวภายใต้เงื่อนไขสิทธิ์การใช้งานของ GLM-4-Voice

ที่มา: MarkTechPost

ความคิดเห็น

แสดงความคิดเห็น
0/2000

พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้