ข้ามไปเนื้อหาหลัก

Sarvam AI เปิดตัว Saaras V4: โมเดลแปลงเสียงเป็นข้อความ

Sarvam AI เปิดตัว Saaras V4 โมเดล Speech-to-Text รองรับ 22 ภาษาอินเดียและภาษาอังกฤษ มาพร้อมความสามารถ Keyterm prompting และทำคะแนนบน IndicContextEval ที่ 16.03% WER เมื่อวันที่ 26 กันยายน 2026

เรียบเรียงโดย AI
Inewgen
สด27 Sep 2026ที่มา: MarkTechPost2 นาทีอ่าน (0 ครั้ง)
แชร์
Sarvam AI เปิดตัว Saaras V4: โมเดลแปลงเสียงเป็นข้อความ

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

ขนาดตัวอักษร
  • Sarvam AI เปิดตัว Saaras V4 โมเดลแปลงเสียงเป็นข้อความรองรับ 22 ภาษาอินเดียและอังกฤษ
  • ใช้สถาปัตยกรรม encoder-decoder ร่วมกับโมเดลภาษา Sarvam-3B ขนาด 3 พันล้านพารามิเตอร์
  • รองรับฟีเจอร์ Keyterm prompting สูงสุด 50 คำเพื่อช่วยเพิ่มความแม่นยำในการจดจำเสียง
  • ทำคะแนน Word Error Rate อยู่ที่ 16.03% บนชุดทดสอบ IndicContextEval

วงการปัญญาประดิษฐ์ตื่นตัวอีกครั้งเมื่อ Sarvam AI ประกาศเปิดตัวโมเดลแปลงเสียงพูดเป็นข้อความรุ่นล่าสุดในชื่อ Saaras V4 ซึ่งออกแบบมาเพื่อรองรับภาษากลุ่มอินเดียทั้งหมด 22 ภาษา รวมถึงภาษาอังกฤษระดับสากล โดยเน้นการยกระดับประสิทธิภาพและความแม่นยำในการถอดเสียงให้ดียิ่งขึ้นกว่ารุ่นก่อนหน้า

ในแง่ของสถาปัตยกรรมภายใน Saaras V4 ทำงานด้วยระบบ encoder-decoder โดยตัว audio encoder จะทำหน้าที่แปลงคลื่นเสียงให้อยู่ในรูปของ embeddings ที่เก็บรายละเอียดด้านสัทศาสตร์และเสียง จากนั้น temporal-downsampling adapter จะย่อความยาวของลำดับและปรับเข้าสู่พื้นที่ embedding space ของโมเดลภาษา ช่วยให้สามารถจัดการกับไฟล์เสียงที่มีความยาวมากๆ ภายในข้อจำกัด context budget ของตัวถอดรหัสได้อย่างมีประสิทธิภาพ

audio waveform data visualization technology screen

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

ส่วนตัวถอดรหัสของระบบนี้ขับเคลื่อนด้วย Sarvam-3B ซึ่งเป็นโมเดลภาษาประเภท hybrid state-space ขนาด 3 พันล้านพารามิเตอร์ที่ถูกฝึกฝนขึ้นมาใหม่ทั้งหมดภายในองค์กร ตัวโมเดลจะอ่านฟีเจอร์เสียงควบคู่ไปกับ text prompt จากนั้นจึงสร้างข้อความถอดเสียงออกมาแบบ autoregressively โดยนำแต่ละโทเค็นที่สร้างขึ้นมาป้อนกลับเป็นอินพุตสำหรับขั้นตอนถัดไป

ไม่อยากพลาดข่าวใหม่?

สมัครรับสรุปข่าวสารใหม่ทางอีเมล ไม่บ่อยจนรำคาญ

โฆษณา

22ภาษาอินเดียที่รองรับ
3Bพารามิเตอร์ Sarvam-3B
16.03%คะแนน WER บน IndicContextEval

จุดเด่นสำคัญในรุ่น V4 คือการเพิ่มฟีเจอร์ Keyterm prompting ซึ่งใช้งานได้เฉพาะกับ saaras:v4 เท่านั้น โดยผู้ใช้งานสามารถส่งรายการคำศัพท์ในรูปแบบ JSON จำนวนสูงสุด 50 คำ (ความยาวไม่เกินคำละ 64 ตัวอักษร) เพื่อช่วยชี้นำความแม่นยำในการจดจำคำศัพท์เฉพาะ นอกจากนี้ยังมีโหมด codemix ที่ช่วยให้ชื่อแบรนด์อย่างเช่น PhonePe ยังคงแสดงผลเป็นตัวอักษรละตินตามที่ต้องการ

การพัฒนาโมเดล Speech-to-Text ที่ครอบคลุมหลากหลายภาษาถิ่นและภาษาท้องถิ่นอย่าง 22 ภาษาของอินเดียถือเป็นความท้าทายทางวิศวกรรมขั้นสูง เนื่องจากความหลากหลายทางสำเนียงและบริบททางภาษา การใช้สถาปัตยกรรมแบบ hybrid state-space ร่วมกับระบบปรับแต่งคำศัพท์เฉพาะ (Keyterm prompting) จึงเป็นแนวทางสำคัญที่ช่วยลดความผิดพลาดในการถอดเสียงชื่อเฉพาะหรือศัพท์เฉพาะทางธุรกิจที่มักสร้างปัญหาให้กับโมเดลทั่วไป

สำหรับการใช้งานจริง ระบบสามารถเรียกใช้งานผ่าน API ของ Sarvam ได้ทันทีโดยใช้พารามิเตอร์ model="saaras:v4" โดยในขณะนี้ตัวเลขและผลการทดสอบทั้งหมดเป็นข้อมูลที่ทางผู้พัฒนาเปิดเผยออกมาเอง และยังไม่มีรายงานการตรวจสอบซ้ำจากนักวิจัยอิสระตีพิมพ์ออกมาอย่างเป็นทางการในขณะนี้

ที่มา: MarkTechPost

ความคิดเห็น

แสดงความคิดเห็น
0/2000

พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้