ข้ามไปเนื้อหาหลัก

Gradium AI ปล่อยโมเดล TTS ใหม่: ผ่านฮาร์ดเคส 81.0% ใน 216 ms

Gradium AI เปิดตัวโมเดล TTS ใหม่ตั้งค่าเริ่มต้นอัตโนมัติบน API และ Studio เมื่อวันที่ 31 ส.ค. 2026 ทำคะแนนฮาร์ดเคส 81.0% ที่เวลา First Audio 216 ms

เรียบเรียงโดย AI
Inewgen
01 Sep 2026ที่มา: MarkTechPost3 นาทีอ่าน (0 ครั้ง)
แชร์
Gradium AI ปล่อยโมเดล TTS ใหม่: ผ่านฮาร์ดเคส 81.0% ใน 216 ms

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

ขนาดตัวอักษร
  • Gradium AI เปิดตัวโมเดล TTS ใหม่เป็นค่าเริ่มต้นบน API และ Studio ตั้งแต่วันที่ 31 สิงหาคม 2026 โดยไม่ต้องย้ายระบบ
  • ทำคะแนนผ่านแบบทดสอบ Hard-Case 500 ประโยค สูงถึง 81.0% เฉลี่ยจาก 5 ภาษาและ 10 เกณฑ์
  • ทำเวลา Time-to-First-Audio (P50) ได้รวดเร็วที่ 216 มิลลิวินาที พร้อมความหน่วงคงที่
  • เปิดโอเพนซอร์สชุดข้อมูลประเมินผล 500 ประโยคบน Hugging Face ภายใต้สัญญาอนุญาต CC BY 4.0

Gradium AI ประกาศอัปเดตครั้งสำคัญด้วยการเปิดตัวโมเดลแปลงข้อความ Text-to-Speech (TTS) ตัวใหม่ ซึ่งถูกตั้งค่าให้เป็นโมเดลเริ่มต้น (Default) บนแพลตฟอร์ม API และ Studio ทันทีตั้งแต่วันที่ 31 สิงหาคม 2026 การเปลี่ยนแปลงนี้ออกแบบมาให้ใช้งานได้อย่างราบรื่นโดยไม่ต้องมีการย้ายระบบแต่อย่างใด เสียงเดิมที่มีอยู่ รวมถึงเสียงโคลนเฉพาะตัว (Custom Clones) สามารถทำงานต่อได้ทันทีโดยไม่ต้องตั้งค่าใหม่

เพื่อให้การประเมินผลมีความโปร่งใส Gradium ได้สร้างชุดประเมินผลจำนวน 500 ประโยค และเปิดโอเพนซอร์สบน Hugging Face ภายใต้สัญญาอนุญาต CC BY 4.0 โดยครอบคลุม 5 ภาษา ได้แก่ อังกฤษ เยอรมัน ฝรั่งเศส สเปน และโปรตุเกส ผ่าน 10 เกณฑ์การทดสอบ ซึ่งแบ่งเป็นเกณฑ์เฉพาะส่วน (Atomic) 7 ด้าน เช่น การสะกดคำ ตัวย่อ ตัวเลขผสมตัวอักษร วันที่ และตัวเลขทศนิยม และเกณฑ์เชิงซ้อน (Composite) 3 ด้าน ได้แก่ คำสั่ง (Orders), ตั๋วไอที (IT Ticket) และการเคลม (Claims)

81.0%Hard-Case Pass Rate ของ Gradium
216 msTime-to-First-Audio (P50)
30 msIQR Spread ที่แคบที่สุด

การให้คะแนนดำเนินการโดยมนุษย์อย่างเข้มงวด โดยผู้ประเมินที่เป็นเจ้าของภาษาต้องได้ยินทุกองค์ประกอบถูกต้องครบถ้วน ประโยคจะถูกปัดตกทันทีหากมีตัวเลขตกหล่นเพียงตัวเดียว ผลคะแนนเฉลี่ยจาก 10 เกณฑ์และ 5 ภาษาพบว่า Gradium TTS ทำได้ 81.0% ตามมาด้วย Cartesia Sonic 3.6 ที่ 75.1%, ElevenLabs v3 Conversational ที่ 65.4%, Fish Audio S2.1 Pro ที่ 49.5% และ Inworld TTS 1.5 Max ที่ 46.5% ตามลำดับเมื่อใช้การตั้งค่าเริ่มต้นทั้งหมดในเดือนสิงหาคม 2026

software engineer workspace computer screen code data analytics

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

ในด้านความเร็วบนเกณฑ์มาตรฐาน TTS ของ Coval ทาง Gradium รายงานเวลา Time-to-First-Audio ที่ระดับ P50 อยู่ที่ 216 มิลลิวินาที ซึ่งเร็กว่าโมเดลรุ่นเดิมที่เข้ามาแทนที่ถึง 170 มิลลิวินาที ตัวเลขที่มีประโยชน์มากกว่าคือส่วนเบี่ยงเบนควอไทล์ (Interquartile Range: p75-p25) ที่ 30 มิลลิวินาทีจากการทดสอบ 480 ครั้ง ซึ่งถือว่าแคบที่สุดในบรรดา 5 โมเดลที่นำมาทดสอบ เปรียบเทียบกับ Cartesia Sonic 3.6 ที่มีค่ากลาง 454 มิลลิวินาทีและความกว้าง 165 มิลลิวินาที

ไม่อยากพลาดข่าวใหม่?

สมัครรับสรุปข่าวสารใหม่ทางอีเมล ไม่บ่อยจนรำคาญ

โฆษณา

การมุ่งเน้นไปที่ค่า Spread หรือความแปรปรวนของเวลาตอบสนอง (Latency Variance) ถือเป็นหัวใจสำคัญในการใช้งานระบบสนทนา AI แบบเรียลไทม์ เนื่องจากผู้ใช้งานจริงมักจะต้องเจอกับช่วงเวลาหน่วงสูงสุด (Tail Latency) มากกว่าค่าเฉลี่ย การที่ Grodium สามารถรักษาความเสถียรของความเร็วเอาไว้ได้ด้วยสเปรดเพียง 30 มิลลิวินาที จึงช่วยลดปัญหาเสียงสะดุดหรือความหน่วงกระตุกที่มักเกิดขึ้นในการสนทนาจริง

แม้ว่า Inworld TTS 2 จะทำเวลาเฉลี่ยได้เร็วกว่าที่ 166 มิลลิวินาที และมีโมเดลอื่นอย่าง Fish Audio S2.1 Pro ที่ 291 มิลลิวินาที รวมถึง ElevenLabs v3 Conversational ที่ 329 มิลลิวินาที แต่จุดขายสำคัญของ Gradium คือการครองตำแหน่งอัตราความผิดพลาดในเคสยาก (Hard-Case) ที่ต่ำที่สุดควบคู่ไปกับความเร็วระดับต่ำกว่า 250 มิลลิวินาทีและความแปรปรวนที่น้อยมาก

สำหรับผู้ใช้งานเดิมไม่ต้องดำเนินการใดๆ เพิ่มเติม ส่วนทีมพัฒนาใหม่สามารถติดตั้งผ่าน Python SDK เชื่อมต่อไปยัง WebSocket TTS endpoint และใช้งาน Voice ID เดิมต่อได้ทันที นอกจากนี้ Gradium ยังเสนอเครดิต 1 ล้านเครดิตให้แก่ผู้ที่พบข้อผิดพลาดแบบฮาร์ดเคสและรายงานเข้ามาผ่านทาง Discord ของบริษัท

ที่มา: MarkTechPost

ความคิดเห็น

แสดงความคิดเห็น
0/2000

พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้