Cartesia เปิดตัว Sonic-3.6 โมเดล TTS สตรีมมิงความเร็วสูง
Cartesia ปล่อย Sonic-3.6 โมเดลสังเคราะห์เสียงแบบสตรีมมิงรุ่นใหม่ ทำความเร็วลาเทนซีต่ำกว่า 90 มิลลิวินาที และครองแชมป์บน Artificial Analysis

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
- Cartesia เปิดตัว Sonic-3.6 โมเดล TTS แบบสตรีมมิงรุ่นล่าสุดในรูปแบบเบตาและโฮสต์ API
- ทำเวลาลาเทนซี (Time-to-First-Audio) ต่ำกว่า 90 มิลลิวินาที และ 100 มิลลิวินาทีสำหรับ STT
- ขับเคลื่อนด้วยโครงสร้าง State Space Models แทนสถาปัตยกรรม Transformer
- ค่าบริการอยู่ที่ 49.00 ดอลลาร์ต่อ 1 ล้านตัวอักษรบนการประเมินของ Artificial Analysis
Cartesia บริษัทผู้พัฒนาเทคโนโลยีปัญญาประดิษฐ์ ได้ประกาศเปิดตัวโมเดลแปลงข้อความ เป็นเสียงพูด (Text-to-Speech) รุ่นใหม่ล่าสุดในชื่อ Sonic-3.6 โดยโมเดลดังกล่าวเปิดให้ใช้งานแล้วในรูปแบบเบตา และผ่านบริการโฮสต์ API ซึ่งเป็นโมเดลเชิงพาณิชย์แบบปิด (Closed Commercial Model) ที่ไม่มีการแจกจ่ายน้ำหนักโมเดลแบบเปิดหรือมีที่เก็บข้อมูลบน Hugging Face แต่เน้นให้ลูกค้านำไปใช้งานผ่านการเช่าบริการแทน
ความโดดเด่นทางเทคนิคของ Sonic คือการเลือกใช้งานสถาปัตยกรรมแบบ State Space Models แทนที่จะเลือกใช้สถาปัตยกรรม Transformer แบบดั้งเดิมที่นิยมใช้กันทั่วไป ทาง Cartesia ระบุว่าแนวทางนี้ช่วยทลายข้อจำกัดเดิมๆ ระหว่างความเร็วและความเป็นธรรมชาติ รวมถึงความแม่นยำและต้นทุน ซึ่งมองว่าเป็นเรื่องของโครงสร้างสถาปัตยกรรมที่สามารถปรับปรุงได้

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
ในด้านประสิทธิภาพการทำงานจริง โมเดลนี้มุ่งเน้นไปที่ตัวชี้วัดเวลาในการผลิตเสียงแรก (Time-to-First-Audio) โดยทาง Cartesia เคลมตัวเลขลาเทนซีสำหรับการสังเคราะห์เสียง TTS ไว้ที่ต่ำกว่า 90 มิลลิวินาที และมีความล่าช้าของทรานสคริปต์ที่ 100 มิลลิวินาทีสำหรับโมเดลแปลงเสียงพูดเป็นข้อความ (Speech-to-Text) รุ่น Ink-2 ซึ่งตัวเลขทั้งสองนี้เป็นค่าลาเทนซีที่ระบุจากฝั่งผู้ให้บริการโดยตรง ยังไม่ใช่การวัดผลแบบ End-to-End รอบขาไปและกลับ
ระบบควบคุมภายในของ Sonic ถูกออกแบบมาให้รองรับการทำงานร่วมกับตัวแทนสนทนา (Agent Transcripts) มากกว่าการใช้เพื่อการอ่านออกเสียงบรรยายทั่วไป โดยตัวอย่างการสาธิตจากทาง Cartesia แสดงให้เห็นถึงการสร้างเสียงภาษาอังกฤษที่มีจังหวะหยุดพักอย่างเป็นธรรมชาติ มีคำอุทานหรือคำเติมเต็ม (Filler Words) รวมถึงความสามารถในการสลับภาษาแบบ Hinglish ระหว่างภาษาฮินดีและภาษาอังกฤษได้อย่างราบรื่น
การที่ Cartesia เลือกใช้ State Space Models (SSMs) แทน Transformers ถือเป็นจุดเปลี่ยนสำคัญในการลดภาระการประมวลผลสำหรับงานสตรีมมิงแบบเรียลไทม์ เนื่องจากสถาปัตยกรรม SSMs สามารถจัดการกับลำดับข้อมูลที่มีความยาวมากๆ ได้อย่างมีประสิทธิภาพมากกว่าโดยใช้ทรัพยากรหน่วยความจำที่น้อยกว่า ส่งผลให้สามารถทำความเร็วลาเทนซีในระดับมิลลิวินาทีที่จำเป็นอย่างยิ่งสำหรับระบบเสียงตอบรับอัตโนมัติหรือ AI Agents ได้ดีขึ้น
สำหรับการประเมินราคาและการแข่งขันในตลาด ทาง Artificial Analysis ได้ทำการปรับมาตรฐานราคาของ Sonic 3.6 อยู่ที่ 49.00 ดอลลาร์สหรัฐต่อ 1 ล้านตัวอักษร ซึ่งถือว่ามีราคาถูกเป็นครึ่งหนึ่งของโมเดล Eleven v3 จาก ElevenLabs ที่ตั้งราคาไว้ 100.00 ดอลลาร์สหรัฐ แต่ก็ยังมีราคาสูงกว่าโมเดล Speechify Simba 3.2 ที่คิดราคา 10.00 ดอลลาร์สหรัฐสำหรับคะแนน Elo ที่ระดับ 1,240
ทั้งนี้ รูปแบบการขายของ Cartesia จะใช้วิธีการขายเครดิตแทนการนับจำนวนตัวอักษรตรงๆ โดยแพ็กเกจ Scale ในราคา 299 ดอลลาร์สหรัฐต่อเดือน จะรวมการใช้งาน TTS ประมาณ 10,667 นาที พร้อมคำขอใช้งานพร้อมกัน (Concurrent Requests) สูงสุด 15 คำขอ สำหรับบริการสายเสียงพูด (Line Voice Agents) จะคิดค่าบริการแยกต่างหากในอัตรา 0.06 ดอลลาร์สหรัฐต่อนาที โดยข้อมูลทั้งหมดได้รับการตรวจสอบความถูกต้อง ณ วันที่ 18 สิงหาคม 2026
ที่มา: MarkTechPost
พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้
ความคิดเห็น
แสดงความคิดเห็น