ElevenLabs เปิดตัว Dubbing v2 ระบบพากย์เสียง AI รองรับกว่า 90 ภาษา
อัปเดตใหม่เน้นความแม่นยำในการซิงค์เสียง จังหวะ และอารมณ์ต้นฉบับ พร้อมเปิดให้ใช้งานแล้วผ่าน ElevenCreative และ ElevenProductions

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
- ElevenLabs เปิดตัว Dubbing v2 รองรับมากกว่า 90 ภาษาและสำเนียง
- ใช้ระบบแปลภาษาแบบ sync-aware ปรับคำพูดให้เข้ากับจังหวะเสียงต้นฉบับ
- วิเคราะห์จากประสิทธิภาพเสียงเดิมแทนการแปลจากตัวอักษรอย่างเดียว
- เปิดให้ใช้งานผ่าน ElevenCreative และ ElevenProductions พร้อมเตรียมปล่อย API เร็วๆ นี้
ElevenLabs ได้ประกาศเปิดตัว Dubbing v2 ซึ่งเป็นการอัปเดตเทคโนโลยีการพากย์เสียงด้วยปัญญาประดิษฐ์ โดยรองรับมากกว่า 90 ภาษาและสำเนียง พร้อมทั้งมุ่งเน้นการรักษาโทนเสียง จังหวะการพูด และอารมณ์ความรู้สึกของผู้พูดต้นฉบับเอาไว้ หัวใจสำคัญของการอัปเดตครั้งนี้คือระบบแปลภาษาที่รับรู้การซิงค์ ซึ่งถูกออกแบบมาเพื่อปรับแต่งคำพูดให้มีความเป็นธรรมชาติในการพูดจริง โดยยังคงความสอดคล้องกับเสียงต้นฉบับได้อย่างแม่นยำ
สำหรับการแปลภาษาสำหรับวิดีโอทั่วโลก การผสมผสานนี้ช่วยแก้ปัญหาข้อจำกัดทางปฏิบัติที่กระบวนการพากย์เสียงต้องเผชิญมาโดยตลอด การแปลอาจมีความถูกต้องตามหลักภาษา แต่อาจฟังดูไม่เป็นธรรมชาติเมื่อเปล่งเสียงออกมา หรืออาจมีความยาวเกินไปหรือสั้นเกินไปสำหรับฉากต้นฉบับ Dubbing v2 จึงถูกสร้างขึ้นมาเพื่อจัดการกับปัญหาทั้งสองประการนี้โดยการอ้างอิงจากเสียงการแสดงผลต้นฉบับ แทนที่จะใช้เพียงแค่สคริปต์ตัวอักษรเป็นอินพุตหลัก

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
ตามประกาศอย่างเป็นทางการของ ElevenLabs ระบบนี้จะทำการซิงค์จุดเริ่มต้น จุดสิ้นสุด และจังหวะให้เข้ากับเนื้อหาต้นฉบับโดยอัตโนมัติ ทางบริษัทวางตำแหน่งการปล่อยตัวนี้ว่าเป็นวิธีรักษาบุคลิกภาพของผู้พูดข้ามภาษา มากกว่าการสร้างแทร็กเสียงที่แปลออกมาเฉยๆ ความแตกต่างที่สำคัญในคำอธิบายของ ElevenLabs คือการประมวลผลตามประสิทธิภาพของเสียงเดิม แทนที่จะทำงานจากบทพูดที่เป็นลายลักษณ์อักษรเท่านั้น Dubbing v2 ใช้คุณลักษณะของการส่งเสียงต้นฉบับมาช่วยกำหนดเสียงพากย์ที่สร้างขึ้น
การที่ระบบพากย์เสียง AI สามารถวิเคราะห์อารมณ์และจังหวะ (Performance Conditioning) แทนที่จะแปลงข้อความตรงๆ ถือเป็นก้าวสำคัญที่ช่วยลดความแข็งกระด้างของเสียงสังเคราะห์ ทำให้ผู้ฟังในภาษาอื่นรู้สึกอินไปกับเนื้อหาได้ไม่ต่างจากผู้ชมในภาษาต้นฉบับ
การปล่อยตัวครั้งนี้มาพร้อมกับสามองค์ประกอบที่เชื่อมโยงกัน:
- ค่าเริ่มต้นเจ็ดวัน: 1 นาทีบนแพ็กเกจ Free, 15 นาทีบน Starter และ 30 นาทีบน Creator+
- ความพร้อมใช้งาน: เปิดให้ใช้งานใน ElevenCreative สำหรับครีเอเตอร์ และ ElevenProductions สำหรับสตูดิโอ
- การพัฒนาในอนาคต: เตรียมเปิดตัว Dubbing API เร็วๆ นี้เพื่อขยายการใช้งานในระบบอัตโนมัติ
ในส่วนของผู้ใช้ระดับองค์กร การอัปเดตนี้ไม่ได้หมายความว่าทุกการตัดสินใจแปลภาษาจะต้องใช้ระบบอัตโนมัติทั้งหมด แต่เป็นการเปลี่ยนแปลงว่ามนุษย์ควรใช้เวลาไปกับส่วนใด ทีมงานด้านความคิดสร้างสรรค์และภาษาจะสามารถมุ่งเน้นไปที่การตรวจสอบเฉพาะตลาด ความเหมาะสมของแบรนด์ และการตัดสินใจเชิงบรรณาธิการได้ ในขณะที่ระบบจัดการเรื่องการสร้างเสียงและการซิงค์เวลาให้
ที่มา: Dev.to
พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้
ความคิดเห็น
แสดงความคิดเห็น