ElevenLabs เปิดตัว Dubbing v2 ชูจุดเด่นรักษาอารมณ์และเสียงต้นฉบับ รองรับกว่า 90 ภาษา
อัปเดตโมเดลพากย์เสียง AI ครั้งใหญ่จาก ElevenLabs เพิ่มการควบคุมสำเนียงเฉพาะถิ่น แยกเสียงพูดและเสียงพื้นหลัง พร้อมรองรับวิดีโอหลายผู้พูด

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
- ElevenLabs เปิดตัว Dubbing v2 รองรับการแปลภาษามากกว่า 90 ภาษา
- คงอารมณ์ จังหวะ และการส่งเสียงของผู้พูดต้นฉบับได้อย่างแม่นยำ
- เพิ่มฟีเจอร์ควบคุมสำเนียงเฉพาะถิ่น เช่น ภาษาสเปนแบบคาสทิลและลาตินอเมริกา
- จัดการเสียงพื้นหลังและผู้พูดหลายคนได้ พร้อมเตรียมเปิดใช้งานผ่าน API เร็วๆ นี้
ElevenLabs ได้ประกาศเปิดตัว Dubbing v2 โมเดล AI พากย์เสียงที่ได้รับการออกแบบโครงสร้างใหม่ทั้งหมด โดยมีเป้าหมายเพื่อรักษาอารมณ์ วิธีการสื่อสาร และจังหวะเวลาของผู้พูดต้นฉบับเอาไว้ ในขณะที่ทำการแปลเนื้อหาข้ามภาษามากกว่า 90 ภาษา การอัปเดตครั้งนี้ช่วยขยายขอบเขตการแปลภาษาของบริษัทให้ก้าวข้ามการแทนที่ด้วยเสียงพื้นฐาน ไปสู่การควบคุมที่ครอบคลุมถึงสำเนียงเฉพาะถิ่น เนื้อหาที่มีผู้พูดหลายคน และการจัดการเสียงประกอบฉากสำหรับวิดีโอและเสียงที่มีความซับซ้อนมากยิ่งขึ้น
ตามประกาศอย่างเป็นทางการ โมเดลนี้ถูกพัฒนาขึ้นสำหรับครีเอเตอร์ นักการตลาด สตูดิโอ และสถานีโทรทัศน์ที่ต้องการแปลภาษาในระดับการผลิตจริง โดยมีการเชื่อมต่อกับ ElevenCreative เพื่อการแปลวิดีโอในคลิกเดียว และ ElevenProductions ซึ่งเป็นบริการแปลภาษาระดับมืออาชีพของบริษัท

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
เป้าหมายหลักคือการรักษาการแสดงออกเดิมเอาไว้แทนที่จะเป็นการสร้างเสียงแปลขึ้นมาเฉยๆ ซึ่งมีความสำคัญอย่างยิ่งสำหรับเนื้อหาที่จังหวะ การเน้นเสียง และอารมณ์เป็นส่วนหนึ่งของสาร เช่น แคมเปญการตลาด วิดีโอของครีเอเตอร์ และรายการที่ผลิตอย่างมืออาชีพ Dubbing v2 ถูกออกแบบมาเพื่อให้บทพูดที่แปลแล้วซิงโครไนซ์กับจังหวะและการส่งเสียงของผู้พูดต้นฉบับในทุกภาษาที่รองรับ
การพัฒนาเทคโนโลยีการพากย์เสียงด้วย AI ในปัจจุบันเริ่มให้ความสำคัญกับรายละเอียดด้านอารมณ์และบริบททางวัฒนธรรมมากขึ้น มากกว่าแค่การแปลคำต่อคำแบบตรงไปตรงมา การที่โมเดลสามารถแยกแยะเสียงพื้นหลังและสำเนียงท้องถิ่นได้ ช่วยลดขั้นตอนการทำงานหลังการผลิต (Post-production) ที่เคยใช้เวลานานลงอย่างมาก ทำให้ครีเอเตอร์และสตูดิโอขนาดเล็กสามารถเข้าถึงการผลิตคอนเทนต์ระดับสากลได้ง่ายขึ้น
การเพิ่มฟีเจอร์ควบคุมที่บันทึกไว้ในเวิร์กโฟลว์ถือเป็นจุดเด่นสำคัญ โดยช่วยให้ทีมงานมีทางเลือกในการปรับแต่งการพากย์ให้เข้ากับเนื้อหาต้นฉบับและกลุ่มเป้าหมาย โดยเฉพาะในโครงการที่มีความหลากหลายของภาษาถิ่นหรือมีการผสมผสานระหว่างบทพูดและเสียงประกอบ
สำหรับการแปลภาษาสเปน ความสามารถเรื่องสำเนียงถือว่ามีความสำคัญเป็นพิเศษ โดย ElevenLabs เน้นย้ำถึงความแม่นยำของสำเนียงภูมิภาค เช่น สำเนียงสเปนแบบคาสทิล (Castilian Spanish) และสำเนียงลาตินอเมริกา ฟิลด์ target_accent ที่ระบุไว้ช่วยให้สามารถใส่สำเนียงเฉพาะถิ่นได้ แม้ทาง ElevenLabs จะระบุว่าฟีเจอร์นี้ยังอยู่ในสถานะทดลองก็ตาม ทีมงานจึงควรพิจารณาเป็นตัวเลือกเสริมที่ต้องผ่านการตรวจสอบตามข้อกำหนดด้านกองบรรณาธิการและแบรนด์ของตนเอง
การอัปเดตนี้ยังแก้ปัญหาข้อจำกัดทั่วไปของการพากย์อัตโนมัติ เนื่องจากเสียงต้นฉบับจริงมักไม่ใช่เสียงเดี่ยวที่สะอาดเรียบร้อย โดยการสัมภาษณ์ รายการ โฆษณา และคอนเทนต์โซเชียลอาจประกอบด้วยผู้พูดหลายคน ดนตรี เอฟเฟกต์ และเสียงบรรยากาศรอบข้าง พารามิเตอร์ num_speakers และอินพุตเสียงฉากหน้ากับฉากหลังที่แยกจากกันแสดงให้เห็นว่า Dubbing v2 ถูกออกแบบมาเพื่อรองรับอินพุตที่มีความซับซ้อนเหล่านี้ ตัวเลือก drop_background_audio ยังช่วยให้ผู้ใช้สามารถถอดเสียงพื้นหลังออกได้เมื่อจำเป็นต้องใช้งานในรูปแบบดังกล่าว
ที่มา: Dev.to
พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้
ความคิดเห็น
แสดงความคิดเห็น