Google เปิดตัว Gemini 3.8 Flash TTS และ Flash-Lite TTS รองรับการออกแบบเสียงด้วย Prompt
Google เปิดตัวโมเดลแปลงข้อความ เป็นเสียงรุ่นใหม่ Gemini 3.8 Flash TTS และ Flash-Lite TTS เปิดให้ใช้งานผ่าน Gemini API และ Google AI Studio แล้ว

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
- Google เปิดตัวโมเดล Gemini 3.8 Flash TTS และ Flash-Lite TTS แล้ว
- รองรับการออกแบบเสียงผ่าน Prompt และสคริปต์การแสดง
- รองรับการโคลนเสียงจากตัวอย่างเสียงความยาว 30 วินาที
- ฝังลายน้ำ SynthID และ C2PA ในทุกคลิปเสียงเพื่อความปลอดภัย
Google ได้ประกาศเปิดตัวโมเดลปัญญาประดิษฐ์แปลงข้อความ เป็นเสียง (Text-to-Speech) รุ่นใหม่ล่าสุด ได้แก่ Gemini 3.8 Flash TTS และ Flash-Lite TTS ซึ่งมาพร้อมกับความสามารถในการออกแบบเสียงผ่าน Prompt และการควบคุมทิศทางเสียงที่ละเอียดยิ่งขึ้น โดยในขณะนี้โมเดลทั้งสองรุ่นกำลังทยอยปล่อยให้ใช้งานผ่านทาง Gemini API และ Google AI Studio เรียบร้อยแล้ว
สำหรับการใช้งานในปัจจุบัน จะเป็นการเข้าถึงผ่านระบบ API เท่านั้น โดยยังไม่มีการเปิดให้นำโมเดลไปโฮสต์เองแบบ Open Weights แต่อย่างใด ในส่วนของการใช้งานระดับองค์กรผ่านทาง Gemini Enterprise นั้น ทาง Google ระบุว่าจะมีการเปิดให้บริการในเร็วๆ นี้ โดยใน AI Studio จะใช้งานผ่านรหัสตัวระบุโมเดลคือ gemini-3.8-flash-tts และ gemini-3.8-flash-lite-tts

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
ในด้านความสามารถของการสร้างเสียง โมเดลรุ่นก่อนหน้าของ Gemini เคยมีเสียงต้นฉบับให้เลือกใช้งานจำนวน 30 เสียง แต่สำหรับการอัปเดตในเวอร์ชัน 3.8 นี้ ได้เปลี่ยนผ่านไปสู่ระบบเสียงที่มีขนาดใหญ่และยืดหยุ่นมากขึ้น โดยโมเดลทั้งสองรุ่นรองรับการใส่คำสั่งควบคุมการแสดง (Stage Directions) ลงไปในบทสคริปต์โดยตรง รวมถึงสามารถควบคุมน้ำเสียงและการถ่ายทอดอารมณ์จากคำใบ้ในสคริปต์ที่เป็นธรรมชาติได้อีกด้วย
การเพิ่มความสามารถในการใส่คำสั่งควบคุมการแสดงและ Prompt-Based Voice Design สะท้อนให้เห็นถึงแนวโน้มของวงการ AI เสียงที่ต้องการข้ามผ่านข้อจำกัดของการสังเคราะห์เสียงแบบเดิมๆ ที่มักฟังดูราบเรียบไร้อารมณ์ การที่นักพัฒนาสามารถกำหนดโทนเสียงผ่านสคริปต์ได้โดยตรง ช่วยลดขั้นตอนในการปรับแต่งเสียงพากย์หรือเสียงผู้ช่วยอัจฉริยะให้เข้ากับบริบทต่างๆ ได้รวดเร็วยิ่งขึ้น ซึ่งเป็นประโยชน์อย่างมากต่ออุตสาหกรรมสื่อและแอปพลิเคชันสนทนา
นอกจากนี้ ฟีเจอร์การโคลนเสียง (Voice Replication) ในระบบใหม่นี้ ยังช่วยให้ผู้พัฒนาสามารถสร้างโปรไฟล์เสียงที่มีความสม่ำเสมอได้จากการใช้ตัวอย่างเสียงความยาวเพียง 30 วินาทีเท่านั้น โดยมีข้อกำหนดที่สำคัญคือ เสียงตัวอย่างนั้นต้องเป็นเสียงของผู้ใช้งานเองหรือเสียงที่ได้รับสิทธิ์ในการใช้อย่างถูกต้องตามกฎหมาย
กระบวนการโคลนเสียงยังต้องมีการบันทึกเสียงยินยอม (Verbal Consent) จากเจ้าของเสียงจริง เพื่อนำมาตรวจสอบเทียบเคียงกับผู้พูดอ้างอิง ในด้านมาตรการความปลอดภัย คลิปเสียงทุกคลิปที่สร้างจากโมเดลเสียงของ Gemini จะมีการฝังลายน้ำ SynthID ที่มองไม่ด้วยตาเปล่าฝังไว้ในเอาต์พุตเสียงโดยตรง ขณะที่เสียงที่ผ่านการโคลนจะมาพร้อมกับข้อมูลรับรองเนื้อหา C2PA เพื่อความโปร่งใสและการตรวจสอบย้อนกลับ
ที่มา: MarkTechPost
พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้
ความคิดเห็น
แสดงความคิดเห็น