ข้ามไปเนื้อหาหลัก

Google เปิดตัว Gemini 3.8 Flash TTS และ Flash-Lite TTS รองรับการออกแบบเสียงด้วย Prompt

Google เปิดตัวโมเดลแปลงข้อความ เป็นเสียงรุ่นใหม่ Gemini 3.8 Flash TTS และ Flash-Lite TTS เปิดให้ใช้งานผ่าน Gemini API และ Google AI Studio แล้ว

เรียบเรียงโดย AI
Inewgen
24 Sep 2026ที่มา: MarkTechPost2 นาทีอ่าน (0 ครั้ง)
แชร์
Google เปิดตัว Gemini 3.8 Flash TTS และ Flash-Lite TTS รองรับการออกแบบเสียงด้วย Prompt

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

ขนาดตัวอักษร
  • Google เปิดตัวโมเดล Gemini 3.8 Flash TTS และ Flash-Lite TTS แล้ว
  • รองรับการออกแบบเสียงผ่าน Prompt และสคริปต์การแสดง
  • รองรับการโคลนเสียงจากตัวอย่างเสียงความยาว 30 วินาที
  • ฝังลายน้ำ SynthID และ C2PA ในทุกคลิปเสียงเพื่อความปลอดภัย

Google ได้ประกาศเปิดตัวโมเดลปัญญาประดิษฐ์แปลงข้อความ เป็นเสียง (Text-to-Speech) รุ่นใหม่ล่าสุด ได้แก่ Gemini 3.8 Flash TTS และ Flash-Lite TTS ซึ่งมาพร้อมกับความสามารถในการออกแบบเสียงผ่าน Prompt และการควบคุมทิศทางเสียงที่ละเอียดยิ่งขึ้น โดยในขณะนี้โมเดลทั้งสองรุ่นกำลังทยอยปล่อยให้ใช้งานผ่านทาง Gemini API และ Google AI Studio เรียบร้อยแล้ว

สำหรับการใช้งานในปัจจุบัน จะเป็นการเข้าถึงผ่านระบบ API เท่านั้น โดยยังไม่มีการเปิดให้นำโมเดลไปโฮสต์เองแบบ Open Weights แต่อย่างใด ในส่วนของการใช้งานระดับองค์กรผ่านทาง Gemini Enterprise นั้น ทาง Google ระบุว่าจะมีการเปิดให้บริการในเร็วๆ นี้ โดยใน AI Studio จะใช้งานผ่านรหัสตัวระบุโมเดลคือ gemini-3.8-flash-tts และ gemini-3.8-flash-lite-tts

data center server racks technology

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

ในด้านความสามารถของการสร้างเสียง โมเดลรุ่นก่อนหน้าของ Gemini เคยมีเสียงต้นฉบับให้เลือกใช้งานจำนวน 30 เสียง แต่สำหรับการอัปเดตในเวอร์ชัน 3.8 นี้ ได้เปลี่ยนผ่านไปสู่ระบบเสียงที่มีขนาดใหญ่และยืดหยุ่นมากขึ้น โดยโมเดลทั้งสองรุ่นรองรับการใส่คำสั่งควบคุมการแสดง (Stage Directions) ลงไปในบทสคริปต์โดยตรง รวมถึงสามารถควบคุมน้ำเสียงและการถ่ายทอดอารมณ์จากคำใบ้ในสคริปต์ที่เป็นธรรมชาติได้อีกด้วย

ไม่อยากพลาดข่าวใหม่?

สมัครรับสรุปข่าวสารใหม่ทางอีเมล ไม่บ่อยจนรำคาญ

โฆษณา

การเพิ่มความสามารถในการใส่คำสั่งควบคุมการแสดงและ Prompt-Based Voice Design สะท้อนให้เห็นถึงแนวโน้มของวงการ AI เสียงที่ต้องการข้ามผ่านข้อจำกัดของการสังเคราะห์เสียงแบบเดิมๆ ที่มักฟังดูราบเรียบไร้อารมณ์ การที่นักพัฒนาสามารถกำหนดโทนเสียงผ่านสคริปต์ได้โดยตรง ช่วยลดขั้นตอนในการปรับแต่งเสียงพากย์หรือเสียงผู้ช่วยอัจฉริยะให้เข้ากับบริบทต่างๆ ได้รวดเร็วยิ่งขึ้น ซึ่งเป็นประโยชน์อย่างมากต่ออุตสาหกรรมสื่อและแอปพลิเคชันสนทนา

นอกจากนี้ ฟีเจอร์การโคลนเสียง (Voice Replication) ในระบบใหม่นี้ ยังช่วยให้ผู้พัฒนาสามารถสร้างโปรไฟล์เสียงที่มีความสม่ำเสมอได้จากการใช้ตัวอย่างเสียงความยาวเพียง 30 วินาทีเท่านั้น โดยมีข้อกำหนดที่สำคัญคือ เสียงตัวอย่างนั้นต้องเป็นเสียงของผู้ใช้งานเองหรือเสียงที่ได้รับสิทธิ์ในการใช้อย่างถูกต้องตามกฎหมาย

30sความยาวตัวอย่างเสียงสำหรับโคลน

กระบวนการโคลนเสียงยังต้องมีการบันทึกเสียงยินยอม (Verbal Consent) จากเจ้าของเสียงจริง เพื่อนำมาตรวจสอบเทียบเคียงกับผู้พูดอ้างอิง ในด้านมาตรการความปลอดภัย คลิปเสียงทุกคลิปที่สร้างจากโมเดลเสียงของ Gemini จะมีการฝังลายน้ำ SynthID ที่มองไม่ด้วยตาเปล่าฝังไว้ในเอาต์พุตเสียงโดยตรง ขณะที่เสียงที่ผ่านการโคลนจะมาพร้อมกับข้อมูลรับรองเนื้อหา C2PA เพื่อความโปร่งใสและการตรวจสอบย้อนกลับ

ที่มา: MarkTechPost

ความคิดเห็น

แสดงความคิดเห็น
0/2000

พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้