ข้ามไปเนื้อหาหลัก

Google เปิดตัว Gemini 3.5 รุ่นใหม่ อัปเกรดความสามารถเสียง

Google อัปเดต Gemini Audio ด้วยรุ่น Gemini 3.5 Transcribe และ Live พร้อมความสามารถตัดคำติดปากอัตโนมัติ รองรับกว่า 85 ภาษา

เรียบเรียงโดย AI
Inewgen
27 Aug 2026ที่มา: The Verge3 นาทีอ่าน (0 ครั้ง)อัปเดตล่าสุด 19 Sep 2026
แชร์
Google เปิดตัว Gemini 3.5 รุ่นใหม่ อัปเกรดความสามารถเสียง

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

ขนาดตัวอักษร
  • Google เปิดตัวโมเดลเสียงตระกูล Gemini 3.5 ใหม่ล่าสุด ได้แก่ Transcribe, Live และ Live Experimental
  • Gemini 3.5 Transcribe มีความสามารถตัดคำติดปาก เช่น "um" และ "uh" ออกจากข้อความอัตโนมัติ
  • รองรับการถอดเสียงมากกว่า 85 ภาษา ป้องกันข้อผิดพลาดด้วยคำศัพท์เฉพาะที่ผู้ใช้กำหนดเอง
  • เปิดให้ใช้งานแล้ววันนี้สำหรับผู้ใช้แอป Gemini บน macOS และฟีเจอร์ Rambler บน Android

Google ได้ประกาศอัปเดตกลุ่มผลิตภัณฑ์ Gemini Audio ด้วยการเปิดตัวโมเดลใหม่ในตระกูล Gemini 3.5 ซึ่งเข้ามาเสริมทัพในขณะที่ผู้ใช้งานหลายคนยังคงรอคอยการเปิดตัวของโมเดล Gemini 3.5 Pro ที่ทางบริษัทเคยสัญญาว่าจะปล่อยออกมาตั้งแต่ช่วงเดือนมิถุนายนที่ผ่านมา โดยการอัปเดตครั้งนี้มุ่งเน้นไปที่การยกระดับประสิทธิภาพด้านเสียงและการถอดเสียงด้วยปัญญาประดิษฐ์

ไฮไลต์สำคัญของการอัปเดตครั้งนี้คือการเปิดตัวโมเดลใหม่อย่าง Gemini 3.5 Transcribe ซึ่งถูกพัฒนาขึ้นมาเพื่อยกระดับความสามารถในการแปลงเสียงพูดเป็นข้อความให้มีความแม่นยำยิ่งขึ้น โดยทาง Google ระบุว่าโมเดลนี้ถือเป็นก้าวสำคัญที่พัฒนาต่อยอดมาจากรุ่นก่อนหน้าอย่าง Chirp 3 ทั้งในด้านประสิทธิภาพการทำงานหลายภาษาและการลดอัตราความผิดพลาดของคำ

โมเดลใหม่นี้มาพร้อมกับฟีเจอร์ที่น่าสนใจมากมาย ซึ่งช่วยอำนวยความสะดวกให้ผู้ใช้งานสามารถจัดการกับข้อความเสียงได้อย่างราบรื่น:

  • ระบบตัดคำฟุ่มเฟือยหรือคำติดปาก เช่น "um" และ "uh" ออกจากบทถอดเสียงโดยอัตโนมัติ
  • รองรับการระบุตัวตนของผู้พูดในเสียงบันทึกได้สูงสุดถึง 3 คน พร้อมทั้งระบุเวลาแบบรายคำ (word-level timestamps)
  • ความสามารถในการเพิ่มคำศัพท์เฉพาะ (customized vocabulary) เพื่อช่วยให้ระบบจดจำคำศัพท์เฉพาะทางและการสะกดคำที่ถูกต้องได้แม่นยำยิ่งขึ้น
85+ภาษาที่รองรับการถอดเสียง
3จำนวนผู้พูดสูงสุดที่ระบบแยกแยะได้

นอกเหนือจากโมเดล Transcribe แล้ว Google ยังได้ปล่อย Gemini 3.5 Live และ Gemini 3.5 Live Experimental ออกมาพร้อมกัน โดยโมเดลเหล่านี้ต่อยอดมาจากเทคโนโลยีการจดจำเสียงที่ใช้งานอยู่ในโหมดสนทนาด้วยเสียงของ Gemini ซึ่งรุ่น Live จะช่วยจัดการกับการถูกขัดจังหวะกลางประโยค การจดจำภาษา และการประมวลผลภาพสดได้ดีขึ้น ขณะที่รุ่น Experimental จะเพิ่มความสามารถในการบรรยายความคืบหน้าแบบเรียลไทม์ขณะประมวลผลโจทย์ที่ซับซ้อน

ไม่อยากพลาดข่าวใหม่?

สมัครรับสรุปข่าวสารใหม่ทางอีเมล ไม่บ่อยจนรำคาญ

โฆษณา

การที่ Google ตัดสินใจทยอยปล่อยโมเดลตระกูลเสียงออกมาก่อนการมาของ Gemini 3.5 Pro แสดงให้เห็นถึงกลยุทธ์การแบ่งสายผลิตภัณฑ์ที่ชัดเจนในการเจาะตลาดเครื่องมือช่วยบันทึกเสียงและปัญญาประดิษฐ์เชิงสนทนา (Voice AI) ซึ่งกำลังแข่งขันกันอย่างดุเดือดในกลุ่มผู้ใช้งานทั่วไปและนักพัฒนา โดยฟีเจอร์อย่างการคัดกรองคำติดปากและการปรับแต่งศัพท์เฉพาะถือเป็นจุดขายสำคัญที่จะช่วยลดเวลาในการตรวจสอบและแก้ไขข้อความหลังการถอดเสียงได้เป็นอย่างมาก

smartphone audio application interface

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

สำหรับการให้บริการในเบื้องต้น การอัปเดต Gemini Audio เหล่านี้ได้เริ่มทยอยปล่อยให้ใช้งานแล้วตั้งแต่วันนี้ โดยรองรับภาษาอังกฤษสำหรับผู้ใช้งานแอป Gemini บนระบบ macOS รวมถึงฟีเจอร์การ dictation ผ่าน Rambler บน Android ในบางประเทศและบางภาษา นอกจากนี้ยังเปิดให้เหล่านักพัฒนาสามารถเข้าถึงได้ผ่าน public preview ใน Gemini API ผ่านทาง AI Studio และ Antigravity โดยทาง Google ยืนยันว่าการรองรับบนเบราว์เซอร์ Chrome จะตามมาในเร็วๆ นี้

ที่มา: The Verge

ความคิดเห็น

แสดงความคิดเห็น
0/2000

พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้