ข้ามไปเนื้อหาหลัก

Google เปิดตัว Gemini 3.8 Live และ Extended Thinking

Google เปิดตัวโมเดล Gemini 3.8 Live และ 3.8 Live Extended Thinking สำหรับสร้าง voice agents ระดับโปรดักชัน พร้อมใช้งานแล้วผ่าน Gemini Live API และ Google AI Studio ในราคา 0.005 ดอลลาร์ต่อนาทีสำหรับเสียงเข้า

เรียบเรียงโดย AI
Inewgen
16 Sep 2026ที่มา: MarkTechPost3 นาทีอ่าน (0 ครั้ง)
แชร์
Google เปิดตัว Gemini 3.8 Live และ Extended Thinking

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

ขนาดตัวอักษร
  • Google เปิดตัว Gemini 3.8 Live และ 3.8 Live Extended Thinking รองรับงาน voice agents ระดับโปรดักชัน
  • โมเดลรุ่น Standard เน้นความคุ้มค่าและรองรับการใช้งานสเกลใหญ่ ส่วนรุ่น Extended Thinking เน้นงานซับซ้อนและการคิดวิเคราะห์หลายขั้นตอน
  • คิดค่าบริการอินพุตเสียง 0.005 ดอลลาร์ต่อนาที และเอาต์พุตเสียง 0.018 ดอลลาร์ต่อนาที
  • จับมือพาร์ทเนอร์ชั้นนำและแพลตฟอร์มบูรณาการระบบเรียลไทม์มากมาย เช่น Agora, LiveKit, Salesforce และ Vercel

Google ประกาศเปิดตัวโมเดลปัญญาประดิษฐ์เสียงรุ่นล่าสุด ได้แก่ Gemini 3.8 Live และ Gemini 3.8 Live Extended Thinking ซึ่งออกแบบมาเพื่อรองรับการใช้งานสร้าง voice agents ในระดับโปรดักชันผ่านทาง API โดยโมเดลทั้งสองพร้อมให้บริการแล้วในวันนี้ทั้งบน Gemini Live API และ Google AI Studio สำหรับรูปแบบการใช้งานจะเป็นลักษณะโมเดลโฮสต์ (hosted models) และไม่มีทางเลือกแบบเปิดน้ำหนักโมเดล (open weights) จึงไม่รองรับการนำไปติดตั้งบนเซิร์ฟเวอร์ส่วนตัว

การเปิดตัวครั้งนี้ประกอบด้วยโมเดล 2 รุ่นที่มีบทบาทหน้าที่แตกต่างกันอย่างชัดเจน โดย Gemini 3.8 Live ถูกพัฒนาขึ้นเพื่อเน้นความคุ้มค่าด้านต้นทุนและการรองรับการใช้งานในสเกลใหญ่ ผสมผสานความสามารถด้านการสนทนาอย่างลื่นไหลเข้ากับการเชื่อมโยงข้อมูลภาพ ส่วน Gemini 3.8 Live Extended Thinking ออกแบบมาเพื่อจัดการกับงานที่มีความซับซ้อนสูง เพิ่มขีดความสามารถด้านสติปัญญาและการใช้เหตุผลแบบหลายขั้นตอนไปพร้อม ๆ กับการพูดคุย ทาง Google วางตำแหน่งให้โมเดลทั้งสองเป็นทางเลือกที่คล่องตัวกว่าระบบท่อส่งเสียงแบบเดิม (cascaded speech pipelines) ที่ต้องร้อยเรียง ASR, LLM และ TTS เข้าด้วยกัน

ในส่วนของความสามารถหลักผ่าน Live API โมเดลใหม่นี้รองรับฟังก์ชันการทำงานที่สำคัญสำหรับนักพัฒนา:

  • รองรับการใช้งานผ่าน Gemini Live API และ Google AI Studio ทันที
  • ขับเคลื่อนการสนทนาด้วยความเร็วและความคล่องตัวสูง
  • ผสานการทำงานร่วมกับภาพ (visual grounding) ในรุ่น Standard
  • เพิ่มขีดความสามารถการคิดวิเคราะห์หลายขั้นตอนขณะพูดในรุ่น Extended Thinking
  • เชื่อมต่อกับระบบนิเวศพาร์ทเนอร์หลากหลายเพื่อจัดการสตรีมมิ่งเรียลไทม์
$0.005ต่อนาทีสำหรับเสียงเข้า
$0.018ต่อนาทีสำหรับเสียงออก

ด้านโครงสร้างราคา โมเดลทั้งสองรุ่นกำหนดอัตราค่าบริการเท่ากันที่ 0.005 ดอลลาร์ต่อนาที สำหรับอินพุตเสียง และ 0.018 ดอลลาร์ต่อนาที สำหรับเอาต์พุตเสียง โดย Google ระบุว่าตัวเลขดังกล่าวเทียบเท่ากับอัตรา 3 ดอลลาร์ต่อ 1 ล้านโทเค็นสำหรับอินพุต และ 12 ดอลลาร์ต่อ 1 ล้านโทเค็นสำหรับเอาต์พุต นอกจากนี้ นักยังสามารถพัฒนาผ่านพาร์ทเนอร์อินเทรเกชันระบบเรียลไทม์ เช่น Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel และ Vision Agents รวมถึงความร่วมมือกับ Salesforce, Genspark และ Lumeris

ไม่อยากพลาดข่าวใหม่?

สมัครรับสรุปข่าวสารใหม่ทางอีเมล ไม่บ่อยจนรำคาญ

โฆษณา

artificial intelligence technology server room

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

การเปิดตัว Gemini 3.8 Live ถือเป็นก้าวสำคัญของ Google ในการลดความซับซ้อนของสถาปัตยกรรมระบบเสียง AI แบบดั้งเดิมที่มักประสบปัญหาดีเลย์สะสมจากการต่อคิวโมเดลแยกส่วน (ASR, LLM, TTS) การรวมความสามารถทั้งหมดไว้ในโมเดลเนทีฟเดียวช่วยให้ Voice Agent ตอบสนองได้เป็นธรรมชาติและรวดเร็วขึ้นอย่างมีนัยสำคัญ ซึ่งเป็นหัวใจสำคัญสำหรับแอปพลิเคชันบริการลูกค้าในระดับองค์กร

สำหรับนักพัฒนาที่สนใจ สามารถเข้าไปดูตัวอย่างแอปพลิเคชันและรายละเอียดเชิงเทคนิคเพิ่มเติมได้ทาง GitHub รวมถึงช่องทางคอมมูนิตี้ต่าง ๆ ของ MarkTechPost

ที่มา: MarkTechPost

ความคิดเห็น

แสดงความคิดเห็น
0/2000

พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้