ข้ามไปเนื้อหาหลัก

Google AI เปิดตัว Gemini Omni 1.1 Flash ขยายวิดีโอ 40 วิ

Google AI เปิดตัว Gemini Omni 1.1 Flash เพิ่มความสามารถขยายฉากวิดีโอสูงสุด 40 วินาที ควบคุมเฟรมแรกและเฟรมสุดท้าย พร้อมระบบอัปสเกล 4K

เรียบเรียงโดย AI
Inewgen
30 Aug 2026ที่มา: MarkTechPost3 นาทีอ่าน (0 ครั้ง)
แชร์
Google AI เปิดตัว Gemini Omni 1.1 Flash ขยายวิดีโอ 40 วิ

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

ขนาดตัวอักษร
  • Gemini Omni 1.1 Flash เพิ่มความสามารถขยายฉากวิดีโอนานสูงสุด 40 วินาที
  • รองรับการควบคุมเฟรมแรกและเฟรมสุดท้าย พร้อมความละเอียด 4K
  • ประหยัดต้นทุนด้วยโหมดพรีวิว 360p ที่เร็วขึ้น 60% ก่อนเรนเดอร์จริง

Google AI ได้ประกาศเปิดตัวโมเดลวิดีโอรุ่นใหม่ล่าสุดในชื่อ Gemini Omni 1.1 Flash ซึ่งถูกพัฒนาต่อยอดขึ้นมาจากพื้นฐานของโมเดลเดิม โดยจุดเด่นสำคัญคือความสามารถในการประมวลผลข้อมูลแบบมัลติโมดัลอย่างแท้จริง ทั้งข้อความ รูปภาพ เสียง และวิดีโอร่วมกัน พร้อมทั้งรองรับการแก้ไขผ่านระบบสนทนาผ่านทาง Interactions API ที่ช่วยให้ผู้ใช้งานสามารถปรับแต่งวิดีโอได้อย่างต่อเนื่องโดยไม่ต้องอัปโหลดไฟล์ใหม่ซ้ำๆ

ในด้านความสามารถในการขยายฉาก โมเดลรุ่นนี้สามารถวิเคราะห์บริบทล่วงหน้าได้นานถึง 10 วินาที ซึ่งเพิ่มขึ้นอย่างมากเมื่อเทียบกับรุ่นก่อนหน้าที่อ้างอิงเพียงเสี้ยววินาทีสุดท้ายเท่านั้น โดยระบบจะทำการขยายวิดีโอทีละ 10 วินาทีสะสมสูงสุดถึง 40 วินาที และสร้างวิดีโอต่อขยายความยาว 3 ถึง 10 วินาทีต่อการเรียกใช้งานหนึ่งครั้ง พร้อมทั้งปรับแต่งเฟรมสุดท้ายของวิดีโอต้นทางเพื่อให้รอยต่อระหว่างคลิปมีความแนบเนียน

การพัฒนาโมเดลวิดีโอ AI ที่รองรับระบบ Stateful Editing และการจำ 10 วินาทีบริบทก่อนหน้า ถือเป็นก้าวสำคัญที่ช่วยลดภาระของครีเอเตอร์ในการเรนเดอร์งานใหม่ทั้งหมดทุกครั้งที่ต้องการแก้ไขเฉพาะจุด ช่วยให้เวิร์กโฟลว์การผลิตสื่อดิจิทัลมีความรวดเร็วและประหยัดต้นทุนฮาร์ดแวร์ได้อย่างมหาศาล

digital video editing timeline interface screen

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

อย่างไรก็ตาม การใช้งานยังมีข้อกำหนดที่ชัดเจน โดยการขยายความยาวจะทำได้เฉพาะส่วนท้ายของคลิปเท่านั้น ไม่สามารถเพิ่มฉากนำหน้าหรือแทรกกลางคลิปได้ นอกจากนี้วิดีโอที่อัปโหลดจะต้องมีความยาวไม่เกิน 10 วินาที และไม่สามารถเพิ่มบทพูดใหม่ได้ในกรณีที่วิดีโอต้นทางมีคนกำลังพูดอยู่ เว้นแต่จะใช้งานผ่านฟีเจอร์ Multi-turn extension ที่รองรับการสนทนาต่อเนื่อง

ไม่อยากพลาดข่าวใหม่?

สมัครรับสรุปข่าวสารใหม่ทางอีเมล ไม่บ่อยจนรำคาญ

โฆษณา

40sขยายฉากสูงสุด
60%พรีวิวเร็วกว่าเดิม
4Kรองรับการอัปสเกล

สำหรับการตั้งค่าความละเอียดของวิดีโอผ่าน response_format จะรองรับตั้งแต่ 360p, 720p ซึ่งเป็นค่าเริ่มต้น, 1080p ไปจนถึงระดับ 4K โดยในส่วนของ 360p นั้น Google ระบุว่าช่วยให้สร้างพรีวิวได้เร็วกว่า 720p ถึง 60% และมีต้นทุนถูกกว่าถึงหนึ่งในสาม ทำให้รูปแบบการทำงานที่เหมาะสมคือการร่างงานด้วยความละเอียดต่ำก่อนแล้วจึงเรนเดอร์จริงในความละเอียดสูง

ในด้านโครงสร้างราคา การป้อนข้อมูล (Input) มีค่าบริการอยู่ที่ 1.50 ดอลลาร์ต่อ 1 ล้านโทเค็น ขณะที่การสร้างผลลัพธ์ (Output) สำหรับข้อความอยู่ที่ 9.00 ดอลลาร์ต่อ 1 ล้านโทเค็น และสำหรับวิดีโออยู่ที่ 17.50 ดอลลาร์ต่อ 1 ล้านโทเค็น โดยการคิดค่าบริการวิดีโอจะอยู่ที่ 5,792 โตเค็นต่อวินาทีสำหรับความละเอียด 720p หรือคิดเป็นประมาณ 0.10 ดอลลาร์ต่อวินาที

ปัจจุบันบริการดังกล่าวเปิดให้ใช้งานผ่าน Gemini API ใน Google AI Studio และ Gemini Enterprise Agent Platform รวมถึงใน Google Flow สำหรับสมาชิก AI Plus, Pro และ Ultra โดยมีพาร์ทเนอร์ระดับองค์กรอย่าง Adobe, Figma Weave, GMI Cloud และ Runway นำไปใช้งานจริงในกระบวนการผลิตแล้ว

ที่มา: MarkTechPost

ความคิดเห็น

แสดงความคิดเห็น
0/2000

พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้