ข้ามไปเนื้อหาหลัก

Google เปิดตัว AI Video Co-Director สร้างวิดีโอระดับนาที

Google Research เผยโฉม AI Video Co-Director ขับเคลื่อนด้วย 4 เฟรมเวิร์กเอเจนต์ ช่วยสร้างวิดีโอยาวต่อเนื่องระดับนาทีไร้รอยต่อ แก้ปัญหาฉากเพี้ยน

เรียบเรียงโดย AI
Inewgen
สด28 Sep 2026ที่มา: MarkTechPost3 นาทีอ่าน (0 ครั้ง)
แชร์
Google เปิดตัว AI Video Co-Director สร้างวิดีโอระดับนาที

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

ขนาดตัวอักษร
  • Google Research พัฒนา AI Video Co-Director แก้ปัญหาการต่อวิดีโอสั้นให้เป็นเรื่องยาว
  • ระบบใช้ 4 เฟรมเวิร์กเอเจนต์หลักทำงานร่วมกันเพื่อควบคุมความต่อเนื่อง
  • รองรับการทำงานร่วมกับโมเดล Gemini และ Veo พร้อมฝังลายน้ำ SynthID
  • เปิดตัว 3 เบนช์มาร์กใหม่เพื่อทดสอบความต่อเนื่องของฉากและวัตถุโดยเฉพาะ

แม้เทคโนโลยีโมเดลแพร่กระจายหรือ Diffusion models จะสามารถเรนเดอร์คลิปวิดีโอความคมชัดสูงได้ภายในเวลาเพียงไม่กี่วินาที แต่การนำคลิปเหล่านั้นมาร้อยเรียงให้กลายเป็นเรื่องราวเดียวกันยังคงเป็นโจทย์ใหญ่ที่ท้าทาย โดยทั่วไปท่อส่งคำสั่งแบบเอเจนต์มักจะเชื่อมต่อโมดูลต่างๆ เข้าด้วยกันผ่านชุดคำสั่งที่เขียนขึ้นเองแบบแยกส่วน ซึ่งมักส่งผลให้เกิดปัญหาการเบี่ยงเบนทางความหมาย หรือ semantic drift ที่ทำให้เสื้อผ้าหรือฉากหลังเปลี่ยนไปมาระหว่างช็อต รวมถึงปัญหาความผิดพลาดต่อเนื่องเป็นลูกโซ่เมื่อเนื้อหาต้นน้ำเกิดข้อผิดพลาด

ทางทีมงาน Google มองว่าปัญหานี้เปรียบเสมือนปัญหาการจัดสรรเครดิต เนื่องจากวิดีโอสำเร็จรูปที่มีข้อบกพร่องมักแกะรอยกลับไปหายCชุดคำสั่งที่เป็นต้นเหตุได้ยาก ระบบใหม่นี้จึงถูกพัฒนาขึ้นมาเพื่ออุดช่องโหว่ดังกล่าวโดยทำงานทับอยู่บนโมเดล Gemini และ Veo อีกทอดหนึ่ง

business conference speaker presentation screen daytime

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

สถาปัตยกรรมใหม่นี้ถูกออกแบบมาให้เป็นแบบ model-agnostic ทำให้ชั้นควบคุมเดียวกันสามารถนำไปขับเคลื่อนเครื่องมือสร้างวิดีโอตัวอื่นๆ ได้เช่นกัน พร้อมทั้งสืบทอดระบบใส่ลายน้ำ SynthID มาจากโมเดลพื้นฐาน โดยงานวิจัยชิ้นนี้ได้รับการตอบรับให้ตีพิมพ์ในงาน COLM 2026

4เฟรมเวิร์กเอเจนต์หลัก
3เบนช์มาร์กใหม่

ระบบ Co-Director ประกอบด้วยองค์ประกอบการทำงานที่สำคัญดังนี้:

ไม่อยากพลาดข่าวใหม่?

สมัครรับสรุปข่าวสารใหม่ทางอีเมล ไม่บ่อยจนรำคาญ

โฆษณา

  • Orchestrator Agent ทำหน้าที่เลือกการกำหนดค่าผ่านกลยุทธ์เชิงสร้างสรรค์ โหมดเนื้อเรื่อง และต้นแบบสุนทรียศาสตร์
  • Pre-Production Agent ทำหน้าที่สร้างสตอรี่บอร์ด
  • Keyframe, Video และ Audio sub-agents ทำหน้าที่ผลิตสื่อภาพและเสียง
  • MLLM Judge ทำหน้าที่ให้คะแนนการตัดต่อและส่งรางวัลกลับไปยังอัลกอริทึม

นอกจากนี้ยังมีระบบ CANVAS ที่ได้รับการยอมรับในงาน EMNLP 2026 ซึ่งทำหน้าที่ติดตามตัวละคร สถานที่ และสถานะของวัตถุขณะที่เรื่องราวดำเนินไป พร้อมดึงข้อมูลภาพอ้างอิงที่จัดเก็บไว้กลับมาใช้เมื่อฉากนั้นวนกลับมาอีกครั้ง โดยในการทดสอบปล้นพิพิธภัณฑ์ของ Google ระบบ AutoStudio เคยทำหมวกของโจรหายและ Gemini-3.1-Pro เปลี่ยนอัญมณี แต่ระบบ CANVAS สามารถรักษาความคงที่ของทั้งสองอย่างไว้ได้ทั้งหมด

การที่ Google หันมาเน้นพัฒนาเฟรมเวิร์กเอเจนต์หลายตัวทำงานร่วมกันสะท้อนให้เห็นทิศทางของวงการ AI ที่ก้าวข้ามจากการสร้างภาพหรือวิดีโอสั้นๆ แยกส่วน ไปสู่การสร้างระบบควบคุมเชิงตรรกะขั้นสูง เพื่อแก้ปัญหาความต่อเนื่องของเนื้อหาในระยะยาว ซึ่งเป็นอุปสรรคสำคัญในการนำ AI ไปประยุกต์ใช้ในอุตสาหกรรมภาพยนตร์และโฆษณาจริง

อีกหนึ่งสถาปัตยกรรมที่น่าสนใจคือ A2RD (Agentic Autoregressive Diffusion) ซึ่งเป็นสถาปัตยกรรมที่ไม่ต้องฝึกอบรมใหม่ โดยแต่ละส่วนจะรันลูปการดึงข้อมูล สังเคราะห์ ปรับแต่ง และอัปเดตเทียบกับหน่วยความจำวิดีโอมัลติมีเดีย ซึ่งทำให้ Google สามารถสร้างภาพยนตร์ความยาว 10 นาทีได้สำเร็จ

ที่มา: MarkTechPost

ความคิดเห็น

แสดงความคิดเห็น
0/2000

พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้