Google เปิดตัว AI Video Co-Director สร้างวิดีโอระดับนาที
Google Research เผยโฉม AI Video Co-Director ขับเคลื่อนด้วย 4 เฟรมเวิร์กเอเจนต์ ช่วยสร้างวิดีโอยาวต่อเนื่องระดับนาทีไร้รอยต่อ แก้ปัญหาฉากเพี้ยน

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
- Google Research พัฒนา AI Video Co-Director แก้ปัญหาการต่อวิดีโอสั้นให้เป็นเรื่องยาว
- ระบบใช้ 4 เฟรมเวิร์กเอเจนต์หลักทำงานร่วมกันเพื่อควบคุมความต่อเนื่อง
- รองรับการทำงานร่วมกับโมเดล Gemini และ Veo พร้อมฝังลายน้ำ SynthID
- เปิดตัว 3 เบนช์มาร์กใหม่เพื่อทดสอบความต่อเนื่องของฉากและวัตถุโดยเฉพาะ
แม้เทคโนโลยีโมเดลแพร่กระจายหรือ Diffusion models จะสามารถเรนเดอร์คลิปวิดีโอความคมชัดสูงได้ภายในเวลาเพียงไม่กี่วินาที แต่การนำคลิปเหล่านั้นมาร้อยเรียงให้กลายเป็นเรื่องราวเดียวกันยังคงเป็นโจทย์ใหญ่ที่ท้าทาย โดยทั่วไปท่อส่งคำสั่งแบบเอเจนต์มักจะเชื่อมต่อโมดูลต่างๆ เข้าด้วยกันผ่านชุดคำสั่งที่เขียนขึ้นเองแบบแยกส่วน ซึ่งมักส่งผลให้เกิดปัญหาการเบี่ยงเบนทางความหมาย หรือ semantic drift ที่ทำให้เสื้อผ้าหรือฉากหลังเปลี่ยนไปมาระหว่างช็อต รวมถึงปัญหาความผิดพลาดต่อเนื่องเป็นลูกโซ่เมื่อเนื้อหาต้นน้ำเกิดข้อผิดพลาด
ทางทีมงาน Google มองว่าปัญหานี้เปรียบเสมือนปัญหาการจัดสรรเครดิต เนื่องจากวิดีโอสำเร็จรูปที่มีข้อบกพร่องมักแกะรอยกลับไปหายCชุดคำสั่งที่เป็นต้นเหตุได้ยาก ระบบใหม่นี้จึงถูกพัฒนาขึ้นมาเพื่ออุดช่องโหว่ดังกล่าวโดยทำงานทับอยู่บนโมเดล Gemini และ Veo อีกทอดหนึ่ง

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
สถาปัตยกรรมใหม่นี้ถูกออกแบบมาให้เป็นแบบ model-agnostic ทำให้ชั้นควบคุมเดียวกันสามารถนำไปขับเคลื่อนเครื่องมือสร้างวิดีโอตัวอื่นๆ ได้เช่นกัน พร้อมทั้งสืบทอดระบบใส่ลายน้ำ SynthID มาจากโมเดลพื้นฐาน โดยงานวิจัยชิ้นนี้ได้รับการตอบรับให้ตีพิมพ์ในงาน COLM 2026
ระบบ Co-Director ประกอบด้วยองค์ประกอบการทำงานที่สำคัญดังนี้:
- Orchestrator Agent ทำหน้าที่เลือกการกำหนดค่าผ่านกลยุทธ์เชิงสร้างสรรค์ โหมดเนื้อเรื่อง และต้นแบบสุนทรียศาสตร์
- Pre-Production Agent ทำหน้าที่สร้างสตอรี่บอร์ด
- Keyframe, Video และ Audio sub-agents ทำหน้าที่ผลิตสื่อภาพและเสียง
- MLLM Judge ทำหน้าที่ให้คะแนนการตัดต่อและส่งรางวัลกลับไปยังอัลกอริทึม
นอกจากนี้ยังมีระบบ CANVAS ที่ได้รับการยอมรับในงาน EMNLP 2026 ซึ่งทำหน้าที่ติดตามตัวละคร สถานที่ และสถานะของวัตถุขณะที่เรื่องราวดำเนินไป พร้อมดึงข้อมูลภาพอ้างอิงที่จัดเก็บไว้กลับมาใช้เมื่อฉากนั้นวนกลับมาอีกครั้ง โดยในการทดสอบปล้นพิพิธภัณฑ์ของ Google ระบบ AutoStudio เคยทำหมวกของโจรหายและ Gemini-3.1-Pro เปลี่ยนอัญมณี แต่ระบบ CANVAS สามารถรักษาความคงที่ของทั้งสองอย่างไว้ได้ทั้งหมด
การที่ Google หันมาเน้นพัฒนาเฟรมเวิร์กเอเจนต์หลายตัวทำงานร่วมกันสะท้อนให้เห็นทิศทางของวงการ AI ที่ก้าวข้ามจากการสร้างภาพหรือวิดีโอสั้นๆ แยกส่วน ไปสู่การสร้างระบบควบคุมเชิงตรรกะขั้นสูง เพื่อแก้ปัญหาความต่อเนื่องของเนื้อหาในระยะยาว ซึ่งเป็นอุปสรรคสำคัญในการนำ AI ไปประยุกต์ใช้ในอุตสาหกรรมภาพยนตร์และโฆษณาจริง
อีกหนึ่งสถาปัตยกรรมที่น่าสนใจคือ A2RD (Agentic Autoregressive Diffusion) ซึ่งเป็นสถาปัตยกรรมที่ไม่ต้องฝึกอบรมใหม่ โดยแต่ละส่วนจะรันลูปการดึงข้อมูล สังเคราะห์ ปรับแต่ง และอัปเดตเทียบกับหน่วยความจำวิดีโอมัลติมีเดีย ซึ่งทำให้ Google สามารถสร้างภาพยนตร์ความยาว 10 นาทีได้สำเร็จ
ที่มา: MarkTechPost
พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้
ความคิดเห็น
แสดงความคิดเห็น