MiniMax เปิดตัว MiniMax H3 โมเดลวิดีโอ Omni-Modal สร้างคลิป 2K พร้อมเสียงสเตอริโอในตัว
MiniMax เผยโฉม H3 โมเดลปัญญาประดิษฐ์สร้างวิดีโอแบบ Omni-Modal รวมความสามารถหลากหลายไว้ในระบบเดียว รองรับการสร้างคลิปความยาว 15 วินาที ความละเอียด 2K พร้อมเสียงสเตอริโอแท้

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
- MiniMax H3 รวบรวมงานวิดีโอหลายรูปแบบไว้ในพรีเทรนนิ่งเดียว
- สร้างคลิปความยาว 15 วินาที ความละเอียด 2K พร้อมเสียงสเตอริโอในตัว
- เปิดให้บริการแล้วผ่านแพลตฟอร์ม API และแอปพลิเคชัน Hailuo AI
- สถาปัตยกรรม H3-Omni Transformer เพิ่มปริมาณงานฝึกอบรมได้เกือบ 30%
วงการปัญญาประดิษฐ์ด้านการสร้างวิดีโอกำลังก้าวไปอีกขั้น เมื่อบริษัท MiniMax ได้ประกาศเปิดตัวโมเดลใหม่ล่าสุดในชื่อ MiniMax H3 เมื่อวันที่ 31 กรกฎาคม 2026 โดยโมเดลนี้เข้ามาแก้ปัญหาการทำงานแบบเดิมที่ต้องใช้โมเดลเฉพาะทางแยกจากกัน ไม่ว่าจะเป็นการแปลงข้อความ ใช้วันที่หรือภาพนิ่งอ้างอิง การกำหนดเฟรมแรกและเฟรมสุดท้าย หรือการแก้ไขตัดต่อวิดีโอ
ทาง MiniMax ได้รวมระบบเหล่านี้เข้าไว้ด้วยกันภายใต้พรีเทรนนิ่งพาราไดม์เดียว ซึ่งความสัมพันธ์ของการอ้างอิงและการแก้ไขจะถูกอธิบายผ่านภาษาธรรมชาติ ผู้ใช้งานสามารถผสมผสานคำสั่งได้อย่างอิสระ เช่น การดึงการเคลื่อนไหวของกล้องจากวิดีโอหนึ่ง ให้ตัวละครในภาพอีกภาพร้องเพลง และจับคู่เสียงร้องกับไฟล์เสียงที่กำหนดไว้

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
ในด้านการใช้งานจริง นักพัฒนาและผู้สนใจสามารถเข้าถึง MiniMax H3 ได้ผ่านทางแพลตฟอร์ม API ภายใต้ไอดีโมเดล MiniMax-H3 รวมถึงใช้งานผ่านแอปพลิเคชันฝั่งผู้บริโภคอย่าง Hailuo AI โดยมีคู่มือการใช้งานที่ระบุโหมดการทำงานหลักไว้ 3 รูปแบบ ได้แก่ การแปลงข้อความ ใช้อภาพกำหนดเฟรมแรกและเฟรมสุดท้าย และการสร้างโดยใช้ข้อมูลอ้างอิง ผ่านกระบวนการทำงานแบบอะซิงโครนัส 3 ขั้นตอน คือสร้างงาน ตรวจสอบ task_id และดาวน์โหลดไฟล์ผ่าน content.url
เบื้องหลังความสามารถอันทรงพลังนี้ MiniMax ได้ยกเครื่องสถาปัตยกรรมครั้งใหญ่ ประกอบด้วย Contextual Omni Representation ที่ปรับปรุงระบบคำบรรยายให้ครอบคลุมความสัมพันธ์ระหว่างบริบทและเป้าหมาย H3-VAE โทไจนอเซอร์ที่เพิ่มอัตราการบีบอัดจนช่วยลดต้นทุน และ H3-Omni Transformer ที่แยกภาระงานทำความเข้าใจและการสร้างวิดีโอออกจากกัน ส่งผลให้ประสิทธิภาพการฝึกอบรมแบบ end-to-end เพิ่มขึ้นเกือบ 30 เปอร์เซ็นต์
การรวมความสามารถหลากหลายประเภทเข้ามาไว้ในโมเดล Omni-Modal เดียวถือเป็นแนวโน้มสำคัญของปัญญาประดิษฐ์ยุคใหม่ โดยช่วยลดความซับซ้อนในการสลับใช้โมเดลหลายตัวพร้อมกัน สำหรับ MiniMax H3 การนำกลไก In-Context Regeneration มาใช้แทนการเพิ่มโมเดลขยายความละเอียดแบบแยกส่วน ช่วยให้ระบบสามารถกู้คืนรายละเอียดปลีกย่อยและข้อความขนาดเล็กบนผลิตภัณฑ์ได้อย่างแม่นยำ ซึ่งเป็นประโยชน์อย่างยิ่งสำหรับภาคอุตสาหกรรมการตลาดและการออกแบบแบรนด์
สำหรับจุดยืนในตลาด ข้อมูลจากรายงานของ SCMP ที่อ้างอิงข้อมูลจาก Artificial Analysis ระบุว่า H3 มีความโดดเด่นเป็นผู้นำในด้านการแก้ไขวิดีโอ แต่ยังคงตามหลังโมเดลอย่าง Google Gemini Omni Flash ในด้านการแปลงข้อความ เป็นวิดีโอ และตามหลังทั้ง Seedance 2.0 และ Gemini Omni Flash ในหมวดหมู่การแปลงภาพเป็นวิดีโอ
ที่มา: MarkTechPost
พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้
ความคิดเห็น
แสดงความคิดเห็น