Black Forest Labs เปิดตัว FLUX 3 โมเดลแบบจำลอง Multimodal สำหรับภาพ วิดีโอ เสียง และหุ่นยนต์
Black Forest Labs เผยโฉม FLUX 3 โมเดล AI หลายรูปแบบที่ผสานข้อมูลภาพ วิดีโอ เสียง และการทำงานของหุ่นยนต์เข้าไว้ด้วยกัน พร้อมผลทดสอบความพึงพอใจที่น่าสนใจ

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
- Black Forest Labs เปิดตัว FLUX 3 โมเดล AI ที่เรียนรู้หลายรูปแบบพร้อมกันทั้งภาพ วิดีโอ เสียง และการกระทำของหุ่นยนต์
- ใช้สถาปัตยกรรม Self-Flow เพื่อเชื่อมโยงการสร้างสรรค์และความเข้าใจเข้าด้วยกัน
- สร้างวิดีโอความยาวสูงสุด 20 วินาทีได้ในครั้งเดียว พร้อมเสียงประกอบที่สอดคล้องกัน
- เหนือกว่าคู่แข่งหลายรายในการทดสอบความพึงพอใจของมนุษย์ เช่น Luma Ray 3.2 และ Runway Gen-4.5
ทีมวิจัยจาก Black Forest Labs (BFL) มีมุมมองว่าแต่ละรูปแบบข้อมูลเพียงอย่างเดียวไม่สามารถสะท้อนโลกความเป็นจริงได้อย่างสมบูรณ์ ภาพนิ่งเก็บโครงสร้างเชิงพื้นที่ วิดีโอนำเสนอดินนามิกทางกายภาพ ส่วนเสียงแสดงความสัมพันธ์เชิงเหตุผลของเหตุการณ์ ข้อมูลเหล่านี้จึงถูกมองว่าเป็นเพียงส่วนเสี้ยวที่สูญเสียรายละเอียดของความเป็นจริงชุดเดียวกัน การฝึกฝนโมเดลด้วยข้อมูลทุกรูปแบบพร้อมกันจะทำให้ข้อมูลเหล่านั้นตรวจสอบกันเอง เช่น เสียงต้องสอดคล้องกับการกระแทก และการเคลื่อนที่ต้องเป็นไปตามกฎของมวล ซึ่ง BFL ระบุว่า FLUX 3 คือโมเดลรุ่นแรกที่สร้างขึ้นบนหลักการนี้
โครงสร้างเบื้องหลังของ FLUX 3 ต่อยอดมาจาก Self-Flow ซึ่งเป็นวิธีการของ BFL ในการผสานการสร้างและทำความเข้าใจข้อมูลหลายรูปแบบไว้ในสถาปัตยกรรมเดียว วิธีการนี้ผสมผสานเป้าหมายการจับคู่การไหลเข้ากับการสร้างฟีเจอร์ใหม่ด้วยตนเอง ทั้งนี้ โค้ดต้นแบบบน GitHub ใช้สัญญาอนุญาตแบบ Apache-2.0 และใช้สถาปัตยกรรม SiT-XL/2 พร้อมการควบคุมตัวแปรเวลาต่อโทเค็น
จุดเด่นสำคัญของ FLUX 3 Video คือความสามารถในการสร้างคลิปวิดีโอยาวสูงสุด 20 วินาทีในการสร้างครั้งเดียว พร้อมเสียงประกอบในตัว รองรับโหมดการทำงานหลากหลาย เช่น ข้อความเป็นวิดีโอ, ภาพเป็นวิดีโอ, วิดีโอเป็นวิดีโอจากคลิปอ้างอิง, เฟรมหลักเป็นวิดีโอเพื่อการเปลี่ยนผ่านที่ควบคุมได้ รวมถึงการสร้างวิดีโอและเสียงต่อเนื่องจากอินพุตเดิม นอกจากนี้ระบบยังรองรับการสนทนาหลายภาษา การร้อยเรียงคลิปเป็นลำดับหลายช็อตด้วยเอเจนต์ และการสร้างตัวอักษรที่มีดีไซน์เคลื่อนไหวได้อย่างโดดเด่น โดยเฉพาะการแสดงสีหน้าของมนุษย์และการจับคู่เสียงกับเหตุการณ์ทางกายภาพ
"video is the expensive modality because rendering the world correctly forces the model to learn contact, motion, weight and cause. Audio and actions are low-dimensional signals that attach to a world model already paid for."
การที่โมเดลสามารถเรียนรู้ข้อมูลหลายประเภท (Multimodal) พร้อมกันในระดับรากฐาน ช่วยให้ AI เข้าใจตรรกะทางกายภาพของโลกใบนี้ได้ดีกว่าการฝึกทีละโมดาลิตี้แยกจากกัน การที่วิดีโอถูกมองว่าเป็นโมดาลิตี้ที่มีต้นทุนการประมวลผลสูงที่สุด เนื่องจากต้องเรียนรู้เรื่องแรงกระแทก น้ำหนัก และความสัมพันธ์ของวัตถุ ทำให้เมื่อโมเดลเข้าใจวิดีโอได้ดีแล้ว ข้อมูลมิติที่ต่ำกว่าอย่างเสียงและการเคลื่อนไหวจึงสามารถประกอบเข้ากับโมเดลโลก (World Model) นั้นได้อย่างมีประสิทธิภาพ

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
ในด้านผลลัพธ์การทดสอบความพึงพอใจของมนุษย์ (Human Preference) เบื้องต้น สำหรับคลิปวิดีโอความละเอียด 720p ความยาว 10 วินาทีพร้อมเสียง FLUX 3 ได้รับคะแนนความนิยมสูงถึง 93% เมื่อเทียบกับ Luma Ray 3.2 และ 77% เมื่อเทียบกับ Runway Gen-4.5 นอกจากนี้บริษัทยังร่วมมือกับ Mimic Robotics นำโมเดลไปทดสอบบนหุ่นยนต์จริงในการหยิบจับชิ้นส่วนและประกอบอุปกรณ์ โดยมี Audi นำระบบดังกล่าวไปทดสอบบนสายการผลิตแล้ว
ที่มา: MarkTechPost
พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้
ความคิดเห็น
แสดงความคิดเห็น