Physis-Lang: นักวิจัย NVIDIA เปิดตัวภาษาฟิสิกส์เชิงรูปภาพ
นักวิจัย NVIDIA เปิดตัว Physis-Lang เฟรมเวิร์กภาษาฟิสิกส์อัปเกรด Cosmos 3 แซงหน้า Veo 3.1 บนกระดานผู้นำ Physics-IQ เมื่อ 29 ก.ย. 2026

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
- Physis-Lang คือเฟรมเวิร์กภาษาฟิสิกส์ที่เติมเหตุผลเชิงฟิสิกส์ลงในคำอธิบายวิดีโอ
- Cosmos3-Super พัฒนาด้วย Physis-Lang ครองอันดับ 1 บนกระดานผู้นำ Physics-IQ Verified ด้วยคะแนน 48.2
- ระบบใช้โมเดล GPT-5.5 ร่วมกับ Gemini-3.1-Pro ในการปรับปรุงคำสั่งอัตโนมัติผ่าน 9 รอบการทดลอง
- ชุดข้อมูลฝึกอบรมรวมทั้งหมด 183,000 วิดีโอ ช่วยยกระดับประสิทธิภาพความสมจริงทางกายภาพ
ปัญหาสำคัญของโมเดลสร้างวิดีโอโลกเสมือนในปัจจุบันคือ แม้จะได้ภาพเคลื่อนไหวที่ดูสมจริงแต่กลับผิดหลักฟิสิกส์พื้นฐาน เช่น การเคลื่อนที่ของวัตถุหรืออุณหภูมิที่เปลี่ยนแปลง นักวิจัยจาก NVIDIA จึงได้พัฒนา Physis-Lang ซึ่งเป็นเฟรมเวิร์กแบบเปิดที่ออกแบบมาเพื่อเสริมการให้เหตุผลทางฟิสิกส์ลงในคำอธิบายวิดีโอโดยตรง
แนวทางดั้งเดิมมักบรรยายเพียงแค่เหตุการณ์ที่เกิดขึ้น เช่น การระบุว่าเนยละลายเมื่ออุณหภูมิสูงขึ้น แต่ไม่ได้อธิบายถึงกลไกการถ่ายเทความร้อนหรือแรงโน้มถ่วง Physis-Lang จึงเข้ามาแก้ไขจุดนี้ด้วยการเพิ่มฟิลด์ physics_reasoning ลงไปในคำอธิบายพื้นฐาน เพื่อระบุเอนทิตี สาเหตุ ปฏิสัมพันธ์ หลักการควบคุม วิวัฒนาการตามเวลา และผลลัพธ์ที่เกิดขึ้นอย่างละเอียด

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
นอกจากนี้ ระบบยังสร้างฟิลด์ physics_negative_prompt สำหรับแต่ละฉากโดยเฉพาะ เพื่ออธิบายผลลัพธ์ที่ไม่น่าเกิดขึ้นได้ เช่น หินลอยน้ำได้ ซึ่งทำหน้าที่เป็นตัวควบคุมเชิงลบในขั้นตอนการอนุมาน (Inference) เพื่อลดข้อผิดพลาดที่อาจเกิดขึ้นระหว่างการสร้างวิดีโอ
"A video world model can make a convincing clip and still get the physics wrong. Our researchers just released Physis-Lang, an open self-evolving framework that adds physics reasoning to video captions."
NVIDIA Researchers
กระบวนการทำงานของระบบจะใช้โมเดล GPT-5.5 ทำหน้าที่เขียนคำอธิบายสำหรับชุดข้อมูลพัฒนาขนาด 20 วิดีโอที่มีการยืนยันจากมนุษย์ 273 รายการ โดยมี Gemini-3.1-Pro ทำหน้าที่เป็นตัววิจารณ์เชิงฟิสิกส์ และมีเอเจนต์วิวัฒนาการคอยอ่านคะแนนเพื่อเขียนคำสั่งใหม่ซ้ำจนกว่าจะได้ผลลัพธ์ที่แม่นยำที่สุดผ่านการทดสอบบนชุดข้อมูล PhysCapBench ที่มี 246 วิดีโอ
การนำภาษาฟิสิกส์หรือ Physics-Lang มาใช้ถือเป็นการแก้ปัญหาคอขวดสำคัญในการสร้างวิดีโอด้วยปัญญาประดิษฐ์ เนื่องจากโมเดลพื้นฐานมักเรียนรู้เพียงรูปแบบภาพภายนอกแต่ขาดความเข้าใจเชิงกลศาสตร์ของนิวตันหรืออุณหพลศาสตร์ การฝังตรรกะเชิงสาเหตุและผลลัพธ์เข้าไปในระดับคำบรรยายช่วยให้โมเดลสามารถสร้างสรรค์การเคลื่อนไหวที่สอดคล้องกับโลกจริงได้ดีขึ้นโดยไม่ต้องเปลี่ยนแปลงสถาปัตยกรรมภายในของโมเดลวิดีโอหลักแต่อย่างใด
ผลลัพธ์จากการทดสอบบนกระดานผู้นำสาธารณะ Physics-IQ Verified เมื่อวันที่ 29 กันยายน 2026 ระบุว่า Physis-Lang บน Cosmos3-Super รั้งอันดับแรกด้วยคะแนน 48.2 ± 1.4 ตามด้วย Cosmos3-Nano ในอันดับที่สองที่คะแนน 43.3 ± 1.5 ซึ่งแสดงให้เห็นถึงความก้าวหน้าที่เหนือกว่าโมเดลอื่น ๆ ในด้านความถูกต้องทางฟิสิกส์
ที่มา: MarkTechPost
พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้
ความคิดเห็น
แสดงความคิดเห็น