ข้ามไปเนื้อหาหลัก

Physis-Lang: นักวิจัย NVIDIA เปิดตัวภาษาฟิสิกส์เชิงรูปภาพ

นักวิจัย NVIDIA เปิดตัว Physis-Lang เฟรมเวิร์กภาษาฟิสิกส์อัปเกรด Cosmos 3 แซงหน้า Veo 3.1 บนกระดานผู้นำ Physics-IQ เมื่อ 29 ก.ย. 2026

เรียบเรียงโดย AI
Inewgen
30 Sep 2026ที่มา: MarkTechPost3 นาทีอ่าน (0 ครั้ง)
แชร์
Physis-Lang: นักวิจัย NVIDIA เปิดตัวภาษาฟิสิกส์เชิงรูปภาพ

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

ขนาดตัวอักษร
  • Physis-Lang คือเฟรมเวิร์กภาษาฟิสิกส์ที่เติมเหตุผลเชิงฟิสิกส์ลงในคำอธิบายวิดีโอ
  • Cosmos3-Super พัฒนาด้วย Physis-Lang ครองอันดับ 1 บนกระดานผู้นำ Physics-IQ Verified ด้วยคะแนน 48.2
  • ระบบใช้โมเดล GPT-5.5 ร่วมกับ Gemini-3.1-Pro ในการปรับปรุงคำสั่งอัตโนมัติผ่าน 9 รอบการทดลอง
  • ชุดข้อมูลฝึกอบรมรวมทั้งหมด 183,000 วิดีโอ ช่วยยกระดับประสิทธิภาพความสมจริงทางกายภาพ

ปัญหาสำคัญของโมเดลสร้างวิดีโอโลกเสมือนในปัจจุบันคือ แม้จะได้ภาพเคลื่อนไหวที่ดูสมจริงแต่กลับผิดหลักฟิสิกส์พื้นฐาน เช่น การเคลื่อนที่ของวัตถุหรืออุณหภูมิที่เปลี่ยนแปลง นักวิจัยจาก NVIDIA จึงได้พัฒนา Physis-Lang ซึ่งเป็นเฟรมเวิร์กแบบเปิดที่ออกแบบมาเพื่อเสริมการให้เหตุผลทางฟิสิกส์ลงในคำอธิบายวิดีโอโดยตรง

แนวทางดั้งเดิมมักบรรยายเพียงแค่เหตุการณ์ที่เกิดขึ้น เช่น การระบุว่าเนยละลายเมื่ออุณหภูมิสูงขึ้น แต่ไม่ได้อธิบายถึงกลไกการถ่ายเทความร้อนหรือแรงโน้มถ่วง Physis-Lang จึงเข้ามาแก้ไขจุดนี้ด้วยการเพิ่มฟิลด์ physics_reasoning ลงไปในคำอธิบายพื้นฐาน เพื่อระบุเอนทิตี สาเหตุ ปฏิสัมพันธ์ หลักการควบคุม วิวัฒนาการตามเวลา และผลลัพธ์ที่เกิดขึ้นอย่างละเอียด

artificial intelligence data center technology server rack no logo

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

นอกจากนี้ ระบบยังสร้างฟิลด์ physics_negative_prompt สำหรับแต่ละฉากโดยเฉพาะ เพื่ออธิบายผลลัพธ์ที่ไม่น่าเกิดขึ้นได้ เช่น หินลอยน้ำได้ ซึ่งทำหน้าที่เป็นตัวควบคุมเชิงลบในขั้นตอนการอนุมาน (Inference) เพื่อลดข้อผิดพลาดที่อาจเกิดขึ้นระหว่างการสร้างวิดีโอ

48.2คะแนน Cosmos3-Super บน Physics-IQ
183Kจำนวนวิดีโอในชุดข้อมูลฝึกอบรมสุดท้าย

"A video world model can make a convincing clip and still get the physics wrong. Our researchers just released Physis-Lang, an open self-evolving framework that adds physics reasoning to video captions."

NVIDIA Researchers

กระบวนการทำงานของระบบจะใช้โมเดล GPT-5.5 ทำหน้าที่เขียนคำอธิบายสำหรับชุดข้อมูลพัฒนาขนาด 20 วิดีโอที่มีการยืนยันจากมนุษย์ 273 รายการ โดยมี Gemini-3.1-Pro ทำหน้าที่เป็นตัววิจารณ์เชิงฟิสิกส์ และมีเอเจนต์วิวัฒนาการคอยอ่านคะแนนเพื่อเขียนคำสั่งใหม่ซ้ำจนกว่าจะได้ผลลัพธ์ที่แม่นยำที่สุดผ่านการทดสอบบนชุดข้อมูล PhysCapBench ที่มี 246 วิดีโอ

ไม่อยากพลาดข่าวใหม่?

สมัครรับสรุปข่าวสารใหม่ทางอีเมล ไม่บ่อยจนรำคาญ

โฆษณา

การนำภาษาฟิสิกส์หรือ Physics-Lang มาใช้ถือเป็นการแก้ปัญหาคอขวดสำคัญในการสร้างวิดีโอด้วยปัญญาประดิษฐ์ เนื่องจากโมเดลพื้นฐานมักเรียนรู้เพียงรูปแบบภาพภายนอกแต่ขาดความเข้าใจเชิงกลศาสตร์ของนิวตันหรืออุณหพลศาสตร์ การฝังตรรกะเชิงสาเหตุและผลลัพธ์เข้าไปในระดับคำบรรยายช่วยให้โมเดลสามารถสร้างสรรค์การเคลื่อนไหวที่สอดคล้องกับโลกจริงได้ดีขึ้นโดยไม่ต้องเปลี่ยนแปลงสถาปัตยกรรมภายในของโมเดลวิดีโอหลักแต่อย่างใด

ผลลัพธ์จากการทดสอบบนกระดานผู้นำสาธารณะ Physics-IQ Verified เมื่อวันที่ 29 กันยายน 2026 ระบุว่า Physis-Lang บน Cosmos3-Super รั้งอันดับแรกด้วยคะแนน 48.2 ± 1.4 ตามด้วย Cosmos3-Nano ในอันดับที่สองที่คะแนน 43.3 ± 1.5 ซึ่งแสดงให้เห็นถึงความก้าวหน้าที่เหนือกว่าโมเดลอื่น ๆ ในด้านความถูกต้องทางฟิสิกส์

ที่มา: MarkTechPost

ความคิดเห็น

แสดงความคิดเห็น
0/2000

พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้