Dyna Robotics เปิดตัว Dyna-2 โมเดลโลกและการกระทำฝึกจากวิดีโอมนุษย์ล้านชั่วโมง
นวัตกรรม World-Action Model ใหม่ล่าสุดจาก Dyna Robotics ยกระดับความสามารถหุ่นยนต์ด้วยวิดีโอ 1 ล้านชั่วโมงและการทดสอบข้ามรูปแบบร่างกาย

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
- Dyna-2 คือโมเดล World-Action (WAM) ที่สร้างวิดีโอและชุดคำสั่งการกระทำอนาคตพร้อมกัน
- ผ่านการฝึกอบรมล่วงหน้าด้วยวิดีโอมุมมองบุคคลที่หนึ่งยาวนานกว่า 1,000,000 ชั่วโมง
- คะแนนเฉลี่ยพุ่งสูงขึ้นอย่างต่อเนื่องตามปริมาณข้อมูลที่เพิ่มขึ้นจนถึงระดับสูงสุด 53%
- ระบบปฏิบัติการแบบจำหน่ายเป็นชุดอุปกรณ์ (Vendor-operated system) ยังไม่มีการเปิดให้ดาวน์โหลดน้ำหนักโมเดล
Dyna Robotics ได้ประกาศเปิดตัวโมเดลปัญญาประดิษฐ์ตัวใหม่ในชื่อ Dyna-2 ซึ่งถูกพัฒนาให้เป็น World-Action Model (WAM) ทำหน้าที่สร้างภาพวิดีโออนาคตและชุดการกระทำของหุ่นยนต์ไปพร้อมกันหรือแยกส่วนบนโครงสร้างวิดีโอ-ดิฟฟิวชัน โมเดลนี้ถูกฝึกฝนล่วงหน้าด้วยวิดีโอมุมมองบุคคลที่หนึ่งของมนุษย์มากกว่าหนึ่งล้านชั่วโมง ซึ่งเทียบเท่ากับประสบการณ์การตื่นนอนต่อเนื่องกันประมาณ 170 ปีเต็ม
ในด้านสถาปัตยกรรมภายใน โมเดลนี้ใช้การผสมผสานของโครงสร้าง Transformers โดยมีการแยกโทเค็นของวิดีโอและชุดการกระทำออกจากกันอย่างชัดเจน พร้อมทั้งใช้ชั้น DiT ที่ทำหน้าที่ใส่ใจซึ่งกันและกัน ระบบรับรู้การเคลื่อนไหวของร่างกายส่งข้อมูลตรงไปยัง transformer ฝั่งการกระทำ ขณะที่โทเค็นวิดีโอใช้การมาสก์แบบเชิงสาเหตุ และโทเค็นการกระทำใช้ระบบความสนใจแบบสองทิศทางพร้อมเชื่อมโยงกับบริบทวิดีโอ
กระบวนการฝึกอบรมใช้เทคนิค Flow matching โดยฟังก์ชันความสูญเสียของวิดีโอและชุดการกระทำจะใช้แกนร่วมกันเป็นสนามความเร็วส่วนเพิ่มสองสนามแยกจากกัน เนื่องจากเครือข่ายการกระทำไม่เคยรับค่าลาเทนต์วิดีโอที่มีสัญญาณรบกวน นโยบายการทำงานจึงมีความรวดเร็วในการตอบสนองขณะใช้งานจริง ทีมผู้พัฒนาได้ออกแบบให้ transformer ฝั่งการกระทำมีความตื้นกว่าและเชื่อมต่อเข้ากับสตรีมวิดีโอตั้งแต่เนิ่นๆ เพื่อปรับปรุงเวลาหน่วงในการทำงานแบบเรียลไทม์โดยไม่สูญเสียประสิทธิภาพ

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
การพัฒนาโมเดลหุ่นยนต์ประเภท World-Action Model (WAM) ถือเป็นก้าวสำคัญที่ช่วยให้หุ่นยนต์ไม่เพียงแต่เข้าใจภาพภายนอก แต่ยังสามารถคาดการณ์ผลลัพธ์ทางกายภาพที่จะเกิดขึ้นจากการกระทำของตนเองได้แบบเรียลไทม์ แนวทางนี้ช่วยลดช่องว่างระหว่างการรับรู้ภาพและการควบคุมการเคลื่อนไหวของแขนกล ซึ่งมักเป็นจุดอ่อนในโมเดลหุ่นยนต์รุ่นก่อนๆ
ทางบริษัทได้ตัดชุดข้อมูลย่อยตามลำดับขนาดอย่างแม่นยำที่ 1,000, 10,000, 100,000 และ 1,000,000 ชั่วโมง โดยรักษาอัตราส่วนที่เท่ากันจากทุกแหล่งที่มา ชุดข้อมูลตรวจสอบความถูกต้องขนาด 100 ชั่วโมงที่ไม่ทับซ้อนกันถูกนำมาใช้ให้คะแนนในทุกระดับขั้น ผลลัพธ์แสดงให้เห็นว่าคะแนนเฉลี่ยที่ปรับมาตรฐานแล้วเพิ่มขึ้นจาก 20% เป็น 28%, 45% และสูงสุดที่ 53% ตามลำดับขั้นของข้อมูล
ระบบรุ่นใหม่นี้ถูกนำไปทดสอบความสามารถเทียบกับรุ่นก่อนหน้าอย่าง Dyna-1 โดย Dyna-2 ทำอัตราความสำเร็จได้สูงถึง 1.55 เท่า และได้เกรด 1.12 เท่าจากการประเมินในหลากหลายงาน นอกจากนี้ ในสถานที่ของลูกค้าที่ยังไม่เคยทดสอบมาก่อน Dyna-2 ผ่านเกณฑ์การผลิตถึง 87% ในขณะที่ Dyna-1 ทำได้เพียง 46% เท่านั้น พร้อมกันนี้ยังมีท่อส่งการกลั่นความรู้ที่ช่วยลดเวลาการสุ่มวิดีโอลงเหลือเพียง 110 มิลลิวินาทีบนฮาร์ดแวร์ H100 เพียงตัวเดียว
ที่มา: MarkTechPost
พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้
ความคิดเห็น
แสดงความคิดเห็น