UC Berkeley เปิดตัว CUA-Lite แพลตฟอร์มเอเจนต์คอมพิวเตอร์
ทีมนักวิจัย UC Berkeley เปิดตัว CUA-Lite แพลตฟอร์มโอเพนซอร์สรวมแซนด์บ็อกซ์ ข้อมูล การประเมิน และ RL สำหรับเอเจนต์คอมพิวเตอร์

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
- ทีมนักวิจัย UC Berkeley เปิดตัว CUA-Lite แพลตฟอร์มโอเพนซอร์สสำหรับ Computer-Use Agents
- รองรับการติดตั้งผ่าน Python 3.12 และทำงานบน Docker ทั่วไปโดยไม่ต้องใช้ /dev/kvm
- รวมชุดข้อมูลกว่า 10 ชุดและงานประเมินผลกว่า 30,000 งานไว้ในที่เดียว
ทีมนักวิจัยจาก UC Berkeley ได้พัฒนาและเปิดตัว CUA-Lite แพลตฟอร์มโอเพนซอร์สรูปแบบใหม่ที่ถูกออกแบบมาเพื่อรวมระบบแซนด์บ็อกซ์ ข้อมูลการฝึกฝน การประเมินผล และการเรียนรู้แบบเสริมแรง (RL) เข้าไว้ด้วยกันสำหรับเอเจนต์ที่ใช้งานคอมพิวเตอร์ (Computer-Use Agents) โดยระบบนี้สามารถติดตั้งได้อย่างง่ายดายผ่านคำสั่ง uv sync --all-extras บน Python 3.12 และทำงานบนโฮสต์ Docker ทั่วไปได้ทันทีโดยไม่จำเป็นต้องใช้ /dev/kvm ทำให้สามารถใช้งานบนอินสแตนซ์คลาวด์และคอนเทนเนอร์ซ้อนกันได้อย่างราบรื่น
หนึ่งในส่วนสนับสนุนที่สำคัญที่สุดคือ Lite.OSWorld ซึ่งโดยทั่วไปแล้ว OSWorld จะจำลองเดสก์ท็อป Ubuntu ผ่านเครื่องเสมือน QEMU/KVM เต็มรูปแบบต่อหนึ่งงาน ซึ่งโครงสร้างพื้นฐานแบบจัดการส่วนใหญ่ไม่รองรับ แต่ CUA-Lite สามารถจำลองชุดงานและตัวประเมินผลแบบเดียวกันบนเดสก์ท็อป GNOME ภายในคอนเทนเนอร์ Docker ธรรมดาได้สำเร็จ โดยคะแนนทดสอบจาก 13 โมเดลระบุว่าคะแนนของ Lite.OSWorld นั้นเทียบเท่ากับ VM ของ OSWorld ดั้งเดิม

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
แพลตฟอร์มดังกล่าวยังมาพร้อมกับแซนด์บ็อกซ์ในเครือ ได้แก่ Lite.ScaleCUA, Lite.CUAGym และ Lite.CUAWorld ซึ่งครอบคลุมแอปพลิเคชันมากกว่า 40 รายการ เช่น Blender, QGIS และ VS Code รวมทั้งสิ้นมากกว่า 30,000 งานที่สามารถตรวจสอบผลได้ นอกจากนี้ยังมีชั้นที่สองคือ Lite.Sample ซึ่งเป็นสกีมาการเรียนรู้แบบมีผู้สอนที่ใช้ร่วมกันทุกสภาพแวดล้อม จัดเก็บในรูปแบบไฟล์ parquet พร้อมรูปภาพ และเผยแพร่บน Hugging Face ฟรี
การพัฒนา CUA-Lite ถือเป็นก้าวสำคัญในการแก้ปัญหาคอขวดด้านโครงสร้างพื้นฐานสำหรับนักพัฒนาเอเจนต์ AI เนื่องจากการใช้งาน Virtual Machine เต็มรูปแบบแบบเดิมมีต้นทุนสูงและจำกัดการปรับขนาด การเปลี่ยนมาใช้ Docker container น้ำหนักเบาช่วยให้นักวิจัยสามารถทดลองและฝึกฝนโมเดลได้เร็วขึ้นบนฮาร์ดแวร์ที่เข้าถึงได้ง่ายกว่าเดิม
ในส่วนของการใช้งานร่วมกับเอเจนต์และสภาพแวดล้อม lite.gym ทำหน้าที่รับส่งภาพหน้าจอและคำสั่ง โดยบูรณาการเอเจนต์มากกว่า 10 แบบ เช่น GPT, Claude, Gemini, Qwen3-VL, UI-TARS และ Fara-7B รวมถึงเบนช์มาร์กมากกว่า 15 รายการครอบคลุมทั้งเดสก์ท็อป เบราว์เซอร์ และมือถือ ผู้พัฒนาสามารถสลับการใช้งานได้เพียงแค่เปลี่ยนตัวแปรในสคริปต์ rollout.py เท่านั้น
ทางด้านการฝึกฝนระบบ เอกสารโครงการระบุตัวอย่างการปรับแต่ง Qwen3-VL-2B-Instruct บนเส้นทางเดสก์ท็อปของ Lite.ScaleCUA ซึ่งช่วยเพิ่มผลตอบแทนเฉลี่ยต่อตอนจาก 0.138 เป็น 0.237 บนชุดประเมิน lite.osworld จำนวน 332 งานโดยใช้ GPU สองตัว ส่วนการเรียนรู้แบบ RL ใช้การอัปเดต GRPO บนโครงสร้าง Slime พร้อมตัวอย่างการใช้งานบน MobileGym ที่ครอบคลุม 416 งานมือถือผ่าน 28 แอปพลิเคชัน
ที่มา: MarkTechPost
พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้
ความคิดเห็น
แสดงความคิดเห็น