Kimi AI และ kvcache-ai เปิดตัว AgentENV ระบบกระจายพลังฝึก Agentic RL
Kimi AI ร่วมกับ kvcache-ai เปิดซอร์ส AgentENV ระบบกระจายอำนาจสำหรับการฝึกอบรม Agentic Reinforcement Learning ที่ใช้ Firecracker microVM และรองรับการทำ Snapshot ความเร็วสูง

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
- AgentENV แก้ปัญหาการจำกัดสภาพแวดล้อมรันไทม์ด้วย Firecracker microVM
- รองรับการกู้คืนและบูตระบบในเวลาน้อยกว่า 50 มิลลิวินาที
- ความสามารถ Fork ช่วยให้แยกแซนด์บ็อกซ์เป็นเด็กได้สูงสุด 16 ตัว
- เข้ากันได้กับ E2B API ช่วยให้เปลี่ยนมาใช้ระบบเซิร์ฟเวอร์เองได้ทันที
การฝึกอบรมแบบ Agentic Reinforcement Learning (RL) มีความซับซ้อนมากกว่าการสุ่มตัวอย่างข้อความทั่วไป เนื่องจากโมเดลจำเป็นต้องปฏิบัติงานจริงภายในคอมพิวเตอร์จริงๆ ซึ่งการทำงานแต่ละครั้ง (rollout) จำเป็นต้องอาศัยสภาพแวดล้อม Linux ที่แยกเป็นอิสระ มีระบบไฟล์ เน็ตเวิร์กสแต็ก และกระบวนการทำงานที่รันอยู่ ความต้องการเหล่านี้สร้างความท้าทายในการตัดสินใจเลือกระหว่างคอนเทนเนอร์ที่เริ่มทำงานได้รวดเร็วแต่แชร์เคอร์เนลร่วมกันจนความปลอดภัยลดลง กับเวอร์ชวลเครื่องเสมือน (VM) เต็มรูปแบบที่แยกส่วนได้ดีแต่บูตช้าและใช้หน่วยความจำค้างไว้
โครงการ AgentENV เข้ามาแก้ช่องว่างดังกล่าวโดยใช้ Firecracker microVM ทำให้การปล่อยให้เครื่องว่าง การรีสตาร์ท และการแยกกิ่งก้าน (branching) มีต้นทุนต่ำเพียงพอต่อการนำไปใช้งานในระดับการฝึกอบรมขนาดใหญ่ ภายในแซนด์บ็อกซ์แต่ละตัวจะประกอบด้วยเคอร์เนล Linux, ระบบไฟล์ และเน็ตเวิร์กเนมสเปซของตนเอง โดยมี Axum HTTP API ทำหน้าที่รับคำขอและส่งต่อให้กับออร์เคสตราเตอร์เพื่อจัดการวงจรชีวิตของแซนด์บ็อกซ์

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
ในด้านการจัดเก็บข้อมูล โครงการนี้ใช้ ublk userspace block device ที่ทำงานร่วมกับภาพเลเยอร์ overlaybd โดยเลเยอร์ฐานแบบอ่านอย่างเดียวจะถูกแชร์ร่วมกัน และแต่ละแซนด์บ็อกซ์จะเขียนข้อมูลลงในเลเยอร์บนของตนเอง นอกจากนี้ยังมีฟีเจอร์สำคัญอย่าง Fork ที่ออกแบบมาเพื่อ RL โดยเฉพาะ ช่วยให้แซนด์บ็อกซ์ที่กำลังทำงานอยู่สามารถโคลนตัวเองออกเป็นแซนด์บ็อกซ์ลูกที่เป็นอิสระได้สูงสุด 16 ตัวบนโหนดเดียวกัน โดยทุกตัวจะสืบทอดระบบไฟล์ หน่วยความจำ และการกำหนดค่าทรัพยากรมาจากต้นฉบับทั้งหมด
การที่ AgentENV เลือกใช้ Firecracker microVM ร่วมกับระบบ snapshot แบบเพิ่มปริมาณ (incremental) ถือเป็นก้าวสำคัญในการลดคอขวดด้านโครงสร้างพื้นฐานสำหรับการฝึก AI Agent สมัยใหม่ การจำลองสภาพแวดล้อมที่รวดเร็วระดับมิลลิวินาทีช่วยให้กระบวนการ trial-and-error ของโมเดล RL ทำได้อย่างต่อเนื่องโดยไม่เสียเวลาเตรียมสถานะเริ่มต้นซ้ำๆ ซึ่งเป็นหัวใจสำคัญในการเร่งความเร็วการพัฒนาโมเดลตระกูล Kimi K3
สำหรับข้อกำหนดเบื้องต้นในการใช้งาน ระบบเซิร์ฟเวอร์จำเป็นต้องรันบน Linux เคอร์เนล 6.8 ขึ้นไป และเข้าถึง /dev/kvm ได้ ขณะที่สคริปต์ติดตั้งกำหนดให้ใช้ Ubuntu 24.04 สำหรับเครื่องมือ CLI รองรับทั้ง Linux และ macOS บนสถาปัตยกรรม x86_64 และ arm64 พร้อมกันนี้ระบบยังรองรับ E2B API ทำให้ทีมพัฒนาสามารถสลับมาใช้เซิร์ฟเวอร์ของตนเองได้โดยไม่ต้องแก้ไขโค้ดแต่อย่างใด
ที่มา: MarkTechPost
พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้
ความคิดเห็น
แสดงความคิดเห็น