Cursor เปิดตัว Mixture-of-Kittens (MoK) เมกะเคอร์เนลฝึก AI บนฮาร์ดแวร์ GB300 NVL72
Cursor โอดซอร์ส MoK เมกะเคอร์เนล Mixture-of-Experts สำหรับสถาปัตยกรรม NVIDIA Blackwell เร่งความเร็วฝึกโมเดลพุ่งสูงสุด 2.37 เท่า

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
- Cursor เปิดซอร์ส Mixture-of-Kittens (MoK) ภายใต้ไลเซนส์ Apache-2.0
- ออกแบบมาเพื่อใช้งานบน GPU NVIDIA Blackwell SM100 หรือ SM103 (GB200/GB300 NVL72) เท่านั้น
- เพิ่มความเร็วในการประมวลผล MXFP8 ไปข้างหน้าสูงสุด 2.37 เท่า
- ลดการซิงโครไนซ์ระหว่าง CPU และ GPU เพื่อแก้ปัญหาคอขวดด้านการสื่อสาร
Cursor ได้ประกาศเปิดตัวซอร์สโค้ดของ Mixture-of-Kittens (MoK) ซึ่งเป็นเมกะเคอร์เนลสำหรับการฝึกโมเดลประเภท Mixture-of-Experts (MoE) แบบ Deterministic บนแพลตฟอร์ม GitHub ภายใต้สัญญาอนุญาตแบบ Apache-2.0 โดยซอฟต์แวร์นี้ถูกสร้างขึ้นมาเพื่อรีดประสิทธิภาพสูงสุดจากฮาร์ดแวร์ระดับไฮเอนด์อย่างแท้จริง
อย่างไรก็ตาม ข้อจำกัดด้านฮาร์ดแวร์ของ MoK นั้นอยู่ในระดับสูงมาก โดยจำเป็นต้องใช้งานร่วมกับ GPU NVIDIA Blackwell SM100 หรือ SM103 ซึ่งหมายความว่าผู้ใช้งานต้องมีหรือเช่าแร็คเซิร์ฟเวอร์รุ่น GB200 NVL72 หรือ GB300 NVL72 เท่านั้น นอกจากนี้ยังต้องรันบนสภาพแวดล้อม Python 3.12+, PyTorch 2.10+, และ CUDA toolkit 13.0+ อีกทั้งบัฟเฟอร์ระหว่าง GPU จะต้องอาศัยระบบ PyTorch symmetric memory
ด้วยเหตุนี้ กลุ่มผู้ใช้งานจริงจึงจำกัดอยู่เพียงองค์กรที่มีความพร้อมด้านโครงสร้างพื้นฐาน เช่น ห้องปฏิบัติการชั้นนำ, สตาร์ทอัพด้านโมเดลที่ได้รับทุนหนา, ผู้ให้บริการ GPU neoclouds และศูนย์คอมพิวเตอร์แห่งชาติ ขณะที่ทีมงานระดับโหนดเดี่ยวหรือร้านค้าที่มี GPU จำนวน 8 ตัวจะไม่สามารถใช้งานได้
การที่ Cursor พัฒนาเคอร์เนลที่เจาะจงฮาร์ดแวร์ Blackwell ขนาดใหญ่นี้ สะท้อนให้เห็นว่าปัญหาคอขวดในการฝึกโมเดล AI ขนาดยักษ์ยุคปัจจุบันได้ย้ายจากการคำนวณมาอยู่ที่การสื่อสารและการซิงโครไนซ์ข้อมูลภายในแร็คแล้ว การออกแบบเมกะเคอร์เนลที่ลดการพึ่งพาซีพียูจึงเป็นกุญแจสำคัญในการปลดล็อกประสิทธิภาพของฮาร์ดแวร์ NVLink โดเมนเดียวที่มี GPU ถึง 72 ตัว
ในแง่ของการประยุกต์ใช้งาน MoK เหมาะสำหรับงานที่มีความจำเพาะแต่มีมูลค่าสูง ได้แก่ การฝึกอบรมล่วงหน้า (Pretraining) และการฝึกอบรมภายหลัง (Post-training) ของโมเดล MoE สไตล์ DeepSeek-V3 รวมถึงการทำ on-policy RL post-training และ internal ablations เนื่องจากระบบมีความเป็น Deterministic สูง อุตสาหกรรมที่เกี่ยวข้องจึงครอบคลุมทั้งการพัฒนาโมเดล AI, โครงสร้างพื้นฐานคลาวด์ GPU, เครื่องมือสร้างโค้ด และการวิจัยเชิงปริมาณ

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
ในกระบวนการผลิตจริง การสื่อสารเคยกลายเป็นปัจจัยจำกัดความเร็ว โดยเลเยอร์ MoE สามารถกินเวลาการฝึกอบรมแบบ end-to-end ไปมากกว่าครึ่งหนึ่ง การเปลี่ยนมาใช้ GB300 NVL72 ช่วยให้เกิดการเหลื่อมซ้อนกันแบบละเอียดย่อย (fine-grained overlap) ภายใน NVLink โดเมนที่มี 72 GPU แต่เนื่องจาก CPU ตระกูล Grace ที่ติดตั้งมาด้วยมีความเร็วต่ำกว่า GPU การลดการซิงโครไนซ์ระหว่าง CPU และ GPU จึงต้องทำอย่างดุดัน
โครงสร้างของ MoK ถูกสร้างขึ้นเป็นเมกะเคอร์เนลและมีความเป็น Deterministic อย่างสมบูรณ์ รองรับโหมดความแม่นยำ BF16 และ MXFP8 การจัดตารางเวลาทำงานผ่าน Cluster Launch Control ของ Blackwell ทำให้ inter-rack RDMA ไม่ถูกจัดลำดับต่อท้าย ในส่วนของเกณฑ์มาตรฐานเลเยอร์บนแร็ค NVL72 เดี่ยวที่ระดับ EP 64 พบว่า MoK ทำความเร็วในการประมวลผล MXFP8 ไปข้างหน้าได้มากกว่าเบสไลน์ที่เร็วที่สุดถึง 2.37 เท่า และเพิ่มอัตราโทเค็นต่อวินาทีต่อ GPU จาก 760.9 เป็น 1,070.2 หรือคิดเป็น 1.41 เท่า
ที่มา: MarkTechPost
พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้
ความคิดเห็น
แสดงความคิดเห็น