ข้ามไปเนื้อหาหลัก

Cursor เปิดตัว Mixture-of-Kittens (MoK) เมกะเคอร์เนลฝึก AI บนฮาร์ดแวร์ GB300 NVL72

Cursor โอดซอร์ส MoK เมกะเคอร์เนล Mixture-of-Experts สำหรับสถาปัตยกรรม NVIDIA Blackwell เร่งความเร็วฝึกโมเดลพุ่งสูงสุด 2.37 เท่า

เรียบเรียงโดย AI
Inewgen
05 Aug 2026ที่มา: MarkTechPost3 นาทีอ่าน (0 ครั้ง)อัปเดตล่าสุด 29 Aug 2026
แชร์
Cursor เปิดตัว Mixture-of-Kittens (MoK) เมกะเคอร์เนลฝึก AI บนฮาร์ดแวร์ GB300 NVL72

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

ขนาดตัวอักษร
  • Cursor เปิดซอร์ส Mixture-of-Kittens (MoK) ภายใต้ไลเซนส์ Apache-2.0
  • ออกแบบมาเพื่อใช้งานบน GPU NVIDIA Blackwell SM100 หรือ SM103 (GB200/GB300 NVL72) เท่านั้น
  • เพิ่มความเร็วในการประมวลผล MXFP8 ไปข้างหน้าสูงสุด 2.37 เท่า
  • ลดการซิงโครไนซ์ระหว่าง CPU และ GPU เพื่อแก้ปัญหาคอขวดด้านการสื่อสาร

Cursor ได้ประกาศเปิดตัวซอร์สโค้ดของ Mixture-of-Kittens (MoK) ซึ่งเป็นเมกะเคอร์เนลสำหรับการฝึกโมเดลประเภท Mixture-of-Experts (MoE) แบบ Deterministic บนแพลตฟอร์ม GitHub ภายใต้สัญญาอนุญาตแบบ Apache-2.0 โดยซอฟต์แวร์นี้ถูกสร้างขึ้นมาเพื่อรีดประสิทธิภาพสูงสุดจากฮาร์ดแวร์ระดับไฮเอนด์อย่างแท้จริง

อย่างไรก็ตาม ข้อจำกัดด้านฮาร์ดแวร์ของ MoK นั้นอยู่ในระดับสูงมาก โดยจำเป็นต้องใช้งานร่วมกับ GPU NVIDIA Blackwell SM100 หรือ SM103 ซึ่งหมายความว่าผู้ใช้งานต้องมีหรือเช่าแร็คเซิร์ฟเวอร์รุ่น GB200 NVL72 หรือ GB300 NVL72 เท่านั้น นอกจากนี้ยังต้องรันบนสภาพแวดล้อม Python 3.12+, PyTorch 2.10+, และ CUDA toolkit 13.0+ อีกทั้งบัฟเฟอร์ระหว่าง GPU จะต้องอาศัยระบบ PyTorch symmetric memory

ด้วยเหตุนี้ กลุ่มผู้ใช้งานจริงจึงจำกัดอยู่เพียงองค์กรที่มีความพร้อมด้านโครงสร้างพื้นฐาน เช่น ห้องปฏิบัติการชั้นนำ, สตาร์ทอัพด้านโมเดลที่ได้รับทุนหนา, ผู้ให้บริการ GPU neoclouds และศูนย์คอมพิวเตอร์แห่งชาติ ขณะที่ทีมงานระดับโหนดเดี่ยวหรือร้านค้าที่มี GPU จำนวน 8 ตัวจะไม่สามารถใช้งานได้

การที่ Cursor พัฒนาเคอร์เนลที่เจาะจงฮาร์ดแวร์ Blackwell ขนาดใหญ่นี้ สะท้อนให้เห็นว่าปัญหาคอขวดในการฝึกโมเดล AI ขนาดยักษ์ยุคปัจจุบันได้ย้ายจากการคำนวณมาอยู่ที่การสื่อสารและการซิงโครไนซ์ข้อมูลภายในแร็คแล้ว การออกแบบเมกะเคอร์เนลที่ลดการพึ่งพาซีพียูจึงเป็นกุญแจสำคัญในการปลดล็อกประสิทธิภาพของฮาร์ดแวร์ NVLink โดเมนเดียวที่มี GPU ถึง 72 ตัว

ในแง่ของการประยุกต์ใช้งาน MoK เหมาะสำหรับงานที่มีความจำเพาะแต่มีมูลค่าสูง ได้แก่ การฝึกอบรมล่วงหน้า (Pretraining) และการฝึกอบรมภายหลัง (Post-training) ของโมเดล MoE สไตล์ DeepSeek-V3 รวมถึงการทำ on-policy RL post-training และ internal ablations เนื่องจากระบบมีความเป็น Deterministic สูง อุตสาหกรรมที่เกี่ยวข้องจึงครอบคลุมทั้งการพัฒนาโมเดล AI, โครงสร้างพื้นฐานคลาวด์ GPU, เครื่องมือสร้างโค้ด และการวิจัยเชิงปริมาณ

ไม่อยากพลาดข่าวใหม่?

สมัครรับสรุปข่าวสารใหม่ทางอีเมล ไม่บ่อยจนรำคาญ

โฆษณา

AI model training infrastructure server rack

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

ในกระบวนการผลิตจริง การสื่อสารเคยกลายเป็นปัจจัยจำกัดความเร็ว โดยเลเยอร์ MoE สามารถกินเวลาการฝึกอบรมแบบ end-to-end ไปมากกว่าครึ่งหนึ่ง การเปลี่ยนมาใช้ GB300 NVL72 ช่วยให้เกิดการเหลื่อมซ้อนกันแบบละเอียดย่อย (fine-grained overlap) ภายใน NVLink โดเมนที่มี 72 GPU แต่เนื่องจาก CPU ตระกูล Grace ที่ติดตั้งมาด้วยมีความเร็วต่ำกว่า GPU การลดการซิงโครไนซ์ระหว่าง CPU และ GPU จึงต้องทำอย่างดุดัน

2.37xความเร็ว MXFP8 ไปข้างหน้า
1.41xโทเค็นต่อวินาทีต่อ GPU

โครงสร้างของ MoK ถูกสร้างขึ้นเป็นเมกะเคอร์เนลและมีความเป็น Deterministic อย่างสมบูรณ์ รองรับโหมดความแม่นยำ BF16 และ MXFP8 การจัดตารางเวลาทำงานผ่าน Cluster Launch Control ของ Blackwell ทำให้ inter-rack RDMA ไม่ถูกจัดลำดับต่อท้าย ในส่วนของเกณฑ์มาตรฐานเลเยอร์บนแร็ค NVL72 เดี่ยวที่ระดับ EP 64 พบว่า MoK ทำความเร็วในการประมวลผล MXFP8 ไปข้างหน้าได้มากกว่าเบสไลน์ที่เร็วที่สุดถึง 2.37 เท่า และเพิ่มอัตราโทเค็นต่อวินาทีต่อ GPU จาก 760.9 เป็น 1,070.2 หรือคิดเป็น 1.41 เท่า

ที่มา: MarkTechPost

ความคิดเห็น

แสดงความคิดเห็น
0/2000

พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้