Prime Intellect เปิดตัวบริการ Prime Inference รองรับโมเดลเปิด
Prime Intellect เปิดบริการ Prime Inference สำหรับประมวลผลโมเดลปัญญาประดิษฐ์แบบเปิด รองรับภาระงาน Agentic และทำความเร็วสูง

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
- Prime Intellect เปิดตัว Prime Inference ระบบประมวลผลสำหรับโมเดลปัญญาประดิษฐ์แบบเปิด
- ผสานการทำงานร่วมกับ NVIDIA Dynamo, vLLM, Mooncake และ FlashInfer
- ออกแบบมาเพื่อรองรับภาระงาน Agentic ที่มีความซับซ้อนสูง
- ชูจุดเด่นลดความหน่วง p90 inter-token ลงเกือบ 40% จากผลทดสอบ
Prime Intellect ได้ประกาศเปิดตัวบริการ Prime Inference ซึ่งเป็นชั้นประมวลผล (serving layer) ตัวใหม่ที่เข้ามาเติมเต็มระบบโครงสร้างพื้นฐานการฝึกอบรมแบบเปิดของบริษัทให้สมบูรณ์ยิ่งขึ้น โดยก่อนหน้านี้ทางบริษัทได้ส่งมอบเครื่องมือหลังการฝึกอบรมมาแล้วหลายตัว เช่น prime-rl, verifiers และ sandboxes การเพิ่มบริการประมวลผลในครั้งนี้จึงช่วยปิดวงจรการทำงาน ทำให้โมเดลที่ถูกปรับใช้สามารถสร้างร่องรอยข้อมูลการผลิต (production traces) เพื่อป้อนกลับเข้าสู่กระบวนการฝึกอบรมได้ทันที
ในส่วนของประสิทธิภาพการทำงาน ทางบริษัทระบุว่าจุดสิ้นสุดการเชื่อมต่อ GLM-5.3 จัดอยู่ในกลุ่มที่มีความเร็วสูงสุดบนแพลตฟอร์ม OpenRouter นอกจากนี้ยังมีอัตราความผิดพลาดในการเรียกใช้เครื่องมือเกือบเป็นศูนย์ และสามารถรักษาเวลาทำงานได้อย่างต่อเนื่อง 100% นับตั้งแต่เปิดให้บริการ
สถาปัตยกรรมเบื้องหลังระบบนี้เป็นการผสานเทคโนโลยีชั้นนำเข้าด้วยกัน ได้แก่ NVIDIA Dynamo, vLLM, Mooncake และ FlashInfer ซึ่งพัฒนาขึ้นร่วมกับ Inferact และ NVIDIA พร้อมทั้งมีการส่งมอบโค้ดแก้ไขกลับไปยังต้นน้ำ (upstream) ด้วย เป้าหมายหลักของระบบคือการรองรับภาระงานประเภท Agentic ซึ่งในหนึ่งรอบการทำงานของเอเจนต์ (agent turn) จะเพิ่มโทเค็นเข้ามาประมาณ 6,000 โทเค็น บนชุดคำสั่งเริ่มต้นที่มีขนาดถึง 140,000 โทเค็น โดยทาง Prime ได้ทำการทดสอบประสิทธิภาพผ่านการจำลองร่วมกับ SemiAnalysis AgentX และการจำลองภาระงานเข้ามาแบบฉับพลัน

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
เทคโนโลยีเบื้องหลังที่สำคัญประกอบด้วยการแยกส่วนการประมวลผลระหว่าง Prefill และ Decode ออกจากกัน โดยรันบนกลุ่ม GPU ที่แยกจากกันอย่างชัดเจน ซึ่ง Dynamo ทำหน้าที่ในการจัดเส้นทางคำขอ ส่วน vLLM ทำหน้าที่รันโมเดลในแต่ละกลุ่ม และตัวถอดรหัสจะดึงค่า KV ที่คำนวณแล้วผ่าน NIXL ส่งผลให้ผลการทดสอบแสดงให้เห็นว่าความหน่วง p90 inter-token ลดลงเกือบ 40%
"Prefill and decode run on separate GPU groups. Dynamo handles routing, and vLLM runs the model on each group."
Prime Intellect Engineering Team
นอกจากนี้ ระบบยังมีการทำ Cache-aware routing โดยเราเตอร์ที่ตระหนักรู้เรื่อง KV ของ Dynamo จะค่าน้ำหนักความทับซ้อนของคำนำหน้าที่มีการแคชไว้เทียบกับงานที่รออยู่ในคิว เพื่อให้เซสชันยังคงอยู่บนตัวถอดรหัสตัวเดิมระหว่างรอบการทำงาน ขณะเดียวกัน Mooncake ได้เพิ่มแคชระดับที่สองไว้ในหน่วยความจำ DRAM ของโฮสต์ เพื่อเพิ่มประสิทธิภาพการทำงานให้ดียิ่งขึ้น
การแยกส่วนระหว่างการประมวลผล Prefill และ Decode ถือเป็นแนวทางสำคัญในการบริหารจัดการทรัพยากรฮาร์ดแวร์สำหรับโมเดลภาษาขนาดใหญ่ (LLM) ในปัจจุบัน เนื่องจากงานทั้งสองประเภทมีความต้องการใช้หน่วยความจำและพลังประมวลผลที่แตกต่างกันอย่างสิ้นเชิง การบริหารจัดการแคชและการจัดเส้นทางคำขออย่างชาญฉลาดจึงช่วยลดคอขวดและเพิ่มขีดความสามารถในการรองรับผู้ใช้งานพร้อมกันจำนวนมากได้อย่างมีประสิทธิภาพ
เป้าหมายด้านความโต้ตอบที่ตั้งไว้คือ 100 โทเค็นต่อวินาทีต่อผู้ใช้งานหนึ่งราย ซึ่งภายใต้เกณฑ์ดังกล่าว สัดส่วน Prefill ต่อ Decode ที่ 1:4 สามารถรองรับผู้ใช้งานได้มากที่สุด โดยระบบสามารถบรรลุระดับ 66 เซสชันต่อกลุ่ม Prefill ที่ความเร็ว 101 โทเค็นต่อวินาทีต่อผู้ใช้งาน และ 100 โทเค็นเอาต์พุตต่อวินาทีต่อ GPU
ที่มา: MarkTechPost
พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้
ความคิดเห็น
แสดงความคิดเห็น