ข้ามไปเนื้อหาหลัก

Prime Intellect เปิดตัวบริการ Prime Inference รองรับโมเดลเปิด

Prime Intellect เปิดบริการ Prime Inference สำหรับประมวลผลโมเดลปัญญาประดิษฐ์แบบเปิด รองรับภาระงาน Agentic และทำความเร็วสูง

เรียบเรียงโดย AI
Inewgen
03 Oct 2026ที่มา: MarkTechPost3 นาทีอ่าน (0 ครั้ง)
แชร์
Prime Intellect เปิดตัวบริการ Prime Inference รองรับโมเดลเปิด

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

ขนาดตัวอักษร
  • Prime Intellect เปิดตัว Prime Inference ระบบประมวลผลสำหรับโมเดลปัญญาประดิษฐ์แบบเปิด
  • ผสานการทำงานร่วมกับ NVIDIA Dynamo, vLLM, Mooncake และ FlashInfer
  • ออกแบบมาเพื่อรองรับภาระงาน Agentic ที่มีความซับซ้อนสูง
  • ชูจุดเด่นลดความหน่วง p90 inter-token ลงเกือบ 40% จากผลทดสอบ

Prime Intellect ได้ประกาศเปิดตัวบริการ Prime Inference ซึ่งเป็นชั้นประมวลผล (serving layer) ตัวใหม่ที่เข้ามาเติมเต็มระบบโครงสร้างพื้นฐานการฝึกอบรมแบบเปิดของบริษัทให้สมบูรณ์ยิ่งขึ้น โดยก่อนหน้านี้ทางบริษัทได้ส่งมอบเครื่องมือหลังการฝึกอบรมมาแล้วหลายตัว เช่น prime-rl, verifiers และ sandboxes การเพิ่มบริการประมวลผลในครั้งนี้จึงช่วยปิดวงจรการทำงาน ทำให้โมเดลที่ถูกปรับใช้สามารถสร้างร่องรอยข้อมูลการผลิต (production traces) เพื่อป้อนกลับเข้าสู่กระบวนการฝึกอบรมได้ทันที

ในส่วนของประสิทธิภาพการทำงาน ทางบริษัทระบุว่าจุดสิ้นสุดการเชื่อมต่อ GLM-5.3 จัดอยู่ในกลุ่มที่มีความเร็วสูงสุดบนแพลตฟอร์ม OpenRouter นอกจากนี้ยังมีอัตราความผิดพลาดในการเรียกใช้เครื่องมือเกือบเป็นศูนย์ และสามารถรักษาเวลาทำงานได้อย่างต่อเนื่อง 100% นับตั้งแต่เปิดให้บริการ

40%ความหน่วง p90 ที่ลดลง
100โทเค็นต่อวินาทีต่อ GPU

สถาปัตยกรรมเบื้องหลังระบบนี้เป็นการผสานเทคโนโลยีชั้นนำเข้าด้วยกัน ได้แก่ NVIDIA Dynamo, vLLM, Mooncake และ FlashInfer ซึ่งพัฒนาขึ้นร่วมกับ Inferact และ NVIDIA พร้อมทั้งมีการส่งมอบโค้ดแก้ไขกลับไปยังต้นน้ำ (upstream) ด้วย เป้าหมายหลักของระบบคือการรองรับภาระงานประเภท Agentic ซึ่งในหนึ่งรอบการทำงานของเอเจนต์ (agent turn) จะเพิ่มโทเค็นเข้ามาประมาณ 6,000 โทเค็น บนชุดคำสั่งเริ่มต้นที่มีขนาดถึง 140,000 โทเค็น โดยทาง Prime ได้ทำการทดสอบประสิทธิภาพผ่านการจำลองร่วมกับ SemiAnalysis AgentX และการจำลองภาระงานเข้ามาแบบฉับพลัน

artificial intelligence server hardware rack

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

เทคโนโลยีเบื้องหลังที่สำคัญประกอบด้วยการแยกส่วนการประมวลผลระหว่าง Prefill และ Decode ออกจากกัน โดยรันบนกลุ่ม GPU ที่แยกจากกันอย่างชัดเจน ซึ่ง Dynamo ทำหน้าที่ในการจัดเส้นทางคำขอ ส่วน vLLM ทำหน้าที่รันโมเดลในแต่ละกลุ่ม และตัวถอดรหัสจะดึงค่า KV ที่คำนวณแล้วผ่าน NIXL ส่งผลให้ผลการทดสอบแสดงให้เห็นว่าความหน่วง p90 inter-token ลดลงเกือบ 40%

ไม่อยากพลาดข่าวใหม่?

สมัครรับสรุปข่าวสารใหม่ทางอีเมล ไม่บ่อยจนรำคาญ

โฆษณา

"Prefill and decode run on separate GPU groups. Dynamo handles routing, and vLLM runs the model on each group."

Prime Intellect Engineering Team

นอกจากนี้ ระบบยังมีการทำ Cache-aware routing โดยเราเตอร์ที่ตระหนักรู้เรื่อง KV ของ Dynamo จะค่าน้ำหนักความทับซ้อนของคำนำหน้าที่มีการแคชไว้เทียบกับงานที่รออยู่ในคิว เพื่อให้เซสชันยังคงอยู่บนตัวถอดรหัสตัวเดิมระหว่างรอบการทำงาน ขณะเดียวกัน Mooncake ได้เพิ่มแคชระดับที่สองไว้ในหน่วยความจำ DRAM ของโฮสต์ เพื่อเพิ่มประสิทธิภาพการทำงานให้ดียิ่งขึ้น

การแยกส่วนระหว่างการประมวลผล Prefill และ Decode ถือเป็นแนวทางสำคัญในการบริหารจัดการทรัพยากรฮาร์ดแวร์สำหรับโมเดลภาษาขนาดใหญ่ (LLM) ในปัจจุบัน เนื่องจากงานทั้งสองประเภทมีความต้องการใช้หน่วยความจำและพลังประมวลผลที่แตกต่างกันอย่างสิ้นเชิง การบริหารจัดการแคชและการจัดเส้นทางคำขออย่างชาญฉลาดจึงช่วยลดคอขวดและเพิ่มขีดความสามารถในการรองรับผู้ใช้งานพร้อมกันจำนวนมากได้อย่างมีประสิทธิภาพ

เป้าหมายด้านความโต้ตอบที่ตั้งไว้คือ 100 โทเค็นต่อวินาทีต่อผู้ใช้งานหนึ่งราย ซึ่งภายใต้เกณฑ์ดังกล่าว สัดส่วน Prefill ต่อ Decode ที่ 1:4 สามารถรองรับผู้ใช้งานได้มากที่สุด โดยระบบสามารถบรรลุระดับ 66 เซสชันต่อกลุ่ม Prefill ที่ความเร็ว 101 โทเค็นต่อวินาทีต่อผู้ใช้งาน และ 100 โทเค็นเอาต์พุตต่อวินาทีต่อ GPU

ที่มา: MarkTechPost

ความคิดเห็น

แสดงความคิดเห็น
0/2000

พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้