Contrastive-LM เปิดตัว CLM-8B โมเดลโอเพนซอร์สประเมินเอเจนต์
Contrastive-LM เปิดตัว CLM-8B โมเดลโอเพนซอร์สขนาด 8 พันล้านพารามิเตอร์ ทำงานเร็วกว่า Jev สูงสุด 9 เท่า พร้อมรองรับสัญญาอนุญาต Apache-2.0

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
- Contrastive-LM เปิดตัว CLM-8B โมเดลโอเพนซอร์สขนาด 8 พันล้านพารามิเตอร์
- ทำความเร็วในการให้คะแนนการกระทำของเอเจนต์เร็วกว่า Jev สูงสุด 9 เท่า
- ใช้สถาปัตยกรรมเข้ารหัสคู่และแคชเวกเตอร์สถานะบนจียูพีเอ็นวิเดียเดี่ยว
Contrastive-LM ได้เปิดตัว CLM-8B ซึ่งเป็นระบบโอเพนซอร์สแบบจำลองเดียวที่ออกแบบมาเพื่อประเมินการกระทำของเอเจนต์ (agent actions) โดยสามารถทำคะแนนได้เร็วกว่าระบบ Jev สูงสุดถึง 9 เท่า โมเดลนี้ใช้งานภายใต้สัญญาอนุญาต Apache-2.0 โดยตัวเฮด (head) มีขนาดเพียง 75 เมกะไบต์ และรันบนจียูพีเอ็นวิเดีย 1 ตัวภายใต้ระบบปฏิบัติการ Linux พร้อมใช้ vLLM ในการให้บริการตัวเข้ารหัส Qwen3-8B
ก่อนหน้านี้ Jev ได้เข้าสู่ช่วงจำกัดการเข้าถึงล่วงหน้าเมื่อวันที่ 15 กันยายน 2026 โดยส่งค่าที่มีการกำหนดชนิดข้อมูล (typed values) พร้อมความน่าจะเป็นแทนที่จะเป็นข้อความธรรมดา ซึ่ง CLM ได้รับการออกแบบให้มุ่งเน้นอินเทอร์เฟซเดียวกัน และมีที่เก็บข้อมูลบน GitHub ที่รองรับ API ที่เข้ากันได้กับ TypeSafe พร้อมเปิดเผยคำถาม 3 รูปแบบเพื่อให้ผู้ใช้สามารถจำลองคำขอผ่านไพธอนไคลเอนต์ของ CLM ได้อย่างราบรื่น
ในด้านกระบวนการฝึกฝน CLM จะฝึกตัวเข้ารหัสสถานะและตัวเข้ารหัสการกระทำด้วยฟังก์ชันสูญเสีย bidirectional InfoNCE โดยแต่ละตัวเข้ารหัสใช้โครงสร้างหลัก Qwen3-8B ที่ถูกแช่แข็ง (frozen backbone) ร่วมกับหัวโปรเจกชันที่ฝึกได้ขนาด 20 ล้านพารามิเตอร์ กระบวนการฝึกจะดึงสถานะเข้าหาการกระทำที่เกิดขึ้นจริง และผลักออกจากสถานะอื่น เพื่อใช้ในการให้คะแนนผ่านผลคูณดอท (dot product) ของเวกเตอร์สถานะและการกระทำในการอนุมาน
สถาปัตยกรรมการออกแบบนี้ช่วยแยกสถานะและการกระทำออกจากกัน โดยในลูปของเอเจนต์ สถานะจะเปลี่ยนแปลงทุกขั้นตอนในขณะที่ชุดการกระทำยังคงที่ clm-serve จึงสำรองหน่วยความจำจียูพีเอ็นในลักษณะคล้ายกับ KV cache ของ vLLM และนำเวกเตอร์ที่แคชไว้กลับมาใช้ใหม่ บนการ์ดจอ RTX 4090 เดี่ยวที่มี 3 การกระทำ สถานะที่มีการเข้าชมซ้ำจะลดเวลาลงเหลือ 0.6 มิลลิวินาที จากเดิม 1.7 มิลลิวินาที และรายงานความเร็วสูงสุดที่ 13 เท่าเมื่อเทียบกับ Jev ในกรณีที่มีแคนดิเดตประมาณ 1,000 รายการ
การแยกส่วนระหว่างสถานะ (State) และการกระทำ (Action) ถือเป็นก้าวสำคัญในการเพิ่มประสิทธิภาพของ AI Agents เพราะช่วยลดภาระการคำนวณซ้ำในส่วนที่ไม่มีการเปลี่ยนแปลง การนำแคชมาใช้คล้ายกับระบบ KV Cache ใน LLM ทั่วไปสะท้อนให้เห็นการนำเทคโนโลยีโครงสร้างพื้นฐานมาประยุกต์ใช้กับงานเอเจนต์เชิงซ้อนได้อย่างลงตัว
สำหรับการประเมินความแม่นยำ บนชุดคำถามทดสอบประมาณ 100,000 ข้อ การฝึกอบรมล่วงหน้า (pre-training) อย่างเดียวให้ความแม่นยำ top-1 ที่ 52.1% และการฝึกช่วงกลาง (mid-training) ช่วยเพิ่มขึ้นเป็น 69.2% ตัวเลข 9 เท่าที่อ้างถึงมาจากเกม T-Rex ซึ่งมีการกระทำซ้ำข้ามสถานะ โดย CLM สามารถทำคะแนนได้ทัดเทียมกับ Jev ในเกม T-Rex และ Super Mario แม้ว่าจะตามหลังในเรื่องการเรียกใช้เครื่องมือ (tool calling) และ WikiRacing แต่ก็ยังคงทำความเร็วได้เหนือกว่าในทุกงาน

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
ทีมวิจัยยังได้ประเมินผลลัพธ์ตัวตรวจสอบ (verifier) ใหม่บนชุดงานทดสอบ DeepSWE 38 งาน และ Terminal-Bench 2.1 อีก 30 งาน โดยวัดความหน่วงบนการ์ดจอ H100 ผลปรากฏว่า CLM ทำงานเร็วกว่า 4.1 ถึง 5.7 เท่า และสร้างสถิติ SOTA ใหม่ ขณะที่ Jev มีคะแนนต่ำกว่า pass@1 บนทั้งสองเกณฑ์มาตรฐาน ทำให้การเลือกด้วย Jevให้ผลลัพธ์แย่กว่าการเลือกเพียง 1 ตัวอย่าง
ที่มา: MarkTechPost
พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้
ความคิดเห็น
แสดงความคิดเห็น