ข้ามไปเนื้อหาหลัก

NVIDIA เปิดตัว SoL-Pi ลูปวิจัยอัตโนมัติ ลดโทเค็นโค้ด 49%

NVIDIA เผยแพร่ SoL-Pi บน GitHub ช่วยลดการใช้โทเค็นของโค้ดดิงเอเจนต์ได้สูงสุด 49% พร้อมลดต้นทุน API ลงกว่า 33% รองรับ Pi 0.85.1

เรียบเรียงโดย AI
Inewgen
สด22 Sep 2026ที่มา: MarkTechPost4 นาทีอ่าน (0 ครั้ง)
แชร์
NVIDIA เปิดตัว SoL-Pi ลูปวิจัยอัตโนมัติ ลดโทเค็นโค้ด 49%

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

ขนาดตัวอักษร
  • NVIDIA เปิดตัว SoL-Pi บน GitHub ภายใต้ไลเซนส์ MIT
  • ช่วยลดการใช้โทเค็นลงสูงสุด 49% และลดต้นทุน API ได้ 33.5%
  • ทำงานบน Pi 0.85.1 และ Node.js 22.19 ขึ้นไปโดยไม่ต้องแก้โครงสร้างพื้นฐาน
  • ใช้ระบบประเมินผลแยกส่วนและชุดทดสอบ EdgeBench ที่ถูกกันไว้ไม่ให้หลุดรอด

ทีมนักวิจัยจาก NVIDIA ได้พัฒนาและปล่อยเครื่องมือใหม่ในชื่อ SoL-Pi ผ่านทาง GitHub ในฐานะส่วนขยายภายใต้ไลเซนส์ MIT ซึ่งทำงานร่วมกับรีลีสพื้นฐานของ Pi โดยได้รับการทดสอบแล้วว่าใช้งานได้กับ Pi 0.85.1 และ Node.js เวอร์ชัน 22.19 ขึ้นไป โดยแนวทางทั่วไปมักจะมุ่งเน้นการลดต้นทุนต่อโทเค็นผ่านเคอร์เนลที่เร็วขึ้น การควอนไทเซชัน หรือการใช้โมเดลที่มีราคาถูกลง แต่ SoL-Pi เลือกใช้วิธีที่แตกต่างออกไปโดยมุ่งลดปริมาณโทเค็นที่งานแต่ละชิ้นต้องใช้ผ่านการจัดการฮาร์เนส (Harness) ซึ่งเป็นชั้นที่คอยควบคุมการเรียกใช้เครื่องมือ บริบท การสังเกตการณ์ และการมอบหมายงาน

การปรับแต่งฮาร์เนสด้วยมือมักทำได้ช้าและมีความซับซ้อน เนื่องจากส่วนประกอบต่างๆ มีความเกี่ยวโยงกัน การแก้ไขในจุดหนึ่งอาจทำให้ต้นทุนไปพุ่งสูงขึ้นในขั้นตอนถัดไป แม้ว่าจะมีระบบอย่าง Meta-Harness เข้ามาช่วย automate งานส่วนนี้ แต่การศึกษาล่าสุดพบว่าฮาร์เนสที่ถูกวิวัฒนาการขึ้นมามักจะเกิดอาการ Overfit กับงานที่ใช้ค้นหา และให้ผลลัพธ์ที่ดีขึ้นเพียงเล็กน้อยเท่านั้นเมื่อต้องเจอกับงานที่ไม่เคยเห็นมาก่อน

การจัดการฮาร์เนสของเอเจนต์ปัญญาประดิษฐ์ถือเป็นคอขวดสำคัญในการพัฒนาซอฟต์แวร์อัตโนมัติ เนื่องจากโค้ดดิงเอเจนต์มักส่งข้อมูลรับ-ส่ง (Token Traffic) ปริมาณมหาศาลระหว่างการทำงาน การที่ NVIDIA หันมาแก้ปัญหาที่ตัวปริมาณโทเค็นโดยตรงผ่านระบบวิจัยอัตโนมัติ จึงเป็นแนวทางที่ช่วยประหยัดค่าใช้จ่ายจริงในระดับองค์กรที่ต้องรันเอเจนต์เหล่านี้เป็นประจำทุกวัน

แนวทางการทำงานของระบบนี้คือ AI ฝั่งวิจัยจะคอยสังเกตการณ์รันไทม์เทรซจากเอเจนต์แยกต่างหากที่รันอยู่บน Pi พื้นฐาน จากนั้นจะทำการเสนอการเปลี่ยนแปลงฮาร์เนสและนำไปทดสอบ โดยแต่ละการค้นหาจะเป็นลูปแบบแยกส่วนอิสระ (Disposable, Isolated Loop) ที่ดำเนินตามวงจร autoresearch ขยายผลด้วยขั้นตอนการใช้งาน Ralph Loop และมีผู้ตรวจสอบอิสระคอยควบคุม

software developer writing code office desk workspace

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

กฎการยอมรับจะถูกตรึงไว้ก่อนที่การค้นหาจะเริ่มต้นขึ้น และตัวเพิ่มประสิทธิภาพจะไม่สามารถเปลี่ยนแปลงกฎเหล่านี้ได้ โดยตัวชี้วัดความสามารถทุกตัวจะต้องอยู่ในเกณฑ์ความคลาดเคลื่อนที่กำหนดไว้ล่วงหน้า และผู้สมัครจะต้องพัฒนาตัวชี้วัดประสิทธิภาพใหดีขึ้นอย่างน้อย 1 รายการ ทั้งนี้ชุดทดสอบ EdgeBench จะถูกกันไว้ไม่ให้นำมาใช้ระหว่างค้นหา โดยจากงานสาธารณะ 51 งาน จะมี 11 งานที่ใช้สำหรับการยอมรับผู้สมัครที่ถูกแช่แข็งแบบทางเดียว และ 40 งานสำหรับการประเมินผลรอบสุดท้าย

ไม่อยากพลาดข่าวใหม่?

สมัครรับสรุปข่าวสารใหม่ทางอีเมล ไม่บ่อยจนรำคาญ

โฆษณา

49.0%โทเค็นที่ลดลงบน GPT-5.6 Sol
44.7%โทเค็นที่ลดลงบน Opus 5
33.5%ต้นทุน API ที่ลดลงสูงสุด

ระบบสแต็กทั้งหมดถูกสร้างขึ้นบน GPT-5.6 Sol และย้ายไปยัง Opus 5 โดยไม่มีการค้นหาเพิ่มเติม ซึ่งบน Opus 5 มันยังคงรักษาคะแนนของ Pi ไว้ได้ 94.3% พร้อมกับตัดทราฟฟิกโทเค็นลง 44.7% และลดต้นทุน API ลง 33.5% ส่วนบน GPT-5.6 Sol สามารถรักษาคะแนนไว้ได้ 93.7% พร้อมกับลดการใช้โทเค็นลง 49.0% และลดต้นทุนลง 33.2% นอกจากนี้ในส่วนของ Performance point ยังเลือกใช้กลไกที่ดีที่สุดสำหรับแต่ละแบ็กเอนด์ ได้แก่ ObservationPack บน GPT-5.6 Sol และ Action Fusion บน Opus 5 ซึ่งช่วยดันคะแนนให้สูงกว่า Pi ปกติถึง 5.3% และ 12.8% ตามลำดับ

แม้ว่าบน GPT-5.6 Sol สแต็กเต็มจะทำให้ทราฟฟิกการเขียนแคชเพิ่มขึ้นจาก 0.0141 พันล้านเป็น 0.0316 พันล้านโทเค็น แต่ต้นทุนรวมก็ยังคงลดลงจาก 1,339 ดอลลาร์เหลือ 894 ดอลลาร์ โดยบทความวิจัยประเมินว่าสามารถประหยัดค่าใช้จ่ายรายชั่วโมงได้ราว 8.75 ถึง 13.50 ดอลลาร์เมื่อเทียบกับฮาร์เนสเนทีฟอย่าง Codex และ Claude Code และประหยัดได้ 4.36 ถึง 5.71 ดอลลาร์เมื่อเทียบกับ Pi ดั้งเดิม อย่างไรก็ตาม ทีมนักวิจัยระบุว่าการถ่ายโอนข้ามโมเดลยังคงเป็นเพียงขั้นต้น เนื่องจากกลไกต่างๆ ทำงานน้อยลงบน Opus 5 ซึ่งอาจเป็นเพราะการค้นหาใช้เพียงเทรเจกทอรีของ GPT-5.6 Sol เท่านั้น

ที่มา: MarkTechPost

ความคิดเห็น

แสดงความคิดเห็น
0/2000

พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้