Google Research เปิดตัว RRSI โอเพนซอร์ส AI Agents พัฒนาตัวเองได้
Google Research เปิดตัว RRSI เฟรมเวิร์กโอเพนซอร์สไลเซนส์ Apache 2.0 ช่วยให้ AI Agents พัฒนาฮาร์เนสของตัวเองได้โดยไม่เกิด Overfitting พร้อมดันคะแนน Terminal-Bench 2.1 พุ่งแตะ 78.7

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
- Google Research เปิดตัว RRSI เป็นโอเพนซอร์สภายใต้ไลเซนส์ Apache 2.0 สำหรับ AI Agents
- ระบบใช้ลูปพัฒนาฮาร์เนสโดยเสนอการแก้ไขและให้คะแนนบนชุดข้อมูลประจำ
- ป้องกัน 3 ความล้มเหลวหลัก ได้แก่ การฟิตจำเพาะ, การไล่ตามสัญญาณรบกวน และความซับซ้อนที่สะสม
- ผลการทดสอบดันคะแนน Terminal-Bench 2.1 จาก 64.6 เป็น 78.7 และประหยัดโทเค็นได้ถึง 30-36 เปอร์เซ็นต์
Google Research ได้ประกาศเปิดตัวเฟรมเวิร์กวิจัยตัวใหม่ในชื่อ RRSI ซึ่งเป็นโอเพนซอร์สภายใต้สัญญาอนุญาต Apache 2.0 โดยระบบดังกล่าวถูกออกแบบมาเพื่อให้ AI Agents สามารถพัฒนาฮาร์เนสหรือโครงสร้างพื้นฐานของตนเองได้โดยไม่ต้องกังวลเรื่องปัญหา Overfitting เฟรมเวิร์กนี้รองรับการทำงานร่วมกับ Python 3.10 ขึ้นไป และสามารถรับสตริงโมเดลใดก็ได้ที่ผ่าน LiteLLM โดยค่าเริ่มต้นจะตั้งค่าไว้ที่โมเดล Claude Opus 4.8 บน Vertex AI
การทำงานของลูปวิวัฒนาการฮาร์เนสจะเริ่มต้นด้วยการเสนอการแก้ไข ทดสอบคะแนนบนชุดข้อมูลคงที่ที่กำหนดไว้ และคัดเลือกผู้ชนะเข้าสู่รอบถัดไป เนื่องจากระบบใช้งานเดิมซ้ำในทุกๆ รอบ ลูปดังกล่าวจึงอาจเกิดภาวะจำจำเพาะได้ ทางทีมวิจัย RRSI จึงได้ระบุโหมดความล้มเหลวสำคัญ 3 ประการ ได้แก่ การฟิตจำเพาะเจาะจงกับเบนช์มาร์ก, การวิ่งตามสัญญาณรบกวน (Noise Chasing) และการสะสมความซับซ้อน ซึ่งปัจจัยเหล่านี้ล้วนส่งผลให้ช่องว่างระหว่างคะแนนบนชุดพัฒนาและประสิทธิภาพการถ่ายโอนความรู้จริงๆ กว้างขึ้น
แนวทางของ RRSI คือการเปิดให้องค์ประกอบทุกส่วนของฮาร์เนสสามารถแก้ไขได้ทั้งหมด แต่จะใช้วิธีการควบคุมการค้นหา (Regularize) แทนการจำกัดโครงสร้าง ทีมวิจัยได้เปรียบเทียบกลไกเหล่านี้กับตัวปรับแต่งค่าคลาสสิก (Classic Regularizers) โดยระบุว่า งบประมาณการแก้ไขเทียบได้กับ L0, การตัดแต่งกิ่ง (Pruning) เทียบได้กับ Lasso (L1) และกฎต้นทุนเทียบได้กับ Ridge (L2)

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
จากการทดสอบบนชุดข้อมูลที่ถูกเก็บไว้ (Held-out splits) ทั้ง 6 ส่วนพบว่ามีประสิทธิภาพดีขึ้นทั้งหมด เมื่อใช้ Gemini 3.5 Flash เป็นนโยบาย คะแนน Terminal-Bench 2.1 เพิ่มขึ้นจาก 64.6 ไปอยู่ที่ 78.7 ขณะที่ SWE-bench Verified ขยับจาก 76.8 ขึ้นมาอยู่ที่ 79.0 นอกจากนี้ ฮาร์เนสตัวนี้ยังมีน้ำหนักเบาลง โดยในการทดสอบบนพื้นที่ทำงานเอเจนต์ RRSI ใช้โทเค็นนโยบาย 2.42 ล้านโทเค็นต่อการทดลอง ขณะที่ระบบวิวัฒนาการแบบไม่ควบคุมใช้ไปถึง 3.80 ล้านโทเค็น ซึ่งรายงานในบทคัดย่อระบุว่าประหยัดได้ 30 เปอร์เซ็นต์ ส่วนหน้าเว็บโครงการระบุว่าประหยัดได้ 36 เปอร์เซ็นต์
การที่ Google Research นำแนวคิดทางคณิตศาสตร์อย่าง L1 (Lasso) และ L2 (Ridge) มาประยุกต์ใช้กับการปรับแต่งฮาร์เนสของ AI Agents ถือเป็นก้าวสำคัญในการแก้ปัญหา Overfitting ซึ่งเป็นอุปสรรคใหญ่ของการพัฒนา Agent ให้มีความสามารถทั่วไป (Generalization) การควบคุมพฤติกรรมการค้นหาโค้ดโดยไม่ไปจำกัดความยืดหยุ่นของตัวโครงสร้าง ช่วยให้ AI สามารถปรับตัวเข้ากับโจทย์ใหม่ๆ ได้ดีขึ้นโดยไม่ต้องสิ้นเปลืองทรัพยากรการประมวลผลมหาศาล
สำหรับนักพัฒนาที่สนใจสามารถเริ่มต้นใช้งานได้ทันทีผ่านคำสั่งโคลนซอร์สโค้ดจาก GitHub และติดตั้งแพ็กเกจด้วยคำสั่ง pip พร้อมรันโดเมนการเขียนโค้ดตามตัวอย่างที่ระบุไว้ในเอกสารทางการของโครงการ ซึ่งแต่ละรอบจะมีการร่างตัวเลือก 2 ชุดในแยก git worktrees ทำการคัดกรอง ประเมินผล และอัปเดตสาขาไปยังตัวเลือกที่ดีที่สุด
ที่มา: MarkTechPost
พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้
ความคิดเห็น
แสดงความคิดเห็น