ข้ามไปเนื้อหาหลัก

KwaiKAT เปิดตัว KAT-Coder-V2.5 โมเดลเขียนโค้ดอัจฉริยะ ฝึกจาก 100,000 สภาพแวดล้อม

ทีมวิจัยเปิดตัว KAT-Coder-V2.5 โมเดลเขียนโค้ดเชิงเอเจนต์ พร้อมชุดข้อมูลตรวจสอบได้กว่า 100,000 สภาพแวดล้อม และสถาปัตยกรรมการฝึกอบรมขั้นสูง

เรียบเรียงโดย AI
Inewgen
26 Jul 2026ที่มา: MarkTechPost4 นาทีอ่าน (0 ครั้ง)อัปเดตล่าสุด 29 Aug 2026
แชร์
KwaiKAT เปิดตัว KAT-Coder-V2.5 โมเดลเขียนโค้ดอัจฉริยะ ฝึกจาก 100,000 สภาพแวดล้อม

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

ขนาดตัวอักษร
  • โมเดล KAT-Coder-V2.5 พัฒนาโดยทีม KwaiKAT เน้นความสามารถด้านการเขียนโค้ดเชิงเอเจนต์
  • ฝึกฝนบนสภาพแวดล้อมที่ตรวจสอบความถูกต้องได้มากกว่า 100,000 รายการ ครอบคลุม 12 ภาษา
  • แก้ปัญหาความผิดพลาดของแซนด์บ็อกซ์ ลดอัตราความผิดพลาดจาก 16% เหลือต่ำกว่า 2%
  • ทำคะแนนนำบน PinchBench ที่ 94.9 แซงหน้าคู่แข่งระดับแนวหน้า

ทีมวิจัย KwaiKAT ได้เผยแพร่โมเดลเอเจนต์เขียนโค้ดรุ่นใหม่ล่าสุดในชื่อ KAT-Coder-V2.5 โดยงานวิจัยชิ้นนี้ได้นิยามงานที่สามารถตรวจสอบความถูกต้องได้ว่าเป็นชุดข้อมูลสามส่วน ได้แก่ คำอธิบายงานที่แม่นยำ สภาพแวดล้อมที่สามารถเรียกใช้งานได้ และชุดการทดสอบเพื่อตรวจสอบ โดยแพตช์จะถือว่าถูกต้องก็ต่อเมื่อผ่านการทดสอบทั้งหมดเท่านั้น งานต่างๆ ถูกคัดกรองมาจากพูลรีเควสต์และคอมมิตจริงตามแนวทางของ SWE-bench โดยโค้ดที่รวมเข้าด้วยกันจะให้แพตช์ต้นแบบและการเปลี่ยนแปลงทดสอบที่เกี่ยวข้อง ส่วนข้อความปัญหาดิบจะถูกตัดทิ้งและสร้างคำอธิบายขึ้นใหม่เป็นสามส่วน ได้แก่ แถลงการณ์ปัญหา ข้อกำหนด และข้อจำกัดด้านอินเทอร์เฟซ ก่อนจะผ่านการตรวจสอบความชัดเจนเพื่อคัดกรองข้อความที่คลุมเครือออกไป

ในส่วนของการจัดการสภาพแวดล้อม AutoBuilder ทำหน้าที่วิเคราะห์คลังโค้ดและเขียนสคริปต์กำหนดค่าเพื่อติดตั้งการพึ่งพาและรันการทดสอบจากเช็คเอาต์ที่สะอาด ขณะที่เอเจนต์ตรวจสอบจะรันสคริปต์ดังกล่าวในแซนด์บ็อกซ์แบบแยกส่วน กฎการยอมรับมีความน่าสนใจตรงที่จะไม่เพียงแค่อ่านรหัสออกหรือรูปแบบล็อก แต่จะวิเคราะห์ผลลัพธ์ของเฟรมเวิร์กการทดสอบที่มีโครงสร้าง และยอมรับสภาพแวดล้อมก็ต่อเมื่อรวบรวมการทดสอบที่คาดหวังได้มากกว่า 90% และผลลัพธ์ผ่าน/ไม่ผ่านสอดคล้องกันข้ามการรัน โดยความล้มเหลวจะถูกส่งกลับเป็นข้อมูลที่มีโครงสร้างเพื่อการซ่อมแซมแบบวนซ้ำ

57.2%อัตราความสำเร็จในการสร้างสภาพแวดล้อม (เพิ่มขึ้นจาก 16.5%)
100,000+สภาพแวดล้อมที่ตรวจสอบได้ใน 12 ภาษา
94.9คะแนนบน PinchBench นำหน้าโมเดลอื่น

การผสมผสานสภาพแวดล้อมพื้นฐาน เทมเพลตระบบบิวด์ และคลังสูตรการบิวด์ ช่วยให้อัตราความสำเร็จในการสร้างเพิ่มขึ้นจาก 16.5% เป็น 57.2% ส่งผลให้ได้สภาพแวดล้อมที่ตรวจสอบได้มากกว่า 100,000 รายการครอบคลุม 12 ภาษา โดยประวัติ Git และเมตาดาตาระอมมิตจะถูกลบออกเพื่อป้องกันไม่ให้เอเจนต์อ่านโซลูชันอ้างอิงได้จากคลังโค้ด นอกจากนี้ KwaiKAT ยังจัดการกับเส้นทางการทำงานทั้งในส่วนของงานที่ใกล้เคียงความสำเร็จด้วยคำใบ้ระดับกระบวนการ และใช้กฎเกณฑ์คัดกรองเส้นทางที่ไม่ถูกต้อง เสถียรน้อยเกินไป หรือมีการฉวยโอกาส รวมถึงการสุ่มชื่อเครื่องมือและรูปแบบพรอมต์เพื่อป้องกันการโอเวอร์ฟิตติ้งของชุดทดสอบ

การพัฒนาโมเดลเขียนโค้ดด้วยวิธี Reinforcement Learning (RL) มักพบอุปสรรคจากปัญหาโครงสร้างพื้นฐาน เช่น แซนด์บ็อกซ์ขัดข้องหรือหน่วยความจำเต็ม ซึ่งการแก้ปัญหาทางวิศวกรรมของทีม KwaiKAT ด้วยนโยบายการลบภาพแคชและการจัดการตัวแปรสภาพแวดล้อมถือเป็นบทเรียนสำคัญว่าเสถียรภาพของระบบเบื้องหลังมีผลอย่างมากต่อความเร็วและความเสถียรในการเรียนรู้ของโมเดลปัญญาประดิษฐ์

ไม่อยากพลาดข่าวใหม่?

สมัครรับสรุปข่าวสารใหม่ทางอีเมล ไม่บ่อยจนรำคาญ

โฆษณา

ในการฝึกอบรม KAT-Coder-V2.5 การแก้ไขปัญหาโครงสร้างพื้นฐาน 3 ประการ ได้แก่ นโยบายการลบภาพในแซนด์บ็อกซ์ การแก้ไขตัวแปรสภาพแวดล้อมระหว่างการเริ่มต้นรีโมทแซนด์บ็อกซ์ และการใช้ Gateway Server เรียกใช้งาน /generate โดยตรงเพื่อหลีกเลี่ยงความเบี่ยงเบนของโทเค็น ช่วยลดอัตราข้อผิดพลาดของฟีดแบ็กแซนด์บ็อกซ์จากประมาณ 16% เหลือต่ำกว่า 2% และลดความล้มเหลวในการฝึกอบรมลงอย่างมาก ทีมวิจัยเลือกใช้ PPO ร่วมกับ GAE และสถาปัตยกรรม Critic ที่ได้รับบริบทสิทธิพิเศษในการฝึกอบรม พร้อมระบบให้รางวัลสามระดับและการกลั่นความรู้แบบ Multi-Teacher On-Policy Distillation

software code repository analytics dashboard

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

ผลการประเมินภายใต้ชุดทดสอบมาตรฐาน KAT-Coder-V2.5 ทำคะแนนนำบน PinchBench ที่ 94.9 เอาชนะ Opus 4.8 ที่ทำได้ 93.5 และอยู่ในอันดับสองบน SWE-Bench Pro ที่ 65.2 ส่วนรุ่นเปิดน้ำหนักอย่าง KAT-Coder-V2.5-Dev เป็นโมเดล Mixture of Experts ขนาด 35B ทั้งหมดและทำงาน 3B ต่อเนื่องจากการโพสต์เทรนบน Qwen3.6-35B-A3B ด้วยตัวอย่าง SFT 127,000 รายการ ก่อนจะเข้าสู่กระบวนการเรียนรู้แบบเสริมแรง

ที่มา: MarkTechPost

ความคิดเห็น

แสดงความคิดเห็น
0/2000

พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้