Cognition เปิดตัว SWE-2 โมเดลเขียนโค้ดต่อยอดจาก Kimi K3
Cognition ปล่อยโมเดลเขียนโค้ด SWE-2 ที่ต่อยอดจาก Kimi K3 ทำคะแนนเทียบเท่า Fable 5.1 บน FrontierCode ด้วยต้นทุนที่ถูกลงถึง 64%

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
- Cognition เปิดตัว SWE-2 โมเดลเขียนโค้ดตัวใหม่ที่พัฒนาต่อจาก Kimi K3
- ทำงานเฉพาะภายในแพลตฟอร์ม Devin เท่านั้น ไม่มี open weights และไม่มี standalone API
- ทำคะแนนบน FrontierCode เทียบเท่า Fable 5.1 แต่ประหยัดต้นทุนกว่าถึง 64%
- มาพร้อมระบบ focused exploration ช่วยลดการสำรวจเกินจำเป็นในงานที่ง่าย
บริษัท Cognition ประกาศเปิดตัว SWE-2 โมเดลปัญญาประดิษฐ์สำหรับการเขียนโค้ดรุ่นใหม่ล่าสุด ซึ่งผ่านกระบวนการ post-training ต่อมาจากโมเดลพื้นฐาน Kimi K3 โดยโมเดลตัวนี้สร้างขึ้นบนโครงสร้างพื้นฐานและสูตรการพัฒนาเดียวกับ SWE-1.7 ที่เคยพัฒนามาจาก Kimi K2.7 ทั้งนี้ Cognition ได้ทำการปรับสเกลการเรียนรู้แบบ reinforcement learning (RL) ไปสู่ระดับ multi-trillion-parameter โดยใช้โมเดลพื้นฐานที่มีจำนวนพารามิเตอร์มากกว่าเดิมเกือบ 3 เท่า พร้อมระบุว่า RL ของพวกเขายังคงค้นพบพื้นที่ให้พัฒนาต่อยอดบน K3 ได้อีก โดยเพิ่มคะแนนขึ้น 5 ถึง 6 คะแนนในหลายเบนช์มาร์ก
สำหรับการใช้งานจริง โมเดล SWE-2 ไม่สามารถนำไปรันบนโครงสร้างพื้นฐานของตนเองได้ เนื่องจากไม่มี open weights และไม่มี standalone API โดยจะใช้งานได้ผ่านระบบของ Devin เท่านั้น ทั้งบน Desktop, CLI รวมถึง Devin Web และ Fusion ที่กำลังทยอยปล่อยออกมา

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
การเปลี่ยนแปลงที่สำคัญที่สุดคืออัลกอริทึม RL ที่สามารถฝึกฝนระดับความพยายาม (effort levels) ทั้ง 3 ระดับได้ในการรันเพียงครั้งเดียว โดยแต่ละระดับจะมีต้นทุนบทลงโทษ (cost penalty) ของตัวเอง ทำให้ต้นทุนและประสิทธิภาพเคลื่อนที่ไปพร้อมกัน นอกจากนี้ SWE-2 ยังแก้ปัญหาการสำรวจเกินจำเป็น (over-explore) ในงานง่ายๆ ของรุ่นก่อนหน้า ด้วยเทคนิคที่เรียกว่า focused exploration บน FrontierCode 1.1 Main ทำให้รุ่น medium ทำคะแนนได้สูงกว่า SWE-1.7 แต่ใช้รอบการทำงานน้อยลง 58% และประหยัดต้นทุนลง 81% โดยค่ามัธยฐานของการแก้ไขจริงเกิดขึ้นในขั้นตอนที่ 18 เทียบกับ 48 ของ SWE-1.7
ทีมงาน Cognition ยังได้รายงานพฤติกรรมเด่น 3 ประการของโมเดล ได้แก่ ความครอบคลุมของการทดสอบแบบ end-to-end ที่ดีขึ้น ความสามารถในการแก้ไขปัญหาเมื่อเครื่องมือถูกบล็อก และวินัยในการตรวจสอบ โดยเมื่อถูกท้าทาย โมเดลจะทำการหาข้อสรุปใหม่อีกครั้งแทนที่จะยืนยันคำตอบเดิม นอกจากนี้ในด้านข้อมูล Cognition ได้เพิ่มสภาพแวดล้อม RL เป็น 3 เท่า เพิ่มชุดคำสั่งตามคำขอ (instruction-following overlays) และสร้างระบบ flywheel ที่ใช้เช็คพอยต์ก่อนหน้าของ SWE-2 มาช่วยแก้ไขผลบวกและผลลบที่ผิดพลาดในตัวตรวจสอบ
"SWE-2 leads on Terminal-Bench 2.1 and beats its K3 base on every row."
Cognition
การพัฒนาโมเดลเขียนโค้ดในยุคปัจจุบันเริ่มให้ความสำคัญกับประสิทธิภาพต่อต้นทุน (Cost-to-Performance Frontier) มากกว่าการแข่งกันเพิ่มขนาดพารามิเตอร์เพียงอย่างเดียว การที่ Cognition ใช้แนวทาง RL แบบฝึกทุกระดับความพยายามพร้อมกันและการจัดการหน่วยความจำผ่านเคอร์เนล NVFP4/FP8 สะท้อนให้เห็นถึงความพยายามในการแก้ปัญหาคอขวดด้านรันไทม์และการแข่งขันในเชิงพาณิชย์สำหรับเครื่องมือพัฒนาซอฟต์แวร์อัตโนมัติ
ในด้านการทดสอบความน่าเชื่อถือ (trustworthiness study) Cognition ได้นำคำถามที่อ่อนไหวทางการเมืองเกี่ยวกับประเทศจีนจำนวน 145 ข้อมาทดสอบ ซึ่ง SWE-2 สามารถผ่านการทดสอบโดยรวมถึง 98.0% แบ่งเป็นภาษาอังกฤษ 99.8% ภาษาจีนตัวย่อ 95.2% และภาษาจีนตัวเต็ม 99.1% ขณะที่การทดสอบช่องโหว่ตามบริบทไม่พบความเปลี่ยนแปลงที่มีนัยสำคัญทางสถิติในทุกรูปแบบคำถาม
ที่มา: MarkTechPost
พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้
ความคิดเห็น
แสดงความคิดเห็น