ข้ามไปเนื้อหาหลัก

Cognition เปิดตัว SWE-2 โมเดลเขียนโค้ดต่อยอดจาก Kimi K3

Cognition ปล่อยโมเดลเขียนโค้ด SWE-2 ที่ต่อยอดจาก Kimi K3 ทำคะแนนเทียบเท่า Fable 5.1 บน FrontierCode ด้วยต้นทุนที่ถูกลงถึง 64%

เรียบเรียงโดย AI
Inewgen
13 Sep 2026ที่มา: MarkTechPost3 นาทีอ่าน (0 ครั้ง)
แชร์
Cognition เปิดตัว SWE-2 โมเดลเขียนโค้ดต่อยอดจาก Kimi K3

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

ขนาดตัวอักษร
  • Cognition เปิดตัว SWE-2 โมเดลเขียนโค้ดตัวใหม่ที่พัฒนาต่อจาก Kimi K3
  • ทำงานเฉพาะภายในแพลตฟอร์ม Devin เท่านั้น ไม่มี open weights และไม่มี standalone API
  • ทำคะแนนบน FrontierCode เทียบเท่า Fable 5.1 แต่ประหยัดต้นทุนกว่าถึง 64%
  • มาพร้อมระบบ focused exploration ช่วยลดการสำรวจเกินจำเป็นในงานที่ง่าย

บริษัท Cognition ประกาศเปิดตัว SWE-2 โมเดลปัญญาประดิษฐ์สำหรับการเขียนโค้ดรุ่นใหม่ล่าสุด ซึ่งผ่านกระบวนการ post-training ต่อมาจากโมเดลพื้นฐาน Kimi K3 โดยโมเดลตัวนี้สร้างขึ้นบนโครงสร้างพื้นฐานและสูตรการพัฒนาเดียวกับ SWE-1.7 ที่เคยพัฒนามาจาก Kimi K2.7 ทั้งนี้ Cognition ได้ทำการปรับสเกลการเรียนรู้แบบ reinforcement learning (RL) ไปสู่ระดับ multi-trillion-parameter โดยใช้โมเดลพื้นฐานที่มีจำนวนพารามิเตอร์มากกว่าเดิมเกือบ 3 เท่า พร้อมระบุว่า RL ของพวกเขายังคงค้นพบพื้นที่ให้พัฒนาต่อยอดบน K3 ได้อีก โดยเพิ่มคะแนนขึ้น 5 ถึง 6 คะแนนในหลายเบนช์มาร์ก

สำหรับการใช้งานจริง โมเดล SWE-2 ไม่สามารถนำไปรันบนโครงสร้างพื้นฐานของตนเองได้ เนื่องจากไม่มี open weights และไม่มี standalone API โดยจะใช้งานได้ผ่านระบบของ Devin เท่านั้น ทั้งบน Desktop, CLI รวมถึง Devin Web และ Fusion ที่กำลังทยอยปล่อยออกมา

software developer office desk computer coding workspace

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

การเปลี่ยนแปลงที่สำคัญที่สุดคืออัลกอริทึม RL ที่สามารถฝึกฝนระดับความพยายาม (effort levels) ทั้ง 3 ระดับได้ในการรันเพียงครั้งเดียว โดยแต่ละระดับจะมีต้นทุนบทลงโทษ (cost penalty) ของตัวเอง ทำให้ต้นทุนและประสิทธิภาพเคลื่อนที่ไปพร้อมกัน นอกจากนี้ SWE-2 ยังแก้ปัญหาการสำรวจเกินจำเป็น (over-explore) ในงานง่ายๆ ของรุ่นก่อนหน้า ด้วยเทคนิคที่เรียกว่า focused exploration บน FrontierCode 1.1 Main ทำให้รุ่น medium ทำคะแนนได้สูงกว่า SWE-1.7 แต่ใช้รอบการทำงานน้อยลง 58% และประหยัดต้นทุนลง 81% โดยค่ามัธยฐานของการแก้ไขจริงเกิดขึ้นในขั้นตอนที่ 18 เทียบกับ 48 ของ SWE-1.7

64%ต้นทุนที่ลดลงเมื่อเทียบกับ Fable 5.1
98.0%คะแนนทดสอบความน่าเชื่อถือประเด็นจีน

ทีมงาน Cognition ยังได้รายงานพฤติกรรมเด่น 3 ประการของโมเดล ได้แก่ ความครอบคลุมของการทดสอบแบบ end-to-end ที่ดีขึ้น ความสามารถในการแก้ไขปัญหาเมื่อเครื่องมือถูกบล็อก และวินัยในการตรวจสอบ โดยเมื่อถูกท้าทาย โมเดลจะทำการหาข้อสรุปใหม่อีกครั้งแทนที่จะยืนยันคำตอบเดิม นอกจากนี้ในด้านข้อมูล Cognition ได้เพิ่มสภาพแวดล้อม RL เป็น 3 เท่า เพิ่มชุดคำสั่งตามคำขอ (instruction-following overlays) และสร้างระบบ flywheel ที่ใช้เช็คพอยต์ก่อนหน้าของ SWE-2 มาช่วยแก้ไขผลบวกและผลลบที่ผิดพลาดในตัวตรวจสอบ

ไม่อยากพลาดข่าวใหม่?

สมัครรับสรุปข่าวสารใหม่ทางอีเมล ไม่บ่อยจนรำคาญ

โฆษณา

"SWE-2 leads on Terminal-Bench 2.1 and beats its K3 base on every row."

Cognition

การพัฒนาโมเดลเขียนโค้ดในยุคปัจจุบันเริ่มให้ความสำคัญกับประสิทธิภาพต่อต้นทุน (Cost-to-Performance Frontier) มากกว่าการแข่งกันเพิ่มขนาดพารามิเตอร์เพียงอย่างเดียว การที่ Cognition ใช้แนวทาง RL แบบฝึกทุกระดับความพยายามพร้อมกันและการจัดการหน่วยความจำผ่านเคอร์เนล NVFP4/FP8 สะท้อนให้เห็นถึงความพยายามในการแก้ปัญหาคอขวดด้านรันไทม์และการแข่งขันในเชิงพาณิชย์สำหรับเครื่องมือพัฒนาซอฟต์แวร์อัตโนมัติ

ในด้านการทดสอบความน่าเชื่อถือ (trustworthiness study) Cognition ได้นำคำถามที่อ่อนไหวทางการเมืองเกี่ยวกับประเทศจีนจำนวน 145 ข้อมาทดสอบ ซึ่ง SWE-2 สามารถผ่านการทดสอบโดยรวมถึง 98.0% แบ่งเป็นภาษาอังกฤษ 99.8% ภาษาจีนตัวย่อ 95.2% และภาษาจีนตัวเต็ม 99.1% ขณะที่การทดสอบช่องโหว่ตามบริบทไม่พบความเปลี่ยนแปลงที่มีนัยสำคัญทางสถิติในทุกรูปแบบคำถาม

ที่มา: MarkTechPost

ความคิดเห็น

แสดงความคิดเห็น
0/2000

พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้