DeepSeek ปล่อยรุ่น Flash แซงหน้าเรือธง ด้วยเทคนิคหลังฝึกฝน
DeepSeek เปิดตัว V4-Flash-0731 ที่ประสิทธิภาพแซงหน้า V4-Pro-Preview บนเกณฑ์มาตรฐานเอเจนต์ โดยไม่ได้เพิ่มพารามิเตอร์ แต่ใช้การปรับแต่งหลังการฝึกฝน

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
- DeepSeek ปล่อย V4-Flash-0731 โดยใช้สถาปัตยกรรม 284B พารามิเตอร์เท่าเดิม
- ประสิทธิภาพแซงหน้า V4-Pro-Preview บนเกณฑ์มาตรฐานเอเจนต์หลายรายการ
- ความสำเร็จมาจากการปรับปรุงหลังการฝึกฝน ไม่ใช่การขยายขนาดโมเดล
- ต้นทุนการอนุมานต่ำกว่ารุ่น Pro มากเนื่องจากใช้พารามิเตอร์ที่ทำงานน้อยกว่า
สัปดาห์ที่ผ่านมา DeepSeek ได้ปล่อยโมเดลใหม่ในชื่อ V4-Flash-0731 ซึ่งยังคงใช้สถาปัตยกรรม 284B พารามิเตอร์ทั้งหมด และ 13B พารามิเตอร์ที่ใช้งานต่อโทเค็นเท่ากับรุ่นพรีวิว โดยเปิดใช้งานแบบ MIT licensed และมี open weights บน HuggingFace โดยไม่มีการเปลี่ยนแปลงทางสถาปัตยกรรมหรือทำให้โมเดลใหญ่ขึ้นแต่อย่างใด
อย่างไรก็ตาม โมเดลรุ่นนี้กลับทำคะแนนแซงหน้า V4-Pro-Preview บนเกณฑ์มาตรฐานเอเจนต์หลายรายการ ซึ่งสะท้อนให้เห็นว่าจุดเด่นไม่ได้อยู่ที่ตัวโมเดล แต่เป็นวิธีปฏิบัติงาน โดยทีมงานระบุว่าโมเดลรุ่นนี้ได้รับการยกระดับความสามารถด้านเอเจนต์อย่างมหาศาล
"We've massively upgraded its Agent capabilities — benchmark scores are now far surpassing the V4-Pro-Preview."
DeepSeek

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
ผลลัพธ์ดังกล่าวชี้ให้เห็นว่าประสิทธิภาพที่เพิ่มขึ้นทั้งหมดมาจากการฝึกฝนเพิ่มเติมหลังจากกระบวนการหลัก โดยตัวโมเดลยังคงมีขนาด 284B พารามิเตอร์ทั้งหมดและทำงาน 13B พารามิเตอร์ต่อโทเค็น เมื่อเทียบกับรุ่น V4-Pro ที่มีพารามิเตอร์ทั้งหมด 1.6 ล้านล้านตัว และใช้งาน 49B พารามิเตอร์
สำหรับผู้ที่รันเอเจนต์ในสเกลใหญ่ ช่องว่างของพารามิเตอร์ที่ใช้งานมีความสำคัญอย่างมาก เนื่องจากต้นทุนการอนุมานจะปรับตามพารามิเตอร์ที่ทำงานจริง ไม่ใช่พารามิเตอร์ทั้งหมด ทำให้ Flash มีต้นทุนการทำงานประมาณหนึ่งในสี่ของรุ่น Pro แต่กลับทำผลงานได้ดีกว่าในงานประเภทเอเจนต์
การที่โมเดลขนาดเล็กสามารถเอาชนะรุ่นใหญ่ได้ผ่านการปรับแต่งหลังการฝึกฝน (Post-training) ถือเป็นหมุดหมายสำคัญที่ท้าทายความเชื่อเดิมในอุตสาหกรรม AI ที่ว่า "โมเดลใหญ่กว่าย่อมดีกว่า" ซึ่งดำเนินมาตลอดสามปีที่ผ่านมา หากผลการทดสอบนี้ได้รับการยืนยันอย่างเป็นทางการ จะช่วยลดต้นทุนและเพิ่มความเป็นไปได้ในการใช้งาน AI บนเซิร์ฟเวอร์องค์กร (On-premise) ได้อย่างกว้างขวาง
รายงานผลคะแนนเกณฑ์มาตรฐานระบุไว้ที่ 82.7 บน Terminal-Bench 2.1, 54.4 บน DeepSWE และ 70.3 บน Toolathlon-Verified แม้ว่าการทดสอบอิสระโดย Artificial Analysis จะวัดคะแนน Terminal-Bench ได้ที่ 79% และตัวเลขภายในบางส่วนยังต้องรอการตรวจสอบอิสระเพื่อความแม่นยำ
ที่มา: Dev.to
พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้
ความคิดเห็น
แสดงความคิดเห็น