Anthropic เปิดตัว Claude Fable 5.1 และ Claude Mythos 5.1
Anthropic เปิดตัว Claude Fable 5.1 และ Claude Mythos 5.1 ทำคะแนน Terminal-Bench-Science 52.6% พร้อมลดราคาแคชรีด 75%

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
- Claude Fable 5.1 เปิดให้ใช้งานทั่วไปแล้วบนหลากหลายแพลตฟอร์มคลาวด์
- Claude Mythos 5.1 จำกัดการใช้งานเฉพาะองค์กรในสหรัฐฯ ภายใต้ Project Glasswing
- Fable 5.1 ทำคะแนนบน Terminal-Bench-Science 0.1 สูงถึง 52.6%
- ราคาแคชรีดลดลง 75% เหลือ 0.25 ดอลลาร์ต่อล้านโทเค็น
Anthropic ได้ประกาศเปิดตัวโมเดลปัญญาประดิษฐ์รุ่นใหม่ล่าสุด ได้แก่ Claude Fable 5.1 และ Claude Mythos 5.1 โดยในส่วนของ Claude Fable 5.1 นั้นเปิดให้ใช้งานทั่วไปในชื่อ claude-fable-5-1 ผ่านทาง Claude API, Amazon Bedrock, Claude Platform บน AWS, Google Cloud และ Microsoft Foundry สำหรับ Claude Mythos 5.1 จะจำกัดการใช้งานเฉพาะองค์กรที่ผ่านการตรวจสอบในสหรัฐอเมริกาภายใต้โครงการ Project Glasswing เท่านั้น
ด้านผลการทดสอบประสิทธิภาพบน Terminal-Bench-Science 0.1 ซึ่งเป็นเกณฑ์มาตรฐานการวิจัยวิทยาศาสตร์เชิงเอเจนต์ (agentic scientific research benchmark) พบว่า Fable 5.1 ทำคะแนนได้ 52.6% เหนือกว่า Opus 5 ที่ทำได้ 29.0%, Fable 5 ที่ได้ 24.7% และ GPT-5.6 Sol ที่ได้ 22.4% ทั้งนี้ Anthropic ระบุว่ามีความคลาดเคลื่อนมาตรฐาน (standard error) อยู่ที่ 3.5 ถึง 4.5 จุดต่อโมเดล จึงควรพิจารณาอันดับด้วยความระมัดระวัง

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
ส่วนบน Terminal-Bench 4.0 โมเดล Fable 5.1 ทำคะแนนได้ 55.8% และ Mythos 5.1 ทำคะแนนได้ 60.9% โดยช่องว่างคะแนนระหว่างโมเดลที่เหมือนกันสองตัวสะท้อนถึงต้นทุนของการแทรกแซงด้านความปลอดภัย นอกจากนี้ยังมีผลการทดสอบอื่น ๆ เช่น CursorBench 3.2.0 อยู่ที่ 73.4%, Humanity’s Last Exam ที่ 60.9% (ไม่ใช้เครื่องมือ) และ 65.0% (ใช้เครื่องมือ), AutomationBench ที่ 31.4%, OSWorld 2.0 แบบเข้มงวดที่ 41.7% และ GDPval-AA v2 ที่ 1853
ในด้านโครงสร้างราคา ราคาอินพุตและเอาต์พุตพื้นฐานยังคงเดิม แต่ราคาแคชรีด (Cache reads) ลดลงถึง 75% จาก 1.00 ดอลลาร์ เหลือ 0.25 ดอลลาร์ต่อล้านโทเค็น ซึ่งคิดเป็น 0.025 เท่าของอินพุตพื้นฐานเทียบกับ 0.1 ในรุ่นอื่น ๆ ของ Claude Anthropic ประเมินว่าต้นทุนโดยรวมจะลดลงประมาณ 25% สำหรับเวิร์กโหลดทั่วไป และสูงถึง 45% สำหรับงานเอเจนต์ที่เน้นบริบทหนัก ๆ ส่วนการประมวลผลแบบแบตช์ (Batch processing) อยู่ที่ 5 และ 25 ดอลลาร์ต่อล้านโทเค็น
การปรับลดราคาแคชรีดลงอย่างมากถึง 75% ของ Anthropic ในครั้งนี้ สะท้อนให้เห็นถึงความพยายามในการลดอุปสรรคด้านต้นทุนสำหรับนักพัฒนาที่ต้องประมวลผลบริบทขนาดใหญ่ซ้ำ ๆ ซึ่งมีความสำคัญอย่างยิ่งต่อการรันเอเจนต์ AI ที่ต้องใช้ข้อมูลป้อนกลับยาว ๆ ในกระบวนการทำงานอัตโนมัติ
สำหรับการเปลี่ยนแปลงเพิ่มเติม ระบบได้เพิ่มฟีเจอร์พยายามต่อข้อความ (per-message effort), ข้อความระบบจำกัดรอบ (turn-scoped system messages) และ thinking.display: "updates" ให้อยู่ในสถานะเบื้องหลังเฮดเดอร์ นอกจากนี้ยังมีมาตรการกำกับดูแลแหล่งที่มาของเนื้อหา (Content provenance) ที่ไม่เป็นตัวเลือกเสริม โดยมีการใส่ลายน้ำข้อความเชิงสถิติในเอาต์พุตทั้งหมดและข้อมูลรับรอง C2PA บนไฟล์
ด้านการวิจัย Mythos 5.1 สามารถออกแบบตัวยึดโปรตีน (protein binders) ด้วยอัตราความสำเร็จประมาณ 50% จาก 12 เป้าหมาย เทียบกับค่าปกติที่ 10 ถึง 15%, Fable 5.1 สร้างแผนที่ความสูงของดาวศุกร์ที่ความละเอียด 2 ถึง 3 กิโลเมตร และเคอร์เนล GPU แบบกำหนดเองช่วยเร่งความเร็วโมเดลจีโนมิกส์โอเพนซอร์ก 7 โมเดลได้สูงสุดถึง 2.5 เท่า
ที่มา: MarkTechPost
พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้
ความคิดเห็น
แสดงความคิดเห็น