GPT-6 Astra เปิดตัว: ก้าวสู่ระบบคิดอัตโนมัติและระดับองค์กร
OpenAI เปิดตัว GPT-6 Astra โมเดล AI ระดับเรือธงรุ่นใหม่ พร้อมความสามารถ Test-Time Compute และ Computer Use ลดข้อผิดพลาดลง 74.7%

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
- OpenAI เปิดตัว GPT-6 Astra โมเดล AI เรือธงรุ่นใหม่ล่าสุด
- รองรับ Test-Time Compute และ Computer Use แบบเนทีฟ
- ทำคะแนน SWE-bench Verified สูงถึง 80.8%
- ลดข้อผิดพลาดในการทำงานของเอเจนต์ลง 74.7% เมื่อเทียบกับ Claude Fable 5.1
OpenAI ประกาศเปิดตัวอย่างเป็นทางการสำหรับ GPT-6 Astra ซึ่งก้าวขึ้นมาอยู่บนจุดสูงสุดของลำดับชั้นโมเดลทั้งหมดของบริษัท โมเดลนี้ถูกออกแบบมาเพื่อเปลี่ยนผ่านจากระบบพยากรณ์แบบคงที่ไปสู่ระบบ cognitiva เชิงอัตโนมัติ ที่มีการจัดสรรพลังประมวลผลแบบไดนามิกในระหว่างการอนุมาน (Test-Time Compute) พร้อมความสามารถในการโต้ตอบกับส่วนติดต่อผู้ใช้แบบมัลติมีเดีย (Computer Use) และการดำเนินการงานขององค์กรระยะยาวได้อย่างแม่นยำโดยไม่มีการเบี่ยงเบนจากความตั้งใจเดิม
การเปิดตัวครั้งนี้มุ่งเป้าไปที่การดำเนินงานที่สำคัญและมีความต้องการสูงในอุตสาหกรรมระดับโลก เช่น การตรวจสอบซอร์สโค้ดขององค์กร การสังเคราะห์กฎหมายและข้อบังคับในสัดส่วนใหญ่ การสร้างแบบจำลองความเสี่ยงเชิงปริมาณ และการควบคุมกองทัพย่อยของเอเจนต์ โดยโมเดลนี้ได้ผ่านการทดสอบล่วงหน้ากับลูกค้าองค์กรกลุ่มเป้าหมายในภาคการเงิน การบินอวกาศ และเทคโนโลยีขั้นสูงมาเป็นเวลาหลายเดือน
หัวใจสำคัญทางสถาปัตยกรรมของ GPT-6 Astra ประกอบด้วยนวัตกรรมที่ทำงานร่วมกันหลายประการ ดังนี้
- ระบบจัดสรรเวลาประมวลผลไดนามิก (Test-Time Compute) ที่ใช้ต้นไม้ค้นหาของมอนติคาร์โลแฝง (Latent MCTS) ร่วมกับโมเดลให้รางวัลกระบวนการภายใน
- ความสามารถ Computer Use ที่ประมวลผลภาพหน้าจอแบบเรียลไทม์ แม่นยำระดับพิกเซลเดี่ยวบนหน้าเว็บ หน้าต่างเทอร์มินัล Linux และแอปพลิเคชันเดสก์ท็อป
- กลไกการจัดแนวทางด้วยการเรียนรู้เสริมแรงและฟีดแบคตรวจสอบอย่างเป็นทางการ เพื่อป้องกันปัญหาเป้าหมายเบี่ยงเบน (goal drift)
"ในระหว่างการประเมินภายในและการตรวจสอบอิสระ โมเดลผลิตผลลัพธ์ที่ไม่พึงประสงค์และผลข้างเคียงน้อยกว่าคู่แข่งโดยตรงหลักอย่าง Claude Fable 5.1 ถึง 74.7%"
OpenAI
ในการประเมินบนชุดข้อมูลอิสระ GPT-6 Astra ทำผลงานได้อย่างโดดเด่น โดยในดัชนี Artificial Analysis ทำคะแนนไปได้ 64.6% เหนือกว่า Claude Fable 5.1 ที่ทำได้ 52.6% ส่วนในด้านวิศวกรรมซอฟต์แวร์ SWE-bench Verified ทำคะแนน 80.8% และในชุดทดสอบ Humanity's Last Exam (HLE) อยู่อันดับสองด้วยคะแนน 66.4% เป็นรองเพียง Claude Mythos 5.1 ที่ทำได้ 68.2% เท่านั้น
การเปลี่ยนผ่านไปสู่ระบบ Test-Time Compute และเอเจนต์ที่มีความสามารถ Computer Use อย่างเต็มรูปแบบ ถือเป็นหมุดหมายสำคัญที่แสดงว่าอุตสาหกรรม AI กำลังขยับจากการตอบคำถามทั่วไปไปสู่การปฏิบัติงานจริงในสภาพแวดล้อมซอฟต์แวร์ที่ซับซ้อน การจัดการความปลอดภัยผ่านการตรวจสอบอย่างเป็นทางการจึงเป็นกุญแจสำคัญที่จะช่วยให้องค์กรธุรกิจกล้าใช้งานระบบอัตโนมัติเหล่านี้ในระดับปฏิบัติการจริง

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
ที่มา: Dev.to
พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้
ความคิดเห็น
แสดงความคิดเห็น