ข้ามไปเนื้อหาหลัก

Qwen3.8 Flash ชนะ Max Prime ในการทดสอบ Forge app

Qwen3.8 รุ่น Flash ที่ประหยัดกว่าทำคะแนนเอาชนะ Qwen3.8 Max Prime บนแอป Atlassian Forge ด้วยต้นทุนที่ถูกกว่ามหาศาล

เรียบเรียงโดย AI
Inewgen
09 Oct 2026ที่มา: Dev.to3 นาทีอ่าน (0 ครั้ง)
แชร์
Qwen3.8 Flash ชนะ Max Prime ในการทดสอบ Forge app

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

ขนาดตัวอักษร
  • Qwen3.8 Flash ทำคะแนนได้ 0.7961 ชนะ Max Prime ที่ได้ 0.6953 บน Atlassian Forge 1.0
  • ต้นทุนการรันของ Flash อยู่ที่ 47 เซนต์ ขณะที่ Max Prime สูงถึง 16.46 ดอลลาร์
  • Max Prime พ่ายแพ้บน Gauntlet 7.2 ด้วยคะแนน 0.6846 ต่อ 0.8364 ของ Flash
  • ข้อผิดพลาดบรรทัดเดียวในไฟล์ manifest เกี่ยวกับดัชนีการจัดเก็บข้อมูลคือจุดเปลี่ยนสำคัญของคะแนน

ผลลัพธ์การทดสอบประสิทธิภาพตระกูลโมเดล Qwen3.8 บนกระดานล่าสุดสร้างความประหลาดใจเมื่อรุ่น Flash ซึ่งมีราคาถูกกว่ามาก สามารถทำคะแนนเหนือรุ่นเรือธงอย่าง Qwen3.8 Max Prime บนแพลตฟอร์มแอปพลิเคชัน Atlassian Forge 1.0 โดย Flash ทำคะแนนไปได้ 0.7961 ขณะที่ Max Prime ได้ 0.6953 ทว่าในการทดสอบบน Gauntlet 7.2 ซึ่งเป็นเว็บแอปพลิเคชันระบบชำระเงิน กลับเป็นฝ่าย Max Prime ที่ทำคะแนนได้ 0.8364 เหนือกว่า Flash ที่ทำได้ 0.6846 โดยมีต้นทุนการรันแตกต่างกันอย่างเห็นได้ชัดคือ 47 เซนต์สำหรับ Flash และ 16.46 ดอลลาร์สำหรับ Max Prime

โมเดล Qwen3.8 Max Prime วางจำหน่ายในฐานะรุ่นที่เร็วกว่าของ Qwen3.8 Max ซึ่งเป็นรุ่นเรือธงขนาด 2.4 ล้านล้านพารามิเตอร์ ส่วนรุ่น Flash มีโมเดลหลักขนาด 1.25 แสนล้านพารามิเตอร์และใช้ 6 พันล้านพารามิเตอร์ต่อโทเค็น ทั้งสองรันผ่านเอเจนต์ goose บนบิวด์เวอร์ชัน 3.0.100 สำหรับ Flash และ 3.0.107 สำหรับ Max Prime ภายใครงบประมาณการเรียกใช้งาน 150 ครั้ง โฮสต์ Alibaba ผ่าน OpenRouter และรันห่างกันหนึ่งวัน โดยในการสร้างแอป Forge ทั้งคู่ทำงานได้ใกล้เคียงกันมากจนกระทั่งติดเพดานข้อจำกัด

0.7961คะแนนของ Flash บน Forge
$16.46ต้นทุนรันของ Max Prime

เพดานข้อจำกัดดังกล่าวมาจากบรรทัดเดียวในไฟล์ manifest ของ Max Prime ซึ่งเป็นดัชนีการจัดเก็บข้อมูลที่มีแอตทริบิวต์ช่วง (range) สองรายการ ในขณะที่ Atlassian Forge อนุญาตให้มีได้เพียงหนึ่งรายการเท่านั้น เมื่อสอบถามทั้งสองรุ่นเกี่ยวกับกฎดังกล่าวในภายหลังด้วยงบประมาณ 100 ครั้ง เป็นเงินประมาณ 60 เซนต์ ทั้งคู่ส่วนใหญ่ตอบว่าช่วงหนึ่งรายการใช้หนึ่งแอตทริบิวต์ ก่อนจะตอบว่าหนึ่งรายการสำหรับพาร์ทิชันเช่นกัน ซึ่งคำตอบที่ถูกต้องตามเอกสารของ Atlassian คือหลายรายการ โดยเมื่อได้รับเฉพาะสัญญา ทั้งคู่เขียนแอตทริบิวต์การเรียงลำดับสองรายการใน 14 จาก 15 คำตอบ แต่เมื่อใส่ประโยคของ Atlassian เกี่ยวกับช่วงลงในพรอมต์ ทั้งคู่ปฏิบัติตามกฎหนึ่งแอตทริบิวต์ช่วงได้ 8 ครั้งจาก 8 ครั้ง

"Optimizes your index for the use of query conditions. This parameter can only have one attribute."

Atlassian's custom entities reference
software code laptop screen close up office desk

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

เหตุการณ์นี้นักพัฒนาและผู้ใช้งาน AI มักเรียกว่าอาการลืมกฎหรือข้อจำกัดเมื่อบริบทมีความซับซ้อน แม้โมเดลขนาดใหญ่จะมีพารามิเตอร์มหาศาล แต่การปฏิบัติตามกฎเฉพาะของแพลตฟอร์ม (Platform Linting) ยังคงเป็นจุดอ่อนที่ทำให้โมเดลตกม้าตายได้ง่ายหากไม่มีการกำหนดเงื่อนไขที่ชัดเจนในพรอมต์ตั้งแต่แรก ต้นทุนที่ต่างกันลิบลับระหว่างสองรุ่นยังสะท้อนถึงความคุ้มค่าในการเลือกใช้โมเดลขนาดเล็กสำหรับงานเฉพาะทางที่มีขอบเขตชัดเจน

สำหรับการทดสอบ Atlassian Forge 1.0 นั้นเป็นการสร้างแอป Jira ประเภทบันทึกความคืบหน้าสเปรนต์ (sprint scope-creep ledger) ที่ทำงานในแซนด์บ็อกซ์ไร้อินเทอร์เน็ต ประเมินผลโดยการรันแอปกับไซต์ Jira ที่ถูกจำลองขึ้นสามแห่ง ผลปรากฏว่าคะแนนแกนหลักของทั้งคู่ใกล้เคียงกันมากคือ 0.9537 สำหรับ Flash และ 0.9519 สำหรับ Max Prime โดยไม่มีข้อบกพร่องระดับวิกฤต แต่ความแตกต่างเกิดขึ้นจากระบบจำกัดเพดานคะแนน (capping) ของแต่ละแบนด์

ไม่อยากพลาดข่าวใหม่?

สมัครรับสรุปข่าวสารใหม่ทางอีเมล ไม่บ่อยจนรำคาญ

โฆษณา

ความล้มเหลวสูงสุดของ Flash อยู่ในแบนด์แพลตฟอร์มปัจจุบันซึ่งจำกัดเพดานไว้ที่ 0.799 จากปัญหาโหมดมืด (dark mode) ขณะที่ Max Prime พลาดในแบนด์ที่ต่ำกว่าคือแบรนด์สมุดบัญชีทำงานซึ่งจำกัดเพดานที่ 0.699 ก่อนที่ระบบจะคำนวณหักคะแนนตามส่วนที่ขาดหายไป ส่งผลให้คะแนนของ Max Prime ลดลงเหลือ 0.6953 หากไม่มีข้อผิดพลาดเรื่องดัชนีนี้ คะแนนที่แท้จริงของ Max Prime จะอยู่ที่ 0.9269 ซึ่งอยู่อันดับที่ 5 บนกระดาน Forge

ที่มา: Dev.to

ความคิดเห็น

แสดงความคิดเห็น
0/2000

พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้