Keenable AI เปิดตัว NEEDLE: Benchmark ค้นหาข้อมูลแบบเรียลไทม์
Keenable AI เปิดซอร์สโค้ด NEEDLE เครื่องมือทดสอบระบบค้นหาข้อมูลสด สร้างชุดคำถามใหม่ทุกชั่วโมง ครอบคลุม 5 หมวดหมู่หลัก พร้อมเผยผลทดสอบประสิทธิภาพเอนจิ้นชั้นนำ

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
- Keenable AI เปิดซอร์สโค้ด NEEDLE ชุดทดสอบระบบค้นหาข้อมูลแบบเรียลไทม์ที่สร้างคำถามใหม่ทุกชั่วโมง
- ครอบคลุม 5 กลุ่มการใช้งานหลัก ได้แก่ ข่าว การเงิน วิชาการ คำหายาก และกฎหมาย เพื่อจำลองเจตนาเอเจนต์
- ใช้ระบบตัดสินคะแนนที่แตกต่างกันตามหมวดหมู่ ทั้ง LLM เป็นผู้ให้คะแนน การตรวจจับความถูกต้อง และการจับคู่ตัวระบุ
- ผลทดสอบชี้หมวดการเงินใกล้แก้ไขได้สำเร็จ แต่หมวดคำหายากยังเป็นความท้าทายสูงสุดของตลาดในปัจจุบัน
Keenable AI ได้ทำการเปิดซอร์สโค้ดให้กับ NEEDLE ซึ่งเป็นชุดประเมินผลการค้นหาข้อมูลแบบเรียลไทม์ (Live Search Benchmark) ที่มีความสามารถในการสร้างชุดคำถามใหม่ทุกๆ ชั่วโมง โดยออกแบบมาในรูปแบบของ Python CLI ที่ติดตั้งผ่านเครื่องมือ uv sync และทำงานผ่านสองคำสั่งย่อยคือ generate และ run ซึ่งรองรับการทำงานทั้งบนแล็ปท็อปและระบบ CI โดยระบบนี้จำเป็นต้องใช้คีย์จาก OpenRouter สำหรับการตัดสิน และคีย์ API สำหรับแต่ละเอนจิ้นที่ต้องการทดสอบ
ชื่อ NEEDLE ย่อมาจาก News, Everyday, Expert, Deep-tail และ Legal Evaluation ซึ่งแต่ละหมวดหมู่ถูกสร้างขึ้นเพื่อจำลองเจตนาที่แตกต่างกันของ AI agent ตัวอย่างเช่น หมวดข่าวจะดึงข้อมูลล่าสุดจากฟีด RSS ที่ผ่านการคัดสรรมาประมาณ 124 แหล่งและ Google Trends มาแปลงเป็นคำค้นหา หมวดการเงินดึงข้อเท็จจริงการจดทะเบียนจาก Wikidata และ GLEIF ร่วมกับงบการเงินไตรมาสเดียวจาก SEC XBRL หมวดวิชาการเปลี่ยนงานวิจัยหนึ่งชิ้นให้เป็นคำค้นหา 4 รูปแบบ และหมวดกฎหมายดึงความเห็นล่าสุดจาก CourtListener กว่า 14 ศาล

ภาพโดย Teemu Paananen / Unsplash
ในส่วนของการให้คะแนนจะแบ่งตามลักษณะของงาน หมวดข่าวและคำหายากไม่มีคำตอบที่ถูกต้องเพียงหนึ่งเดียว ดังนั้นจึงใช้ผู้ตัดสินที่เป็น LLM ให้คะแนนตั้งแต่ 0 ถึง 4 พร้อมรายงานค่า nDCG@5 หมวดการเงินวัดผลด้วย answer-recall@5 หมวดวิชาการและกฎหมายใช้การตรวจจับด้วยการจับคู่ตัวระบุ (identifier match) โดยทุกเอนจิ้นจะได้รับข้อความคำค้นหาเดียวกันและถูกทดสอบทีละรายการเพื่อให้เปรียบเทียบค่าความหน่วง (latency) ได้อย่างแม่นยำ
การวิเคราะห์ข้อมูลเชิงลึกจากรายงานระบุว่า ตัวเลขที่น่าสนใจที่สุดคือเพดานสูงสุด (ultimate ceiling) ซึ่งเกิดจากการรวบรวมผลลัพธ์ของทุกเอนจิ้นเข้าด้วยกันเป็นเอนจิ้นจำลอง เพื่อดูว่าภาพรวมตลาดสามารถดึงข้อมูลอะไรออกมาได้บ้าง ช่องว่างระหว่างผลลัพธ์ที่เอนจิ้นทำได้กับเพดานสูงสุดนี้ จึงเป็นขีดจำกัดบนของคุณภาพการค้นหาของเอเจนต์ในปัจจุบัน ซึ่งช่วยให้สามารถแยกแยะระหว่างปัญหาด้านการจัดอันดับและการดึงข้อมูลออกจากกันได้อย่างชัดเจน
การที่ NEEDLE สร้างชุดคำถามใหม่ทุกชั่วโมงถือเป็นก้าวสำคัญในการแก้ปัญหาการท่องเว็บของ AI (Benchmark contamination) ที่โมเดลปัญญาประดิษฐ์มักจะจดจำชุดข้อมูลทดสอบเดิมล่วงหน้า การประเมินผลด้วยข้อมูลสดแบบเรียลไทม์จึงช่วยสะท้อนประสิทธิภาพที่แท้จริงของ Search Engine เมื่อต้องเผชิญหน้ากับสถานการณ์ปัจจุบันที่เปลี่ยนแปลงตลอดเวลา
จากผลการทดสอบรอบ 7 วันสิ้นสุดวันที่ 28 สิงหาคม 2026 พบว่าหมวดการเงินใกล้จะเป็นเรื่องที่แก้ไขได้สำเร็จ โดย Exa ทำคะแนนได้ 0.910 ตามด้วย Keenable ที่ 0.872 และ Perplexity ที่ 0.871 เทียบกับเพดานสูงสุดที่ 0.965 ในขณะที่หมวดคำหายากมีความยากที่สุดและใกล้เคียงกับการใช้งานจริงของเอเจนต์ โดย Exa นำอยู่ที่ 0.557 และ Bing อยู่ที่ 0.199 ส่วนด้านความหน่วง Keenable-realtime ทำเวลาได้ดีที่สุดที่ 193 มิลลิวินาที (p50) เทียบกับ Exa ที่ 1,876 มิลลิวินาที
ที่มา: MarkTechPost
พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้
ความคิดเห็น
แสดงความคิดเห็น