Datalab เปิดตัว OmniExtractBench แก้ปัญหาความลำเอียง
Datalab เปิดตัว OmniExtractBench มาตรฐานกลางสำหรับทดสอบการดึงข้อมูลจากเอกสาร แก้ปัญหาความลำเอียงและเกณฑ์การวัดผลที่ไม่โปร่งใส

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
- Datalab เปิดตัว OmniExtractBench มาตรฐานกลางสำหรับทดสอบการดึงข้อมูล
- แก้ปัญหาความลำเอียงและเกณฑ์การวัดผลที่ไม่โปร่งใสจากผู้ให้บริการ
- ใช้ระบบเปรียบเทียบเนื้อหาด้วย Hungarian algorithm แทนการเทียบตำแหน่ง
- ติดตั้งได้จาก PyPI (v0.1.7) และเปิดซอร์สโค้ดบน GitHub
ในขณะที่ผู้ให้บริการระบบดึงข้อมูลเอกสารต่างพากันเผยแพร่ตารางผู้นำ (Leaderboard) ของตนเอง ทาง Datalab ได้ชี้ให้เห็นว่าตารางเหล่านี้มีความยากลำบากในการเปรียบเทียบและตรวจสอบความถูกต้อง ทางบริษัทจึงได้พัฒนา OmniExtractBench ขึ้นมาเพื่อทำหน้าที่เป็นบรรทัดฐานกลางที่ทุกฝ่ายสามารถใช้งานร่วมกันได้ โดยระบบนี้ถูกสร้างขึ้นมาเพื่อให้ผู้ใช้งานสามารถตรวจสอบประสิทธิภาพได้อย่างเที่ยงตรง
การทำงานของเครื่องมือนี้เริ่มต้นจากเอกสาร PDF และโครงสร้าง JSON schema ที่กำหนดไว้ ระบบจะต้องแปลงข้อมูลออกมาเป็น JSON เพื่อนำไปเทียบเคียงค่าต่อค่ากับไฟล์ต้นแบบ (Gold file) ทางด้านตัวซอร์สโค้ดถูกจัดเก็บไว้บน GitHub ส่วนชุดข้อมูลทั้งหมดเปิดให้ใช้งานบน Hugging Face ภายใต้สัญญาอนุญาต CC BY 4.0 ในส่วนของการติดตั้ง ผู้ใช้งานสามารถดาวน์โหลดตัวประเมินผลผ่าน PyPI ได้ทันทีภายใต้ชื่อ omni-extract-bench เวอร์ชัน 0.1.7 โดยรองรับ Python 3.11 ขึ้นไปและใช้ไลบรารี SciPy เป็นหลักภายใต้สัญญาอนุญาต Apache 2.0

ภาพโดย Jaime Lopes / Unsplash
Datalab ได้ระบุถึงปัญหาหลัก 4 ประการที่มักพบในเกณฑ์มาตรฐานการดึงข้อมูลเดิม โดยประเภทเอกสารที่ใหญ่ที่สุดคือแบบฟอร์มการยื่นกฎระเบียบที่มีจำนวน 88 ฉบับ นอกจากนี้ยังมีเอกสารความยาวหน้าเดียว 128 ฉบับ ในทางกลับกัน เอกสารที่มีความยาวมากกว่า 100 หน้า ซึ่งมีอยู่จำนวน 33 ฉบับ กลับกินพื้นที่สัดส่วนถึง 40% ของจำนวนหน้าทั้งหมด ขณะที่ชุดข้อมูลสังเคราะห์ของ Datalab เองถือว่ามีสัดส่วนใหญ่เป็นอันดับที่สอง
ปัญหาที่ยากที่สุดในการประมวลผลคือเรื่องของตาราง หากใช้การเปรียบเทียบตามตำแหน่ง (Positional comparison) การที่แถวแรกหายไปจะส่งผลให้แถวที่เหลือทั้งหมดเลื่อนตำแหน่งและทำให้คะแนนตกลงเหลือ 0% ทันที แต่ OmniExtractBench แก้ไขปัญหนี้ด้วยระบบจับคู่เนื้อหาโดยอาศัย Hungarian algorithm ซึ่งแม้จะเคยมีเครื่องมืออย่าง ExtractBench และ LongArray-Extract ใช้งานมาก่อนหน้านี้แล้ว แต่ OmniExtractBench ได้เพิ่มชั้นการตัดสิน (Verdict layer) เข้าไปเสริมความแม่นยำยิ่งขึ้น
การใช้เกณฑ์มาตรฐานกลางอย่าง OmniExtractBench ถือเป็นก้าวสำคัญสำหรับวงการเอกสารอัตโนมัติ เนื่องจากระบบดึงข้อมูลจากเอกสาร (Document Extraction) มักประสบปัญหาการวัดผลที่ผู้พัฒนาแต่ละรายมักกำหนดเงื่อนไขเข้าข้างผลิตภัณฑ์ตนเอง การมีเครื่องมือโอเพนซอร์สที่ใช้ขั้นตอนวิธีทางคณิตศาสตร์อย่าง Hungarian algorithm มาช่วยจับคู่ข้อมูลระดับเนื้อหา จึงช่วยลดความผิดพลาดจากการเลื่อนตำแหน่งของตาราง และสร้างความโปร่งใสที่นักพัฒนาสามารถนำไปตรวจสอบซ้ำได้จริง
สำหรับการทดสอบบนชุดข้อมูลทั้งหมด Datalab ได้ทำการทดสอบการกำหนดค่าระบบ 10 รูปแบบ ผลปรากฏว่าโหมด accurate ของ Datalab ทำคะแนนนำมาเป็นอันดับหนึ่งที่ความแม่นยำ 93.85% ตามมาด้วยโหมด balanced ที่ 93.48% และ Reducto deep_extract v2 ที่ 93.47% ซึ่งทำคะแนนได้ใกล้เคียงกันมาก โดยตัวชี้วัดด้าน Precision และ Recall จะช่วยเผยให้เห็นว่าระบบแต่ละตัวมีความบกพร่องในจุดใดบ้าง
ที่มา: MarkTechPost
พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้
ความคิดเห็น
แสดงความคิดเห็น