Jina AI เปิดตัว jina-ocr-v1 โมเดลแปลงเอกสาร 3.4B MoE
Jina AI ปล่อย jina-ocr-v1 โมเดล MoE ขนาด 3.4 พันล้านพารามิเตอร์ พร้อมระบบ speculative decoding สำหรับ GPU งบประหยัด ให้ความเร็วสูง 2.57 หน้าต่อวินาที

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
- Jina AI เปิดตัว jina-ocr-v1 โมเดลแยกวิเคราะห์เอกสารขนาด 3.4B MoE สำหรับใช้งานวิจัยและไม่แสวงหาผลกำไร
- ชูจุดเด่นความเร็วในการประมวลผลสูงถึง 2.57 หน้าต่อวินาทีบน A100 40GB ที่ความขนาน 32
- ผสานเทคโนโลยี speculative decoding ผ่านหัว FastMTP ช่วยเพิ่มความเร็วไร้การสูญเสียความแม่นยำ
- รองรับการใช้งานผ่าน vLLM, Transformers และบริการ API แบบ OpenAI-compatible
วงการปัญญาประดิษฐ์และเครื่องมือจัดการเอกสารต้องตื่นตัวอีกครั้ง เมื่อ Jina AI ประกาศเปิดตัว jina-ocr-v1 โมเดลแปลงเอกสารประเภท Mixture of Experts (MoE) ขนาด 3.4 พันล้านพารามิเตอร์ โดยถูกออกแบบมาเพื่อให้สามารถรันบนกราฟิกการ์ด (GPU) ระดับล่างหรือมีงบประมาณจำกัดได้อย่างมีประสิทธิภาพ โดยในปัจจุบันโมเดลดังกล่าวเปิดให้ดาวน์โหลดน้ำหนักโมเดล (open weights) ขนาดราว 6.8 GB ในรูปแบบ BF16 สำหรับงานวิจัยและการใช้งานที่ไม่ใช่เชิงพาณิชย์ภายใต้สัญญาอนุญาต CC BY-NC 4.0
โครงสร้างเบื้องหลังของโมเดลนี้เป็นการต่อยอดจากการฝึกอบรมเพิ่มเติม (post-training) บนพื้นฐานของ DeepSeek-OCR พร้อมคงองค์ประกอบด้านความเร็วดั้งเดิมไว้ โดยส่วน DeepEncoder มีพารามิเตอร์ราว 380 ล้านพารามิเตอร์ ทำหน้าที่ผสานการทำงานของ SAM, ตัวบีบอัดแบบคอนโวลูชัน 16x และ CLIP-L เพื่อแปลงหน้าเอกสารขนาด 1024x1024 พิกเซล จาก 4,096 แพตช์ ให้กลายเป็น 256 โทเค็นภาพ พร้อมโหมดความละเอียดแบบไดนามิกที่เพิ่มไทต์ท้องถิ่นได้สูงสุด 9 ไทต์ ไทต์ละ 100 โทเค็น ทำให้จำกัดหน้ากระดาษไว้สูงสุดที่ 1,156 โทเค็นภาพ
ในส่วนของตัวถอดรหัส (Decoder) เลือกใช้ DeepSeek-3B-MoE ซึ่งประกอบด้วย 12 เลเยอร์, 64 routed experts และ 2 shared experts โดยมีการทำงานแบบ Top-6 routing ที่เปิดใช้งานพารามิเตอร์ประมาณ 570 ล้านพารามิเตอร์ต่อหนึ่งโทเค็น รองรับขีดจำกัดตำแหน่งสูงสุด 32,768 โทเค็น ให้ผลลัพธ์ออกมาในรูปแบบ Markdown สำหรับข้อความทั่วไป ตารางในรูปแบบ HTML และสูตรทางคณิตศาสตร์ในรูปแบบ LaTeX

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
ความโดดเด่นสำคัญคือการประยุกต์ใช้ Speculative Decoding ผ่านหัวอ่าน FastMTP ที่มีบล็อกร่างแบบทึบ 1 บล็อกทำงานแบบเรียกซ้ำ (recursive) สำหรับขั้นตอน K=3 เพื่อเร่งความเร็วในการสร้างข้อความโดยไม่ทำให้ความแม่นยำตกหล่น ซึ่งค่าเฉลี่ยในการคอมมิตโทเค็นอยู่ที่ 2.73 โทเค็นต่อขั้นตอน เมื่อทดสอบบน NVIDIA L4 ที่ขนาดแบตช์ 1 พบว่าการถอดรหัสแบบกระตือรือร้น (eager decoding) ช่วยเพิ่มความเร็วจาก 42.7 เป็น 83.1 โทเค็นต่อวินาที หรือคิดเป็นอัตราเร็วกว่าเดิม 1.95 เท่า
"Throughput is the main result. On 1 A100 40 GB at concurrency 32, jina-ocr-v1 parses 2.57 pages per second."
Jina AI
การที่ Jina AI มุ่งเน้นไปที่ความเร็วในการประมวลผล (Throughput) แทนที่จะแข่งกับโมเดลที่เน้นความแม่นยำสูงสุด ถือเป็นแนวทางที่ชาญฉลาดสำหรับกลุ่มผู้ใช้งานระดับองค์กรหรือนักพัฒนาที่มีทรัพยากรฮาร์ดแวร์จำกัด การนำเทคนิค Speculative Decoding มาผสานในงาน OCR ช่วยลดคอขวดของการประมวลผลเอกสารจำนวนมากๆ ได้อย่างมีนัยสำคัญ ทำให้การแปลงไฟล์ PDF หรือเอกสารสแกนหนาๆ กลายเป็นข้อมูล Markdown พร้อมใช้งานทำได้รวดเร็วขึ้นบนต้นทุนที่ต่ำลง
สำหรับการใช้งานจริง นักพัฒนาสามารถเรียกใช้งานผ่านบริการ Jina Reader เพียงส่ง URL ไปที่ r.jina.ai พร้อมส่วนหัวคำสั่ง หรือเชื่อมต่อผ่าน OpenAI-compatible endpoint ที่ api.jina.ai/v1/chat/completions รวมถึงสามารถดาวน์โหลดโค้ดและน้ำหนักโมเดลไปติดตั้งบนเซิร์ฟเวอร์ของตนเองผ่านไลบรารี Transformers หรือ vLLM ได้ทันที
ที่มา: MarkTechPost
พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้
ความคิดเห็น
แสดงความคิดเห็น