ข้ามไปเนื้อหาหลัก

Cohere เปิดตัว Parse 5 โมเดลวิชันภาษา 2.3 พันล้านพารามิเตอร์

Cohere ปล่อย Parse 5 (parse-v5.0) โมเดลวิชันภาษาขนาด 2.3 พันล้านพารามิเตอร์ แปลงเอกสารองค์กรเป็น Markdown ในรอบเดียว ทำคะแนน ParseBench 79.2

เรียบเรียงโดย AI
Inewgen
28 Aug 2026ที่มา: MarkTechPost3 นาทีอ่าน (0 ครั้ง)
แชร์
Cohere เปิดตัว Parse 5 โมเดลวิชันภาษา 2.3 พันล้านพารามิเตอร์

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

ขนาดตัวอักษร
  • Parse 5 เป็นโมเดลวิชันภาษาขนาด 2.3 พันล้านพารามิเตอร์จาก Cohere
  • แปลงเอกสาร PDF, PPT และ JPEG เป็น Markdown ได้โดยตรงในรอบเดียว
  • ทำคะแนนเฉลี่ยบน ParseBench ได้ 79.2 แซงหน้าคู่แข่งหลายราย
  • เปิดให้บริการแล้วผ่าน Cohere Parse API, Microsoft Foundry และ AWS SageMaker

Cohere เปิดตัว Parse 5 (parse-v5.0) โมเดลวิชันภาษา (Vision Language Model) ขนาด 2.3 พันล้านพารามิเตอร์ ซึ่งพัฒนาขึ้นบนสถาปัตยกรรม North-Micro-Vision-Instruct ของ Cohere Labs โมเดลตัวนี้ถูกออกแบบมาเพื่อแปลงเอกสารขององค์กรให้กลายเป็นรูปแบบ Markdown โดยรองรับหน้าเอกสารในรูปแบบ PDF, PPT และ JPEG ที่เข้ารหัสเป็น base64-encoded data URIs พร้อมหน้าต่างบริบท (context window) ขนาด 8,192 โทเค็น และขนาดโมเดลประมาณ 4.6 กิกะไบต์

จุดเด่นสำคัญคือระบบไม่มีขั้นตอนการทำ OCR แยกต่างหากก่อนประมวลผล แต่โมเดลสามารถดึงข้อมูลข้อความ ลำดับการอ่าน ตาราง รายการ ฟอร์ม คู่คีย์-วาล์ว รูปภาพพร้อมคำอธิบาย รวมถึงตำแหน่งขอบเขตหน้าและองค์ประกอบภาพทั้งหมดได้ภายในรอบเดียว (one pass) ทั้งยังรองรับภาษาที่มีความเสถียรทั้งหมด 9 ภาษา ได้แก่ อาหรับ อังกฤษ ฝรั่งเศส เยอรมัน อิตาลี ญี่ปุ่น เกาหลี โปรตุเกส และสเปน พร้อมรองรับแบบ zero-shot สำหรับภาษาอื่น ๆ ด้วยความแม่นยำที่ลดหลั่นลงไป

chromebook notebook computer office desk workspace

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

ในภาคปฏิบัติ โมเดลมีโหมดการส่งออกข้อมูล 2 รูปแบบหลัก คือโหมดค่าเริ่มต้นที่จะคืนค่าเป็นสตริง Markdown ต่อหน้า และโหมด output_format="blocks" ที่จะคืนค่าเป็นบล็อกประเภทต่าง ๆ เช่น บล็อกตารางที่จะพกพาโค้ด HTML ขอบเขตพิกัด และคำอธิบายมาด้วย ซึ่งโหมดที่สองนี้เองที่ช่วยให้สามารถตรวจสอบย้อนกลับไปถึงระดับการอ้างอิงได้ (citation-level traceability)

ไม่อยากพลาดข่าวใหม่?

สมัครรับสรุปข่าวสารใหม่ทางอีเมล ไม่บ่อยจนรำคาญ

โฆษณา

79.2คะแนน ParseBench ของ Parse 5
2.3Bพารามิเตอร์ของโมเดล
1.50$ราคาต่อ 1,000 หน้าบน API

ในด้านผลงานการทดสอบ Cohere รายงานว่า Parse ทำคะแนนบน ParseBench ได้ 79.2 ซึ่งคำนวณเฉลี่ยจากด้านตาราง ความถูกต้องของเนื้อหา และการจัดรูปแบบเชิงความเซแมนติก โดยทำคะแนนนำหน้า Mistral OCR 4 ที่ได้ 74.5, Azure Document Intelligence ที่ 74.3 และ Databricks AI Parse ที่ 72.4 ทั้งนี้ ParseBench เป็นชุดทดสอบของ LlamaIndex ที่ประกอบด้วยหน้าเอกสารองค์กรที่ตรวจสอบโดยมนุษย์ประมาณ 2,078 หน้า โดย Cohere เลือกนำมาคำนวณเฉลี่ยเพียง 3 ด้าน และตัดด้านแผนภูมิกับกราฟฟิกออกไปเนื่องจากเป็นจุดที่เครื่องมือส่วนใหญ่ทำคะแนนได้น้อย

การที่โมเดลวิชันภาษาสามารถข้ามขั้นตอนการทำ OCR แบบเดิมแล้วอ่านโครงสร้างตารางพร้อมรูปภาพได้ในขั้นตอนเดียว ถือเป็นก้าวสำคัญในการลดความผิดพลาดของการแปลงไฟล์เอกสารองค์กรที่ซับซ้อน เช่น รายงานการเงินหรือสไลด์นำเสนอ อย่างไรก็ตาม ผู้ใช้งานควรพิจารณาขอบเขตการทดสอบเบนช์มาร์กที่ผู้ให้บริการเลือกนำมาแสดงผลเปรียบเทียบกับความเป็นจริงในการใช้งานเอกสารภายในของตนเองด้วย

สำหรับด้านราคาและการใช้งาน Parse เปิดให้บริการทั่วไปแล้วผ่าน Cohere Parse API, Microsoft Foundry, AWS SageMaker และ Model Vault แบบ single-tenant โดยไม่มีคิวรอและไม่ต้องใช้ใบอนุญาตวิจัย ราคาผ่าน API คิดอยู่ที่ 1.50 ดอลลาร์สหรัฐต่อ 1,000 หน้า ส่วนบน Model Vault สำหรับอินสแตนซ์ขนาด Medium มีราคา 4.00 ดอลลาร์ต่อชั่วโมง หรือ 2,500 ดอลลาร์ต่อเดือน และอินสแตนซ์ขนาด XL มีราคา 7.00 ดอลลาร์ต่อชั่วโมง หรือ 4,300 ดอลลาร์ต่อเดือน ซึ่งช่วยให้องค์กรสามารถเลือกความคุ้มค่าระหว่างการเรียกใช้แบบคิดตามปริมาณกับการเช่าใช้โครงสร้างพื้นฐานเฉพาะได้ตามปริมาณงานจริง

ที่มา: MarkTechPost

ความคิดเห็น

แสดงความคิดเห็น
0/2000

พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้