ข้ามไปเนื้อหาหลัก

Liquid AI เปิดตัว LFM2.5-VL-3B โมเดลวิสัยทัศน์และภาษาขนาด 3 พันล้านพารามิเตอร์ ทำงานบนอุปกรณ์ได้

โมเดลปัญญาประดิษฐ์ขนาด 3B ตัวใหม่จาก Liquid AI รองรับการอ่านหน้าจอและเรียกใช้งานเครื่องมือบนอุปกรณ์พกพา พร้อมความสามารถประมวลผลหลากหลายภาษา

เรียบเรียงโดย AI
Inewgen
14 Aug 2026ที่มา: MarkTechPost4 นาทีอ่าน (0 ครั้ง)อัปเดตล่าสุด 29 Aug 2026
แชร์
Liquid AI เปิดตัว LFM2.5-VL-3B โมเดลวิสัยทัศน์และภาษาขนาด 3 พันล้านพารามิเตอร์ ทำงานบนอุปกรณ์ได้

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

ขนาดตัวอักษร
  • Liquid AI เปิดตัวโมเดล LFM2.5-VL-3B ขนาด 3 พันล้านพารามิเตอร์
  • ใช้แบ็คโบนภาษา LFM2.5-2.6B และตัวเข้ารหัสภาพ SigLIP2 NaFlex 400M
  • รองรับความยาวบริบท 32,768 โทเค็น และรองรับการใช้งานถึง 16 ภาษา
  • ทำคะแนนเฉลี่ย 69.4 บน 28 เบนช์มาร์กด้านวิสัยทัศน์ เทียบเท่าโมเดลขนาดใหญ่กว่า

Liquid AI ได้ประกาศเปิดตัวโมเดลปัญญาประดิษฐ์ตัวใหม่ล่าสุดในชื่อ LFM2.5-VL-3B ซึ่งเป็นโมเดลวิสัยทัศน์และภาษา (Vision-Language Model) ขนาด 3 พันล้านพารามิเตอร์ ออกแบบมาให้มีความสามารถในการอ่านหน้าจอ ระบุตำแหน่งวัตถุ และเรียกใช้งานเครื่องมือต่างๆ ได้โดยตรงบนอุปกรณ์ (On-Device) โดยโมเดลชุดนี้ถูกปล่อยออกมาใน 4 รูปแบบหลัก ได้แก่ native, GGUF, ONNX และ MLX พร้อมด้วยรันไทม์ในวันแรกอย่าง llama.cpp, MLX, vLLM, SGLang และ ONNX ซึ่งใช้หน่วยความจำในการทำงานประมาณ 3 GB เท่านั้น

โครงสร้างภายในของ LFM2.5-VL-3B เป็นการต่อยอดมาจากรุ่น LFM2-VL-3B โดยแบ่งออกเป็นแกนหลักทางภาษาคือ LFM2.5-2.6B และส่วนวิสัยทัศน์ที่ใช้ตัวเข้ารหัส SigLIP2 NaFlex แบบปรับแต่งรูปทรงขนาด 400 ล้านพารามิเตอร์ เทคโนโลยี NaFlex นี้ช่วยให้โมเดลสามารถจัดการกับความละเอียดภาพแบบดั้งเดิมได้โดยการแบ่งภาพขนาดใหญ่ออกเป็นแพตช์ขนาด 512x512 พิกเซลที่ไม่ซ้อนทับกัน พร้อมกับภาพขนาดย่อของภาพเต็มที่ปรับขนาดใหม่ นอกจากนี้ โมเดลยังรองรับความยาวบริบทถึง 32,768 โทเค็น และครอบคลุมการใช้งานถึง 16 ภาษาทั่วโลก

smartphone screen artificial intelligence interface code

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

ในกระบวนการฝึกอบรมล่วงหน้า (Pre-training) ทางทีมพัฒนาได้ใช้โทเค็นประมาณ 34 ล้านล้านโทเค็น พร้อมทั้งขยายขนาดคลังคำศัพท์ (Vocabulary) ขึ้นเป็นสองเท่าสู่ระดับ 128,000 โทเค็น ด้วยการขยายโทแกไนเซอร์เดิมที่มีอยู่ ซึ่งช่วยยกระดับความครอบคลุมของชุดตัวอักษรที่ไม่ใช่ภาษาลาติน นอกจากนี้ ในส่วนของการฝึกวิสัยทัศน์ล่วงหน้ายังมีการเพิ่มสเกลโทเค็นขึ้นถึง 4 เท่าผ่านข้อมูลคำอธิบายภาพที่คัดสรรและสังเคราะห์ขึ้น รวมถึงข้อมูล OCR การระบุตำแหน่งวัตถุ และข้อมูลการปฏิบัติตามคำสั่ง ส่วนขั้นตอนการฝึกอบรมภายหลัง (Post-training) ใช้กระบวนการ SFT พร้อมกับการกลั่นความรู้ (Knowledge Distillation) จากโมเดลครูที่มีขนาดใหญ่กว่า และการฝึกแบบ Antidoom ตามด้วยการเรียนรู้เสริมแรงด้วยรางวัลหลายตัว (Multi-reward reinforcement learning)

ไม่อยากพลาดข่าวใหม่?

สมัครรับสรุปข่าวสารใหม่ทางอีเมล ไม่บ่อยจนรำคาญ

โฆษณา

69.4คะแนนเฉลี่ยบน 28 เบนช์มาร์กวิสัยทัศน์
32Kรองรับความยาวบริบทโทเค็น
3GBหน่วยความจำที่ใช้งานโดยประมาณ

การออกแบบของโมเดลนี้เน้นไปที่การไม่ใช้กระบวนการคิดวิเคราะห์เชิงลึก (Non-reasoning) โดยโมเดลจะให้คำตอบโดยตรง ซึ่งเป็นทางเลือกในการออกแบบที่ช่วยควบคุมโปรไฟล์ความหน่วง (Latency) ของระบบ เมื่อทำการประเมินบน 28 เบนช์มาร์กด้านวิสัยทัศน์โดยใช้ vLLM 0.26.0 ในโหมด Non-reasoning พบว่า LFM2.5-VL-3B ทำคะแนนเฉลี่ยได้ที่ 69.4 ซึ่งทำคะแนนได้เท่ากับโมเดล InternVL-3.5-4B และตามหลัง Qwen3.5-4B เพียง 0.7 คะแนนเท่านั้น แม้ว่าทั้งสองโมเดลเปรียบเทียบจะมีขนาดพารามิเตอร์สูงถึง 4.7 พันล้านพารามิเตอร์ก็ตาม

การเปิดตัว LFM2.5-VL-3B สะท้อนให้เห็นถึงแนวโน้มการพัฒนาปัญญาประดิษฐ์ขนาดเล็กที่ทรงพลัง ซึ่งสามารถรันได้โดยตรงบนอุปกรณ์พกพาหรือฮาร์ดแวร์ที่มีข้อจำกัดด้านทรัพยากร (Edge AI) การที่โมเดลสามารถทำงานทั้งการมองเห็นและการประมวลผลภาษาโดยใช้หน่วยความจำเพียงราว 3 GB ถือเป็นก้าวสำคัญที่จะช่วยให้นักพัฒนาสามารถนำ AI ไปฝังไว้ในแอปพลิเคชันฝั่งไคลเอนต์ได้อย่างมีประสิทธิภาพ โดยไม่ต้องพึ่งพิงการประมวลผลบนคลาวด์ตลอดเวลา ซึ่งช่วยลดต้นทุนด้านเซิร์ฟเวอร์และเพิ่มความเป็นส่วนตัวของผู้ใช้งาน

ในด้านผลลัพธ์รายรายการที่โดดเด่น โมเดลทำคะแนนบน RealWorldQA ได้ 73.1 (เหนือกว่า InternVL-3.5-4B ที่ทำได้ 67.7) และ TextVQA ทำได้ 84.3 (เทียบกับ Qwen3.5-4B ที่ทำได้ 81.2) รวมถึงคะแนนจาก MMStar ที่ 63.3, MathVista-mini ที่ 68.5, ChartQA ที่ 81.3, DocVQA ที่ 91.1 และ OCRBench v1 ที่ 84.2 อย่างไรก็ตาม คะแนนในส่วนของ CountBenchQA ลดลงเหลือ 87.3 จากเดิม 87.3 ในรุ่นก่อนหน้า ส่วนการประเมินเฉพาะข้อความ (Text-only) บน IFEval ทำคะแนนได้ 82.3 เพิ่มขึ้นจากเดิมที่เคยทำได้ 72.9 โดยมี Gemma-4-E4B ครองตำแหน่งผู้นำในด้านนี้ที่ 87.9 คะแนน

ที่มา: MarkTechPost

ความคิดเห็น

แสดงความคิดเห็น
0/2000

พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้