Liquid AI เปิดตัว LFM2.5-VL-3B-DSpark เร่งความเร็วโมเดล
Liquid AI ปล่อย LFM2.5-VL-3B-DSpark ใช้ Speculative Decoding เร่งความเร็วโมเดลวิชัน-ภาษาได้สูงสุด 3.13 เท่า พร้อมใช้งานบน Hugging Face

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
- Liquid AI เปิดตัว LFM2.5-VL-3B-DSpark สำหรับโมเดลวิชัน-ภาษา
- ใช้เทคนิค Speculative Decoding เร่งความเร็วถอดรหัสได้สูงสุด 3.13 เท่า
- โมเดลและน้ำหนักใช้งานได้แล้วบน Hugging Face ในรูปแบบ Safetensors และ GGUF
- ใช้งานได้บน SGLang, MLX-VLM และ llama.cpp ตั้งแต่วันแรก
Liquid AI ได้ประกาศเปิดตัวโมเดลรุ่นใหม่ล่าสุด LFM2.5-VL-3B-DSpark ซึ่งนำเทคนิค Speculative Decoding มาปรับใช้กับโมเดลวิชัน-ภาษา (Vision-Language Models) โดยสามารถทำความเร็วในการถอดรหัส (Decoding) ได้สูงถึง 3.13 เท่า โครงการนี้เปิดให้ใช้งานในฐานะรุ่นทดลอง (Experimental) ภายใต้ไลเซนส์ LFM Open License v1.0 ซึ่งอนุญาตให้บริษัทที่มีรายได้ประจำปีต่ำกว่า 10 ล้านดอลลาร์สหรัฐสามารถนำไปใช้ในเชิงพาณิชย์ได้ฟรี น้ำหนักโมเดลพร้อมใช้งานบน Hugging Face ในฟอร์แมต Safetensors และ GGUF พร้อมรองรับการทำงานบนเฟรมเวิร์กต่างๆ ตั้งแต่วันแรก
หลักการทำงานทั่วไปของโมเดลมาตรฐานคือการสร้างโทเค็นทีละหนึ่งตัวต่อการประมวลผลหนึ่งครั้ง แต่เทคนิค Speculative Decoding จะเพิ่มโมเดลร่างขนาดเล็ก (Drafter) ทำหน้าที่ทำนายโทเค็นล่วงหน้าหลายตัว จากนั้นโมเดลหลักตัวใหญ่จะตรวจสอบชุดโทเค็นทั้งหมดในคราวเดียวและเลือกเก็บเฉพาะโทเค็นที่ถูกต้องตามหลักการ สำหรับสถาปัตยกรรม DSpark นี้ถูกถอดแบบมาจากงานวิจัยข้อความของ Liquid AI โดยตัว drafter จะอ่านสถานะซ่อน (Hidden States) จากหลายเลเยอร์ของโมเดลหลักเพื่อพยากรณ์โทเค็นถัดไปจำนวน k ตัว

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
จุดเด่นสำคัญของการออกแบบคือความสามารถในการไม่จำกัดโมดัลิตี (Modality-agnostic) เนื่องจากเมื่อข้อมูลเดินทางมาถึงเลเยอร์ซ่อน ทั้งข้อความและแพตช์ภาพจะถูกแปลงเป็นเทนเซอร์เหมือนกันทั้งหมด ทางทีมงาน Liquid AI จึงสามารถนำอัลกอริทึมการอนุมานตัวเดียวกันมาใช้กับโมเดลวิชัน-ภาษาได้ทันที ตัว drafter ถูกออกแบบให้เป็นโมเดลที่เน้นแอตเทนชันแบบง่าย (Attention-only) จากการทดสอบความบกพร่อง (Ablations) พบว่าการเลือกใช้ 4 เลเยอร์และขนาดบล็อก (Block Size) เท่ากับ 9 ให้ผลลัพธ์ที่ดี โดย Liquid AI แนะนำให้ใช้ขนาดบล็อก 8 หรือ 9 ตามสภาพฮาร์ดแวร์ ขณะที่การรันบนชิป Apple Silicon จะใช้ขนาดบล็อก 8
การฝึกอบรมโมเดลนี้ใช้ข้อมูลการปรับแต่งแบบมีผู้สอน (Supervised Fine-Tuning) ครอบคลุมงานวิชัน-ภาษาทั่วไปเป็นเวลา 10 epochs โดยกระบวนการทดสอบและฝึกฝนทั้งหมดรันบนฮาร์ดแวร์ของ AMD โดยเฉพาะ ในส่วนของการประเมินผลอ้างอิงจากชุดทดสอบ MMSpec ครอบคลุม 6 ประเภทงาน ได้แก่ General VQA, Text VQA, Image Captioning, Chart VQA, Complex Reasoning และ Multi-turn Conversation ซึ่งรันด้วยแบตช์ไซส์ 1, อุณหภูมิ (Temperature) เท่ากับ 0 และใช้น้ำหนัก 16 บิต
บริบทเพิ่มเติม: เทคนิค Speculative Decoding ช่วยแก้ปัญหาคอขวดของการประมวลผลโมเดลภาษาขนาดใหญ่ (LLM) และ Vision-Language Models โดยอาศัยโมเดลขนาดเล็กช่วยเดาคำตอบล่วงหน้าก่อนให้โมเดลใหญ่ตรวจสอบทีเดียว ซึ่งช่วยประหยัดเวลาการประมวลผลทีละโทเค็นได้อย่างมีนัยสำคัญ แต่ขั้นตอนการประมวลผลภาพเริ่มต้น (Image Encoding และ Prefill) ยังคงใช้เวลาเท่าเดิมตามกฎของอัมดาล (Amdahl's Law)
ผลลัพธ์ตัวเลขความเร็วสูงสุดและภาพรวมทั้งหมดมาจากงานที่แตกต่างกัน ตัวอย่างเช่น บนชิประบบ M5 Max ความเร็วถอดรหัส 3.13x มาจากงาน COCO captioning ในขณะที่ความเร็วแบบ end-to-end ที่ 2.62x มาจากงาน MMMU-Pro สำหรับการใช้งานบนฮาร์ดแวร์ระดับสูงอย่างชิป H100 เดี่ยวใน SGLang ตัว DSpark ยังคงรักษาความได้เปรียบด้าน Throughput ไว้ได้ในทุกระดับความหนาแน่นของการประมวลผล (Concurrency)
ผู้ที่สนใจสามารถเรียกใช้งานได้ผ่านเครื่องมือต่างๆ โดย SGLang ต้องใช้เวอร์ชัน v0.5.19 หรือใหม่กว่า คำสั่งเรียกใช้คือ LiquidAI/LFM2.5-VL-3B ร่วมกับพารามิเตอร์ --speculative-algorithm DSPARK ส่วนบน Apple Silicon สามารถใช้ MLX-VLM v0.7.2 ขึ้นไปผ่านพารามิเตอร์ --draft-model และสำหรับ llama.cpp ให้จับคู่ GGUF drafter กับเป้าหมาย LFM2.5-VL-3B-GGUF ทั้งนี้ การเร่งความเร็วสำหรับโมเดลที่ผ่านการ Quantize ยังไม่อยู่ในขอบเขตการ releases รอบนี้
ที่มา: MarkTechPost
พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้
ความคิดเห็น
แสดงความคิดเห็น