DeepSeek-V4.1-Flash เปิดตัวแล้ว: บริบท 1M พร้อม FP4 KV Cache
DeepSeek AI เปิดตัวโมเดลรุ่นใหม่ DeepSeek-V4.1-Flash มาพร้อมความจุบริบท 1 ล้านโทเค็น ลดขนาดแคชด้วย FP4 และเปิดให้ใช้งานแบบ Open Weights

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
- DeepSeek-V4.1-Flash รองรับความยาวบริบทถึง 1 ล้านโทเค็น
- ใช้เทคโนโลยี FP4 KV Cache ช่วยลดขนาดหน่วยความจำเกือบครึ่งหนึ่ง
- โครงสร้างสถาปัตยกรรมแบ่งเป็นเอนโคเดอร์และดีโคเดอร์อย่างละ 20 เลเยอร์
- เปิดให้ใช้งานผ่านสิทธิ์ MIT License บน Hugging Face พร้อม API สาธารณะ
DeepSeek AI ได้ประกาศเปิดตัวโมเดลปัญญาประดิษฐ์รุ่นใหม่ล่าสุดในชื่อ DeepSeek-V4.1-Flash ซึ่งมาพร้อมจุดเด่นด้านการรองรับความยาวบริบท (Context Length) สูงสุดถึง 1 ล้านโทเค็น โดยมุ่งเน้นไปที่ประสิทธิภาพในการประมวลผลและการใช้งานจริงที่นักพัฒนาสามารถนำไปปรับใช้ได้ทันที
โมเดลดังกล่าวถูกปล่อยออกมาในรูปแบบ Open Weights ภายใต้สิทธิ์การใช้งานแบบ MIT License โดยมีช่องทางการใช้งานผ่านเครื่องมือยอดนิยมอย่าง vLLM, SGLang และ Transformers บนแพลตฟอร์ม Hugging Face รวมถึงการให้บริการผ่าน Public API ที่แบ่งระดับการใช้เหตุผลออกเป็นขั้นต่ำ ปานกลาง และสูงสุด
ในด้านสถาปัตยกรรมภายใน โมเดลนี้ใช้โครงสร้างแบ็คโบนแบบ 40 เลเยอร์ ซึ่งถูกแบ่งออกเป็น Causal Encoder จำนวน 20 เลเยอร์ และ Decoder อีก 20 เลเยอร์ โดยดีโคเดอร์จะดึงค่าน้ำหนักการฉายภาพมาจากฮิดเดนสเตทสุดท้ายของเอนโคเดอร์ แทนที่จะคำนวณ Global KV ของตัวเอง ช่วยลดภาระการคำนวณในช่วง Prefill ลงได้เกือบครึ่งหนึ่ง
นอกจากนี้ ทีมวิจัยยังได้พัฒนาเทคนิค Decoder SWA Bounded Replay สำหรับจัดการกับ Sliding-Window Attention (SWA) ขนาด 128 โทเค็น ทำให้ระบบสามารถสร้างสถานะ SWA ขึ้นใหม่โดยการเล่นซ้ำเฉพาะ 128 โทเค็นสุดท้ายเท่านั้น รวมถึงการใช้เทคโนโลยี FP4 KV Cache ที่ช่วยลดพื้นที่จัดเก็บข้อมูลลงเกือบ 50% เมื่อเทียบกับแคชแบบ FP8 ในรุ่นก่อนหน้า
การเปิดตัว DeepSeek-V4.1-Flash สะท้อนให้เห็นถึงความพยายามอย่างต่อเนื่องในการแก้ไขปัญหาคอขวดด้านหน่วยความจำ (Memory Bottleneck) ของโมเดลภาษาขนาดใหญ่ การเลือกใช้เทคนิคการบีบอัดแคชระดับ FP4 ร่วมกับการจัดการสถาปัตยกรรมแบบแยกส่วนระหว่างเอนโคเดอร์และดีโคเดอร์ ช่วยให้การประมวลผลข้อมูลที่มีความยาวมากๆ มีความคุ้มค่าด้านทรัพยากรฮาร์ดแวร์มากขึ้น ซึ่งเป็นก้าวสำคัญที่จะช่วยลดต้นทุนการรันโมเดล AI ในระดับองค์กร
สำหรับการฝึกอบรมล่วงหน้า (Pre-training) โมเดลนี้ใช้โทเค็นมัลติโมเดลจำนวนถึง 45 ล้านล้านโทเค็น ด้วยอัตราส่วนข้อความต่อมัลติโมเดล 7:1 และผ่านการฝึกฝนแบบสแปร์สแอตเทนชันเริ่มต้นที่ความยาว 64K ก่อนจะขยายไปสู่ 1 ล้านโทเค็นในภายหลัง โดยโมเดลฐานมีประสิทธิภาพเทียบเท่ากับ DeepSeek-V4-Pro-Base แต่ใช้พารามิเตอร์รวมเพียง 1 ใน 3 และพารามิเตอร์ที่ใช้งานจริงเพียง 1 ใน 4 เท่านั้น
ที่มา: MarkTechPost
พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้
ความคิดเห็น
แสดงความคิดเห็น