ข้ามไปเนื้อหาหลัก

DeepSeek-V4.1-Flash เปิดตัวแล้ว: บริบท 1M พร้อม FP4 KV Cache

DeepSeek AI เปิดตัวโมเดลรุ่นใหม่ DeepSeek-V4.1-Flash มาพร้อมความจุบริบท 1 ล้านโทเค็น ลดขนาดแคชด้วย FP4 และเปิดให้ใช้งานแบบ Open Weights

เรียบเรียงโดย AI
Inewgen
10 Sep 2026ที่มา: MarkTechPost2 นาทีอ่าน (0 ครั้ง)
แชร์
DeepSeek-V4.1-Flash เปิดตัวแล้ว: บริบท 1M พร้อม FP4 KV Cache

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

ขนาดตัวอักษร
  • DeepSeek-V4.1-Flash รองรับความยาวบริบทถึง 1 ล้านโทเค็น
  • ใช้เทคโนโลยี FP4 KV Cache ช่วยลดขนาดหน่วยความจำเกือบครึ่งหนึ่ง
  • โครงสร้างสถาปัตยกรรมแบ่งเป็นเอนโคเดอร์และดีโคเดอร์อย่างละ 20 เลเยอร์
  • เปิดให้ใช้งานผ่านสิทธิ์ MIT License บน Hugging Face พร้อม API สาธารณะ

DeepSeek AI ได้ประกาศเปิดตัวโมเดลปัญญาประดิษฐ์รุ่นใหม่ล่าสุดในชื่อ DeepSeek-V4.1-Flash ซึ่งมาพร้อมจุดเด่นด้านการรองรับความยาวบริบท (Context Length) สูงสุดถึง 1 ล้านโทเค็น โดยมุ่งเน้นไปที่ประสิทธิภาพในการประมวลผลและการใช้งานจริงที่นักพัฒนาสามารถนำไปปรับใช้ได้ทันที

โมเดลดังกล่าวถูกปล่อยออกมาในรูปแบบ Open Weights ภายใต้สิทธิ์การใช้งานแบบ MIT License โดยมีช่องทางการใช้งานผ่านเครื่องมือยอดนิยมอย่าง vLLM, SGLang และ Transformers บนแพลตฟอร์ม Hugging Face รวมถึงการให้บริการผ่าน Public API ที่แบ่งระดับการใช้เหตุผลออกเป็นขั้นต่ำ ปานกลาง และสูงสุด

1Mรองรับความยาวบริบทโทเค็น
45Tโทเค็นมัลติโมเดลในการฝึกอบรม

ในด้านสถาปัตยกรรมภายใน โมเดลนี้ใช้โครงสร้างแบ็คโบนแบบ 40 เลเยอร์ ซึ่งถูกแบ่งออกเป็น Causal Encoder จำนวน 20 เลเยอร์ และ Decoder อีก 20 เลเยอร์ โดยดีโคเดอร์จะดึงค่าน้ำหนักการฉายภาพมาจากฮิดเดนสเตทสุดท้ายของเอนโคเดอร์ แทนที่จะคำนวณ Global KV ของตัวเอง ช่วยลดภาระการคำนวณในช่วง Prefill ลงได้เกือบครึ่งหนึ่ง

นอกจากนี้ ทีมวิจัยยังได้พัฒนาเทคนิค Decoder SWA Bounded Replay สำหรับจัดการกับ Sliding-Window Attention (SWA) ขนาด 128 โทเค็น ทำให้ระบบสามารถสร้างสถานะ SWA ขึ้นใหม่โดยการเล่นซ้ำเฉพาะ 128 โทเค็นสุดท้ายเท่านั้น รวมถึงการใช้เทคโนโลยี FP4 KV Cache ที่ช่วยลดพื้นที่จัดเก็บข้อมูลลงเกือบ 50% เมื่อเทียบกับแคชแบบ FP8 ในรุ่นก่อนหน้า

การเปิดตัว DeepSeek-V4.1-Flash สะท้อนให้เห็นถึงความพยายามอย่างต่อเนื่องในการแก้ไขปัญหาคอขวดด้านหน่วยความจำ (Memory Bottleneck) ของโมเดลภาษาขนาดใหญ่ การเลือกใช้เทคนิคการบีบอัดแคชระดับ FP4 ร่วมกับการจัดการสถาปัตยกรรมแบบแยกส่วนระหว่างเอนโคเดอร์และดีโคเดอร์ ช่วยให้การประมวลผลข้อมูลที่มีความยาวมากๆ มีความคุ้มค่าด้านทรัพยากรฮาร์ดแวร์มากขึ้น ซึ่งเป็นก้าวสำคัญที่จะช่วยลดต้นทุนการรันโมเดล AI ในระดับองค์กร

สำหรับการฝึกอบรมล่วงหน้า (Pre-training) โมเดลนี้ใช้โทเค็นมัลติโมเดลจำนวนถึง 45 ล้านล้านโทเค็น ด้วยอัตราส่วนข้อความต่อมัลติโมเดล 7:1 และผ่านการฝึกฝนแบบสแปร์สแอตเทนชันเริ่มต้นที่ความยาว 64K ก่อนจะขยายไปสู่ 1 ล้านโทเค็นในภายหลัง โดยโมเดลฐานมีประสิทธิภาพเทียบเท่ากับ DeepSeek-V4-Pro-Base แต่ใช้พารามิเตอร์รวมเพียง 1 ใน 3 และพารามิเตอร์ที่ใช้งานจริงเพียง 1 ใน 4 เท่านั้น

ที่มา: MarkTechPost

ความคิดเห็น

แสดงความคิดเห็น
0/2000

พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้