ข้ามไปเนื้อหาหลัก

เทคนิค Grouped Value Attention ลด KV cache ได้ถึง 45%

นวัตกรรม Grouped Value Attention และ DeepSeek-V4.1-Flash ช่วยลดภาระหน่วยความจำ KV cache ลงกว่า 45-890 bytes ต่อ token พร้อมรักษาความแม่นยำแทบไม่เปลี่ยน

เรียบเรียงโดย AI
Inewgen
25 Sep 2026ที่มา: Dev.to3 นาทีอ่าน (0 ครั้ง)
แชร์
เทคนิค Grouped Value Attention ลด KV cache ได้ถึง 45%

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

ขนาดตัวอักษร
  • Grouped Value Attention ลด KV cache ลงประมาณ 45% โดยไม่กระทบความแม่นยำ
  • ทดสอบบนโมเดล 350M พารามิเตอร์ ได้ความแม่นยำเฉลี่ย 44.35 ใกล้เคียง GQA เดิม
  • DeepSeek-V4.1-Flash กดขนาด HBM เหลือเพียง 890 bytes ต่อ token

วงการปัญญาประดิษฐ์และโมเดลภาษาขนาดใหญ่กำลังก้าวไปอีกขั้น ด้วยการคิดค้นวิธีการจัดการหน่วยความจำที่มีประสิทธิภาพสูงขึ้น โดยเทคนิคใหม่ที่เรียกว่า Grouped Value Attention สามารถตัดขนาด KV memory ในสถาปัตยกรรม transformer ลงได้ราว 45 เปอร์เซ็นต์โดยที่คะแนนการทดสอบแทบไม่ลดลงเลย หลักการทำงานคือการจัดเก็บเฉพาะ grouped values แล้วนำมาสร้าง keys ขึ้นใหม่แบบ on-the-fly ในระหว่างขั้นตอนการถอดรหัส ซึ่งช่วยตัดความจำเป็นในการสร้าง key matrix เต็มรูปแบบ และลด persistent cache scalars ลงอย่างมหาศาล

ในอดีตที่ผ่านมา การถอดรหัสข้อความยาวๆ จำเป็นต้องอาศัย full key–value caches ที่มีขนาดเติบโตเป็นเส้นตรงตามความยาวของชุดข้อมูล แม้กระทั่งเทคนิคยอดนิยมอย่าง grouped-query attention ก็ยังคงต้องเก็บบันทึก key สำหรับทุกๆ token เอาไว้ ทำให้แรงกดดันต่อหน่วยความจำยังคงเป็นอุปสรรคสำคัญในการประมวลผลแบบ autoregressive inference

46%ลด cache scalars บนโมเดล 350M
44.35ความแม่นยำเฉลี่ย GVA รุ่น 16 มิติ
890 BHBM footprint ต่อ token ของ DeepSeek

ผลการทดสอบบนโมเดลขนาด 350 ล้านพารามิเตอร์ ชี้ให้เห็นว่าเทคนิค GVA สามารถลด persistent cache scalars ลงได้ประมาณ 46 เปอร์เซ็นต์ ในขณะที่ยังคงรักษาความแม่นยำเฉลี่ยในการทำ 5 งานทดสอบเอาไว้ได้ห่างจาก GQA ดั้งเดิมเพียง 0.01 คะแนนเท่านั้น โดยรุ่น 16 มิติทำคะแนนเฉลี่ยได้ 44.35 เปรียบเทียบกับ GQA ที่ 44.36 และ MLA ที่ 43.88

"this representation reduces persistent cache scalars by approximately 45–47 % relative to matched GQA"

คณะผู้จัดทำรายงานวิจัย

นอกจากนี้ โมเดล DeepSeek-V4.1-Flash ยังช่วยผลักดันขีดจำกัดของการบีบอัด KV cache ให้สูงขึ้นไปอีกขั้น ด้วยการลดพื้นที่ global HBM ลงเหลือเพียง 890 bytes ต่อ token ซึ่งคิดเป็นประมาณหนึ่งในสี่ของรุ่นก่อนหน้า พร้อมกันนี้ยังมีฟีเจอร์ SWA Bounded Replay ที่ช่วยบีบอัด footprint ให้ลดลงเหลือราว 1 ใน 8 ของ DeepSeek-V4.1-Flash ทั่วไป และยังคงมอบประสิทธิภาพที่เหนือกว่าโมเดลพื้นฐานอย่างชัดเจน

ไม่อยากพลาดข่าวใหม่?

สมัครรับสรุปข่าวสารใหม่ทางอีเมล ไม่บ่อยจนรำคาญ

โฆษณา

การจัดการหน่วยความจำ KV cache ถือเป็นคอขวดสำคัญที่จำกัดความยาวบริบทของ Large Language Model มาโดยตลอด เนื่องจากหน่วยความจำประเภทนี้ใช้พื้นที่มหาศาลในการประมวลผลข้อความยาวๆ การที่นักวิจัยสามารถลดขนาดลงได้เกือบครึ่งโดยไม่เสียความแม่นยำ จึงเป็นกุญแจสำคัญที่จะช่วยให้ฮาร์ดแวร์ระดับผู้บริโภคหรือการ์ดจอขนาดเล็กสามารถรันโมเดลภาษาที่มีบริบทขนาดยาวมากๆ ได้ในอนาคต

อย่างไรก็ตาม บทความวิจัยทั้งสองฉบับยังไม่ได้ระบุชัดเจนว่า การประหยัดหน่วยความจำเหล่านี้จะแปลงไปเป็นความเร็วในการประมวลผลแบบ end-to-end บนฮาร์ดแวร์ทั่วไปได้มากน้อยเพียงใด เนื่องจาก custom decoding kernels ของ GVA ยังอยู่ในระหว่างการประเมิน ทำให้ต้องติดตามผลลัพธ์ในสถานการณ์ใช้งานจริงต่อไป

ที่มา: Dev.to

ความคิดเห็น

แสดงความคิดเห็น
0/2000

พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้