Nunchux AI เปิดตัว VC-Attention เร่งความเร็ว Video DiTs
Nunchux AI เผยโฉม VC-Attention เคอร์เนลความสนใจแบบ low-bit ไม่ต้องเทรดซ้ำ ช่วยเร่งความเร็วโมเดล Video Diffusion บนชิป B200 และ RTX 5090

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
- Nunchux AI เปิดตัว VC-Attention เคอร์เนลความสนใจแบบ low-bit ที่ไม่ต้องเทรดซ้ำ
- ช่วยลดเวลาการประมวลผลส่วน Attention ใน Video Diffusion Transformers ได้อย่างมีนารี
- ทดสอบบนโมเดลชั้นนำ 4 ตัว ได้แก่ Wan2.2, LongCat-Video, HunyuanVideo-1.5 และ MiniMax-H3
- ทำความเร็วเหนือกว่า SageAttention2 บนชิป B200 ได้ถึง 6.02 เท่า
การสร้างวิดีโอด้วยปัญญาประดิษฐ์ผ่านโมเดล Video Diffusion Transformers หรือ Video DiTs มักเผชิญกับอุปสรรคด้านการประมวลผล โดยคลิปวิดีโอความยาว 5 วินาที ความละเอียด 720p ของ Wan2.2-14B จะขยายออกเป็นโทเค็นเชิงพื้นที่และเวลามากถึง 70,000 โทเค็น ส่งผลให้บนการ์ดจอ RTX 5090 กระบวนการ Attention กินเวลาไปมากกว่าร้อยละ 64 ของเวลาการสร้างทั้งหมด ขณะที่ทีมวิจัยระบุว่ากระบวนการนี้กินสัดส่วนราวสองในสามของทุกขั้นตอนการขจัดสัญญาณรบกวนบนชิป B200 ตัวเดียว
แม้ว่า Tensor Cores แบบ low-bit จะช่วยเร่งการคูณเมทริกซ์ QK และ PV ได้ แต่ยังคงมีอุปสรรคสำคัญเหลืออยู่สองประการ ประการแรก วิธีการเดิมอย่าง SageAttention2 จะทำการปรับเรียบควรีและคีย์ แต่หลังจากกระบวนการดังกล่าว ค่าเทอมของ Value จะส่งผลให้เกิดความผิดพลาดของเอาต์พุตสูงถึงร้อยละ 82 บนโมเดล Wan2.2 และประการที่สอง การคำนวณ Softmax ระหว่างการคูณยังคงรันบน FP32 ซึ่งบนชิป B200 และ H200 ฟังก์ชันเอ็กซ์โพเนนเชียลและการแปลงเป็น FP8 กลายเป็นขั้นตอนในพาสป์ไลน์ที่ใช้เวลานานที่สุด

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
เพื่อแก้ปัญหาดังกล่าว ทีมงานจึงได้พัฒนาเทคนิคการจัดกลุ่มเฉพาะในช่วงร้อยละ 25 แรกของขั้นตอนการขจัดสัญญาณรบกวน โดยนำการจัดเรียงนี้กลับมาใช้ซ้ำใน 4 ขั้นตอนที่อยู่ติดกัน ซึ่งเมื่อเฉลี่ยตลอดตารางเวลาทั้งหมดแล้ว การจัดกลุ่มนี้จะมีต้นทุนเวลา Attention เพียงร้อยละ 3 ถึง 4 เท่านั้น นอกจากนี้ยังมีการใช้ ExpCast-FP8 เพื่อเขียนไบต์โดยตรงจากคะแนนในโดเมนลอการิทึม ช่วยลดความผิดพลาดและเพิ่มประสิทธิภาพในการประมวลผล
ในการทดสอบกับโมเดลโอเพนซอร์กสำหรับวิดีโอ 4 ตัว ได้แก่ Wan2.2-T2V-A14B, LongCat-Video, HunyuanVideo-1.5 และ MiniMax-H3 พบว่าผลลัพธ์บนชิป B200 ทำให้ VC-Attention มีความเร็วสูงกว่า SageAttention2 ถึง 6.02 เท่า ส่วนบนชิป H200 ทำความเร็วได้มากกว่า 1.16 เท่า และบนการ์ดเวิร์กสเตชัน RTX PRO 6000 แบบ 4-bit V-Smooth สามารถทำผลงานได้ทัดเทียมกับ SageAttention3
"VC-Attention เร็วกว่า SageAttention2 ถึง 6.02 เท่าบนชิป B200"
Nunchux AI Research
การพัฒนาเคอร์เนลเฉพาะทางอย่าง VC-Attention สะท้อนให้เห็นถึงความพยายามของอุตสาหกรรม AI ในการทะลวงคอขวดด้านฮาร์ดแวร์สำหรับการประมวลผลวิดีโอ ซึ่งต้องการทรัพยากรคำนวณสูงมาก การปรับแต่งในระดับเคอร์เนลโดยไม่ต้องฝึกโมเดลใหม่ (Training-Free) ช่วยให้ผู้พัฒนาสามารถนำไปประยุกต์ใช้กับโมเดลที่มีอยู่เดิมได้ทันที ลดต้นทุนและเวลาในการพัฒนาโมเดลสร้างวิดีโอความละเอียดสูง
ที่มา: MarkTechPost
พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้
ความคิดเห็น
แสดงความคิดเห็น