ข้ามไปเนื้อหาหลัก

Nunchux AI เปิดตัว VC-Attention เร่งความเร็ว Video DiTs

Nunchux AI เผยโฉม VC-Attention เคอร์เนลความสนใจแบบ low-bit ไม่ต้องเทรดซ้ำ ช่วยเร่งความเร็วโมเดล Video Diffusion บนชิป B200 และ RTX 5090

เรียบเรียงโดย AI
Inewgen
17 Sep 20263 นาทีอ่าน (0 ครั้ง)
แชร์
Nunchux AI เปิดตัว VC-Attention เร่งความเร็ว Video DiTs

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

ขนาดตัวอักษร
  • Nunchux AI เปิดตัว VC-Attention เคอร์เนลความสนใจแบบ low-bit ที่ไม่ต้องเทรดซ้ำ
  • ช่วยลดเวลาการประมวลผลส่วน Attention ใน Video Diffusion Transformers ได้อย่างมีนารี
  • ทดสอบบนโมเดลชั้นนำ 4 ตัว ได้แก่ Wan2.2, LongCat-Video, HunyuanVideo-1.5 และ MiniMax-H3
  • ทำความเร็วเหนือกว่า SageAttention2 บนชิป B200 ได้ถึง 6.02 เท่า

การสร้างวิดีโอด้วยปัญญาประดิษฐ์ผ่านโมเดล Video Diffusion Transformers หรือ Video DiTs มักเผชิญกับอุปสรรคด้านการประมวลผล โดยคลิปวิดีโอความยาว 5 วินาที ความละเอียด 720p ของ Wan2.2-14B จะขยายออกเป็นโทเค็นเชิงพื้นที่และเวลามากถึง 70,000 โทเค็น ส่งผลให้บนการ์ดจอ RTX 5090 กระบวนการ Attention กินเวลาไปมากกว่าร้อยละ 64 ของเวลาการสร้างทั้งหมด ขณะที่ทีมวิจัยระบุว่ากระบวนการนี้กินสัดส่วนราวสองในสามของทุกขั้นตอนการขจัดสัญญาณรบกวนบนชิป B200 ตัวเดียว

แม้ว่า Tensor Cores แบบ low-bit จะช่วยเร่งการคูณเมทริกซ์ QK และ PV ได้ แต่ยังคงมีอุปสรรคสำคัญเหลืออยู่สองประการ ประการแรก วิธีการเดิมอย่าง SageAttention2 จะทำการปรับเรียบควรีและคีย์ แต่หลังจากกระบวนการดังกล่าว ค่าเทอมของ Value จะส่งผลให้เกิดความผิดพลาดของเอาต์พุตสูงถึงร้อยละ 82 บนโมเดล Wan2.2 และประการที่สอง การคำนวณ Softmax ระหว่างการคูณยังคงรันบน FP32 ซึ่งบนชิป B200 และ H200 ฟังก์ชันเอ็กซ์โพเนนเชียลและการแปลงเป็น FP8 กลายเป็นขั้นตอนในพาสป์ไลน์ที่ใช้เวลานานที่สุด

microchip hardware technology circuit board

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

เพื่อแก้ปัญหาดังกล่าว ทีมงานจึงได้พัฒนาเทคนิคการจัดกลุ่มเฉพาะในช่วงร้อยละ 25 แรกของขั้นตอนการขจัดสัญญาณรบกวน โดยนำการจัดเรียงนี้กลับมาใช้ซ้ำใน 4 ขั้นตอนที่อยู่ติดกัน ซึ่งเมื่อเฉลี่ยตลอดตารางเวลาทั้งหมดแล้ว การจัดกลุ่มนี้จะมีต้นทุนเวลา Attention เพียงร้อยละ 3 ถึง 4 เท่านั้น นอกจากนี้ยังมีการใช้ ExpCast-FP8 เพื่อเขียนไบต์โดยตรงจากคะแนนในโดเมนลอการิทึม ช่วยลดความผิดพลาดและเพิ่มประสิทธิภาพในการประมวลผล

ไม่อยากพลาดข่าวใหม่?

สมัครรับสรุปข่าวสารใหม่ทางอีเมล ไม่บ่อยจนรำคาญ

โฆษณา

6.02xเร็วกว่า SageAttention2 บนชิป B200
1.91xความเร็ว Nunchux Attention บน MiniMax-H3

ในการทดสอบกับโมเดลโอเพนซอร์กสำหรับวิดีโอ 4 ตัว ได้แก่ Wan2.2-T2V-A14B, LongCat-Video, HunyuanVideo-1.5 และ MiniMax-H3 พบว่าผลลัพธ์บนชิป B200 ทำให้ VC-Attention มีความเร็วสูงกว่า SageAttention2 ถึง 6.02 เท่า ส่วนบนชิป H200 ทำความเร็วได้มากกว่า 1.16 เท่า และบนการ์ดเวิร์กสเตชัน RTX PRO 6000 แบบ 4-bit V-Smooth สามารถทำผลงานได้ทัดเทียมกับ SageAttention3

"VC-Attention เร็วกว่า SageAttention2 ถึง 6.02 เท่าบนชิป B200"

Nunchux AI Research

การพัฒนาเคอร์เนลเฉพาะทางอย่าง VC-Attention สะท้อนให้เห็นถึงความพยายามของอุตสาหกรรม AI ในการทะลวงคอขวดด้านฮาร์ดแวร์สำหรับการประมวลผลวิดีโอ ซึ่งต้องการทรัพยากรคำนวณสูงมาก การปรับแต่งในระดับเคอร์เนลโดยไม่ต้องฝึกโมเดลใหม่ (Training-Free) ช่วยให้ผู้พัฒนาสามารถนำไปประยุกต์ใช้กับโมเดลที่มีอยู่เดิมได้ทันที ลดต้นทุนและเวลาในการพัฒนาโมเดลสร้างวิดีโอความละเอียดสูง

ที่มา: MarkTechPost

ความคิดเห็น

แสดงความคิดเห็น
0/2000

พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้