Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← Към новините

Nunchux AI представи VC-Attention: нискобитово ядро за внимание без обучение, което ускорява видео дифузионните трансформъри

Nunchux AI пусна VC-Attention — нискобитово ядро за attention, което не изисква обучение и е създадено за видео Diffusion Transformers (DiTs). То адресира едновременно 2 проблема: грешката при квантизацията на стойностите и бавния етап на softmax.

Защо Attention е тесният участък при видеото

Видео DiT моделите преобразуват клипа в 1 последователност от пространствено-времеви токени и изпълняват пълен self-attention на всеки слой. 5-секунден клип с резолюция 720p от Wan2.2-14B съдържа около 70K токена. При RTX 5090 attention заема над 64% от времето за генериране. Изследователският екип посочва, че attention заема около две трети от всяка стъпка на денойзинг при MiniMax-H3 на един B200.

Нискобитовите Tensor Cores ускоряват 2-те матрични произведения — QK и PV. Остават 2 препятствия. Първо, предишни методи като SageAttention2 изглаждат заявките и ключовете. След изглаждането и ротацията на QK компонентът на стойностите отговаря за 82% от грешката в изхода при Wan2.2. Второ, softmax между произведенията все още се изпълнява във FP32. При B200 и H200 тази експонента и нейното преобразуване към FP8 се превръщат в най-дългия етап от конвейера.

V-Smooth: Отстраняване на аутлайърите в стойностите

Аутлайърите в стойностите се намират в малък брой токени, а каналите им се променят между главите, слоевете и стъпките. Ротацията на Адамар запазва нормите на токените, така че не ги премахва. Ротирането на V променя грешката при стойностите само с 0,2%.

V-Smooth използва различен подход:

  • Групиране: Онлайн k-means клъстерира токените на стойностите за всеки пакет и глава. Ключовете и стойностите се пермутират заедно, така че изходът на некаузалния attention остава непроменен.
  • Премахване на средната стойност: Всеки хардуерен блок от 128 токена изважда средната си стойност. Квантизира се само остатъкът, като се използва E4M3 на канал при 8 бита или NVFP4 при 4 бита.
  • Възстановяване: Средната стойност се добавя обратно чрез сумата на реда, която онлайн softmax вече съхранява. Не е необходим втори проход или допълнителен буфер.

Осреднено за 100 глави на Wan2.2, средната стойност на блока премахва 8% от енергията на блока при подреждане по последователност. При DeltaQuant’s static cube тя премахва 12%, а след сортиране — 36%. Всяка средна стойност струва 0,125 бита на елемент от стойността.

Групирането се изпълнява само през първите 25% от стъпките на денойзинг. Пермутацията се използва повторно за 4 съседни стъпки. Осреднено за целия график, групирането струва 3 до 4% от времето за attention.

ExpCast-FP8: Премахване на тесния участък при Softmax

Един байт E4M3 вече е близък до логаритъма на стойността, която съхранява. Прочетен като цяло число, той приблизително се равнява на 8 log2(v) + 56. Затова ExpCast-FP8 записва байта директно от оценката в логаритмичната област с 1 слято умножение и събиране. Константата β = -0.35 центрира остатъчната грешка, а за отделните модели не се напасва константа.

Директният път записва същия байт като пътя „експонента във FP32, след това преобразуване“ в 79,6% от всеки диапазон на удвояване. В останалите случаи разликата е 1 код. Статията доказва горна граница за пълната вариация на реда под 3,64%, плюс евентуална опашка от стойности, изпаднали под долната граница. При 204,8K реда за attention на Wan2.2 измерената средна стойност е 1,6%. ExpCast-FP8 се прилага само към 8-битовото ядро, тъй като NVFP4 няма еднозначно афинно преобразуване от логаритъм към код.

Ръчно написаното сливане CuTe/CUDA на веригата за предварителна обработка намалява времето за 1 извикване на V-Smooth от 42,2 ms на 4,8 ms при B200.

Обяснение: Как работи VC-Attention

Бенчмаркове

Тестовете обхващат 4 видео DiT модела с отворени тегла: Wan2.2-T2V-A14B, LongCat-Video, HunyuanVideo-1.5 и MiniMax-H3. Точността се оценява спрямо изходите на BF16 FlashAttention-4 за 100 подсказки.

GPU (Wan2.2)ПрецизностУскорение на attentionУскорение от край до край
B2008-битова1,59×1,19×
H2008-битова1,46×1,13×
RTX PRO 60004-битова2,27×1,36×
RTX 50904-битова3,58×1,70×

При B200 VC-Attention е 6,02× по-бърз от SageAttention2, който не разполага с ядро за Blackwell. При H200 разликата е 1,16×. При работните станции 4-битовият V-Smooth се изравнява със SageAttention3 при RTX PRO 6000. При RTX 5090 остава в рамките на 5%, така че точността е факторът, който ги разграничава.

Резултати за точността:

  • При 8 бита V-Smooth добавя 2,3 dB PSNR спрямо SageAttention2 при Wan2.2 и 2,8 dB при HunyuanVideo-1.5.
  • Добавянето на ExpCast-FP8 възстановява 0,7 до 2,1 dB, но все пак надминава SageAttention2 и при 4-те модела.
  • При 4 бита V-Smooth надминава SageAttention3 с 2,9 dB при Wan2.2 и с 3,6 dB при LongCat-Video.
  • При изпълнение без обучение Attn-QAT изостава с 3,4 до 6,7 dB спрямо SageAttention2.

При MiniMax-H3 с резолюция 1344×768 attention работи 1,60× по-бързо от BF16 FlashAttention-4 на B200. PSNR е 20,2 dB спрямо 19,9 dB при SageAttention2. При B300 статията отчита 1,47× спрямо 1,31× за обикновено FP8 ядро. Графиката в блога посочва 1,51× за B300.

Nunchux Attention, собственото разширение на компанията, достига 1,91× при B200 и 1,83× при B300 за attention на MiniMax-H3.

Методът променя само разходите за отделните взаимодействия. Затова може да се комбинира с разреден attention като Sparse VideoGen и Radial Attention, както и с дистилация и изпълнение на множество GPU. Nunchux съобщава, че безплатният достъп до MiniMax-H3 ще бъде наличен чрез неговия списък с чакащи за Modelverse.

Основни изводи

  • VC-Attention е нискобитов attention без обучение за видео DiT модели от Nunchux AI.
  • V-Smooth клъстерира токените на стойностите, след което квантизира само остатъците след изваждане на средната стойност на блока.
  • ExpCast-FP8 заменя експонентата и преобразуването във FP32 с 1 умножение и събиране.
  • Attention при Wan2.2 работи 1,59× по-бързо на B200 и 3,58× на RTX 5090.
  • Все още няма публично ядро; Nunchux използва собствено разширение в своя стек.

Разгледайте статията и техническите подробности. Цялата заслуга е на изследователя на този проект. Също така можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия ML SubReddit с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.

Имате нужда от партньорство с нас за популяризиране на вашето GitHub хранилище, Hugging Face страница, продуктово представяне, уебинар и др.? Свържете се с нас

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини