Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← До новин

Nunchux AI представила VC-Attention: низькорозрядне ядро уваги без навчання, що пришвидшує відео Diffusion Transformers

Nunchux AI випустила VC-Attention — навчання-вільне низькорозрядне ядро уваги, створене для відеотрансформерів дифузії (DiT). Воно одночасно розв’язує 2 проблеми: похибку квантування значень і повільний етап softmax.

Чому увага є вузьким місцем для відео

Відео-DiT перетворюють кліп на 1 послідовність просторово-часових токенів і виконують повну багатоголову увагу на кожному шарі. 5-секундний кліп Wan2.2-14B у форматі 720p містить близько 70K токенів. На RTX 5090 на увагу припадає понад 64% часу генерації. Дослідницька команда зазначає, що увага займає близько двох третин кожного кроку денойзингу MiniMax-H3 на одному B200.

Тензорні ядра з низькою розрядністю прискорюють 2 матричні добутки — QK і PV. Залишаються 2 перешкоди. По-перше, попередні методи, як-от SageAttention2, згладжують запити та ключі. Після згладжування й обертання QK на складову значень припадає 82% похибки вихідних даних у Wan2.2. По-друге, softmax між добутками все ще працює у FP32. На B200 і H200 ця експонента та її перетворення у FP8 стають найдовшим етапом конвеєра.

V-Smooth: усунення викидів у значеннях

Викиди значень містяться в кількох токенах, а їхні канали змінюються між головами, шарами та кроками. Обертання Адамара зберігає норми токенів, тому не усуває їх. Обертання V змінює похибку значень лише на 0,2%.

V-Smooth використовує інший підхід:

  • Групування: Онлайн-алгоритм k-середніх кластеризує токени значень для кожного пакета й голови. Ключі та значення переставляються разом, тому вихід невипадкової уваги не змінюється.
  • Центрування: Кожен апаратний блок із 128 токенів віднімає своє середнє значення. Квантується лише залишок — із використанням E4M3 для кожного каналу при 8 бітах або NVFP4 при 4 бітах.
  • Відновлення: Середнє значення додається назад за допомогою суми рядка, яку вже зберігає онлайн-softmax. Другий прохід або додатковий буфер не потрібні.

Усереднено для 100 голів Wan2.2 середнє значення блоку усуває 8% енергії блоку в порядку послідовності. Воно усуває 12% за статичного куба DeltaQuant і 36% після сортування. Кожне середнє значення коштує 0,125 біта на елемент значення.

Групування виконується лише протягом перших 25% кроків денойзингу. Перестановка повторно використовується для 4 сусідніх кроків. Усереднено за всім розкладом, групування займає 3–4% часу роботи уваги.

ExpCast-FP8: усунення вузького місця softmax

Байт E4M3 уже близький до логарифма значення, яке він зберігає. Якщо прочитати його як ціле число, він приблизно дорівнює 8 log2(v) + 56. Тож ExpCast-FP8 записує байт безпосередньо зі значення оцінки в логарифмічній області за допомогою 1 об’єднаної операції множення й додавання. Константа β = -0,35 центрує залишкову похибку, і жодна константа не підбирається окремо для кожної моделі.

Прямий шлях записує той самий байт, що й шлях «експонента FP32, потім перетворення», у 79,6% кожного подвоєння. В інших випадках результат відрізняється на 1 код. У статті доведено обмеження повної варіації для кожного рядка на рівні до 3,64% плюс хвіст переповнення вниз. Для 204,8K рядків уваги Wan2.2 виміряне середнє становить 1,6%. ExpCast-FP8 застосовується лише до 8-бітного ядра, оскільки NVFP4 не має єдиного афінного відображення логарифма в код.

Ручне об’єднання ланцюжка попередньої обробки за допомогою CuTe/CUDA скорочує час 1 виклику V-Smooth з 42,2 мс до 4,8 мс на B200.

Пояснення: як працює VC-Attention

Бенчмарки

Тести охоплюють 4 відео-DiT із відкритими вагами: Wan2.2-T2V-A14B, LongCat-Video, HunyuanVideo-1.5 і MiniMax-H3. Точність оцінюється порівняно з вихідними даними BF16 FlashAttention-4 за 100 запитами.

GPU (Wan2.2)ТочністьПрискорення увагиПрискорення наскрізного виконання
B2008 біт1,59×1,19×
H2008 біт1,46×1,13×
RTX PRO 60004 біти2,27×1,36×
RTX 50904 біти3,58×1,70×

На B200 VC-Attention працює у 6,02× швидше за SageAttention2, який не має ядра для Blackwell. На H200 розрив становить 1,16×. На робочих станціях 4-бітний V-Smooth відповідає SageAttention3 на RTX PRO 6000. На RTX 5090 різниця не перевищує 5%, тож їх розмежовує точність.

Результати за точністю:

  • При 8 бітах V-Smooth забезпечує перевагу над SageAttention2 у 2,3 дБ PSNR на Wan2.2 і 2,8 дБ на HunyuanVideo-1.5.
  • Додавання ExpCast-FP8 повертає 0,7–2,1 дБ, але результат усе одно перевершує SageAttention2 на всіх 4 моделях.
  • При 4 бітах V-Smooth перевершує SageAttention3 на 2,9 дБ на Wan2.2 і на 3,6 дБ на LongCat-Video.
  • За роботи без навчання Attn-QAT поступається SageAttention2 на 3,4–6,7 дБ.

На MiniMax-H3 із роздільною здатністю 1344×768 увага працює у 1,60× швидше за BF16 FlashAttention-4 на B200. PSNR становить 20,2 дБ проти 19,9 дБ у SageAttention2. Для B300 у статті наведено показник 1,47× проти 1,31× для наївного ядра FP8. На графіку в блозі вказано 1,51× для B300.

Nunchux Attention, власне розширення компанії, досягає прискорення 1,91× на B200 і 1,83× на B300 для уваги MiniMax-H3.

Метод змінює лише вартість окремої взаємодії. Тому його можна поєднувати з розрідженою увагою, як-от Sparse VideoGen і Radial Attention, а також із дистиляцією та виконанням на кількох GPU. Nunchux повідомляє, що безкоштовний доступ до MiniMax-H3 незабаром стане доступним через список очікування Modelverse.

Основні висновки

  • VC-Attention — навчання-вільна низькорозрядна увага для відео-DiT від Nunchux AI.
  • V-Smooth кластеризує токени значень, а потім квантує лише залишки після віднімання середнього значення блоку.
  • ExpCast-FP8 замінює експоненту FP32 і перетворення однією операцією множення й додавання.
  • Увага Wan2.2 працює у 1,59× швидше на B200 і у 3,58× на RTX 5090.
  • Публічного випуску ядра поки немає; Nunchux використовує власне розширення у своєму стеку.

Ознайомтеся зі статтею та технічними деталями. Уся подяка належить досліднику цього проєкту. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого сабреддіту ML із понад 150 тис. учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? Тепер ви також можете приєднатися до нас у Telegram.

Потрібно співпрацювати з нами для просування вашого репозиторію GitHub, сторінки Hugging Face, випуску продукту, вебінару тощо? Зв’яжіться з нами

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MarkTechPost

Читати оригінал на MarkTechPost ↗

Текст і зображення належать MarkTechPost і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини