Nunchux AI представила VC-Attention: низькорозрядне ядро уваги без навчання, що пришвидшує відео Diffusion Transformers
Nunchux AI випустила VC-Attention — навчання-вільне низькорозрядне ядро уваги, створене для відеотрансформерів дифузії (DiT). Воно одночасно розв’язує 2 проблеми: похибку квантування значень і повільний етап softmax.
Чому увага є вузьким місцем для відео
Відео-DiT перетворюють кліп на 1 послідовність просторово-часових токенів і виконують повну багатоголову увагу на кожному шарі. 5-секундний кліп Wan2.2-14B у форматі 720p містить близько 70K токенів. На RTX 5090 на увагу припадає понад 64% часу генерації. Дослідницька команда зазначає, що увага займає близько двох третин кожного кроку денойзингу MiniMax-H3 на одному B200.
Тензорні ядра з низькою розрядністю прискорюють 2 матричні добутки — QK і PV. Залишаються 2 перешкоди. По-перше, попередні методи, як-от SageAttention2, згладжують запити та ключі. Після згладжування й обертання QK на складову значень припадає 82% похибки вихідних даних у Wan2.2. По-друге, softmax між добутками все ще працює у FP32. На B200 і H200 ця експонента та її перетворення у FP8 стають найдовшим етапом конвеєра.
V-Smooth: усунення викидів у значеннях
Викиди значень містяться в кількох токенах, а їхні канали змінюються між головами, шарами та кроками. Обертання Адамара зберігає норми токенів, тому не усуває їх. Обертання V змінює похибку значень лише на 0,2%.
V-Smooth використовує інший підхід:
- Групування: Онлайн-алгоритм k-середніх кластеризує токени значень для кожного пакета й голови. Ключі та значення переставляються разом, тому вихід невипадкової уваги не змінюється.
- Центрування: Кожен апаратний блок із 128 токенів віднімає своє середнє значення. Квантується лише залишок — із використанням E4M3 для кожного каналу при 8 бітах або NVFP4 при 4 бітах.
- Відновлення: Середнє значення додається назад за допомогою суми рядка, яку вже зберігає онлайн-softmax. Другий прохід або додатковий буфер не потрібні.
Усереднено для 100 голів Wan2.2 середнє значення блоку усуває 8% енергії блоку в порядку послідовності. Воно усуває 12% за статичного куба DeltaQuant і 36% після сортування. Кожне середнє значення коштує 0,125 біта на елемент значення.
Групування виконується лише протягом перших 25% кроків денойзингу. Перестановка повторно використовується для 4 сусідніх кроків. Усереднено за всім розкладом, групування займає 3–4% часу роботи уваги.
ExpCast-FP8: усунення вузького місця softmax
Байт E4M3 уже близький до логарифма значення, яке він зберігає. Якщо прочитати його як ціле число, він приблизно дорівнює 8 log2(v) + 56. Тож ExpCast-FP8 записує байт безпосередньо зі значення оцінки в логарифмічній області за допомогою 1 об’єднаної операції множення й додавання. Константа β = -0,35 центрує залишкову похибку, і жодна константа не підбирається окремо для кожної моделі.
Прямий шлях записує той самий байт, що й шлях «експонента FP32, потім перетворення», у 79,6% кожного подвоєння. В інших випадках результат відрізняється на 1 код. У статті доведено обмеження повної варіації для кожного рядка на рівні до 3,64% плюс хвіст переповнення вниз. Для 204,8K рядків уваги Wan2.2 виміряне середнє становить 1,6%. ExpCast-FP8 застосовується лише до 8-бітного ядра, оскільки NVFP4 не має єдиного афінного відображення логарифма в код.
Ручне об’єднання ланцюжка попередньої обробки за допомогою CuTe/CUDA скорочує час 1 виклику V-Smooth з 42,2 мс до 4,8 мс на B200.
Пояснення: як працює VC-Attention
Бенчмарки
Тести охоплюють 4 відео-DiT із відкритими вагами: Wan2.2-T2V-A14B, LongCat-Video, HunyuanVideo-1.5 і MiniMax-H3. Точність оцінюється порівняно з вихідними даними BF16 FlashAttention-4 за 100 запитами.
| GPU (Wan2.2) | Точність | Прискорення уваги | Прискорення наскрізного виконання |
|---|---|---|---|
| B200 | 8 біт | 1,59× | 1,19× |
| H200 | 8 біт | 1,46× | 1,13× |
| RTX PRO 6000 | 4 біти | 2,27× | 1,36× |
| RTX 5090 | 4 біти | 3,58× | 1,70× |
На B200 VC-Attention працює у 6,02× швидше за SageAttention2, який не має ядра для Blackwell. На H200 розрив становить 1,16×. На робочих станціях 4-бітний V-Smooth відповідає SageAttention3 на RTX PRO 6000. На RTX 5090 різниця не перевищує 5%, тож їх розмежовує точність.
Результати за точністю:
- При 8 бітах V-Smooth забезпечує перевагу над SageAttention2 у 2,3 дБ PSNR на Wan2.2 і 2,8 дБ на HunyuanVideo-1.5.
- Додавання ExpCast-FP8 повертає 0,7–2,1 дБ, але результат усе одно перевершує SageAttention2 на всіх 4 моделях.
- При 4 бітах V-Smooth перевершує SageAttention3 на 2,9 дБ на Wan2.2 і на 3,6 дБ на LongCat-Video.
- За роботи без навчання Attn-QAT поступається SageAttention2 на 3,4–6,7 дБ.
На MiniMax-H3 із роздільною здатністю 1344×768 увага працює у 1,60× швидше за BF16 FlashAttention-4 на B200. PSNR становить 20,2 дБ проти 19,9 дБ у SageAttention2. Для B300 у статті наведено показник 1,47× проти 1,31× для наївного ядра FP8. На графіку в блозі вказано 1,51× для B300.
Nunchux Attention, власне розширення компанії, досягає прискорення 1,91× на B200 і 1,83× на B300 для уваги MiniMax-H3.
Метод змінює лише вартість окремої взаємодії. Тому його можна поєднувати з розрідженою увагою, як-от Sparse VideoGen і Radial Attention, а також із дистиляцією та виконанням на кількох GPU. Nunchux повідомляє, що безкоштовний доступ до MiniMax-H3 незабаром стане доступним через список очікування Modelverse.
Основні висновки
- VC-Attention — навчання-вільна низькорозрядна увага для відео-DiT від Nunchux AI.
- V-Smooth кластеризує токени значень, а потім квантує лише залишки після віднімання середнього значення блоку.
- ExpCast-FP8 замінює експоненту FP32 і перетворення однією операцією множення й додавання.
- Увага Wan2.2 працює у 1,59× швидше на B200 і у 3,58× на RTX 5090.
- Публічного випуску ядра поки немає; Nunchux використовує власне розширення у своєму стеку.
Ознайомтеся зі статтею та технічними деталями. Уся подяка належить досліднику цього проєкту. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого сабреддіту ML із понад 150 тис. учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? Тепер ви також можете приєднатися до нас у Telegram.
Потрібно співпрацювати з нами для просування вашого репозиторію GitHub, сторінки Hugging Face, випуску продукту, вебінару тощо? Зв’яжіться з нами
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.