DeepSeek AI випустила DeepSeek-V4.1-Flash із контекстом на 1 млн токенів, KV-кешем FP4 і повторним використанням уваги між шарами
Агенти з довгим горизонтом перетворили обслуговування LLM на робоче навантаження, орієнтоване на введення. Повторні префіли та контексти на мільйон токенів створюють KV-кеші, які створюють навантаження на HBM, місткість SSD і пропускну здатність. DeepSeek AI побудувала свій найновіший реліз навколо саме цього вузького місця. DeepSeek-V4.1-Flash — мультимодальна модель Mixture-of-Experts із 552 млрд параметрів основної мережі, 196 млрд додаткових параметрів Engram і контекстним вікном на 1 млн токенів. Під час префілу вона активує 8 млрд параметрів на токен, а під час декодування — 16 млрд. Головний показник — глобальний обсяг KV-кешу в 890 байт на токен, приблизно 1/4 від DeepSeek-V4-Flash і приблизно у 437 разів менше, ніж у DeepSeek-V1.
Чи придатна вона до розгортання? Так. Відкриті ваги поширюються за умовами ліцензії MIT, а на Hugging Face доступні варіанти для vLLM, SGLang і Transformers. Дослідницька команда також описує публічний API з низьким, високим і максимальним рівнями міркування.
Каузальний енкодер-декодер: удвічі менший префіл
Основна мережа з 40 шарів поділена на каузальний енкодер із 20 шарів і декодер із 20 шарів. Натхненний YOCO, декодер не обчислює власний глобальний KV. Натомість ваги проєкції для кожного шару отримують його з фінального прихованого стану енкодера. Тому токени запиту проходять лише через енкодер, що майже вдвічі скорочує обчислення префілу. У кожному шарі все ще працює увага зі змінним вікном (SWA) розміром 128 токенів, тож стани SWA декодера відновлюються шляхом повторного відтворення лише останніх 128 токенів запиту. Дослідницька команда називає це обмеженим повторним відтворенням SWA декодера.
Стиснена розріджена увага 2 (CSA2)
У DeepSeek-V4 поєднували CSA із сильно стисненою увагою. У V4.1-Flash використовується лише CSA2, яка зменшує розмір кешу вздовж осі шарів. Кожному шару CSA2 статично призначається один із 3 режимів:
- Full: обчислює власний основний KV, отримує K індексатора з нього та вибирає нові індекси Top-512.
- Reindex: повторно використовує основний KV і K індексатора з останнього шару Full, але повторно оцінює їх за допомогою власного Q індексатора.
- Reuse: повторно використовує основний KV і найновіші індекси Top-K, повністю пропускаючи індексатор.
Кожен шар зберігає власні основні Q і KV SWA. 18 шарів CSA2 енкодера використовують коефіцієнт стиснення 2 у 3 групах по 6 шарів (1 Full, 5 Reuse). 20 шарів декодера використовують коефіцієнт 1 у 5 групах по 4: перша група — Full плюс 3 Reuse, решта — Reindex плюс 3 Reuse. Ієрархічний розріджений індексатор у декодері дає змогу шару Full створити пул кандидатів розміром до 16 384 позицій (2 048 блоків по 8), тож наступні шари Reindex оцінюють обмежений набір, а не весь контекст.
FP4 KV, обмежене повторне відтворення та інші розширення
Основний KV-кеш квантується до E2M1 з одним масштабом E4M3 на кожні 16 каналів за принципом NVFP4, але без його глобального масштабу. Це реалізується за допомогою квантування з урахуванням навчання на етапі донавчання й майже вдвічі зменшує обсяг зберігання порівняно з кешем FP8 у V4.
На рівні розгортання KV SWA більше не зберігається на SSD. Він перебуває в розподіленому пулі, виділеному з 10% оперативної пам’яті хоста, із TTL у кілька хвилин, тоді як глобальний KV має гарантований термін зберігання 72 години. У разі промаху обмежене повторне відтворення SWA енкодера повторно обчислює лише 128 токенів замість добутку кількості шарів на розмір вікна.
Серед інших змін — однопрохідний mHC, який зміщує коефіцієнти змішування входу на один блок, завдяки чому об’єднане ядро Mega-mHC може вдвічі зменшити трафік пам’яті активацій; модуль умовної пам’яті Engram у шарах 1 і 14; спекулятивне декодування DSpark, навчене після попереднього навчання зафіксованої основної мережі; а також Muon для окремих голів. FLOPs декодування одного токена зростає лише на 1/4, коли контекст збільшується з 4K до 1M.
Навчання та результати
Попереднє навчання охоплює 45T мультимодальних токенів у співвідношенні 7:1 текстових до мультимодальних. Розріджена увага навчається з нуля на послідовностях довжиною 64K без щільного прогрівання, а контекст розширюється до 1M на 34T токенів. Базова модель відповідає DeepSeek-V4-Pro-Base за знаннями про світ і програмування, використовуючи 1/3 загальної кількості та 1/4 активованих параметрів.
Під час донавчання нові алгоритми не впроваджуються. Покращення досягаються завдяки масштабному синтезу агентських завдань, які можна перевірити, навчанню з підкріпленням на гетерогенних каркасах (Claude Code, Codex, OpenCode, Pi, mini-SWE, DeepSeek Harness) і дистиляції за політикою від понад 40 учителів. Вибрані результати за максимального рівня зусиль:
| Бенчмарк | DS-V4.1-Flash | DS-V4-Flash | Opus-5 | GPT-5.6 Sol |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 90.6 | 82.7 | 89.1 | 88.8 |
| DeepSWE v1.1 | 74.2 | 54.4 | 74.0 | 73.0 |
| Terminal-Bench 4.0 | 31.2 | 7.0 | 51.8 | 39.9 |
| Automation-Bench | 54.8 | 37.7 | 50.3 | 45.8 |
| GPQA Diamond | 90.9 | 89.9 | 93.4 | 94.1 |
| Codeforces (рейтинг) | 3471 | 3289 | н/д | н/д |
Інтерактивне пояснення
Ключові висновки
- Глобальний KV-кеш зменшується до 890 байт на токен — приблизно 1/4 від V4-Flash і у 437 разів менше, ніж у V1.
- CED під час префілу використовує лише 20 шарів енкодера, активуючи 8 млрд параметрів проти 16 млрд під час декодування.
- CSA2 розподіляє основний KV, K індексатора та індекси Top-K між шарами в режимах Full, Reindex і Reuse.
- Основний KV у FP4 разом з обмеженим повторним відтворенням SWA скорочують постійний кеш приблизно до 1/8 від V4-Flash.
- Перевершує Opus-5 і GPT-5.6 Sol у Terminal-Bench 2.1 та DeepSWE v1.1, маючи ваги за ліцензією MIT.
Ознайомтеся з моделлю на Hugging Face та технічним звітом. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого ML SubReddit із понад 150 тис. учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? Тепер ви також можете приєднатися до нас у Telegram.
Потрібно співпрацювати з нами для просування вашого репозиторію GitHub, сторінки Hugging Face, випуску продукту, вебінару тощо? Зв’яжіться з нами
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.