DeepSeek AI выпустила DeepSeek-V4.1-Flash с контекстом в 1 млн токенов, KV-кэшем FP4 и повторным использованием внимания между слоями
Агенты с длинным горизонтом превратили обслуживание LLM в рабочую нагрузку, ориентированную на ввод. Повторные префиллы и контексты длиной в миллион токенов создают KV-кэши, которые нагружают HBM, ёмкость SSD и пропускную способность. DeepSeek AI построила свой новый релиз вокруг именно этого узкого места. DeepSeek-V4.1-Flash — мультимодальная модель типа Mixture-of-Experts с 552 млрд параметров базовой модели, 196 млрд дополнительных параметров Engram и контекстным окном в 1 млн токенов. На этапе префилла на каждый токен активируется 8 млрд параметров, а на этапе декодирования — 16 млрд. Главный показатель — глобальный размер KV-кэша, составляющий 890 байт на токен: примерно 1/4 от DeepSeek-V4-Flash и примерно в 437 раз меньше, чем у DeepSeek-V1.
Можно ли её развернуть? Да. Открытые веса распространяются по лицензии MIT, а на Hugging Face доступны варианты запуска с vLLM, SGLang и Transformers; исследовательская команда также описывает публичный API с уровнями рассуждения low, high и max.
Каузальный энкодер-декодер: вдвое меньший префилл
Базовая модель из 40 слоёв разделена на каузальный энкодер из 20 слоёв и декодер из 20 слоёв. По аналогии с YOCO декодер не вычисляет собственный глобальный KV. Вместо этого проекционные веса каждого слоя выводят его из финального скрытого состояния энкодера. Поэтому токены промпта обрабатываются только энкодером, что почти вдвое сокращает вычисления префилла. В каждом слое по-прежнему работает внимание с окном скользящего типа (SWA) размером 128 токенов, поэтому состояния SWA декодера восстанавливаются повторным проигрыванием только последних 128 токенов промпта. Исследовательская команда называет это Decoder SWA Bounded Replay.
Сжатое разреженное внимание 2 (CSA2)
В DeepSeek-V4 использовалось сочетание CSA и Heavily Compressed Attention. В V4.1-Flash применяется чистый CSA2, который уменьшает размер кэша по оси слоёв. Каждый слой CSA2 статически назначается в один из 3 режимов:
- Full: вычисляет собственный основной KV, проецирует из него K индексатора и выбирает новые индексы Top-512.
- Reindex: повторно использует основной KV и K индексатора из последнего слоя Full, но повторно оценивает их с помощью собственного Q индексатора.
- Reuse: повторно использует и основной KV, и последние индексы Top-K, полностью пропуская индексатор.
Каждый слой хранит собственный основной Q и KV SWA. 18 энкодерных слоёв CSA2 используют коэффициент сжатия 2 в 3 группах по 6 слоёв (1 Full, 5 Reuse). 20 слоёв декодера используют коэффициент 1 в 5 группах по 4 слоя: первая группа состоит из Full и 3 Reuse, остальные — из Reindex и 3 Reuse. Иерархический разреженный индексатор в декодере позволяет слою Full сформировать пул кандидатов размером до 16 384 позиций (2048 блоков по 8), поэтому последующие слои Reindex оценивают ограниченный набор, а не весь контекст.
FP4 KV, ограниченное повторное проигрывание и другие расширения
Основной KV-кэш квантуется в E2M1 с одним масштабом E4M3 на каждые 16 каналов по принципу NVFP4, но без его глобального масштаба. Это достигается с помощью обучения с учётом квантизации на этапе постобучения и почти вдвое сокращает объём хранения по сравнению с FP8-кэшем V4.
На уровне развёртывания KV SWA больше не сохраняется на SSD. Он размещается в распределённом пуле, выделенном из 10% оперативной памяти хоста, с TTL в несколько минут, тогда как для глобального KV гарантируется срок хранения 72 часа. При промахе Encoder SWA Bounded Replay пересчитывает только 128 токенов вместо произведения числа слоёв на размер окна.
К другим изменениям относятся Single-Pass mHC, который сдвигает коэффициенты смешивания входных данных на один блок, позволяя объединённому ядру Mega-mHC вдвое сократить трафик памяти активаций; модуль условной памяти Engram в слоях 1 и 14; спекулятивное декодирование DSpark, обученное после предварительного обучения при замороженной базовой модели; и Muon по головам внимания. FLOPs декодирования одного токена увеличиваются лишь на 1/4 при росте контекста с 4K до 1M.
Обучение и результаты
Предварительное обучение охватывает 45 трлн мультимодальных токенов при соотношении текста к мультимодальным данным 7:1. Разреженное внимание обучается с нуля на последовательностях длиной 64K без этапа плотного прогрева, а контекст расширяется до 1M на 34 трлн токенов. Базовая модель соответствует DeepSeek-V4-Pro-Base по знаниям о мире и программированию, используя 1/3 общего числа параметров и 1/4 активируемых параметров.
Постобучение не привносит новых алгоритмов. Улучшения достигаются за счёт масштабного синтеза проверяемых задач для агентов, обучения с подкреплением на неоднородных каркасах (Claude Code, Codex, OpenCode, Pi, mini-SWE, DeepSeek Harness) и дистилляции по стратегии on-policy от более чем 40 учителей. Отдельные результаты при максимальном уровне усилий:
| Тест | DS-V4.1-Flash | DS-V4-Flash | Opus-5 | GPT-5.6 Sol |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 90.6 | 82.7 | 89.1 | 88.8 |
| DeepSWE v1.1 | 74.2 | 54.4 | 74.0 | 73.0 |
| Terminal-Bench 4.0 | 31.2 | 7.0 | 51.8 | 39.9 |
| Automation-Bench | 54.8 | 37.7 | 50.3 | 45.8 |
| GPQA Diamond | 90.9 | 89.9 | 93.4 | 94.1 |
| Codeforces (рейтинг) | 3471 | 3289 | н/д | н/д |
Интерактивное объяснение
Ключевые выводы
- Размер глобального KV-кэша снижен до 890 байт на токен — примерно до 1/4 от V4-Flash и в 437 раз ниже, чем у V1.
- CED использует на этапе префилла только 20 энкодерных слоёв, активируя 8 млрд параметров против 16 млрд при декодировании.
- CSA2 совместно использует основной KV, K индексатора и индексы Top-K между слоями в режимах Full, Reindex и Reuse.
- Основной KV в FP4 и SWA Bounded Replay сокращают постоянный кэш примерно до 1/8 от V4-Flash.
- Превосходит Opus-5 и GPT-5.6 Sol в Terminal-Bench 2.1 и DeepSWE v1.1; веса распространяются по лицензии MIT.
Посмотрите модель на Hugging Face и технический отчёт. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тыс. участников и подписаться на нашу рассылку. Стоп! Вы есть в Telegram? теперь к нам можно присоединиться и в Telegram.
Хотите стать нашим партнёром для продвижения вашего репозитория GitHub, страницы на Hugging Face, релиза продукта, вебинара и т. д.? Свяжитесь с нами
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.