DeepSeek AI представи DeepSeek-V4.1-Flash с контекст от 1 млн токена, FP4 KV кеш и повторно използване на вниманието между слоевете
Агентите с дълъг хоризонт превърнаха обслужването на LLM в натоварване, доминирано от входните данни. Повторните prefill операции и контекстите от милиони токени оставят KV кешове, които натоварват HBM, капацитета и честотната лента на SSD. DeepSeek AI изгради най-новото си издание именно около това ограничение. DeepSeek-V4.1-Flash е мултимодален Mixture-of-Experts модел с 552B параметъра в основната мрежа, 196B допълнителни Engram параметъра и контекстен прозорец от 1M токена. Той активира 8B параметъра на токен по време на prefill и 16B по време на decode. Основният показател е глобалният размер на KV кеша от 890 байта на токен — около 1/4 от този на DeepSeek-V4-Flash и приблизително 437 пъти по-малък от този на DeepSeek-V1.
Може ли да бъде внедрен? Да. Отворените тегла се разпространяват под лиценз MIT, като в Hugging Face са налични пътища за vLLM, SGLang и Transformers, а изследователският екип описва публичен API с нива за ниско, високо и максимално разсъждение.
Каузален енкодер-декодер: наполовина по-малък prefill
Основната мрежа от 40 слоя е разделена на каузален енкодер от 20 слоя и декодер от 20 слоя. Вдъхновен от YOCO, декодерът не изчислява собствен глобален KV. Вместо това теглата за проектиране на всеки слой го извеждат от крайното скрито състояние на енкодера. Затова входните токени преминават само през енкодера, което почти наполовина намалява изчисленията за prefill. Във всеки слой все още се изпълнява внимание с плъзгащ се прозорец (SWA) от 128 токена, така че състоянията на SWA в декодера се възстановяват чрез повторно възпроизвеждане само на последните 128 токена от подканата. Изследователският екип нарича това Decoder SWA Bounded Replay.
Компресирано разредено внимание 2 (CSA2)
DeepSeek-V4 комбинира CSA със силно компресирано внимание. V4.1-Flash използва само CSA2 и атакува размера на кеша по оста на слоевете. Всеки слой CSA2 статично се разпределя към един от 3 режима:
- Full: изчислява собствен основен KV, проектира K на индексатора от него и избира нови Top-512 индекси.
- Reindex: използва повторно основния KV и K на индексатора от последния Full слой, но ги преоценява със собственото си Q на индексатора.
- Reuse: използва повторно както основния KV, така и най-новите Top-K индекси, като изцяло пропуска индексатора.
Всеки слой съхранява собствено основно Q и SWA KV. 18-те CSA2 слоя на енкодера използват коефициент на компресия 2 в 3 групи по 6 (1 Full, 5 Reuse). 20-те слоя на декодера използват коефициент 1 в 5 групи по 4: първата е Full плюс 3 Reuse, а останалите са Reindex плюс 3 Reuse. Йерархичен разреден индексатор в декодера позволява на Full слоя да изгради набор от кандидати с до 16 384 позиции (2048 блока по 8), така че следващите Reindex слоеве да оценяват ограничен набор вместо целия контекст.
FP4 KV, ограничено повторно възпроизвеждане и други разширения
Основният KV кеш се квантува до E2M1 с една E4M3 скала на всеки 16 канала, следвайки NVFP4, но без неговата глобална скала. Това се въвежда чрез обучение, съобразено с квантуването, на етапа след обучението и почти наполовина намалява обема за съхранение спрямо FP8 кеша на V4.
На ниво внедряване SWA KV вече не се съхранява на SSD. Той се намира в разпределен пул, заделен от 10% от DRAM паметта на хоста, с TTL от няколко минути, докато глобалният KV има гарантиран живот от 72 часа. При пропуск Encoder SWA Bounded Replay преизчислява само 128 токена вместо броя на слоевете, умножен по размера на прозореца.
Другите промени включват Single-Pass mHC, който измества коефициентите за смесване на входа с един блок, така че слят Mega-mHC kernel да може да намали наполовина трафика на паметта за активации, условния модул за памет Engram в слоеве 1 и 14, спекулативното декодиране DSpark, обучено след предварителното обучение при замразена основна мрежа, и Muon по глави. FLOPs при декодиране на един токен се увеличават само с 1/4, когато контекстът нараства от 4K до 1M.
Обучение и резултати
Предварителното обучение обхваща 45T мултимодални токена при съотношение 7:1 между текстови и мултимодални токени. Разреденото внимание се обучава от нулата при дължина на последователността 64K без плътно предварително обучение, а контекстът се разширява до 1M при 34T токена. Базовият модел се изравнява с DeepSeek-V4-Pro-Base по знания за света и програмиране, като използва 1/3 от общия брой и 1/4 от активираните параметри.
Обучението след предварителното обучение не въвежда нови алгоритми. Подобренията идват от мащабен синтез на проверими агентски задачи, RL върху хетерогенни среди (Claude Code, Codex, OpenCode, Pi, mini-SWE, DeepSeek Harness) и дистилация по текущата политика от над 40 учители. Избрани резултати при максимално усилие:
| Бенчмарк | DS-V4.1-Flash | DS-V4-Flash | Opus-5 | GPT-5.6 Sol |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 90.6 | 82.7 | 89.1 | 88.8 |
| DeepSWE v1.1 | 74.2 | 54.4 | 74.0 | 73.0 |
| Terminal-Bench 4.0 | 31.2 | 7.0 | 51.8 | 39.9 |
| Automation-Bench | 54.8 | 37.7 | 50.3 | 45.8 |
| GPQA Diamond | 90.9 | 89.9 | 93.4 | 94.1 |
| Codeforces (рейтинг) | 3471 | 3289 | н/п | н/п |
Интерактивно обяснение
Основни изводи
- Глобалният KV кеш намалява до 890 байта на токен — около 1/4 от този на V4-Flash и 437 пъти по-малък от този на V1.
- CED изпълнява само 20-те слоя на енкодера при prefill, като активира 8B параметъра срещу 16B при decode.
- CSA2 споделя основния KV, K на индексатора и Top-K индексите между слоевете в режимите Full, Reindex и Reuse.
- Основният KV във FP4 плюс SWA Bounded Replay намаляват постоянния кеш до около 1/8 от този на V4-Flash.
- Надминава Opus-5 и GPT-5.6 Sol на Terminal-Bench 2.1 и DeepSWE v1.1 с MIT лицензирани тегла.
Разгледайте модела в Hugging Face и техническия доклад. Също така не се колебайте да ни последвате в Twitter и не забравяйте да се присъедините към нашия ML SubReddit с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.
Имате нужда от партньор за популяризиране на вашето GitHub хранилище ИЛИ страница в Hugging Face ИЛИ продуктово представяне ИЛИ уебинар и т.н.? Свържете се с нас
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.