Новая модель DeepSeek V4.1-Flash снижает потребность ИИ-агентов в памяти
Ключевые моменты
- Deepseek выпустила новую ИИ-модель V4.1-Flash. Она резко снижает операционные расходы на обработку длинных текстов, значительно уменьшая буфер, необходимый для этой работы.
- Модель также вдвое сокращает вычислительные ресурсы, необходимые для ввода данных. Это достигается за счёт технического разделения: для чтения информации активируется меньше вычислительных ресурсов, чем впоследствии для генерации текста.
- В задачах программирования свободно доступная модель соответствует ведущим закрытым моделям OpenAI и Anthropic. Однако система по-прежнему демонстрирует слабые результаты в сложных научных задачах и анализе изображений.
Новая мультимодальная модель Deepseek создана главным образом для снижения операционных расходов при работе с длинными контекстами. Наибольший эффект достигается за счёт использования памяти, хотя Deepseek также обещает более высокую производительность модели.
Согласно техническому отчёту, у Deepseek есть чёткая цель для V4.1-Flash: уменьшить так называемый KV-кэш. Этот буфер хранит части контекста, которые модель уже обработала, чтобы ей не приходилось пересчитывать всё на каждом новом шаге. У агентов, работающих в течение множества шагов, он быстро увеличивается и создаёт нагрузку на память GPU, SSD и пропускную способность каналов передачи данных. Это повышает стоимость развёртывания.
В основе языковой модели лежит 552 миллиарда параметров, а длина обрабатываемого контекста достигает одного миллиона токенов. Компания утверждает, что буфер в быстрой памяти GPU теперь занимает лишь около четверти пространства, которое использовала предыдущая модель Deepseek-V4-Flash. Постоянно выгружаемая часть, размещаемая на SSD или в памяти хост-системы, сократилась примерно до одной восьмой. По сравнению с Deepseek-V1 размер глобального KV-кэша на токен уменьшился в 437 раз.

Меньше вычислений при вводе данных
Deepseek достигает этого благодаря нескольким взаимодополняющим технологиям. Одна из ключевых разделяет модель на две половины. Первая обрабатывает поступающие данные, а вторая использует полученные результаты вместо повторного вычисления всего. При чтении входных данных модель активирует только 8 миллиардов параметров на токен, но во время фактического вывода текста — 16 миллиардов.

Deepseek утверждает, что это почти вдвое сокращает вычислительные ресурсы, необходимые для обработки входных данных. Решение рассчитано именно на агентов, которые постоянно обрабатывают новые входные данные посредством частых вызовов инструментов. Deepseek также хранит основной KV-кэш в формате FP4 вместо FP8. Согласно отчёту, это почти вдвое уменьшает объём памяти, занимаемый этой частью кэша.
Модель обучалась с нуля на наборе данных из 45 триллионов токенов, включающем тексты и изображения. На этапе дообучения Deepseek намеренно не использует новые методы. Компания утверждает, что основные улучшения были достигнуты не благодаря новым алгоритмам, а за счёт более крупных и лучше контролируемых данных, задач и сред обучения. По мнению Deepseek, на данном этапе такое масштабирование приносит больше пользы, чем алгоритмические доработки.

Однако Deepseek также обнаружила, что обученные агенты иногда пытались манипулировать своей системой вознаграждений, а в других случаях случайно выводили тестовую среду из строя. Иногда они использовали недавно раскрытые уязвимости в системе безопасности или удаляли критически важные системные файлы.
На уровне Opus 5 и GPT-5.6 Sol в бенчмарке программирования
Несмотря на относительно небольшую долю активных параметров, Deepseek сообщает о результатах, близких к показателям ведущих моделей, в нескольких бенчмарках. В бенчмарках для агентов она иногда сравнивается с лучшими закрытыми моделями. В программном тесте DeepSWE v1.1 она с результатом 74,2 процента немного опережает такие модели, как Opus 5 от Anthropic и GPT-5.6 Sol от OpenAI, тогда как в ProgramBench она значительно отстаёт.
В научно сложных задачах для агентов, требующих экспертных знаний, сохраняется заметный разрыв с очень крупными моделями. В техническом отчёте также признаётся измеримый разрыв с ведущими закрытыми системами при чтении сложных изображений.
Как и у многих других рассуждающих моделей, можно настраивать «глубину мышления». Пользователи управляют тщательностью работы модели с помощью одного значения, балансируя между вычислительными затратами и точностью. Согласно отчёту, максимальная настройка заметно улучшает результаты в нескольких бенчмарках, но генерирует примерно в 2,5 раза больше выходных токенов.

Deepseek публикует файлы модели на Hugging Face по открытой лицензии MIT, рассчитывая, что они станут отправной точкой для дальнейшей работы над более дешёвыми ИИ-агентами. Модель также доступна через API по тем же ценам, что и V4-Flash.
В конце июля Deepseek значительно улучшила предшественницу V4-Flash с обновлением 0731. Модель со 284 миллиардами параметров, из которых 13 миллиардов активны, отстала всего на один балл от GPT-5.6 Luna от OpenAI в индексе искусственного интеллекта Artificial Analysis и обходилась примерно на 60 процентов дешевле за задачу. В середине августа Deepseek вывела свою флагманскую V4-Pro из тестирования и одновременно повысила цены на API. Попадания в кэш, то есть уже буферизованные входные данные, стали в шесть раз дороже. По данным тайваньской компании по кибербезопасности TeamT5, китайские хакерские группировки более чем вдвое увеличили число атак с тех пор, как начали использовать Deepseek для таких задач, как создание эксплойтов и сканирование сетей.
В июне Deepseek привлекла около 7,4 миллиарда долларов в рамках своего первого внешнего раунда финансирования при оценке более чем в 50 миллиардов долларов, а теперь, согласно Reuters, наняла китайский инвестиционный банк CITIC Securities для проведения IPO в Китае.
Новости ИИ без шумихи — отобраны людьми
Подпишитесь на THE DECODER, чтобы читать материалы без рекламы, получать еженедельную рассылку об ИИ и наш эксклюзивный ежегодный шесть раз публикуемый отчёт о передовых разработках «AI Radar», иметь полный доступ к архиву и разделу комментариев.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.