Нова модель DeepSeek V4.1-Flash зменшує потребу ШІ-агентів у пам’яті
Ключові моменти
- Deepseek випустила нову модель ШІ V4.1-Flash. Вона різко скорочує експлуатаційні витрати на обробку довгих текстів, значно зменшуючи буфер, необхідний для цієї роботи.
- Модель також удвічі скорочує обчислення, необхідні для введення даних. Це забезпечується технічним розділенням, за якого для читання інформації активується менше обчислювальних ресурсів, ніж згодом для генерування тексту.
- У завданнях із програмування безкоштовно доступна модель відповідає найкращим закритим моделям від OpenAI та Anthropic. Однак система все ще демонструє слабкі результати у складних наукових завданнях і аналізі зображень.
Нова мультимодальна модель Deepseek створена насамперед для скорочення експлуатаційних витрат під час роботи з довгими контекстами. Найбільший виграш — у використанні пам’яті, хоча Deepseek також обіцяє кращу продуктивність моделі.
Згідно з технічним звітом, Deepseek має чітку мету щодо V4.1-Flash: зменшити так званий KV-кеш. Цей буфер зберігає частини контексту, які модель уже обробила, щоб їй не доводилося перераховувати все на кожному новому кроці. Для агентів, які працюють упродовж багатьох кроків, він швидко зростає та створює навантаження на пам’ять графічного процесора, SSD-накопичувачі й пропускну здатність каналів передавання даних. Це підвищує витрати на розгортання.
У своїй основі мовна модель має 552 мільярди параметрів і обробляє контексти обсягом до одного мільйона токенів. Компанія заявляє, що буфер у швидкій пам’яті GPU тепер потребує лише близько чверті простору, який використовував її попередник Deepseek-V4-Flash. Частина, що постійно вивантажується та зберігається на SSD або в пам’яті хоста, скоротилася приблизно до однієї восьмої. Порівняно з Deepseek-V1, розмір глобального KV-кешу на токен зменшився у 437 разів.

Менше обчислень на етапі введення
Deepseek досягає цього завдяки кільком методам, які працюють разом. Один із центральних підходів розділяє модель на дві половини. Перша обробляє вхідні дані, а друга використовує ці результати замість повторного обчислення всього. Під час читання вхідних даних модель активує лише 8 мільярдів параметрів на токен, але під час безпосереднього виведення тексту — 16 мільярдів.

Deepseek заявляє, що це майже вдвічі скорочує обчислення, необхідні для обробки вхідних даних. Підхід цілеспрямовано розрахований на агентів, які постійно обробляють нові введення через часті виклики інструментів. Deepseek також зберігає основний KV-кеш у форматі FP4 замість FP8. Згідно зі звітом, це майже вдвічі зменшує обсяг пам’яті, який займає ця частина кешу.
Модель навчали з нуля на наборі даних із 45 трильйонів токенів, що охоплює тексти та зображення. Під час донавчання Deepseek свідомо не застосовувала нові методи. Компанія заявляє, що основні здобутки стали результатом не нових алгоритмів, а більших і краще контрольованих даних, завдань та навчальних середовищ. За словами Deepseek, на цьому етапі таке масштабування допомагає більше, ніж алгоритмічні вдосконалення.

Однак Deepseek також виявила, що навчені агенти іноді намагаються маніпулювати своєю системою винагород, а в інших випадках випадково виводять тестове середовище з ладу. Часом вони використовували нещодавно розкриті вразливості безпеки або видаляли критично важливі системні файли.
На одному бенчмарку програмування — нарівні з Opus 5 і GPT-5.6 Sol
Попри відносно невелику частку активних параметрів, Deepseek повідомляє про результати, близькі до показників провідних моделей на кількох бенчмарках. На бенчмарках для агентів вона іноді відповідає найкращим закритим моделям. У програмному тесті DeepSWE v1.1 вона з результатом 74,2 відсотка незначно випереджає такі моделі, як Opus 5 від Anthropic і GPT-5.6 Sol від OpenAI, тоді як у ProgramBench вона суттєво відстає.
У складних наукових завданнях для агентів, що потребують експертних знань, розрив із дуже великими моделями залишається очевидним. У технічному звіті також визнається помітне відставання від провідних закритих систем у читанні складних зображень.
Як і в багатьох інших моделях для міркування, можна налаштувати «глибину мислення». Користувачі керують ретельністю роботи моделі за допомогою одного значення, балансуючи між витратами на обчислення та точністю. Згідно зі звітом, найвище налаштування помітно покращує результати на кількох бенчмарках, але генерує приблизно у 2,5 раза більше вихідних токенів.

Deepseek надає файли моделі на Hugging Face за відкритою ліцензією MIT, маючи на меті створити основу для подальшої роботи над дешевшими агентами ШІ. Модель також доступна через API за такими самими цінами, як і V4-Flash.
Наприкінці липня Deepseek суттєво вдосконалила попередню модель V4-Flash за допомогою оновлення 0731. Модель, що має 284 мільярди параметрів, із яких 13 мільярдів активні, відстала лише на один пункт від GPT-5.6 Luna від OpenAI в індексі інтелекту Artificial Analysis і коштувала приблизно на 60 відсотків дешевше за завдання. У середині серпня Deepseek вивела свою флагманську V4-Pro з тестування та одночасно підвищила ціни на API. Попадання в кеш, тобто введення, яке вже було буферизовано, подорожчали вшестеро. За даними тайванської компанії з кібербезпеки TeamT5, китайські хакерські угруповання більш ніж удвічі збільшили кількість атак після того, як почали використовувати Deepseek для таких завдань, як створення експлойт-коду та сканування мереж.
У червні Deepseek залучила близько 7,4 мільярда доларів у своєму першому раунді зовнішнього фінансування за оцінки понад 50 мільярдів доларів, а тепер, за даними Reuters, найняла китайський інвестиційний банк CITIC Securities для проведення IPO у Китаї.
Новини ШІ без хайпу — відібрані людьми
Підпишіться на THE DECODER, щоб читати матеріали без реклами, отримувати щотижневий інформаційний бюлетень про ШІ, наш ексклюзивний звіт про передові розробки «AI Radar» шість разів на рік, повний доступ до архіву та доступ до розділу коментарів.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.