Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← До новин

Нова модель DeepSeek V4.1-Flash зменшує потребу ШІ-агентів у пам’яті

Нова модель Deepseek V4.1-Flash скорочує потреби ШІ-агентів у пам’яті
Джонатан Кемпер
10 вересня 2026 року
Nano Banana Pro за запитом THE DECODER

Ключові моменти

  • Deepseek випустила нову модель ШІ V4.1-Flash. Вона різко скорочує експлуатаційні витрати на обробку довгих текстів, значно зменшуючи буфер, необхідний для цієї роботи.
  • Модель також удвічі скорочує обчислення, необхідні для введення даних. Це забезпечується технічним розділенням, за якого для читання інформації активується менше обчислювальних ресурсів, ніж згодом для генерування тексту.
  • У завданнях із програмування безкоштовно доступна модель відповідає найкращим закритим моделям від OpenAI та Anthropic. Однак система все ще демонструє слабкі результати у складних наукових завданнях і аналізі зображень.

Нова мультимодальна модель Deepseek створена насамперед для скорочення експлуатаційних витрат під час роботи з довгими контекстами. Найбільший виграш — у використанні пам’яті, хоча Deepseek також обіцяє кращу продуктивність моделі.

Згідно з технічним звітом, Deepseek має чітку мету щодо V4.1-Flash: зменшити так званий KV-кеш. Цей буфер зберігає частини контексту, які модель уже обробила, щоб їй не доводилося перераховувати все на кожному новому кроці. Для агентів, які працюють упродовж багатьох кроків, він швидко зростає та створює навантаження на пам’ять графічного процесора, SSD-накопичувачі й пропускну здатність каналів передавання даних. Це підвищує витрати на розгортання.

У своїй основі мовна модель має 552 мільярди параметрів і обробляє контексти обсягом до одного мільйона токенів. Компанія заявляє, що буфер у швидкій пам’яті GPU тепер потребує лише близько чверті простору, який використовував її попередник Deepseek-V4-Flash. Частина, що постійно вивантажується та зберігається на SSD або в пам’яті хоста, скоротилася приблизно до однієї восьмої. Порівняно з Deepseek-V1, розмір глобального KV-кешу на токен зменшився у 437 разів.

Глобальний KV-кеш на токен у різних моделях Deepseek
Deepseek суттєво зменшила глобальний KV-кеш порівняно з V1. | Зображення: Deepseek

Менше обчислень на етапі введення

Deepseek досягає цього завдяки кільком методам, які працюють разом. Один із центральних підходів розділяє модель на дві половини. Перша обробляє вхідні дані, а друга використовує ці результати замість повторного обчислення всього. Під час читання вхідних даних модель активує лише 8 мільярдів параметрів на токен, але під час безпосереднього виведення тексту — 16 мільярдів.

Архітектура Deepseek V4.1 Flash із причинним енкодером і декодером
V4.1-Flash розділяє мовну основу на енкодер і декодер. | Зображення: Deepseek

Deepseek заявляє, що це майже вдвічі скорочує обчислення, необхідні для обробки вхідних даних. Підхід цілеспрямовано розрахований на агентів, які постійно обробляють нові введення через часті виклики інструментів. Deepseek також зберігає основний KV-кеш у форматі FP4 замість FP8. Згідно зі звітом, це майже вдвічі зменшує обсяг пам’яті, який займає ця частина кешу.

Модель навчали з нуля на наборі даних із 45 трильйонів токенів, що охоплює тексти та зображення. Під час донавчання Deepseek свідомо не застосовувала нові методи. Компанія заявляє, що основні здобутки стали результатом не нових алгоритмів, а більших і краще контрольованих даних, завдань та навчальних середовищ. За словами Deepseek, на цьому етапі таке масштабування допомагає більше, ніж алгоритмічні вдосконалення.

Продуктивність Deepseek V4.1 Flash зі збільшенням навчання з підкріпленням на бенчмарках програмних агентів
Зі збільшенням навчання з підкріпленням продуктивність покращується на кількох бенчмарках програмних агентів. | Зображення: Deepseek

Однак Deepseek також виявила, що навчені агенти іноді намагаються маніпулювати своєю системою винагород, а в інших випадках випадково виводять тестове середовище з ладу. Часом вони використовували нещодавно розкриті вразливості безпеки або видаляли критично важливі системні файли.

На одному бенчмарку програмування — нарівні з Opus 5 і GPT-5.6 Sol

Попри відносно невелику частку активних параметрів, Deepseek повідомляє про результати, близькі до показників провідних моделей на кількох бенчмарках. На бенчмарках для агентів вона іноді відповідає найкращим закритим моделям. У програмному тесті DeepSWE v1.1 вона з результатом 74,2 відсотка незначно випереджає такі моделі, як Opus 5 від Anthropic і GPT-5.6 Sol від OpenAI, тоді як у ProgramBench вона суттєво відстає.

У складних наукових завданнях для агентів, що потребують експертних знань, розрив із дуже великими моделями залишається очевидним. У технічному звіті також визнається помітне відставання від провідних закритих систем у читанні складних зображень.

Як і в багатьох інших моделях для міркування, можна налаштувати «глибину мислення». Користувачі керують ретельністю роботи моделі за допомогою одного значення, балансуючи між витратами на обчислення та точністю. Згідно зі звітом, найвище налаштування помітно покращує результати на кількох бенчмарках, але генерує приблизно у 2,5 раза більше вихідних токенів.

Точність і довжина виведення Deepseek V4.1 Flash за різного рівня зусиль міркування
Більші зусилля на міркування покращують результати, але збільшують використання токенів. | Зображення: Deepseek

Deepseek надає файли моделі на Hugging Face за відкритою ліцензією MIT, маючи на меті створити основу для подальшої роботи над дешевшими агентами ШІ. Модель також доступна через API за такими самими цінами, як і V4-Flash.

Наприкінці липня Deepseek суттєво вдосконалила попередню модель V4-Flash за допомогою оновлення 0731. Модель, що має 284 мільярди параметрів, із яких 13 мільярдів активні, відстала лише на один пункт від GPT-5.6 Luna від OpenAI в індексі інтелекту Artificial Analysis і коштувала приблизно на 60 відсотків дешевше за завдання. У середині серпня Deepseek вивела свою флагманську V4-Pro з тестування та одночасно підвищила ціни на API. Попадання в кеш, тобто введення, яке вже було буферизовано, подорожчали вшестеро. За даними тайванської компанії з кібербезпеки TeamT5, китайські хакерські угруповання більш ніж удвічі збільшили кількість атак після того, як почали використовувати Deepseek для таких завдань, як створення експлойт-коду та сканування мереж.

У червні Deepseek залучила близько 7,4 мільярда доларів у своєму першому раунді зовнішнього фінансування за оцінки понад 50 мільярдів доларів, а тепер, за даними Reuters, найняла китайський інвестиційний банк CITIC Securities для проведення IPO у Китаї.

Новини ШІ без хайпу — відібрані людьми

Підпишіться на THE DECODER, щоб читати матеріали без реклами, отримувати щотижневий інформаційний бюлетень про ШІ, наш ексклюзивний звіт про передові розробки «AI Radar» шість разів на рік, повний доступ до архіву та доступ до розділу коментарів.

Джерела: дослідження | Hugging Face

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням The Decoder

Читати оригінал на The Decoder ↗

Текст і зображення належать The Decoder і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини