Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← Към новините

Новият модел DeepSeek V4.1-Flash намалява нуждата от памет на ИИ агентите

Новият модел Deepseek V4.1-Flash намалява нуждата от памет за AI агенти
Jonathan Kemper
10 септември 2026 г.
Nano Banana Pro по заявка на THE DECODER

Основни акценти

  • Deepseek пусна новия си AI модел V4.1-Flash. Той значително намалява оперативните разходи за обработка на дълги текстове, като драстично свива буфера, необходим за задачата.
  • Моделът също така намалява наполовина изчислителната мощност, необходима за въвеждане на данни. Това става чрез техническо разделяне, което активира по-малко изчислителни ресурси за четене на информация, отколкото за последващото генериране на текст.
  • При задачи за програмиране свободно достъпният модел се изравнява с водещите затворени модели на OpenAI и Anthropic. Но системата все още показва слабости при сложни научни задачи и анализ на изображения.

Новият мултимодален модел на Deepseek е създаден основно за намаляване на оперативните разходи при работа с дълги контексти. Най-голямото подобрение е при използването на памет, макар че Deepseek обещава и по-добра производителност на модела.

Според техническия доклад Deepseek има ясна цел с V4.1-Flash: да намали така наречения KV кеш. Този буфер съхранява частите от контекста, които моделът вече е обработил, така че да не се налага всичко да се изчислява отново при всяка нова стъпка. При агентите, които работят в много стъпки, той нараства бързо и натоварва паметта на графичните процесори, SSD дисковете и пропускателната способност на данните. Това увеличава разходите за внедряване.

В основата си езиковият модел има 552 милиарда параметъра и обработва контексти с дължина до един милион токена. Компанията твърди, че буферът във високоскоростната GPU памет вече се нуждае от около една четвърт от пространството, използвано от предшественика му Deepseek-V4-Flash. Частта, която постоянно се прехвърля към SSD или паметта на хост системата, е намалена приблизително до една осма. В сравнение с Deepseek-V1 размерът на глобалния KV кеш на токен е намалял 437 пъти.

Глобален KV кеш на токен при различни модели на Deepseek
Deepseek драстично е намалил глобалния KV кеш от V1 насам. | Изображение: Deepseek

По-малко изчисления при въвеждане на данни

Deepseek постига това чрез няколко техники, които работят заедно. Една от основните разделя модела на две половини. Първата обработва постъпващите данни, а втората използва тези резултати, вместо да изчислява всичко отново. При четене на входни данни моделът активира само 8 милиарда параметъра на токен, но 16 милиарда по време на същинското генериране на текст.

Архитектура на Deepseek V4.1 Flash с каузален енкодер и декодер
V4.1-Flash разделя езиковата основа на енкодер и декодер. | Изображение: Deepseek

Deepseek твърди, че това почти наполовина намалява изчислителната мощност, необходима за обработка на входни данни. Подходът е насочен директно към агентите, които постоянно обработват нови входни данни чрез чести извиквания на инструменти. Deepseek също така съхранява основния KV кеш във формат FP4 вместо FP8. Според доклада това почти наполовина намалява обема на паметта, необходим за тази част от кеша.

Моделът е обучен от нулата върху набор от данни с 45 трилиона токена, обхващащ текст и изображения. По време на дообучаването Deepseek умишлено пропуска нови методи. Компанията твърди, че основните подобрения не идват от нови алгоритми, а от по-големи и по-добре контролирани данни, задачи и среди за обучение. Според Deepseek на този етап този тип мащабиране помага повече от алгоритмичните промени.

Производителност на Deepseek V4.1 Flash при увеличаване на обучението с подсилване върху бенчмаркове за кодиращи агенти
При повече обучение с подсилване производителността се подобрява при няколко бенчмарка за кодиращи агенти. | Изображение: Deepseek

Deepseek обаче е установил, че обучените агенти понякога се опитват да манипулират системата си за възнаграждение, а в други случаи случайно сриват тестовата среда. Понякога те използват наскоро разкрити уязвимости в сигурността или изтриват критични системни файлове.

Изравнява се с Opus 5 и GPT-5.6 Sol в бенчмарк за програмиране

Въпреки сравнително малкия дял активни параметри Deepseek отчита резултати, близки до тези на водещите модели в няколко бенчмарка. При бенчмарковете за агенти той понякога се изравнява с водещите затворени модели. При софтуерния тест DeepSWE v1.1 той с малко изпреварва модели като Opus 5 на Anthropic и GPT-5.6 Sol на OpenAI със 74,2 процента, докато при ProgramBench изостава значително.

При научно сложни агентски задачи, изискващи експертни знания, остава ясна разлика спрямо много големите модели. Техническият доклад също признава измерима разлика спрямо водещите затворени системи при разчитането на сложни изображения.

Подобно на много други модели за разсъждение, „дълбочината на мислене“ може да се задава. Потребителите контролират колко задълбочено работи моделът чрез една стойност, като правят компромис между изчислителните разходи и точността. Според доклада най-високата настройка осезаемо подобрява резултатите в няколко бенчмарка, но генерира около 2,5 пъти повече изходни токени.

Точност и дължина на изхода на Deepseek V4.1 Flash при различни нива на усилие за разсъждение
По-голямото усилие за разсъждение подобрява резултатите, но увеличава използването на токени. | Изображение: Deepseek

Deepseek предоставя файловете на модела в Hugging Face под отворения MIT лиценз с цел те да послужат като отправна точка за по-нататъшна работа по по-евтини AI агенти. Моделът е достъпен и чрез API на същите цени като V4-Flash.

Deepseek значително подобри предшественика V4-Flash едва в края на юли с актуализацията 0731. Моделът, с 284 милиарда параметъра, от които 13 милиарда активни, остана само с една точка зад GPT-5.6 Luna на OpenAI в индекса Artificial Analysis Intelligence и струваше около 60 процента по-малко за задача. В средата на август Deepseek извади водещия си V4-Pro от тестов период и едновременно повиши цените на API. Попаденията в кеша, тоест вече буферираните входни данни, станаха шест пъти по-скъпи. Според тайванската компания за киберсигурност TeamT5 китайските хакерски групи са увеличили повече от два пъти атаките си, откакто са започнали да използват Deepseek за неща като код за експлойти и мрежови сканирания.

През юни Deepseek набра около 7,4 милиарда долара в първия си кръг на външно финансиране при оценка над 50 милиарда долара, а според Reuters вече е наела китайската инвестиционна банка CITIC Securities за първично публично предлагане в Китай.

Новини за AI без преувеличения – подбрани от хора

Абонирайте се за THE DECODER, за да четете без реклами, да получавате седмичен AI бюлетин, нашия ексклузивен годишен шестмесечен доклад за водещите технологии „AI Radar“, пълен достъп до архива и достъп до секцията за коментари.

Източник: Доклад | Hugging Face

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от The Decoder на

Прочетете оригинала в The Decoder ↗

Текстът и изображенията са собственост на The Decoder и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини