Sakhanda Wire
NVDA $215.08 -0.81% MSFT $483.20 +0.43% GOOGL $345.39 +1.39% META $551.08 +0.96% AMZN $259.42 -0.27%
← Към новините

DeepSeek пуска експериментален Flash vision модел, който съперничи на Opus 4.8 в бенчмаркове за агенти

Deepseek пуска на експериментален Flash vision модел, който съперничи на Opus 4.8 в агентски бенчмаркове
Matthias Bastian
21 авг. 2026 г.
Nano Banana Pro, подканен от THE DECODER

Китайската компания за изкуствен интелект Deepseek пусна V4-Flash-Vision-Exp — експериментален мултимодален модел, който добавя разбиране на изображения към текстовите си възможности. Според собствените бенчмаркове на Deepseek моделът почти се изравнява с Opus 4.8 при агентски задачи.

Deepseek-V4-Flash-Vision-Exp разширява Deepseek-V4-Flash с обработка на изображения, като същевременно запазва текстовите възможности на базовия модел при разсъждение и общи познания, казва Deepseek. При вътрешните мултимодални бенчмаркове на компанията агентският вариант с vision възможности постига резултати, близки до тези на Opus 4.8.

Deepseek се насочва към визуални агентски работни процеси

Deepseek позиционира модела за приложения, базирани на агенти. Той е проектиран да работи с различни агентски рамки и да комбинира визуално разбиране с използване на инструменти. На практика може да описва изображения, да извлича текст от екранни снимки и да анализира диаграми. Поддържа JPEG, PNG, GIF и WebP и определя формата от действителното съдържание на файла, а не от името на файла или декларирания MIME тип, според API документацията.

С добавените vision възможности новият модел на Deepseek се изравнява или понякога надминава Opus 4.8 в агентските бенчмаркове. | Изображение: DeepseekМоделът работи с API-тата Chat Completions и Responses на OpenAI и с крайна точка Messages на Anthropic. Deepseek пусна и версия 0.1.1 на своята рамка Harness, която поддържа новия модел още от самото начало.

Цени и ограничения за изображенията

Има три начина за изпращане на изображения към модела. Разработчиците могат да ги вградят директно чрез Base64 кодиране, да посочат публично достъпни URL адреси (до 32 MiB) или да използват новия безплатен Files API. Files API позволява да качите файл веднъж и да го посочвате чрез идентификатор при множество заявки, с ограничение за размера от 64 MiB.

Незадължителното поле „detail“ намалява изображенията до 512 x 512 пиксела, спестявайки токени, когато не са необходими фини визуални детайли. Преди обработка моделът автоматично нормализира изображенията до приблизително 800 x 800 пиксела в зависимост от съотношението на страните. Независимо от първоначалната резолюция всяко изображение струва най-много 384 токена. Ценообразуването следва тарифите на V4-Flash.

Една заявка може да включва до 600 изображения. Максималната дължина на страната е 8 192 пиксела, но пада до 4 096 пиксела, когато заявката съдържа 15 или повече изображения. Изображенията могат да се добавят само в потребителски съобщения.

Новини за изкуствения интелект без сензации – подбрани от хора

Абонирайте се за THE DECODER за четене без реклами, седмичен бюлетин за изкуствения интелект, нашия ексклузивен шест пъти годишно доклад за авангардните технологии „AI Radar“, пълен достъп до архива и достъп до секцията за коментари.

Източник: Deepseek

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от The Decoder на

Прочетете оригинала в The Decoder ↗

Текстът и изображенията са собственост на The Decoder и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини