Sakhanda Wire
NVDA $215.08 -0.81% MSFT $483.20 +0.43% GOOGL $345.39 +1.39% META $551.08 +0.96% AMZN $259.42 -0.27%
← К новостям

DeepSeek выпустила экспериментальную Flash vision-модель, соперничающую с Opus 4.8 в бенчмарках для агентов

Deepseek выпускает экспериментальную визуальную модель Flash, сопоставимую с Opus 4.8 в агентских бенчмарках
Маттиас Бастиан
21 авг. 2026
Nano Banana Pro по запросу THE DECODER

Китайская компания в сфере ИИ Deepseek выпустила V4-Flash-Vision-Exp — экспериментальную мультимодальную модель, которая добавляет понимание изображений к текстовым возможностям. В собственных бенчмарках Deepseek модель почти сравнялась с Opus 4.8 в агентских задачах.

Deepseek-V4-Flash-Vision-Exp дополняет Deepseek-V4-Flash обработкой изображений, сохраняя производительность базовой модели в работе с рассуждениями и мировыми знаниями, сообщает Deepseek. Во внутренних мультимодальных бенчмарках компании визуальная версия набирает результаты, близкие к Opus 4.8.

Deepseek ориентируется на визуальные рабочие процессы с агентами

Deepseek позиционирует модель для приложений на основе агентов. Она разработана для работы с различными агентскими фреймворками и сочетания визуального понимания с использованием инструментов. На практике она может описывать изображения, извлекать текст со скриншотов и анализировать диаграммы. Модель поддерживает JPEG, PNG, GIF и WebP, а формат определяет по фактическому содержимому файла, а не по имени файла или указанному MIME-типу, согласно документации API.

После добавления возможностей зрения новая модель Deepseek сравнялась с Opus 4.8 или иногда превзошла его в агентских бенчмарках. | Изображение: DeepseekМодель работает с API Chat Completions и Responses от OpenAI, а также с эндпоинтом Messages от Anthropic. Deepseek также выпустила версию 0.1.1 своего фреймворка Harness, которая поддерживает новую модель «из коробки».

Стоимость и ограничения на изображения

Есть три способа отправить изображения модели. Разработчики могут встроить их напрямую с кодированием Base64, указать общедоступные URL-адреса (до 32 МиБ) или использовать новый бесплатный Files API. Files API позволяет загрузить файл один раз и ссылаться на него по идентификатору в нескольких запросах; ограничение размера составляет 64 МиБ.

Необязательное поле «detail» уменьшает изображения до 512 × 512 пикселей, экономя токены, когда высокая детализация не требуется. Перед обработкой модель автоматически нормализует изображения примерно до 800 × 800 пикселей в зависимости от соотношения сторон. Независимо от исходного разрешения каждое изображение стоит не более 384 токенов. Цены соответствуют тарифам V4-Flash.

Один запрос может содержать до 600 изображений. Максимальная длина стороны составляет 8 192 пикселя, но снижается до 4 096 пикселей, если запрос содержит 15 или более изображений. Изображения можно добавлять только в сообщения пользователя.

Новости ИИ без шумихи — отобраны людьми

Подпишитесь на THE DECODER, чтобы читать материалы без рекламы, получать еженедельную рассылку об ИИ, эксклюзивный передовой отчет «AI Radar» шесть раз в год, полный доступ к архиву и доступ к разделу комментариев.

Источник: Deepseek

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием The Decoder

Читать оригинал на The Decoder ↗

Текст и изображения принадлежат The Decoder и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости