DeepSeek выпустила экспериментальную Flash vision-модель, соперничающую с Opus 4.8 в бенчмарках для агентов
Китайская компания в сфере ИИ Deepseek выпустила V4-Flash-Vision-Exp — экспериментальную мультимодальную модель, которая добавляет понимание изображений к текстовым возможностям. В собственных бенчмарках Deepseek модель почти сравнялась с Opus 4.8 в агентских задачах.
Deepseek-V4-Flash-Vision-Exp дополняет Deepseek-V4-Flash обработкой изображений, сохраняя производительность базовой модели в работе с рассуждениями и мировыми знаниями, сообщает Deepseek. Во внутренних мультимодальных бенчмарках компании визуальная версия набирает результаты, близкие к Opus 4.8.
Deepseek ориентируется на визуальные рабочие процессы с агентами
Deepseek позиционирует модель для приложений на основе агентов. Она разработана для работы с различными агентскими фреймворками и сочетания визуального понимания с использованием инструментов. На практике она может описывать изображения, извлекать текст со скриншотов и анализировать диаграммы. Модель поддерживает JPEG, PNG, GIF и WebP, а формат определяет по фактическому содержимому файла, а не по имени файла или указанному MIME-типу, согласно документации API.

После добавления возможностей зрения новая модель Deepseek сравнялась с Opus 4.8 или иногда превзошла его в агентских бенчмарках. | Изображение: DeepseekМодель работает с API Chat Completions и Responses от OpenAI, а также с эндпоинтом Messages от Anthropic. Deepseek также выпустила версию 0.1.1 своего фреймворка Harness, которая поддерживает новую модель «из коробки».
Стоимость и ограничения на изображения
Есть три способа отправить изображения модели. Разработчики могут встроить их напрямую с кодированием Base64, указать общедоступные URL-адреса (до 32 МиБ) или использовать новый бесплатный Files API. Files API позволяет загрузить файл один раз и ссылаться на него по идентификатору в нескольких запросах; ограничение размера составляет 64 МиБ.
Необязательное поле «detail» уменьшает изображения до 512 × 512 пикселей, экономя токены, когда высокая детализация не требуется. Перед обработкой модель автоматически нормализует изображения примерно до 800 × 800 пикселей в зависимости от соотношения сторон. Независимо от исходного разрешения каждое изображение стоит не более 384 токенов. Цены соответствуют тарифам V4-Flash.
Один запрос может содержать до 600 изображений. Максимальная длина стороны составляет 8 192 пикселя, но снижается до 4 096 пикселей, если запрос содержит 15 или более изображений. Изображения можно добавлять только в сообщения пользователя.
Новости ИИ без шумихи — отобраны людьми
Подпишитесь на THE DECODER, чтобы читать материалы без рекламы, получать еженедельную рассылку об ИИ, эксклюзивный передовой отчет «AI Radar» шесть раз в год, полный доступ к архиву и доступ к разделу комментариев.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.