Sakhanda Wire
NVDA $215.08 -0.81% MSFT $483.20 +0.43% GOOGL $345.39 +1.39% META $551.08 +0.96% AMZN $259.42 -0.27%
← До новин

DeepSeek випустила експериментальну Flash vision-модель, що конкурує з Opus 4.8 у бенчмарках для агентів

Deepseek випустила експериментальну мультимодальну модель Flash Vision, яка конкурує з Opus 4.8 у тестах для агентів
Маттіас Бастіан
21 серпня 2026
Nano Banana Pro за запитом THE DECODER

Китайська компанія у сфері ШІ Deepseek випустила V4-Flash-Vision-Exp — експериментальну мультимодальну модель, яка додає розуміння зображень до її текстових можливостей. За власними тестами Deepseek, модель майже відповідає Opus 4.8 у завданнях для агентів.

Deepseek-V4-Flash-Vision-Exp розширює можливості Deepseek-V4-Flash обробкою зображень, зберігаючи продуктивність базової моделі в міркуванні та знаннях про світ, повідомляє Deepseek. За внутрішніми мультимодальними тестами компанії для агентів, варіант із підтримкою зору набирає бали, близькі до Opus 4.8.

Deepseek орієнтується на візуальні робочі процеси агентів

Deepseek позиціонує модель для застосувань на основі агентів. Вона розроблена для роботи з різними фреймворками агентів і поєднання візуального розуміння з використанням інструментів. На практиці вона може описувати зображення, витягувати текст зі скриншотів та аналізувати діаграми. Модель підтримує JPEG, PNG, GIF і WebP та визначає формат за фактичним вмістом файлу, а не за назвою файлу чи вказаним типом MIME, згідно з документацією API.

Після додавання можливостей зору нова модель Deepseek відповідає Opus 4.8 або іноді перевершує її в тестах для агентів. | Зображення: DeepseekМодель працює з API Chat Completions і Responses від OpenAI та кінцевою точкою Messages від Anthropic. Deepseek також випустила версію 0.1.1 свого фреймворку Harness, яка підтримує нову модель одразу після встановлення.

Ціни та обмеження для зображень

Є три способи надсилати зображення моделі. Розробники можуть вбудовувати їх безпосередньо за допомогою кодування Base64, указувати загальнодоступні URL-адреси (до 32 МіБ) або використовувати новий безкоштовний Files API. Files API дає змогу один раз завантажити файл і посилатися на нього за ідентифікатором у кількох запитах; обмеження розміру становить 64 МіБ.

Необов’язкове поле «detail» зменшує розмір зображень до 512 x 512 пікселів, заощаджуючи токени, коли дрібні візуальні деталі не потрібні. Перед обробкою модель автоматично нормалізує зображення приблизно до 800 x 800 пікселів залежно від співвідношення сторін. Незалежно від початкової роздільної здатності, кожне зображення коштує щонайбільше 384 токени. Ціни відповідають тарифам V4-Flash.

Один запит може містити до 600 зображень. Максимальна довжина сторони становить 8 192 пікселі, але зменшується до 4 096 пікселів, якщо запит містить 15 або більше зображень. Зображення можна додавати лише до повідомлень користувача.

Новини ШІ без хайпу — відібрані людьми

Підпишіться на THE DECODER, щоб читати матеріали без реклами, отримувати щотижневу розсилку про ШІ та наш ексклюзивний аналітичний звіт про передові розробки «AI Radar» шість разів на рік, мати повний доступ до архіву та доступ до розділу коментарів.

Джерело: Deepseek

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням The Decoder

Читати оригінал на The Decoder ↗

Текст і зображення належать The Decoder і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини