DeepSeek випустила експериментальну Flash vision-модель, що конкурує з Opus 4.8 у бенчмарках для агентів
Китайська компанія у сфері ШІ Deepseek випустила V4-Flash-Vision-Exp — експериментальну мультимодальну модель, яка додає розуміння зображень до її текстових можливостей. За власними тестами Deepseek, модель майже відповідає Opus 4.8 у завданнях для агентів.
Deepseek-V4-Flash-Vision-Exp розширює можливості Deepseek-V4-Flash обробкою зображень, зберігаючи продуктивність базової моделі в міркуванні та знаннях про світ, повідомляє Deepseek. За внутрішніми мультимодальними тестами компанії для агентів, варіант із підтримкою зору набирає бали, близькі до Opus 4.8.
Deepseek орієнтується на візуальні робочі процеси агентів
Deepseek позиціонує модель для застосувань на основі агентів. Вона розроблена для роботи з різними фреймворками агентів і поєднання візуального розуміння з використанням інструментів. На практиці вона може описувати зображення, витягувати текст зі скриншотів та аналізувати діаграми. Модель підтримує JPEG, PNG, GIF і WebP та визначає формат за фактичним вмістом файлу, а не за назвою файлу чи вказаним типом MIME, згідно з документацією API.

Після додавання можливостей зору нова модель Deepseek відповідає Opus 4.8 або іноді перевершує її в тестах для агентів. | Зображення: DeepseekМодель працює з API Chat Completions і Responses від OpenAI та кінцевою точкою Messages від Anthropic. Deepseek також випустила версію 0.1.1 свого фреймворку Harness, яка підтримує нову модель одразу після встановлення.
Ціни та обмеження для зображень
Є три способи надсилати зображення моделі. Розробники можуть вбудовувати їх безпосередньо за допомогою кодування Base64, указувати загальнодоступні URL-адреси (до 32 МіБ) або використовувати новий безкоштовний Files API. Files API дає змогу один раз завантажити файл і посилатися на нього за ідентифікатором у кількох запитах; обмеження розміру становить 64 МіБ.
Необов’язкове поле «detail» зменшує розмір зображень до 512 x 512 пікселів, заощаджуючи токени, коли дрібні візуальні деталі не потрібні. Перед обробкою модель автоматично нормалізує зображення приблизно до 800 x 800 пікселів залежно від співвідношення сторін. Незалежно від початкової роздільної здатності, кожне зображення коштує щонайбільше 384 токени. Ціни відповідають тарифам V4-Flash.
Один запит може містити до 600 зображень. Максимальна довжина сторони становить 8 192 пікселі, але зменшується до 4 096 пікселів, якщо запит містить 15 або більше зображень. Зображення можна додавати лише до повідомлень користувача.
Новини ШІ без хайпу — відібрані людьми
Підпишіться на THE DECODER, щоб читати матеріали без реклами, отримувати щотижневу розсилку про ШІ та наш ексклюзивний аналітичний звіт про передові розробки «AI Radar» шість разів на рік, мати повний доступ до архіву та доступ до розділу коментарів.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.