Alibaba Qwen представила Qwen3.8-Omni-Flash: омнимодальную модель с контекстом в 1 млн токенов для агентного понимания аудио и видео и работы с инструментами
Команда Qwen компании Alibaba выпустила Qwen3.8-Omni-Flash. В компании назвали его своей первой омнимодальной моделью, созданной с учетом агентных возможностей. Она принимает текст, изображения, аудио и видео, а возвращает текст. Понимание аудио и видео, рассуждение и использование инструментов объединены в одной модели. Заявленный рабочий процесс прост: понять содержимое, спланировать задачу, выполнить ее с помощью инструментов и предоставить результат.
Можно ли ее развернуть? Да, сегодня — в виде размещаемого API. Модель доступна на платформах QwenCloud, Alibaba Cloud Model Studio и Qwen Studio. При запуске открытые веса не были представлены, поэтому самостоятельное размещение невозможно.
Что такое Qwen3.8-Omni-Flash
Qwen3.8-Omni-Flash создана на основе архитектуры Qwen3.8-Flash-Next. Эта базовая модель с открытыми весами вышла в августе 2026 года.
Размер контекстного окна составляет 1 млн токенов. QwenCloud указывает максимум в 991 тыс. входных и 131 тыс. выходных токенов. Максимальная длина рассуждений — 262 тыс. токенов.
Вывод осуществляется только в текстовом формате. В документации Model Studio разработчикам рекомендуют использовать Qwen3.5-Omni, если им нужна генерация речи. Режим рассуждений включен по умолчанию, а параметр reasoning_effort установлен в xhigh. Установка значения none отключает рассуждения.
API поддерживает протоколы DashScope и OpenAI. Он работает с Chat Completions и Responses API. Поддерживаются вызовы функций, веб-поиск, структурированные выводы, кэширование контекста и пакетные запросы.
Агентное восприятие длинных видео
Большинство видеомоделей просматривают длинный файл от начала до конца. Это происходит даже тогда, когда ответ содержится в трех минутах видеозаписи.
Исследовательская команда Qwen описывает другой подход. Агент начинает с вопроса. Он определяет, что именно нужно посмотреть и услышать. Затем в несколько раундов — от грубого анализа к детальному — собирает доказательства. Вычислительные ресурсы и токены направляются на важные сегменты.
Исследовательская команда сообщает о результатах на OmniVideoBench. Точность повышается с 63,4 до 67,8. Использование токенов сокращается со 145 736 до 79 117. Это примерно на 45,7% меньше токенов.
Заявленные результаты тестирования
Все приведенные здесь показатели получены от Qwen. На момент публикации независимые результаты отсутствовали.
- В 29 оценках средний результат более чем на 25% выше, чем у Qwen3.5-Omni-Plus.
- Результат WildClawBench-MM улучшился на 36,5 пункта. Результат AgenticVBench улучшился на 22,3 пункта.
- UniClawBench достигает 69,6.
- Показатель LongAudioSpan вырос на 8,3 пункта. Показатель OmniVideoBench вырос на 9,6 пункта.
- Показатели CSR и ISR на OmniCap-IF улучшились на 8,5 и 14,1 пункта.
Исследовательская команда утверждает, что результаты в области аудиовизуального анализа близки к Gemini 3.8 Flash. Также заявляется, что общие результаты в обработке аудио выше, чем у Gemini 3.8 Flash. В публикации в X представлены агентные улучшения: в среднем +19,5 пункта в WildClawBench-MM и UniClawBench.
Представляем Qwen3.8-Omni-Flash — первую омнимодальную модель Qwen, созданную с учетом агентных возможностей!
— Qwen (@Alibaba_Qwen) 18 сентября 2026 года
Нативное понимание аудио и видео, рассуждение и использование инструментов объединены в одной модели: понять содержимое, спланировать задачу, выполнить ее с помощью инструментов и предоставить результат.
Основные особенности:
-… pic.twitter.com/iJypeohw7y
Цены и ограничения на входные данные
QwenCloud указывает цену $0,15 за 1 млн входных токенов и $0,47 за 1 млн выходных токенов. Попадания в неявный кэш стоят $0,016 за 1 млн токенов.
Исследовательская команда сообщает о значительном снижении затрат по сравнению с Qwen3.5-Omni-Plus. Стоимость обработки аудиовхода в расчете на час снизилась более чем на 98%. Стоимость аудиовизуального ввода в расчете на час снизилась более чем на 93%. В публикации в X сокращение затрат на обработку видеовхода оценивается примерно в 89%.
Основные ограничения согласно документации Model Studio:
- Видеофайлы размером до 2 часов и 2 ГБ при передаче по URL.
- Аудиофайлы длительностью до 3 часов.
- Аудиовход на 113 языках и диалектах.
- Стабильные результаты при частоте дискретизации видео до 15 кадров в секунду.
- Двухканальный стереозвук и четырехканальный пространственный звук FOA через
use_multichannel. - Доступность в 6 регионах: Пекин, Сингапур, Гонконг, Токио, Франкфурт и Вирджиния.
Для вызова модели с помощью OpenAI SDK достаточно нескольких строк:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DASHSCOPE_API_KEY"],
base_url=os.environ["DASHSCOPE_BASE_URL"],
)
completion = client.chat.completions.create(
model="qwen3.8-omni-flash",
messages=[{"role": "user", "content": [
{"type": "video_url", "video_url": {"url": os.environ["VIDEO_URL"]}},
{"type": "text", "text": "List the key moments with timestamps."},
]}],
modalities=["text"],
stream=True,
)
for chunk in completion:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="")Инструменты с открытым исходным кодом: Qwen-MM-Plugins и Qwen-Live Harness
Модель возвращает текст, поэтому работу с медиа выполняют инструменты. Команда Qwen открывает исходный код двух проектов для их поддержки.
Qwen-MM-Plugins доступен по лицензии Apache-2.0. Его слоган — «Сделайте любой агентский каркас мультимодальным». Каждая возможность устанавливается как Skill с опциональным MCP-сервером. Пошаговый установщик поддерживает Claude Code, CodeBuddy, Codex, Qoder, OpenClaw, Qwen Code и Gemini CLI.
Омнимодальные возможности соответствуют демонстрациям, представленным при запуске:
omni-memoryсоздает аудиовизуальную память длинного видео.omni-video2noteпреобразует обучающее видео в иллюстрированный PDF-файл.omni-chatcutподдерживает Music-to-MV, комментарии к фильмам и перевод видео с сохранением голоса выступающего.
Плагин core позволяет основной модели нативно считывать локальные изображения и кадры видео. В README отмечается один текущий пробел. Большинство каркасов пока не могут нативно передавать аудио основной модели. На данный момент аудио направляется через API.
Интерактивное объяснение
Основные выводы
- Qwen3.8-Omni-Flash принимает текст, изображения, аудио и видео, а возвращает текст.
- Модель предлагает контекст размером 1 млн токенов, вызовы функций, веб-поиск и включенные по умолчанию рассуждения.
- Агентное восприятие повышает результат OmniVideoBench с 63,4 до 67,8 при сокращении числа токенов примерно на 45,7%.
- Цена QwenCloud составляет $0,15 за входные и $0,47 за выходные 1 млн токенов.
- На момент запуска модель доступна только через API, а для агентских каркасов предлагаются Qwen-MM-Plugins по лицензии Apache-2.0.
Ознакомьтесь с техническими подробностями, страницей модели QwenCloud, документацией API и репозиторием GitHub. Все заслуги принадлежат исследователю этого проекта. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тысячами участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? теперь вы также можете присоединиться к нам в Telegram.
Хотите сотрудничать с нами для продвижения своего репозитория GitHub, страницы Hugging Face, релиза продукта, вебинара и т. д.? Свяжитесь с нами
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.
