Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← К новостям

Alibaba Qwen представила Qwen3.8-Omni-Flash: омнимодальную модель с контекстом в 1 млн токенов для агентного понимания аудио и видео и работы с инструментами

Команда Qwen компании Alibaba выпустила Qwen3.8-Omni-Flash. В компании назвали его своей первой омнимодальной моделью, созданной с учетом агентных возможностей. Она принимает текст, изображения, аудио и видео, а возвращает текст. Понимание аудио и видео, рассуждение и использование инструментов объединены в одной модели. Заявленный рабочий процесс прост: понять содержимое, спланировать задачу, выполнить ее с помощью инструментов и предоставить результат.

Можно ли ее развернуть? Да, сегодня — в виде размещаемого API. Модель доступна на платформах QwenCloud, Alibaba Cloud Model Studio и Qwen Studio. При запуске открытые веса не были представлены, поэтому самостоятельное размещение невозможно.

Что такое Qwen3.8-Omni-Flash

Qwen3.8-Omni-Flash создана на основе архитектуры Qwen3.8-Flash-Next. Эта базовая модель с открытыми весами вышла в августе 2026 года.

Размер контекстного окна составляет 1 млн токенов. QwenCloud указывает максимум в 991 тыс. входных и 131 тыс. выходных токенов. Максимальная длина рассуждений — 262 тыс. токенов.

Вывод осуществляется только в текстовом формате. В документации Model Studio разработчикам рекомендуют использовать Qwen3.5-Omni, если им нужна генерация речи. Режим рассуждений включен по умолчанию, а параметр reasoning_effort установлен в xhigh. Установка значения none отключает рассуждения.

API поддерживает протоколы DashScope и OpenAI. Он работает с Chat Completions и Responses API. Поддерживаются вызовы функций, веб-поиск, структурированные выводы, кэширование контекста и пакетные запросы.

Агентное восприятие длинных видео

Большинство видеомоделей просматривают длинный файл от начала до конца. Это происходит даже тогда, когда ответ содержится в трех минутах видеозаписи.

Исследовательская команда Qwen описывает другой подход. Агент начинает с вопроса. Он определяет, что именно нужно посмотреть и услышать. Затем в несколько раундов — от грубого анализа к детальному — собирает доказательства. Вычислительные ресурсы и токены направляются на важные сегменты.

Исследовательская команда сообщает о результатах на OmniVideoBench. Точность повышается с 63,4 до 67,8. Использование токенов сокращается со 145 736 до 79 117. Это примерно на 45,7% меньше токенов.

Заявленные результаты тестирования

Все приведенные здесь показатели получены от Qwen. На момент публикации независимые результаты отсутствовали.

  • В 29 оценках средний результат более чем на 25% выше, чем у Qwen3.5-Omni-Plus.
  • Результат WildClawBench-MM улучшился на 36,5 пункта. Результат AgenticVBench улучшился на 22,3 пункта.
  • UniClawBench достигает 69,6.
  • Показатель LongAudioSpan вырос на 8,3 пункта. Показатель OmniVideoBench вырос на 9,6 пункта.
  • Показатели CSR и ISR на OmniCap-IF улучшились на 8,5 и 14,1 пункта.

Исследовательская команда утверждает, что результаты в области аудиовизуального анализа близки к Gemini 3.8 Flash. Также заявляется, что общие результаты в обработке аудио выше, чем у Gemini 3.8 Flash. В публикации в X представлены агентные улучшения: в среднем +19,5 пункта в WildClawBench-MM и UniClawBench.

Представляем Qwen3.8-Omni-Flash — первую омнимодальную модель Qwen, созданную с учетом агентных возможностей!

Нативное понимание аудио и видео, рассуждение и использование инструментов объединены в одной модели: понять содержимое, спланировать задачу, выполнить ее с помощью инструментов и предоставить результат.

Основные особенности: 🥳
-… pic.twitter.com/iJypeohw7y

— Qwen (@Alibaba_Qwen) 18 сентября 2026 года

Цены и ограничения на входные данные

QwenCloud указывает цену $0,15 за 1 млн входных токенов и $0,47 за 1 млн выходных токенов. Попадания в неявный кэш стоят $0,016 за 1 млн токенов.

Исследовательская команда сообщает о значительном снижении затрат по сравнению с Qwen3.5-Omni-Plus. Стоимость обработки аудиовхода в расчете на час снизилась более чем на 98%. Стоимость аудиовизуального ввода в расчете на час снизилась более чем на 93%. В публикации в X сокращение затрат на обработку видеовхода оценивается примерно в 89%.

Основные ограничения согласно документации Model Studio:

  • Видеофайлы размером до 2 часов и 2 ГБ при передаче по URL.
  • Аудиофайлы длительностью до 3 часов.
  • Аудиовход на 113 языках и диалектах.
  • Стабильные результаты при частоте дискретизации видео до 15 кадров в секунду.
  • Двухканальный стереозвук и четырехканальный пространственный звук FOA через use_multichannel.
  • Доступность в 6 регионах: Пекин, Сингапур, Гонконг, Токио, Франкфурт и Вирджиния.

Для вызова модели с помощью OpenAI SDK достаточно нескольких строк:

Копировать кодСкопированоИспользовать другой браузер
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["DASHSCOPE_API_KEY"],
    base_url=os.environ["DASHSCOPE_BASE_URL"],
)
completion = client.chat.completions.create(
    model="qwen3.8-omni-flash",
    messages=[{"role": "user", "content": [
        {"type": "video_url", "video_url": {"url": os.environ["VIDEO_URL"]}},
        {"type": "text", "text": "List the key moments with timestamps."},
    ]}],
    modalities=["text"],
    stream=True,
)
for chunk in completion:
    if chunk.choices and chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="")

Инструменты с открытым исходным кодом: Qwen-MM-Plugins и Qwen-Live Harness

Модель возвращает текст, поэтому работу с медиа выполняют инструменты. Команда Qwen открывает исходный код двух проектов для их поддержки.

Qwen-MM-Plugins доступен по лицензии Apache-2.0. Его слоган — «Сделайте любой агентский каркас мультимодальным». Каждая возможность устанавливается как Skill с опциональным MCP-сервером. Пошаговый установщик поддерживает Claude Code, CodeBuddy, Codex, Qoder, OpenClaw, Qwen Code и Gemini CLI.

Омнимодальные возможности соответствуют демонстрациям, представленным при запуске:

  • omni-memory создает аудиовизуальную память длинного видео.
  • omni-video2note преобразует обучающее видео в иллюстрированный PDF-файл.
  • omni-chatcut поддерживает Music-to-MV, комментарии к фильмам и перевод видео с сохранением голоса выступающего.

Плагин core позволяет основной модели нативно считывать локальные изображения и кадры видео. В README отмечается один текущий пробел. Большинство каркасов пока не могут нативно передавать аудио основной модели. На данный момент аудио направляется через API.

Интерактивное объяснение

Основные выводы

  • Qwen3.8-Omni-Flash принимает текст, изображения, аудио и видео, а возвращает текст.
  • Модель предлагает контекст размером 1 млн токенов, вызовы функций, веб-поиск и включенные по умолчанию рассуждения.
  • Агентное восприятие повышает результат OmniVideoBench с 63,4 до 67,8 при сокращении числа токенов примерно на 45,7%.
  • Цена QwenCloud составляет $0,15 за входные и $0,47 за выходные 1 млн токенов.
  • На момент запуска модель доступна только через API, а для агентских каркасов предлагаются Qwen-MM-Plugins по лицензии Apache-2.0.

Ознакомьтесь с техническими подробностями, страницей модели QwenCloud, документацией API и репозиторием GitHub. Все заслуги принадлежат исследователю этого проекта. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тысячами участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? теперь вы также можете присоединиться к нам в Telegram.

Хотите сотрудничать с нами для продвижения своего репозитория GitHub, страницы Hugging Face, релиза продукта, вебинара и т. д.? Свяжитесь с нами

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости