Alibaba Qwen представи Qwen3.8-Omni-Flash: омнимодален модел с контекст от 1 млн. токена, създаден за агентно разбиране на аудио и видео и използване на инструменти
Екипът на Alibaba Qwen представи Qwen3.8-Omni-Flash. Те го нарекоха първия си омни-модален модел, изграден около агентски възможности. Той приема текст, изображения, аудио и видео и връща текст. Разбирането на аудио и видео, разсъждението и използването на инструменти са обединени в един модел. Заявеният работен процес е прост: разбиране на съдържанието, планиране на задачата, изпълнение с инструменти, предоставяне на резултата.
Може ли да бъде внедрен? Да, днес като хостван API. Той е достъпен в QwenCloud, Alibaba Cloud Model Studio и Qwen Studio. При стартирането не бяха обявени отворени тегла, така че самостоятелното хостване не е възможно.
Какво представлява Qwen3.8-Omni-Flash
Qwen3.8-Omni-Flash е изграден върху архитектурата Qwen3.8-Flash-Next. Този базов модел беше пуснат с отворени тегла през август 2026 г.
Контекстовият прозорец е 1 млн. токена. QwenCloud посочва максимум от 991 хил. входни и 131 хил. изходни токена. Максималната дължина на разсъждението е 262 хил. токена.
Изходът е само текст. Документацията на Model Studio насочва разработчиците към Qwen3.5-Omni, когато им е необходим генериран говор. Режимът на мислене е включен по подразбиране, като reasoning_effort е зададен на xhigh. Задаването му на none изключва мисленето.
API следва както протоколите DashScope, така и OpenAI. Работи с Chat Completions и Responses API. Поддържат се извикване на функции, уеб търсене, структурирани изходи, кеширане на контекста и пакетни заявки.
Агентско възприемане на дълги видеоклипове
Повечето видео модели прочитат дълъг файл от началото до края. Това се случва дори когато отговорът се съдържа в 3 минути от записа.
Изследователският екип на Qwen описва различен подход. Агентът започва с въпроса. Той решава какво да гледа и слуша. След това събира доказателства в няколко итерации от груби към прецизни. Изчислителните ресурси и токените се насочват към важните сегменти.
Изследователският екип отчита резултата в OmniVideoBench. Точността се повишава от 63.4 на 67.8. Използването на токени намалява от 145 736 на 79 117. Това е с около 45.7% по-малко токени.
Отчетени резултати от бенчмаркове
Всички посочени тук стойности са предоставени от Qwen. Към момента на публикацията нямаше независими резултати.
- При 29 оценки средният резултат се подобрява с повече от 25% спрямо Qwen3.5-Omni-Plus.
- WildClawBench-MM се подобрява с 36.5 пункта. AgenticVBench се подобрява с 22.3 пункта.
- UniClawBench достига 69.6.
- LongAudioSpan печели 8.3 пункта. OmniVideoBench печели 9.6 пункта.
- OmniCap-IF CSR и ISR се подобряват съответно с 8.5 и 14.1 пункта.
Изследователският екип заявява, че аудио-визуалната производителност е близка до тази на Gemini 3.8 Flash. Той също така твърди, че общата аудио производителност е по-висока от тази на Gemini 3.8 Flash. Публикацията в X обобщава агентските подобрения като +19.5 пункта средно в WildClawBench-MM и UniClawBench.
Представяме Qwen3.8-Omni-Flash, първия омни-модален модел на Qwen, изграден около агентски възможности!
— Qwen (@Alibaba_Qwen) 18 септември 2026 г.
Вроденото разбиране на аудио и видео, разсъждението и използването на инструменти са обединени в един модел: разбиране на съдържанието, планиране на задачата, изпълнение с инструменти и предоставяне на резултата.
Акценти:
-… pic.twitter.com/iJypeohw7y
Цени и ограничения за входа
QwenCloud посочва цена от 0.15 щ.д. за 1 млн. входни токена и 0.47 щ.д. за 1 млн. изходни токена. Неявните попадения в кеша струват 0.016 щ.д. за 1 млн. токена.
Изследователският екип отчита значително намаляване на разходите спрямо Qwen3.5-Omni-Plus. Входът за аудио струва над 98% по-малко на час. Аудио-визуалният вход струва над 93% по-малко на час. Публикацията в X посочва намаление на разходите за видео входа с около 89%.
Основни ограничения според документацията на Model Studio:
- Видео файлове с продължителност до 2 часа и размер до 2 GB чрез URL.
- Аудио файлове с продължителност до 3 часа.
- Аудио вход на 113 езика и диалекта.
- Стабилни резултати при видео, семплирано с до 15 кадъра в секунда.
- Двуканален стерео и четириканален пространствен звук FOA чрез
use_multichannel. - Достъпност в 6 региона: Пекин, Сингапур, Хонконг, Токио, Франкфурт и Вирджиния.
Извикването му изисква само няколко реда с OpenAI SDK:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DASHSCOPE_API_KEY"],
base_url=os.environ["DASHSCOPE_BASE_URL"],
)
completion = client.chat.completions.create(
model="qwen3.8-omni-flash",
messages=[{"role": "user", "content": [
{"type": "video_url", "video_url": {"url": os.environ["VIDEO_URL"]}},
{"type": "text", "text": "List the key moments with timestamps."},
]}],
modalities=["text"],
stream=True,
)
for chunk in completion:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="")Инструменти с отворен код: Qwen-MM-Plugins и Qwen-Live Harness
Моделът връща текст, така че инструментите се занимават с медийната обработка. Екипът на Qwen публикува с отворен код 2 проекта в подкрепа на това.
Qwen-MM-Plugins е достъпен под лиценза Apache-2.0. Мотото му е „Направете всеки агентски хъс мултимодален по природа.“ Всяка възможност се инсталира като Skill с опционален MCP сървър. Асистираният инсталатор поддържа Claude Code, CodeBuddy, Codex, Qoder, OpenClaw, Qwen Code и Gemini CLI.
Омни възможностите съответстват на демонстрациите при стартирането:
omni-memoryизгражда аудио-визуална памет на дълъг видеоклип.omni-video2noteпревръща обучителен видеоклип в илюстриран PDF.omni-chatcutобхваща Music-to-MV, коментари към филми и превод на видео със запазване на говорещия.
Плъгинът core позволява на основния модел да чете локални изображения и видео кадри по естествен начин. В README се посочва едно текущо ограничение. Повечето хъсове все още не могат да подават аудио към основния модел по естествен начин. Засега аудиото се маршрутизира през API.
Интерактивно обяснение
Основни изводи
- Qwen3.8-Omni-Flash приема текст, изображения, аудио и видео и връща текст.
- Той предлага контекст от 1 млн. токена, извикване на функции, уеб търсене и включено по подразбиране мислене.
- Агентското възприемане повишава резултата в OmniVideoBench от 63.4 на 67.8 с около 45.7% по-малко токени.
- Цената в QwenCloud е 0.15 щ.д. за вход и 0.47 щ.д. за изход на 1 млн. токена.
- При стартирането е достъпен само чрез API, с Qwen-MM-Plugins под Apache-2.0 за агентски хъсове.
Разгледайте техническите подробности, страницата на модела в QwenCloud, API документацията и хранилището в GitHub. Всички заслуги са за изследователя на този проект. Също така, можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия ML SubReddit с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? вече можете да се присъедините към нас и там.
Имате нужда от партньорство с нас за популяризиране на вашето GitHub хранилище, Hugging Face страница, продуктово представяне, уебинар и т.н.? Свържете се с нас
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.
