Alibaba Qwen представила Qwen3.8-Omni-Flash: омнімодальну модель із контекстом у 1 млн токенів для агентного розуміння аудіо й відео та роботи з інструментами
Команда Alibaba Qwen випустила Qwen3.8-Omni-Flash. Вони назвали її першою омнімодальною моделлю, створеною навколо агентних можливостей. Вона приймає текст, зображення, аудіо та відео й повертає текст. Розуміння аудіо й відео, міркування та використання інструментів об’єднані в одній моделі. Заявлений робочий процес простий: зрозуміти вміст, спланувати завдання, виконати його за допомогою інструментів і надати результат.
Чи можна її розгорнути? Так, сьогодні — як розміщений API. Вона доступна на QwenCloud, Alibaba Cloud Model Studio і Qwen Studio. На момент запуску відкриті ваги не були представлені, тож самостійне розгортання неможливе.
Що таке Qwen3.8-Omni-Flash
Qwen3.8-Omni-Flash створена на основі архітектури Qwen3.8-Flash-Next. Цю базову модель із відкритими вагами випустили в серпні 2026 року.
Контекстне вікно становить 1 млн токенів. QwenCloud вказує максимум у 991 тис. токенів для введення та 131 тис. для виведення. Максимальна довжина міркування — 262 тис. токенів.
Виведення здійснюється лише у форматі тексту. Документація Model Studio рекомендує розробникам використовувати Qwen3.5-Omni, коли їм потрібне генероване мовлення. Режим міркування ввімкнено за замовчуванням, а reasoning_effort встановлено в xhigh. Встановлення значення none вимикає міркування.
API підтримує протоколи DashScope та OpenAI. Він працює з Chat Completions і Responses API. Підтримуються виклики функцій, вебпошук, структуровані результати, кешування контексту та пакетні виклики.
Агентне сприйняття довгих відео
Більшість відеомоделей читають довгий файл від початку до кінця. Це відбувається навіть тоді, коли відповідь міститься у 3 хвилинах відеозапису.
Дослідницька команда Qwen описує інший підхід. Агент починає із запитання. Він визначає, що саме потрібно переглянути та прослухати. Потім у кілька етапів — від грубого до детального — збирає докази. Обчислювальні ресурси й токени спрямовуються на важливі сегменти.
Дослідницька команда повідомляє про результати на OmniVideoBench. Точність зростає з 63,4 до 67,8. Використання токенів скорочується зі 145 736 до 79 117. Це приблизно на 45,7% менше токенів.
Заявлені результати тестування
Усі наведені тут показники походять від Qwen. На момент публікації незалежних результатів не було.
- У 29 оцінюваннях середній результат покращується більш ніж на 25% порівняно з Qwen3.5-Omni-Plus.
- WildClawBench-MM покращується на 36,5 бала. AgenticVBench покращується на 22,3 бала.
- UniClawBench досягає 69,6.
- LongAudioSpan додає 8,3 бала. OmniVideoBench додає 9,6 бала.
- CSR та ISR в OmniCap-IF покращуються на 8,5 і 14,1 бала.
Дослідницька команда стверджує, що результати в аудіовізуальних завданнях наближаються до Gemini 3.8 Flash. Вона також заявляє, що загальні результати в аудіозавданнях перевищують показники Gemini 3.8 Flash. У дописі в X наведено приріст від агентних можливостей: у середньому +19,5 бала на WildClawBench-MM і UniClawBench.
Зустрічайте Qwen3.8-Omni-Flash — першу омнімодальну модель Qwen, створену навколо агентних можливостей!
— Qwen (@Alibaba_Qwen) 18 вересня 2026 року
Нативне розуміння аудіо й відео, міркування та використання інструментів об’єднані в одній моделі: зрозуміти вміст, спланувати завдання, виконати його за допомогою інструментів і надати результат.
Основні переваги:
-… pic.twitter.com/iJypeohw7y
Ціни та обмеження введення
QwenCloud вказує ціну $0,15 за 1 млн вхідних токенів і $0,47 за 1 млн вихідних токенів. Неявні влучання в кеш коштують $0,016 за 1 млн токенів.
Дослідницька команда повідомляє про значне зниження витрат порівняно з Qwen3.5-Omni-Plus. Вартість аудіовведення за годину зменшилася більш ніж на 98%. Вартість аудіовізуального введення за годину зменшилася більш ніж на 93%. У дописі в X скорочення витрат на відеовведення оцінюється приблизно в 89%.
Основні обмеження з документації Model Studio:
- Відеофайли тривалістю до 2 годин і розміром до 2 ГБ за URL-адресою.
- Аудіофайли тривалістю до 3 годин.
- Аудіовведення 113 мовами та діалектами.
- Стабільні результати для відео, дискретизованого з частотою до 15 кадрів/с.
- Двоканальний стереозвук і чотириканальний просторовий звук FOA через
use_multichannel. - Доступність у 6 регіонах: Пекін, Сінгапур, Гонконг, Токіо, Франкфурт і Вірджинія.
Виклик моделі за допомогою OpenAI SDK займає кілька рядків:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DASHSCOPE_API_KEY"],
base_url=os.environ["DASHSCOPE_BASE_URL"],
)
completion = client.chat.completions.create(
model="qwen3.8-omni-flash",
messages=[{"role": "user", "content": [
{"type": "video_url", "video_url": {"url": os.environ["VIDEO_URL"]}},
{"type": "text", "text": "List the key moments with timestamps."},
]}],
modalities=["text"],
stream=True,
)
for chunk in completion:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="")Інструменти з відкритим кодом: Qwen-MM-Plugins і Qwen-Live Harness
Модель повертає текст, тож роботу з медіа виконують інструменти. Команда Qwen відкриває вихідний код 2 проєктів для їхньої підтримки.
Qwen-MM-Plugins доступний за ліцензією Apache-2.0. Його слоган — «Зробіть будь-який агентний каркас мультимодально-нативним». Кожна можливість встановлюється як Skill із додатковим MCP-сервером. Керований інсталятор підтримує Claude Code, CodeBuddy, Codex, Qoder, OpenClaw, Qwen Code і Gemini CLI.
Омнімодальні можливості відповідають демонстраціям запуску:
omni-memoryстворює аудіовізуальну пам’ять довгого відео.omni-video2noteперетворює навчальне відео на ілюстрований PDF-файл.omni-chatcutохоплює Music-to-MV, коментарі до фільмів і переклад відео зі збереженням голосів мовців.
Плагін core дає змогу основній моделі нативно читати локальні зображення та кадри відео. У README зазначено одне поточне обмеження. Більшість каркасів поки не можуть нативно передавати аудіо основній моделі. Наразі аудіо передається через API.
Інтерактивне пояснення
Основні висновки
- Qwen3.8-Omni-Flash приймає текст, зображення, аудіо та відео й повертає текст.
- Вона пропонує контекст на 1 млн токенів, виклики функцій, вебпошук і ввімкнене за замовчуванням міркування.
- Агентне сприйняття підвищує результат OmniVideoBench з 63,4 до 67,8, використовуючи приблизно на 45,7% менше токенів.
- Ціна QwenCloud становить $0,15 за введення та $0,47 за виведення на 1 млн токенів.
- На момент запуску модель доступна лише через API, а для агентних каркасів пропонуються Qwen-MM-Plugins за ліцензією Apache-2.0.
Ознайомтеся з технічними деталями, сторінкою моделі QwenCloud, документацією API та репозиторієм на GitHub. Уся подяка належить досліднику цього проєкту. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого 150-тисячного ML-сабреддіту та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? Тепер ви також можете приєднатися до нас у Telegram.
Потрібно співпрацювати з нами для просування вашого репозиторію на GitHub, сторінки на Hugging Face, випуску продукту, вебінару тощо? Зв’яжіться з нами
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.
