Alibaba Qwen выпустила Qwen-Audio-3.1-Realtime: полнодуплексную голосовую модель, обученную думать, действовать и решать, когда говорить
Команда Qwen компании Alibaba выпустила Qwen-Audio-3.1 — стек из 5 аудиомоделей для ASR, TTS и взаимодействия в реальном времени. Основная модель — Qwen-Audio-3.1-Realtime, речевая модель с полнодуплексным режимом, созданная для голосовых агентов, вызывающих инструменты. Qwen также снизила цены: примерно на 85% для Realtime, примерно на 70% для TTS и до 95% для ASR.
Можно ли развернуть модель? Да, в виде управляемого API. qwen-audio-3.1-realtime-plus доступна в QwenCloud через WebSocket. Открытые веса не выпускались.
Что доступно в QwenCloud
На странице модели указано, что и текст, и аудио поддерживаются в качестве входных и выходных данных. Контекст составляет 262K токенов, максимальный объём входных данных — 245K, выходных — 16K. Лимиты по умолчанию составляют 60 запросов и 100K токенов в минуту. Стоимость — $6.4 за 1 млн токенов аудио на входе и $0.8 за 1 млн текстовых токенов на входе. Выходные текст и аудио стоят $24 за 1 млн токенов, при этом текстовый вывод не тарифицируется. Ключевые функции включают вызов функций, веб-поиск, структурированные ответы, кэширование контекста и дообучение.
Сопутствующая модель, Qwen-Audio-3.1-ASR-Flash-Filetrans, предназначена для офлайн-транскрибации длинных аудиозаписей. Она поддерживает ключевые слова, разделение говорящих, расстановку знаков препинания, многоязычное распознавание и распознавание китайских диалектов. Стоимость составляет $0.15 за входные и $0.47 за выходные данные на 1 млн токенов.
Архитектура: 2 модели для 1 голоса
Система работает на базе 2 моделей с единым аудиоэнкодером и архитектурой LLM. Модель принятия решений в полнодуплексном режиме прогнозирует, продолжать ли слушать, говорить, остановиться или возобновить речь. Модель преобразования речи в текст записывает содержание ответа в виде текста. Затем контекстно-зависимый голосовой рендерер превращает этот текст в потоковую речь. Он учитывает историю разговора, голосовые сигналы и акустический контекст.
Обучение организовано в 3 слоя: Think, Act и Speak and Coordinate.
Think: M²-OPD
Core-Cocktail SFT заново привязывает аудиомодель к исходной текстовой LLM с помощью парных данных масштаба в миллион часов. Затем применяется мультимодальный OPD. Текстовый учитель и замороженный аудиореференс оценивают каждый токен собственной траектории ученика. Это дистилляция на основе собственной политики, а не имитация заранее написанных ответов. Затем с помощью GRPO обучаются доменные эксперты по эмпатии, прагматическим намерениям и акустическим сценам. Multi-Teacher OPD объединяет их в 1 модель, готовую к развертыванию.
Act: исполняемые среды
Каждый обучающий домен объединяет набор инструментов, базу данных JSON с состоянием и бизнес-политику на естественном языке. Домены создаются на основе определений инструментов и MCP-серверов с открытым исходным кодом. Каждая задача предусматривает 1 из 3 результатов: запись, обоснованный отказ или неподдерживаемый запрос. Оценка проверяет конечное состояние, затем разрешённые записи, а после этого — поведенческие утверждения. Беглый ответ не может компенсировать провал проверки состояния.
GRPO получает вознаграждения на уровне диалога, этапа и хода. Обучение поиску штрафует избыточные запросы с помощью . Среднее число запросов на один поисковый вызов снизилось с 4.37 до 1.05. Показатель F1 для срабатываний снизился с 60.87% до 58.61%.
Speak and Coordinate
Этот слой решает, говорить ли, когда и каким образом. На Full-Duplex-Bench v1.5 доля ответов людям, разговаривающим с кем-то другим, снизилась с 0.13 до 0.03. В версии v3.0 доля заполнителей снизилась с 0.7590 до 0.2960. Однако есть компромиссы. После прерываний доля нежелательных возобновлений речи выросла с 0.035 до 0.130. Задержка остановки после прерывания составляет 1.116 секунды против 0.383 у GPT-Realtime-2.
Интерактивное объяснение
Изучите цикл Think, Act, Speak, решения в дуплексном режиме, оцениваемый обучающий эпизод и вознаграждение за поиск.
Бенчмарки вкратце
По сравнению с версией 3.0 показатель Audio MultiChallenge вырос с 47.12 до 52.21. Среднее значение BBA для 14 языков увеличилось с 81.7% до 88.1%. WER на FLEURS снизился с 9.01 до 3.98. Показатели τ-Voice получены с использованием адаптации преобразования речи в текст в полудуплексном режиме. Их нельзя сравнивать с официальными результатами для полнодуплексного режима. GPT-Realtime-2 по-прежнему лидирует в исследовании с участием людей и 50 сессий красной команды: 96.00% против 92.00%.
Сравнение
| Функция | Qwen-Audio-3.1-Realtime-Plus | OpenAI GPT-Realtime-2 | Google Gemini 3.8 Live |
|---|---|---|---|
| Входные данные | Текст, аудио | Текст, аудио, изображение | Текст, изображения, аудио, видео |
| Выходные данные | Текст, аудио | Текст, аудио | Текст и аудио |
| Контекст / лимит входных данных | 262K | 128K | 131,072 |
| Максимальный объём выходных данных | 16K | 32K | 65,536 |
| Вызов функций | Да | Да | Да (по умолчанию асинхронный) |
| Встроенный веб-поиск | Да | Не указан | Поиск Google |
| Рассуждение | Режим рассуждения, максимум 2K токенов на рассуждение | Настраиваемая интенсивность | Интерливинг рассуждений |
| Входное аудио / 1 млн токенов | $6.4 | $32 | $3.00 |
| Выходное аудио / 1 млн токенов | $24 (текст и аудио) | $64 | $12.00 |
| Открытые веса | Нет | Нет | Нет |
| Источник | QwenCloud | документация OpenAI | страница модели, цены |
Указаны стандартные цены, проверенные 28 сентября 2026 года. Тарифы за токены нельзя напрямую сравнивать, поскольку каждый провайдер по-разному токенизирует аудио.
Основные выводы
- Успешность выполнения задач в адаптации τ-Voice выросла с 78.4% до 82.0% по сравнению с версией 3.0.
- Доля ответов на фоновую речь снизилась с 73.0% до 13.0% на Full-Duplex-Bench v1.5.
- Контекст 262K, вызов функций и веб-поиск по цене $6.4 за 1 млн входных аудиотокенов.
- Использование инструментов обучается с помощью GRPO внутри саморазвивающихся исполняемых сред.
- Успешность многоходовых атак снижается до 26.0% (китайский язык) и 23.5% (английский язык).
Часто задаваемые вопросы
- Что такое Qwen-Audio-3.1-Realtime? Полнодуплексная речевая модель от команды Qwen компании Alibaba для голосовых агентов, которые рассуждают, вызывают инструменты и управляют сменой говорящих.
- Можно ли разместить её на собственных серверах? Открытые веса не выпускались. Доступ предоставляется через API QwenCloud как
qwen-audio-3.1-realtime-plus. - Сколько это стоит? $6.4 за 1 млн входных аудиотокенов и $24 за 1 млн выходных токенов для текста и аудио.
Ознакомьтесь с исследованием, Qwen-Audio-3.1-ASR и Qwen-Audio-3.1-Realtime. Вся благодарность принадлежит исследователю этого проекта. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тыс. участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? теперь вы также можете присоединиться к нам в Telegram.
Хотите сотрудничать с нами для продвижения своего репозитория GitHub, страницы на Hugging Face, выпуска продукта, вебинара и т. д.? Свяжитесь с нами
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.