Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← К новостям

Alibaba Qwen выпустила Qwen-Audio-3.1-Realtime: полнодуплексную голосовую модель, обученную думать, действовать и решать, когда говорить

Команда Qwen компании Alibaba выпустила Qwen-Audio-3.1 — стек из 5 аудиомоделей для ASR, TTS и взаимодействия в реальном времени. Основная модель — Qwen-Audio-3.1-Realtime, речевая модель с полнодуплексным режимом, созданная для голосовых агентов, вызывающих инструменты. Qwen также снизила цены: примерно на 85% для Realtime, примерно на 70% для TTS и до 95% для ASR.

Можно ли развернуть модель? Да, в виде управляемого API. qwen-audio-3.1-realtime-plus доступна в QwenCloud через WebSocket. Открытые веса не выпускались.

Что доступно в QwenCloud

На странице модели указано, что и текст, и аудио поддерживаются в качестве входных и выходных данных. Контекст составляет 262K токенов, максимальный объём входных данных — 245K, выходных — 16K. Лимиты по умолчанию составляют 60 запросов и 100K токенов в минуту. Стоимость — $6.4 за 1 млн токенов аудио на входе и $0.8 за 1 млн текстовых токенов на входе. Выходные текст и аудио стоят $24 за 1 млн токенов, при этом текстовый вывод не тарифицируется. Ключевые функции включают вызов функций, веб-поиск, структурированные ответы, кэширование контекста и дообучение.

Сопутствующая модель, Qwen-Audio-3.1-ASR-Flash-Filetrans, предназначена для офлайн-транскрибации длинных аудиозаписей. Она поддерживает ключевые слова, разделение говорящих, расстановку знаков препинания, многоязычное распознавание и распознавание китайских диалектов. Стоимость составляет $0.15 за входные и $0.47 за выходные данные на 1 млн токенов.

Архитектура: 2 модели для 1 голоса

Система работает на базе 2 моделей с единым аудиоэнкодером и архитектурой LLM. Модель принятия решений в полнодуплексном режиме прогнозирует, продолжать ли слушать, говорить, остановиться или возобновить речь. Модель преобразования речи в текст записывает содержание ответа в виде текста. Затем контекстно-зависимый голосовой рендерер превращает этот текст в потоковую речь. Он учитывает историю разговора, голосовые сигналы и акустический контекст.

Обучение организовано в 3 слоя: Think, Act и Speak and Coordinate.

Think: M²-OPD

Core-Cocktail SFT заново привязывает аудиомодель к исходной текстовой LLM с помощью парных данных масштаба в миллион часов. Затем применяется мультимодальный OPD. Текстовый учитель и замороженный аудиореференс оценивают каждый токен собственной траектории ученика. Это дистилляция на основе собственной политики, а не имитация заранее написанных ответов. Затем с помощью GRPO обучаются доменные эксперты по эмпатии, прагматическим намерениям и акустическим сценам. Multi-Teacher OPD объединяет их в 1 модель, готовую к развертыванию.

Act: исполняемые среды

Каждый обучающий домен объединяет набор инструментов, базу данных JSON с состоянием и бизнес-политику на естественном языке. Домены создаются на основе определений инструментов и MCP-серверов с открытым исходным кодом. Каждая задача предусматривает 1 из 3 результатов: запись, обоснованный отказ или неподдерживаемый запрос. Оценка проверяет конечное состояние, затем разрешённые записи, а после этого — поведенческие утверждения. Беглый ответ не может компенсировать провал проверки состояния.

GRPO получает вознаграждения на уровне диалога, этапа и хода. Обучение поиску штрафует избыточные запросы с помощью . Среднее число запросов на один поисковый вызов снизилось с 4.37 до 1.05. Показатель F1 для срабатываний снизился с 60.87% до 58.61%.

Speak and Coordinate

Этот слой решает, говорить ли, когда и каким образом. На Full-Duplex-Bench v1.5 доля ответов людям, разговаривающим с кем-то другим, снизилась с 0.13 до 0.03. В версии v3.0 доля заполнителей снизилась с 0.7590 до 0.2960. Однако есть компромиссы. После прерываний доля нежелательных возобновлений речи выросла с 0.035 до 0.130. Задержка остановки после прерывания составляет 1.116 секунды против 0.383 у GPT-Realtime-2.

Интерактивное объяснение

Изучите цикл Think, Act, Speak, решения в дуплексном режиме, оцениваемый обучающий эпизод и вознаграждение за поиск.

Бенчмарки вкратце

По сравнению с версией 3.0 показатель Audio MultiChallenge вырос с 47.12 до 52.21. Среднее значение BBA для 14 языков увеличилось с 81.7% до 88.1%. WER на FLEURS снизился с 9.01 до 3.98. Показатели τ-Voice получены с использованием адаптации преобразования речи в текст в полудуплексном режиме. Их нельзя сравнивать с официальными результатами для полнодуплексного режима. GPT-Realtime-2 по-прежнему лидирует в исследовании с участием людей и 50 сессий красной команды: 96.00% против 92.00%.

Сравнение

ФункцияQwen-Audio-3.1-Realtime-PlusOpenAI GPT-Realtime-2Google Gemini 3.8 Live
Входные данныеТекст, аудиоТекст, аудио, изображениеТекст, изображения, аудио, видео
Выходные данныеТекст, аудиоТекст, аудиоТекст и аудио
Контекст / лимит входных данных262K128K131,072
Максимальный объём выходных данных16K32K65,536
Вызов функцийДаДаДа (по умолчанию асинхронный)
Встроенный веб-поискДаНе указанПоиск Google
РассуждениеРежим рассуждения, максимум 2K токенов на рассуждениеНастраиваемая интенсивностьИнтерливинг рассуждений
Входное аудио / 1 млн токенов$6.4$32$3.00
Выходное аудио / 1 млн токенов$24 (текст и аудио)$64$12.00
Открытые весаНетНетНет
ИсточникQwenCloudдокументация OpenAIстраница модели, цены

Указаны стандартные цены, проверенные 28 сентября 2026 года. Тарифы за токены нельзя напрямую сравнивать, поскольку каждый провайдер по-разному токенизирует аудио.

Основные выводы

  • Успешность выполнения задач в адаптации τ-Voice выросла с 78.4% до 82.0% по сравнению с версией 3.0.
  • Доля ответов на фоновую речь снизилась с 73.0% до 13.0% на Full-Duplex-Bench v1.5.
  • Контекст 262K, вызов функций и веб-поиск по цене $6.4 за 1 млн входных аудиотокенов.
  • Использование инструментов обучается с помощью GRPO внутри саморазвивающихся исполняемых сред.
  • Успешность многоходовых атак снижается до 26.0% (китайский язык) и 23.5% (английский язык).

Часто задаваемые вопросы

  • Что такое Qwen-Audio-3.1-Realtime? Полнодуплексная речевая модель от команды Qwen компании Alibaba для голосовых агентов, которые рассуждают, вызывают инструменты и управляют сменой говорящих.
  • Можно ли разместить её на собственных серверах? Открытые веса не выпускались. Доступ предоставляется через API QwenCloud как qwen-audio-3.1-realtime-plus.
  • Сколько это стоит? $6.4 за 1 млн входных аудиотокенов и $24 за 1 млн выходных токенов для текста и аудио.

Ознакомьтесь с исследованием, Qwen-Audio-3.1-ASR и Qwen-Audio-3.1-Realtime. Вся благодарность принадлежит исследователю этого проекта. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тыс. участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? теперь вы также можете присоединиться к нам в Telegram.

Хотите сотрудничать с нами для продвижения своего репозитория GitHub, страницы на Hugging Face, выпуска продукта, вебинара и т. д.? Свяжитесь с нами

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости