Alibaba Qwen представила Qwen-Audio-3.1-Realtime: повнодуплексну голосову модель, навчену думати, діяти й вирішувати, коли говорити
Команда Qwen компанії Alibaba випустила Qwen-Audio-3.1 — стек із 5 аудіомоделей, що охоплює ASR, TTS і взаємодію в реальному часі. Основна модель — Qwen-Audio-3.1-Realtime, повнодуплексна мовна модель для голосових агентів, які викликають інструменти. Qwen також знизила ціни: приблизно на 85% для Realtime, приблизно на 70% для TTS і до 95% для ASR.
Чи придатна вона для розгортання? Так, як керований API. qwen-audio-3.1-realtime-plus доступна на QwenCloud через WebSocket. Про відкриті ваги не повідомлялося.
Що доступно на QwenCloud
На сторінці моделі зазначено, що текст і аудіо є як вхідними, так і вихідними даними. Контекст становить 262K токенів, із максимальним обсягом вхідних даних 245K і вихідних даних 16K. Типові ліміти — 60 запитів і 100K токенів на хвилину. Ціна становить $6.4 за 1 млн аудіовхідних токенів і $0.8 за 1 млн текстових вхідних токенів. Вихідні текст і аудіо коштують $24 за 1 млн токенів, при цьому вихідний текст не тарифікується. Серед ключових функцій — виклик функцій, вебпошук, структуровані результати, кешування контексту та донавчання.
Супутня модель, Qwen-Audio-3.1-ASR-Flash-Filetrans, призначена для офлайн-транскрибування довгих аудіозаписів. Вона підтримує ключові слова, розділення мовців, пунктуацію, а також багатомовне розпізнавання й розпізнавання китайських діалектів. Вартість становить $0.15 за вхідні та $0.47 за вихідні дані на 1 млн токенів.
Архітектура: 2 моделі за 1 голосом
Система працює на 2 моделях з однаковими аудіокодером і архітектурою LLM. Повнодуплексна модель прийняття рішень прогнозує, чи продовжувати слухати, говорити, зупинитися або відновити розмову. Модель перетворення мовлення на текст записує зміст відповіді у вигляді тексту. Потім контекстно-залежний голосовий рендерер перетворює цей текст на потокове мовлення. Він враховує історію розмови, голосові сигнали та акустичний контекст.
Навчання організовано на 3 рівнях: Think, Act і Speak and Coordinate.
Think: M²-OPD
Core-Cocktail SFT повторно прив’язує аудіомодель до її вихідної текстової LLM за допомогою парних даних масштабу мільйонів годин. Далі застосовується мультимодальний OPD. Текстовий учитель і заморожений аудіореферент оцінюють кожен токен власної траєкторії учня. Це дистиляція на основі власної політики, а не імітація заздалегідь написаних відповідей. Потім за допомогою GRPO навчаються доменні експерти з емпатії, прагматичного наміру та акустичних сцен. Multi-Teacher OPD об’єднує їх в 1 модель, придатну для розгортання.
Act: Виконувані середовища
Кожен навчальний домен об’єднує пул інструментів, базу даних JSON зі збереженням стану та бізнес-політику природною мовою. Домени створюються на основі визначень інструментів і MCP-серверів із відкритим кодом. Кожне завдання визначає 1 із 3 результатів: запис, обґрунтовану відмову або непідтримуваний запит. Оцінювання перевіряє кінцевий стан, потім дозволені записи, а далі поведінкові твердження. Вільна відповідь не може компенсувати невдалу перевірку стану.
GRPO отримує винагороди на рівнях діалогу, етапу та репліки. Навчання пошуку штрафує надлишкові запити за допомогою . Середня кількість запитів на один пошуковий виклик зменшилася з 4.37 до 1.05. F1 тригера знизився з 60.87% до 58.61%.
Speak and Coordinate
Цей рівень визначає, чи говорити, коли саме і як. На Full-Duplex-Bench v1.5 кількість відповідей людям, які розмовляють з кимось іншим, зменшилася з 0.13 до 0.03. У версії v3.0 частка заповнювачів знизилася з 0.7590 до 0.2960. Водночас є компроміси. Після переривань частота небажаного відновлення зросла з 0.035 до 0.130. Затримка припинення мовлення після переривання становить 1.116 секунди проти 0.383 у GPT-Realtime-2.
Інтерактивне пояснення
Дослідіть цикл Think, Act, Speak, рішення повнодуплексного режиму, оцінений навчальний епізод і винагороду за пошук.
Порівняння результатів тестування
Порівняно з версією 3.0 показник Audio MultiChallenge зріс із 47.12 до 52.21. Середній результат BBA для 14 мов підвищився з 81.7% до 88.1%. WER на FLEURS знизився з 9.01 до 3.98. Показники τ-Voice отримано за допомогою адаптації мовлення в текст у напівдуплексному режимі. Їх не можна порівнювати з офіційними результатами повнодуплексного режиму. GPT-Realtime-2 досі лідирує в дослідженні за участю людей, що проводили red-team-тестування у 50 сесіях: 96.00% проти 92.00%.
Як вона порівнюється з іншими
| Функція | Qwen-Audio-3.1-Realtime-Plus | OpenAI GPT-Realtime-2 | Google Gemini 3.8 Live |
|---|---|---|---|
| Вхідні дані | Текст, аудіо | Текст, аудіо, зображення | Текст, зображення, аудіо, відео |
| Вихідні дані | Текст, аудіо | Текст, аудіо | Текст і аудіо |
| Контекст / ліміт вхідних даних | 262K | 128K | 131,072 |
| Максимальний обсяг вихідних даних | 16K | 32K | 65,536 |
| Виклик функцій | Так | Так | Так (за замовчуванням асинхронний) |
| Вбудований вебпошук | Так | Не зазначено | Заземлення на Google Search |
| Міркування | Режим міркування, максимум 2K для міркувань | Налаштовувані зусилля | Переплетені міркування |
| Аудіовхід / 1 млн токенів | $6.4 | $32 | $3.00 |
| Аудіовихід / 1 млн токенів | $24 (текст і аудіо) | $64 | $12.00 |
| Відкриті ваги | Ні | Ні | Ні |
| Джерело | QwenCloud | документація OpenAI | сторінка моделі, ціни |
Ціни — це опубліковані тарифи, перевірені 28 вересня 2026 року. Тарифікація токенів не є безпосередньо порівнюваною, оскільки кожен провайдер по-різному токенізує аудіо.
Ключові висновки
- У адаптації τ-Voice показник успішності виконання завдань зріс із 78.4% до 82.0% порівняно з версією 3.0.
- Кількість відповідей на фонове мовлення зменшилася з 73.0% до 13.0% на Full-Duplex-Bench v1.5.
- Контекст 262K, виклик функцій і вебпошук за ціною $6.4 за 1 млн аудіовхідних токенів.
- Використання інструментів навчається за допомогою GRPO у саморозвивальних виконуваних середовищах.
- Успішність багатоетапних атак знижується до 26.0% (китайською) і 23.5% (англійською).
Поширені запитання
- Що таке Qwen-Audio-3.1-Realtime? Повнодуплексна мовна модель від команди Qwen компанії Alibaba для голосових агентів, які міркують, викликають інструменти та керують черговістю реплік.
- Чи можу я розгорнути її самостійно? Про відкриті ваги не повідомлялося. Доступ надається через API QwenCloud під назвою
qwen-audio-3.1-realtime-plus. - Скільки це коштує? $6.4 за 1 млн аудіовхідних токенів і $24 за 1 млн вихідних токенів для тексту й аудіо.
Ознайомтеся з науковою статтею, Qwen-Audio-3.1-ASR і Qwen-Audio-3.1-Realtime. Уся подяка належить досліднику цього проєкту. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого 150k+ ML SubReddit та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? тепер ви також можете приєднатися до нас у Telegram.
Потрібно стати нашим партнером для просування вашого репозиторію GitHub, сторінки Hugging Face, випуску продукту, вебінару тощо? Зв’яжіться з нами
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.