Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← До новин

Alibaba Qwen представила Qwen-Audio-3.1-Realtime: повнодуплексну голосову модель, навчену думати, діяти й вирішувати, коли говорити

Команда Qwen компанії Alibaba випустила Qwen-Audio-3.1 — стек із 5 аудіомоделей, що охоплює ASR, TTS і взаємодію в реальному часі. Основна модель — Qwen-Audio-3.1-Realtime, повнодуплексна мовна модель для голосових агентів, які викликають інструменти. Qwen також знизила ціни: приблизно на 85% для Realtime, приблизно на 70% для TTS і до 95% для ASR.

Чи придатна вона для розгортання? Так, як керований API. qwen-audio-3.1-realtime-plus доступна на QwenCloud через WebSocket. Про відкриті ваги не повідомлялося.

Що доступно на QwenCloud

На сторінці моделі зазначено, що текст і аудіо є як вхідними, так і вихідними даними. Контекст становить 262K токенів, із максимальним обсягом вхідних даних 245K і вихідних даних 16K. Типові ліміти — 60 запитів і 100K токенів на хвилину. Ціна становить $6.4 за 1 млн аудіовхідних токенів і $0.8 за 1 млн текстових вхідних токенів. Вихідні текст і аудіо коштують $24 за 1 млн токенів, при цьому вихідний текст не тарифікується. Серед ключових функцій — виклик функцій, вебпошук, структуровані результати, кешування контексту та донавчання.

Супутня модель, Qwen-Audio-3.1-ASR-Flash-Filetrans, призначена для офлайн-транскрибування довгих аудіозаписів. Вона підтримує ключові слова, розділення мовців, пунктуацію, а також багатомовне розпізнавання й розпізнавання китайських діалектів. Вартість становить $0.15 за вхідні та $0.47 за вихідні дані на 1 млн токенів.

Архітектура: 2 моделі за 1 голосом

Система працює на 2 моделях з однаковими аудіокодером і архітектурою LLM. Повнодуплексна модель прийняття рішень прогнозує, чи продовжувати слухати, говорити, зупинитися або відновити розмову. Модель перетворення мовлення на текст записує зміст відповіді у вигляді тексту. Потім контекстно-залежний голосовий рендерер перетворює цей текст на потокове мовлення. Він враховує історію розмови, голосові сигнали та акустичний контекст.

Навчання організовано на 3 рівнях: Think, Act і Speak and Coordinate.

Think: M²-OPD

Core-Cocktail SFT повторно прив’язує аудіомодель до її вихідної текстової LLM за допомогою парних даних масштабу мільйонів годин. Далі застосовується мультимодальний OPD. Текстовий учитель і заморожений аудіореферент оцінюють кожен токен власної траєкторії учня. Це дистиляція на основі власної політики, а не імітація заздалегідь написаних відповідей. Потім за допомогою GRPO навчаються доменні експерти з емпатії, прагматичного наміру та акустичних сцен. Multi-Teacher OPD об’єднує їх в 1 модель, придатну для розгортання.

Act: Виконувані середовища

Кожен навчальний домен об’єднує пул інструментів, базу даних JSON зі збереженням стану та бізнес-політику природною мовою. Домени створюються на основі визначень інструментів і MCP-серверів із відкритим кодом. Кожне завдання визначає 1 із 3 результатів: запис, обґрунтовану відмову або непідтримуваний запит. Оцінювання перевіряє кінцевий стан, потім дозволені записи, а далі поведінкові твердження. Вільна відповідь не може компенсувати невдалу перевірку стану.

GRPO отримує винагороди на рівнях діалогу, етапу та репліки. Навчання пошуку штрафує надлишкові запити за допомогою . Середня кількість запитів на один пошуковий виклик зменшилася з 4.37 до 1.05. F1 тригера знизився з 60.87% до 58.61%.

Speak and Coordinate

Цей рівень визначає, чи говорити, коли саме і як. На Full-Duplex-Bench v1.5 кількість відповідей людям, які розмовляють з кимось іншим, зменшилася з 0.13 до 0.03. У версії v3.0 частка заповнювачів знизилася з 0.7590 до 0.2960. Водночас є компроміси. Після переривань частота небажаного відновлення зросла з 0.035 до 0.130. Затримка припинення мовлення після переривання становить 1.116 секунди проти 0.383 у GPT-Realtime-2.

Інтерактивне пояснення

Дослідіть цикл Think, Act, Speak, рішення повнодуплексного режиму, оцінений навчальний епізод і винагороду за пошук.

Порівняння результатів тестування

Порівняно з версією 3.0 показник Audio MultiChallenge зріс із 47.12 до 52.21. Середній результат BBA для 14 мов підвищився з 81.7% до 88.1%. WER на FLEURS знизився з 9.01 до 3.98. Показники τ-Voice отримано за допомогою адаптації мовлення в текст у напівдуплексному режимі. Їх не можна порівнювати з офіційними результатами повнодуплексного режиму. GPT-Realtime-2 досі лідирує в дослідженні за участю людей, що проводили red-team-тестування у 50 сесіях: 96.00% проти 92.00%.

Як вона порівнюється з іншими

ФункціяQwen-Audio-3.1-Realtime-PlusOpenAI GPT-Realtime-2Google Gemini 3.8 Live
Вхідні даніТекст, аудіоТекст, аудіо, зображенняТекст, зображення, аудіо, відео
Вихідні даніТекст, аудіоТекст, аудіоТекст і аудіо
Контекст / ліміт вхідних даних262K128K131,072
Максимальний обсяг вихідних даних16K32K65,536
Виклик функційТакТакТак (за замовчуванням асинхронний)
Вбудований вебпошукТакНе зазначеноЗаземлення на Google Search
МіркуванняРежим міркування, максимум 2K для міркуваньНалаштовувані зусилляПереплетені міркування
Аудіовхід / 1 млн токенів$6.4$32$3.00
Аудіовихід / 1 млн токенів$24 (текст і аудіо)$64$12.00
Відкриті вагиНіНіНі
ДжерелоQwenCloudдокументація OpenAIсторінка моделі, ціни

Ціни — це опубліковані тарифи, перевірені 28 вересня 2026 року. Тарифікація токенів не є безпосередньо порівнюваною, оскільки кожен провайдер по-різному токенізує аудіо.

Ключові висновки

  • У адаптації τ-Voice показник успішності виконання завдань зріс із 78.4% до 82.0% порівняно з версією 3.0.
  • Кількість відповідей на фонове мовлення зменшилася з 73.0% до 13.0% на Full-Duplex-Bench v1.5.
  • Контекст 262K, виклик функцій і вебпошук за ціною $6.4 за 1 млн аудіовхідних токенів.
  • Використання інструментів навчається за допомогою GRPO у саморозвивальних виконуваних середовищах.
  • Успішність багатоетапних атак знижується до 26.0% (китайською) і 23.5% (англійською).

Поширені запитання

  • Що таке Qwen-Audio-3.1-Realtime? Повнодуплексна мовна модель від команди Qwen компанії Alibaba для голосових агентів, які міркують, викликають інструменти та керують черговістю реплік.
  • Чи можу я розгорнути її самостійно? Про відкриті ваги не повідомлялося. Доступ надається через API QwenCloud під назвою qwen-audio-3.1-realtime-plus.
  • Скільки це коштує? $6.4 за 1 млн аудіовхідних токенів і $24 за 1 млн вихідних токенів для тексту й аудіо.

Ознайомтеся з науковою статтею, Qwen-Audio-3.1-ASR і Qwen-Audio-3.1-Realtime. Уся подяка належить досліднику цього проєкту. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого 150k+ ML SubReddit та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? тепер ви також можете приєднатися до нас у Telegram.

Потрібно стати нашим партнером для просування вашого репозиторію GitHub, сторінки Hugging Face, випуску продукту, вебінару тощо? Зв’яжіться з нами

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MarkTechPost

Читати оригінал на MarkTechPost ↗

Текст і зображення належать MarkTechPost і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини