Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← Към новините

Alibaba Qwen представи Qwen-Audio-3.1-Realtime: гласов модел с пълен дуплекс, обучен да мисли, действа и решава кога да говори

Екипът на Alibaba за Qwen пусна Qwen-Audio-3.1 — аудио стек от 5 модела, обхващащ ASR, TTS и взаимодействие в реално време. Основният модел е Qwen-Audio-3.1-Realtime — модел за двупосочна комуникация, създаден за гласови агенти, които извикват инструменти. Qwen също намали цените: с около 85% за Realtime, около 70% за TTS и до 95% за ASR.

Може ли да бъде внедрен? Да, като управляван API. qwen-audio-3.1-realtime-plus е достъпен в QwenCloud чрез WebSocket. Не бяха обявени отворени тегла.

Какво предлага QwenCloud

Страницата на модела посочва текста и аудиото както като вход, така и като изход. Контекстът е от 262K токена, с максимален вход от 245K и максимален изход от 16K. Лимитите по подразбиране са 60 заявки и 100K токена на минута. Цената е $6.4 за 1 милион аудио входни токена и $0.8 за 1 милион текстови входни токена. Изходът от текст и аудио струва $24 за 1 милион токена, като изходният текст не се таксува. Основните функции включват извикване на функции, уеб търсене, структурирани изходи, кеширане на контекста и фино дообучаване.

Придружаващият модел Qwen-Audio-3.1-ASR-Flash-Filetrans е предназначен за офлайн транскрибиране на дълги аудиозаписи. Той поддържа ключови думи, разделяне на говорителите, пунктуация и многоезично разпознаване, както и разпознаване на китайски диалекти. Цената му е $0.15 за вход и $0.47 за изход на 1 милион токена.

Архитектура: 2 модела зад 1 глас

Системата използва 2 модела с еднакъв Audio Encoder и LLM дизайн. Модел за решения при двупосочна комуникация прогнозира дали да продължи да слуша, да говори, да спре или да възобнови разговора. Модел за преобразуване на реч в текст записва съдържанието на отговора като текст. След това контекстно ориентиран гласов рендерер превръща този текст в поточна реч. Той се съобразява с историята на разговора, гласовите сигнали и акустичния контекст.

Обучението е организирано в 3 слоя: Мислене, Действие и Говорене и координация.

Мислене: M²-OPD

Core-Cocktail SFT пренастройва аудио модела към неговия изходен текстов LLM чрез сдвоени данни в мащаб от милиони часове. Следва мултимодално OPD. Текстов учител и замразена аудио референция оценяват всеки токен от собствената траектория на ученика. Това е дестилация според текущата политика, а не имитация на предварително написани отговори. След това с GRPO се обучават домейн експерти за емпатия, прагматично намерение и акустични сцени. Multi-Teacher OPD ги обединява в 1 модел, готов за внедряване.

Действие: изпълними среди

Всеки обучаващ домейн включва набор от инструменти, JSON база данни със състояние и бизнес политика на естествен език. Домейните се инициализират от дефиниции на инструменти с отворен код и MCP сървъри. Всяка задача определя 1 от 3 резултата: запис, обоснован отказ или неподдържана заявка. Оценяването проверява крайното състояние, след това разрешените записи и накрая поведенческите твърдения. Плавният отговор не може да компенсира неуспешна проверка на състоянието.

GRPO получава награди на ниво диалог, етап и ход. Обучението за търсене санкционира излишните заявки с . Средният брой заявки при едно извикване за търсене спадна от 4.37 на 1.05. F1 показателят за задействане спадна от 60.87% на 58.61%.

Говорене и координация

Този слой решава дали, кога и как да говори. При Full-Duplex-Bench v1.5 отговорите към хора, които говорят с някой друг, спаднаха от 0.13 на 0.03. При v3.0 делът на запълващите реплики спадна от 0.7590 на 0.2960. Има компромиси. След прекъсвания делът на нежеланото възобновяване се повиши от 0.035 на 0.130. Латентността при спиране след прекъсване е 1.116 секунди спрямо 0.383 за GPT-Realtime-2.

Интерактивно обяснение

Разгледайте цикъла „Мислене, Действие, Говорене“, решенията при двупосочна комуникация, оценен епизод от обучението и наградата за търсене.

Бенчмаркове накратко

В сравнение с 3.0 резултатът от Audio MultiChallenge се повишава от 47.12 на 52.21. Средната стойност на BBA за 14 езика се увеличава от 81.7% на 88.1%. WER на FLEURS спада от 9.01 на 3.98. Данните за τ-Voice използват адаптация от реч към текст с полудуплексен режим. Те не са сравними с официалните резултати за пълен дуплекс. GPT-Realtime-2 все още води в проучването с човешки red-team тестове в 50 сесии — 96.00% срещу 92.00%.

Сравнение

ФункцияQwen-Audio-3.1-Realtime-PlusOpenAI GPT-Realtime-2Google Gemini 3.8 Live
ВходТекст, аудиоТекст, аудио, изображениеТекст, изображения, аудио, видео
ИзходТекст, аудиоТекст, аудиоТекст и аудио
Контекст / лимит на входа262K128K131,072
Максимален изход16K32K65,536
Извикване на функцииДаДаДа (асинхронно по подразбиране)
Вградено уеб търсенеДаНе е посоченоОбосноваване чрез Google Search
РазсъждениеРежим на мислене, максимум 2K за разсъждениеКонфигурируемо усилиеПреплетено разсъждение
Аудио вход / 1 милион токена$6.4$32$3.00
Аудио изход / 1 милион токена$24 (текст и аудио)$64$12.00
Отворени теглаНеНеНе
ИзточникQwenCloudДокументация на OpenAIСтраница на модела, цени

Цените са стандартните тарифи, проверени на 28 септември 2026 г. Тарифите за токени не са пряко сравними, тъй като всеки доставчик токенизира аудиото по различен начин.

Основни изводи

  • Успеваемостта на задачите при адаптацията на τ-Voice се повишава от 78.4% на 82.0% спрямо 3.0.
  • Отговорите към фоновата реч спадат от 73.0% на 13.0% при Full-Duplex-Bench v1.5.
  • Контекст от 262K, извикване на функции и уеб търсене на цена от $6.4 за 1 милион аудио входни токена.
  • Използването на инструменти се обучава с GRPO в саморазвиващи се изпълними среди.
  • Успеваемостта на многоходовите атаки спада до 26.0% (китайски) и 23.5% (английски).

Често задавани въпроси

  • Какво представлява Qwen-Audio-3.1-Realtime? Модел за реч с пълен дуплекс от екипа на Alibaba за Qwen, предназначен за гласови агенти, които разсъждават, извикват инструменти и управляват редуването на репликите.
  • Мога ли да го хоствам самостоятелно? Не бяха обявени отворени тегла. Достъпът е чрез API на QwenCloud като qwen-audio-3.1-realtime-plus.
  • Колко струва? $6.4 за 1 милион аудио входни токена и $24 за 1 милион изходни токена за текст и аудио.

Разгледайте научната статия, Qwen-Audio-3.1-ASR и Qwen-Audio-3.1-Realtime. Всички заслуги са за изследователя на този проект. Също така, не се колебайте да ни последвате в Twitter и не забравяйте да се присъедините към нашия ML SubReddit с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.

Имате нужда от партньор за популяризиране на вашето GitHub хранилище ИЛИ страница в Hugging Face ИЛИ издание на продукт ИЛИ уебинар и т.н.? Свържете се с нас

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини