Sakhanda Wire
NVDA $233.95 +1.34% MSFT $517.53 +0.92% GOOGL $343.50 +1.56% META $728.08 +0.30% AMZN $251.52 +1.33%
← Към новините

Microsoft AI пусна MAI-Transcribe-2-Streaming: модел №1 за разпознаване на реч в реално време според Artificial Analysis

Microsoft AI пусна MAI-Transcribe-2-Streaming, своя първи модел за поточно преобразуване на реч в текст (STT). Той беше представен на 1 октомври 2026 г. заедно с 2 модела за преобразуване на текст в реч — MAI-Voice-2.1 и MAI-Voice-2.1-Flash. Artificial Analysis го класира на #1 сред 38 модела по точност на крайния и първия частичен транскрипт. Моделът е предназначен за гласови агенти, субтитри в реално време и диктовка, при които латентността определя качеството на изживяването.

Какво представи Microsoft

MAI-Transcribe-2-Streaming е моделът за работа в реално време, допълващ пакетния MAI-Transcribe-2, представен през септември. Той транскрибира 60 езика с автоматично, непрекъснато разпознаване на езика. Аудиото се предава непрекъснато, а текстът се връща, докато говорещият все още говори.

Моделът генерира първите си хипотези, наричани частични резултати, малко над 100 мс след получаването на аудиото. Той преработва тези частични резултати с постъпването на контекст, след което потвърждава стабилен окончателен транскрипт. Така един агент може да започне да разсъждава или да извиква инструменти още по средата на изречението. Екипът на Microsoft посочва, че вътрешните му тестове показват появяване на думите 2 пъти по-бързо спрямо най-близкия конкурент.

Какво измери Artificial Analysis

Индексът AA-WER Streaming използва около 8 часа аудио. Съставът му включва AA-AgentTalk (50%), VoxPopuli (25%) и Earnings22 (25%). Латентността се измерва от края на речта, установен от SileroVAD.

  • Краен транскрипт: 2,5% WER при 0,13 с след края на речта, #1 сред 38 модела.
  • Първи частичен транскрипт: 2,5% WER при 0,12 с след края на речта, също #1.
  • Подгласници: Grok Voice Transcribe 2.0 с 2,7% и 0,49 с. Muse Voice Transcribe с 3,1% и 0,16 с.
  • Не е най-бързият: Cartesia Ink-2 (външни крайни точки) връща крайни резултати за 0,07 с, но при 4,0% WER.

Първият частичен резултат е толкова точен, колкото и крайният транскрипт. Това е важно за агенти, които действат, преди говорещият да е завършил. Microsoft също поставя модела на границата на Парето по отношение на точността и латентността.

Ценообразуване

MAI-Transcribe-2-Streaming струва $0,54 на час аудио. Това е въвеждаща цена до края на 2026 г. Artificial Analysis я нормализира до $9,00 на 1000 минути. Пакетният MAI-Transcribe-2 струва $0,10 на час. При поточно предаване Microsoft таксува повече от xAI и Meta и приблизително колкото прогнозната ставка на Google.

Как разработчиците го интегрират

Microsoft описва 2 начина за интеграция. Realtime API е подходящ за приложения, които вече използват WebSocket, съвместим с OpenAI Realtime. Azure Speech SDK управлява свързването, повторните опити и поточното предаване на аудио. И двата варианта връщат междинни и крайни резултати.

Моделът е достъпен и в MAI Playground, чрез Vercel и Azure Voice Live. Поддръжката на LiveKit е посочена като предстояща.

Microsoft го комбинира с MAI-Voice-2.1-Flash за цялостни гласови цикли. Flash генерира 45 с аудио при латентност от край до край 150 мс за $15 на 1 млн. знака. MAI-Voice-2.1 поддържа 23 езика и 26 локали на цена от $22 на 1 млн. знака.

Сравнение: MAI-Transcribe-2-Streaming спрямо най-близките конкуренти за поточно предаване

ФункцияMAI-Transcribe-2-StreamingGrok Voice Transcribe 2.0Muse Voice TranscribeGemini 3.5 Transcribe Live
РазработчикMicrosoft AIxAIMeta Superintelligence LabsGoogle
Представен1 октомври 2026 г.18 септември 2026 г.1 септември 2026 г.26 август 2026 г.
AA-WER Streaming (краен)2,5%2,7%3,1%4,0%
Време до крайния резултат0,13 с0,49 с0,16 сНе е посочено от цитирания източник на AA
Цена за поточно предаване / час$0,54 (въвеждаща)$0,20$0,18~$0,54 (оценка на база таксуване за токени)
Езици60, непрекъснато автоматично разпознаванеДесетки, автоматично разпознаване, превключване по време на записа70+ обучени, 25 проверени85+, автоматично разпознаване
Диаризация на говорещите в потокаНе е посоченоВключена в API (поточното предаване не е потвърдено)Да, 20+ говорещиНе се поддържа в режим Live
ИнтерфейсRealtime API (WebSocket) + Azure Speech SDKWebSocketWebSocket + крайна точка за файловеLive API (WebSocket)
Отворени теглаНеНеНеНе

Източници: Artificial Analysis, 9to5Mac (цени на Muse), DataCamp (цени на Grok), The Batch (цени на Gemini). Проверено на 2 октомври 2026 г.

Основни изводи

  • #1 сред 38 модела в AA-WER Streaming: 2,5% WER за 0,13 с до крайния резултат.
  • Първите частични резултати показват същите 2,5% WER при 0,12 с.
  • 60 езика с непрекъснато автоматично разпознаване на езика.
  • Въвеждаща цена от $0,54 на час, по-висока от тази на xAI и Meta.
  • Публична предварителна версия без SLA и без отворени тегла.

Вижте техническите подробности. Всички заслуги са за изследователя на този проект. Също така, можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия SubReddit с над 150 хил. членове за машинно обучение и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Сега можете да се присъедините към нас и в Telegram.

Имате нужда от партньор за популяризиране на вашето GitHub хранилище ИЛИ страница в Hugging Face ИЛИ представяне на продукт ИЛИ уебинар и т.н.? Свържете се с нас

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини