Microsoft AI пусна MAI-Transcribe-2-Streaming: модел №1 за разпознаване на реч в реално време според Artificial Analysis
Microsoft AI пусна MAI-Transcribe-2-Streaming, своя първи модел за поточно преобразуване на реч в текст (STT). Той беше представен на 1 октомври 2026 г. заедно с 2 модела за преобразуване на текст в реч — MAI-Voice-2.1 и MAI-Voice-2.1-Flash. Artificial Analysis го класира на #1 сред 38 модела по точност на крайния и първия частичен транскрипт. Моделът е предназначен за гласови агенти, субтитри в реално време и диктовка, при които латентността определя качеството на изживяването.
Какво представи Microsoft
MAI-Transcribe-2-Streaming е моделът за работа в реално време, допълващ пакетния MAI-Transcribe-2, представен през септември. Той транскрибира 60 езика с автоматично, непрекъснато разпознаване на езика. Аудиото се предава непрекъснато, а текстът се връща, докато говорещият все още говори.
Моделът генерира първите си хипотези, наричани частични резултати, малко над 100 мс след получаването на аудиото. Той преработва тези частични резултати с постъпването на контекст, след което потвърждава стабилен окончателен транскрипт. Така един агент може да започне да разсъждава или да извиква инструменти още по средата на изречението. Екипът на Microsoft посочва, че вътрешните му тестове показват появяване на думите 2 пъти по-бързо спрямо най-близкия конкурент.
Какво измери Artificial Analysis
Индексът AA-WER Streaming използва около 8 часа аудио. Съставът му включва AA-AgentTalk (50%), VoxPopuli (25%) и Earnings22 (25%). Латентността се измерва от края на речта, установен от SileroVAD.
- Краен транскрипт: 2,5% WER при 0,13 с след края на речта, #1 сред 38 модела.
- Първи частичен транскрипт: 2,5% WER при 0,12 с след края на речта, също #1.
- Подгласници: Grok Voice Transcribe 2.0 с 2,7% и 0,49 с. Muse Voice Transcribe с 3,1% и 0,16 с.
- Не е най-бързият: Cartesia Ink-2 (външни крайни точки) връща крайни резултати за 0,07 с, но при 4,0% WER.
Първият частичен резултат е толкова точен, колкото и крайният транскрипт. Това е важно за агенти, които действат, преди говорещият да е завършил. Microsoft също поставя модела на границата на Парето по отношение на точността и латентността.
Ценообразуване
MAI-Transcribe-2-Streaming струва $0,54 на час аудио. Това е въвеждаща цена до края на 2026 г. Artificial Analysis я нормализира до $9,00 на 1000 минути. Пакетният MAI-Transcribe-2 струва $0,10 на час. При поточно предаване Microsoft таксува повече от xAI и Meta и приблизително колкото прогнозната ставка на Google.
Как разработчиците го интегрират
Microsoft описва 2 начина за интеграция. Realtime API е подходящ за приложения, които вече използват WebSocket, съвместим с OpenAI Realtime. Azure Speech SDK управлява свързването, повторните опити и поточното предаване на аудио. И двата варианта връщат междинни и крайни резултати.
Моделът е достъпен и в MAI Playground, чрез Vercel и Azure Voice Live. Поддръжката на LiveKit е посочена като предстояща.
Microsoft го комбинира с MAI-Voice-2.1-Flash за цялостни гласови цикли. Flash генерира 45 с аудио при латентност от край до край 150 мс за $15 на 1 млн. знака. MAI-Voice-2.1 поддържа 23 езика и 26 локали на цена от $22 на 1 млн. знака.
Сравнение: MAI-Transcribe-2-Streaming спрямо най-близките конкуренти за поточно предаване
| Функция | MAI-Transcribe-2-Streaming | Grok Voice Transcribe 2.0 | Muse Voice Transcribe | Gemini 3.5 Transcribe Live |
|---|---|---|---|---|
| Разработчик | Microsoft AI | xAI | Meta Superintelligence Labs | |
| Представен | 1 октомври 2026 г. | 18 септември 2026 г. | 1 септември 2026 г. | 26 август 2026 г. |
| AA-WER Streaming (краен) | 2,5% | 2,7% | 3,1% | 4,0% |
| Време до крайния резултат | 0,13 с | 0,49 с | 0,16 с | Не е посочено от цитирания източник на AA |
| Цена за поточно предаване / час | $0,54 (въвеждаща) | $0,20 | $0,18 | ~$0,54 (оценка на база таксуване за токени) |
| Езици | 60, непрекъснато автоматично разпознаване | Десетки, автоматично разпознаване, превключване по време на записа | 70+ обучени, 25 проверени | 85+, автоматично разпознаване |
| Диаризация на говорещите в потока | Не е посочено | Включена в API (поточното предаване не е потвърдено) | Да, 20+ говорещи | Не се поддържа в режим Live |
| Интерфейс | Realtime API (WebSocket) + Azure Speech SDK | WebSocket | WebSocket + крайна точка за файлове | Live API (WebSocket) |
| Отворени тегла | Не | Не | Не | Не |
Източници: Artificial Analysis, 9to5Mac (цени на Muse), DataCamp (цени на Grok), The Batch (цени на Gemini). Проверено на 2 октомври 2026 г.
Основни изводи
- #1 сред 38 модела в AA-WER Streaming: 2,5% WER за 0,13 с до крайния резултат.
- Първите частични резултати показват същите 2,5% WER при 0,12 с.
- 60 езика с непрекъснато автоматично разпознаване на езика.
- Въвеждаща цена от $0,54 на час, по-висока от тази на xAI и Meta.
- Публична предварителна версия без SLA и без отворени тегла.
Вижте техническите подробности. Всички заслуги са за изследователя на този проект. Също така, можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия SubReddit с над 150 хил. членове за машинно обучение и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Сега можете да се присъедините към нас и в Telegram.
Имате нужда от партньор за популяризиране на вашето GitHub хранилище ИЛИ страница в Hugging Face ИЛИ представяне на продукт ИЛИ уебинар и т.н.? Свържете се с нас
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.