Microsoft AI выпустила MAI-Transcribe-2-Streaming: модель №1 для распознавания речи в реальном времени по версии Artificial Analysis
Microsoft AI выпустила MAI-Transcribe-2-Streaming — свою первую потоковую модель преобразования речи в текст (STT). Она была запущена 1 октября 2026 года вместе с 2 моделями преобразования текста в речь — MAI-Voice-2.1 и MAI-Voice-2.1-Flash. Artificial Analysis поставила её на первое место среди 38 моделей по точности финальной и первой промежуточной расшифровки. Модель предназначена для голосовых агентов, субтитров в реальном времени и диктовки, где задержка определяет качество взаимодействия.
Что выпустила Microsoft
MAI-Transcribe-2-Streaming — потоковый аналог пакетной модели MAI-Transcribe-2, выпущенной в сентябре. Она расшифровывает речь на 60 языках с автоматическим непрерывным определением языка. Аудио передаётся непрерывно, а текст поступает обратно ещё во время речи говорящего.
Модель выдаёт первые гипотезы, называемые промежуточными результатами, чуть более чем через 100 мс после получения аудио. По мере поступления контекста она пересматривает эти результаты, а затем фиксирует стабильную финальную расшифровку. Поэтому агент может начать рассуждать или вызывать инструменты ещё в середине предложения. По данным команды Microsoft, внутренние тесты показывают, что слова появляются в 2 раза быстрее, чем у ближайшего конкурента.
Что измерила Artificial Analysis
Индекс AA-WER Streaming использует около 8 часов аудио. В выборку входят AA-AgentTalk (50%), VoxPopuli (25%) и Earnings22 (25%). Задержка отсчитывается от конца речи, определяемого с помощью SileroVAD.
- Финальная расшифровка: 2,5% WER через 0,13 с после окончания речи, первое место среди 38 моделей.
- Первая промежуточная расшифровка: 2,5% WER через 0,12 с после окончания речи, также первое место.
- Ближайшие конкуренты: Grok Voice Transcribe 2.0 — 2,7% и 0,49 с. Muse Voice Transcribe — 3,1% и 0,16 с.
- Не самая быстрая: Cartesia Ink-2 (внешние конечные точки) возвращает финальные результаты за 0,07 с, но с показателем WER 4,0%.
Первая промежуточная расшифровка столь же точна, как и финальная. Это важно для агентов, которые действуют до того, как говорящий закончит фразу. Microsoft также относит модель к фронту Парето по точности и задержке.
Стоимость
MAI-Transcribe-2-Streaming стоит $0,54 за час аудио. Это вводная цена, действующая до конца 2026 года. Artificial Analysis приводит её к эквиваленту $9,00 за 1 000 минут. Пакетная MAI-Transcribe-2 стоит $0,10 за час. В потоковом режиме Microsoft взимает больше, чем xAI и Meta, и примерно соответствует расчётной ставке Google.
Как разработчики интегрируют модель
Microsoft документирует 2 способа интеграции. Realtime API подходит приложениям, которые уже используют WebSocket, совместимый с OpenAI Realtime. Azure Speech SDK управляет подключением, повторными попытками и потоковой передачей аудио. Оба варианта возвращают промежуточные и финальные результаты.
Модель также доступна в MAI Playground, через Vercel и Azure Voice Live. Поддержка LiveKit заявлена как готовящаяся к выпуску.
Microsoft объединяет её с MAI-Voice-2.1-Flash для создания полноценных голосовых циклов. Flash генерирует 45 секунд аудио с задержкой 150 мс от начала до конца за $15 за 1 млн символов. MAI-Voice-2.1 поддерживает 23 языка и 26 локалей по цене $22 за 1 млн символов.
Сравнение: MAI-Transcribe-2-Streaming и ближайшие потоковые конкуренты
| Характеристика | MAI-Transcribe-2-Streaming | Grok Voice Transcribe 2.0 | Muse Voice Transcribe | Gemini 3.5 Transcribe Live |
|---|---|---|---|---|
| Разработчик | Microsoft AI | xAI | Meta Superintelligence Labs | |
| Дата выпуска | 1 октября 2026 г. | 18 сентября 2026 г. | 1 сентября 2026 г. | 26 августа 2026 г. |
| AA-WER Streaming (финальный результат) | 2,5% | 2,7% | 3,1% | 4,0% |
| Время до финального результата | 0,13 с | 0,49 с | 0,16 с | Не сообщается в указанном источнике AA |
| Стоимость потоковой передачи / час | $0,54 (вводная цена) | $0,20 | $0,18 | ~$0,54 (оценка при оплате по токенам) |
| Языки | 60, непрерывное автоматическое определение | Десятки, автоматическое определение, переключение во время записи | Более 70 в обучении, 25 проверенных | Более 85, автоматическое определение |
| Диаризация говорящих в потоке | Не указана | Включена в API (потоковый режим не подтверждён) | Да, более 20 говорящих | Не поддерживается в режиме Live |
| Интерфейс | Realtime API (WebSocket) + Azure Speech SDK | WebSocket | WebSocket + конечная точка для файлов | Live API (WebSocket) |
| Открытые веса | Нет | Нет | Нет | Нет |
Источники: Artificial Analysis, 9to5Mac (стоимость Muse), DataCamp (стоимость Grok), The Batch (стоимость Gemini). Проверено 2 октября 2026 года.
Основные выводы
- Первое место среди 38 моделей в AA-WER Streaming: 2,5% WER через 0,13 с до финального результата.
- Первые промежуточные результаты показывают такой же WER — 2,5% — через 0,12 с.
- 60 языков с непрерывным автоматическим определением языка.
- Вводная цена $0,54 за час, выше, чем у xAI и Meta.
- Публичная предварительная версия без SLA и открытых весов.
Ознакомьтесь с техническими подробностями. Вся заслуга принадлежит исследователю этого проекта. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту 150k+ ML и подписаться на нашу рассылку. Подождите! Вы есть в Telegram? теперь вы также можете присоединиться к нам в Telegram.
Хотите сотрудничать с нами для продвижения своего репозитория GitHub, страницы Hugging Face, релиза продукта, вебинара и т. д.? Свяжитесь с нами
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.