Sakhanda Wire
NVDA $233.95 +1.34% MSFT $517.53 +0.92% GOOGL $343.50 +1.56% META $728.08 +0.30% AMZN $251.52 +1.33%
← К новостям

Microsoft AI выпустила MAI-Transcribe-2-Streaming: модель №1 для распознавания речи в реальном времени по версии Artificial Analysis

Microsoft AI выпустила MAI-Transcribe-2-Streaming — свою первую потоковую модель преобразования речи в текст (STT). Она была запущена 1 октября 2026 года вместе с 2 моделями преобразования текста в речь — MAI-Voice-2.1 и MAI-Voice-2.1-Flash. Artificial Analysis поставила её на первое место среди 38 моделей по точности финальной и первой промежуточной расшифровки. Модель предназначена для голосовых агентов, субтитров в реальном времени и диктовки, где задержка определяет качество взаимодействия.

Что выпустила Microsoft

MAI-Transcribe-2-Streaming — потоковый аналог пакетной модели MAI-Transcribe-2, выпущенной в сентябре. Она расшифровывает речь на 60 языках с автоматическим непрерывным определением языка. Аудио передаётся непрерывно, а текст поступает обратно ещё во время речи говорящего.

Модель выдаёт первые гипотезы, называемые промежуточными результатами, чуть более чем через 100 мс после получения аудио. По мере поступления контекста она пересматривает эти результаты, а затем фиксирует стабильную финальную расшифровку. Поэтому агент может начать рассуждать или вызывать инструменты ещё в середине предложения. По данным команды Microsoft, внутренние тесты показывают, что слова появляются в 2 раза быстрее, чем у ближайшего конкурента.

Что измерила Artificial Analysis

Индекс AA-WER Streaming использует около 8 часов аудио. В выборку входят AA-AgentTalk (50%), VoxPopuli (25%) и Earnings22 (25%). Задержка отсчитывается от конца речи, определяемого с помощью SileroVAD.

  • Финальная расшифровка: 2,5% WER через 0,13 с после окончания речи, первое место среди 38 моделей.
  • Первая промежуточная расшифровка: 2,5% WER через 0,12 с после окончания речи, также первое место.
  • Ближайшие конкуренты: Grok Voice Transcribe 2.0 — 2,7% и 0,49 с. Muse Voice Transcribe — 3,1% и 0,16 с.
  • Не самая быстрая: Cartesia Ink-2 (внешние конечные точки) возвращает финальные результаты за 0,07 с, но с показателем WER 4,0%.

Первая промежуточная расшифровка столь же точна, как и финальная. Это важно для агентов, которые действуют до того, как говорящий закончит фразу. Microsoft также относит модель к фронту Парето по точности и задержке.

Стоимость

MAI-Transcribe-2-Streaming стоит $0,54 за час аудио. Это вводная цена, действующая до конца 2026 года. Artificial Analysis приводит её к эквиваленту $9,00 за 1 000 минут. Пакетная MAI-Transcribe-2 стоит $0,10 за час. В потоковом режиме Microsoft взимает больше, чем xAI и Meta, и примерно соответствует расчётной ставке Google.

Как разработчики интегрируют модель

Microsoft документирует 2 способа интеграции. Realtime API подходит приложениям, которые уже используют WebSocket, совместимый с OpenAI Realtime. Azure Speech SDK управляет подключением, повторными попытками и потоковой передачей аудио. Оба варианта возвращают промежуточные и финальные результаты.

Модель также доступна в MAI Playground, через Vercel и Azure Voice Live. Поддержка LiveKit заявлена как готовящаяся к выпуску.

Microsoft объединяет её с MAI-Voice-2.1-Flash для создания полноценных голосовых циклов. Flash генерирует 45 секунд аудио с задержкой 150 мс от начала до конца за $15 за 1 млн символов. MAI-Voice-2.1 поддерживает 23 языка и 26 локалей по цене $22 за 1 млн символов.

Сравнение: MAI-Transcribe-2-Streaming и ближайшие потоковые конкуренты

ХарактеристикаMAI-Transcribe-2-StreamingGrok Voice Transcribe 2.0Muse Voice TranscribeGemini 3.5 Transcribe Live
РазработчикMicrosoft AIxAIMeta Superintelligence LabsGoogle
Дата выпуска1 октября 2026 г.18 сентября 2026 г.1 сентября 2026 г.26 августа 2026 г.
AA-WER Streaming (финальный результат)2,5%2,7%3,1%4,0%
Время до финального результата0,13 с0,49 с0,16 сНе сообщается в указанном источнике AA
Стоимость потоковой передачи / час$0,54 (вводная цена)$0,20$0,18~$0,54 (оценка при оплате по токенам)
Языки60, непрерывное автоматическое определениеДесятки, автоматическое определение, переключение во время записиБолее 70 в обучении, 25 проверенныхБолее 85, автоматическое определение
Диаризация говорящих в потокеНе указанаВключена в API (потоковый режим не подтверждён)Да, более 20 говорящихНе поддерживается в режиме Live
ИнтерфейсRealtime API (WebSocket) + Azure Speech SDKWebSocketWebSocket + конечная точка для файловLive API (WebSocket)
Открытые весаНетНетНетНет

Источники: Artificial Analysis, 9to5Mac (стоимость Muse), DataCamp (стоимость Grok), The Batch (стоимость Gemini). Проверено 2 октября 2026 года.

Основные выводы

  • Первое место среди 38 моделей в AA-WER Streaming: 2,5% WER через 0,13 с до финального результата.
  • Первые промежуточные результаты показывают такой же WER — 2,5% — через 0,12 с.
  • 60 языков с непрерывным автоматическим определением языка.
  • Вводная цена $0,54 за час, выше, чем у xAI и Meta.
  • Публичная предварительная версия без SLA и открытых весов.

Ознакомьтесь с техническими подробностями. Вся заслуга принадлежит исследователю этого проекта. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту 150k+ ML и подписаться на нашу рассылку. Подождите! Вы есть в Telegram? теперь вы также можете присоединиться к нам в Telegram.

Хотите сотрудничать с нами для продвижения своего репозитория GitHub, страницы Hugging Face, релиза продукта, вебинара и т. д.? Свяжитесь с нами

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости