Sakhanda Wire
NVDA $233.95 +1.34% MSFT $517.53 +0.92% GOOGL $343.50 +1.56% META $728.08 +0.30% AMZN $251.52 +1.33%
← До новин

Microsoft AI випустила MAI-Transcribe-2-Streaming: модель №1 для розпізнавання мовлення в реальному часі за версією Artificial Analysis

Microsoft AI випустила MAI-Transcribe-2-Streaming — свою першу потокову модель перетворення мовлення на текст (STT). Її запустили 1 жовтня 2026 року разом із 2 моделями перетворення тексту на мовлення — MAI-Voice-2.1 і MAI-Voice-2.1-Flash. Artificial Analysis посідає для неї 1-ше місце серед 38 моделей за точністю фінальної та першої часткової транскрипції. Модель орієнтована на голосових агентів, живі субтитри та диктування, де затримка визначає якість взаємодії.

Що випустила Microsoft

MAI-Transcribe-2-Streaming — це модель для роботи в реальному часі, споріднена з пакетною MAI-Transcribe-2, випущеною у вересні. Вона транскрибує мовлення 60 мовами з автоматичним безперервним визначенням мови. Аудіо надходить безперервним потоком, а текст повертається ще під час розмови мовця.

Модель видає перші гіпотези, які називаються частковими транскриптами, трохи більше ніж через 100 мс після отримання аудіо. Вона переглядає ці часткові транскрипти в міру надходження контексту, а потім фіксує стабільну фінальну транскрипцію. Таким чином, агент може почати міркувати або викликати інструменти ще в середині речення. Команда Microsoft стверджує, що її внутрішні тести показують появу слів у 2 рази швидше, ніж у найближчого конкурента.

Що виміряла Artificial Analysis

Індекс AA-WER Streaming використовує близько 8 годин аудіо. До набору входять AA-AgentTalk (50%), VoxPopuli (25%) та Earnings22 (25%). Затримка вимірюється від кінця мовлення, визначеного за допомогою SileroVAD.

  • Фінальна транскрипція: 2,5% WER через 0,13 с після завершення мовлення, 1-ше місце серед 38 моделей.
  • Перша часткова транскрипція: 2,5% WER через 0,12 с після завершення мовлення, також 1-ше місце.
  • Найближчі конкуренти: Grok Voice Transcribe 2.0 — 2,7% і 0,49 с. Muse Voice Transcribe — 3,1% і 0,16 с.
  • Не найшвидша: Cartesia Ink-2 (зовнішні кінцеві точки) повертає фінальні транскрипції за 0,07 с, але з WER 4,0%.

Перша часткова транскрипція така ж точна, як і фінальна. Це важливо для агентів, які діють до того, як мовець завершить фразу. Microsoft також розміщує модель на фронтирі Парето між точністю та затримкою.

Ціноутворення

MAI-Transcribe-2-Streaming коштує $0,54 за годину аудіо. Це вступна ціна, яка діятиме до кінця 2026 року. Artificial Analysis нормалізує її до $9,00 за 1 000 хвилин. Пакетна MAI-Transcribe-2 коштує $0,10 за годину. Для потокової обробки Microsoft стягує більше, ніж xAI і Meta, та приблизно відповідає розрахунковій ціні Google.

Як розробники інтегрують модель

Microsoft документує 2 способи інтеграції. Realtime API підходить для застосунків, які вже використовують WebSocket, сумісний з OpenAI Realtime. Azure Speech SDK керує підключенням, повторними спробами та потоковою передачею аудіо. Обидва варіанти повертають проміжні та фінальні результати.

Модель також доступна в MAI Playground, через Vercel та Azure Voice Live. Підтримка LiveKit зазначена як така, що з’явиться найближчим часом.

Microsoft поєднує її з MAI-Voice-2.1-Flash для створення повних голосових циклів. Flash генерує 45 с аудіо із наскрізною затримкою 150 мс за $15 за 1 млн символів. MAI-Voice-2.1 охоплює 23 мови та 26 локалей за ціною $22 за 1 млн символів.

Порівняння: MAI-Transcribe-2-Streaming і найближчі потокові конкуренти

ХарактеристикаMAI-Transcribe-2-StreamingGrok Voice Transcribe 2.0Muse Voice TranscribeGemini 3.5 Transcribe Live
РозробникMicrosoft AIxAIMeta Superintelligence LabsGoogle
Випуск1 жовтня 2026 р.18 вересня 2026 р.1 вересня 2026 р.26 серпня 2026 р.
AA-WER Streaming (фінальна)2,5%2,7%3,1%4,0%
Час до фінальної транскрипції0,13 с0,49 с0,16 сНе повідомляється у зазначеному джерелі AA
Ціна потокової обробки / годину$0,54 (вступна)$0,20$0,18~$0,54 (оцінка на основі тарифікації за токенами)
Мови60, безперервне автоматичне визначенняДесятки, автоматичне визначення, перемикання під час записуПонад 70 навчених, 25 перевіренихПонад 85, автоматичне визначення
Діаризація мовців у потоціНе зазначеноВключена в API (потоковий режим не підтверджено)Так, понад 20 мовцівНе підтримується в режимі Live
ІнтерфейсRealtime API (WebSocket) + Azure Speech SDKWebSocketWebSocket + кінцева точка для файлівLive API (WebSocket)
Відкриті вагиНіНіНіНі

Джерела: Artificial Analysis, 9to5Mac (ціни Muse), DataCamp (ціни Grok), The Batch (ціни Gemini). Перевірено 2 жовтня 2026 року.

Основні висновки

  • 1-ше місце серед 38 моделей за AA-WER Streaming: 2,5% WER за 0,13 с до фінальної транскрипції.
  • Перші часткові транскрипції мають такий самий показник WER — 2,5% — за 0,12 с.
  • 60 мов із безперервним автоматичним визначенням мови.
  • Вступна ціна $0,54 за годину, що вище, ніж у xAI та Meta.
  • Публічна попередня версія без SLA та відкритих ваг.

Ознайомтеся з технічними деталями. Уся подяка належить досліднику цього проєкту. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого 150-тисячного ML SubReddit та підписатися на нашу розсилку. Стривайте! Ви користуєтеся Telegram? Тепер ви також можете приєднатися до нас у Telegram.

Потрібно співпрацювати з нами для просування вашого GitHub-репозиторію, сторінки на Hugging Face, випуску продукту, вебінару тощо? Зв’яжіться з нами

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MarkTechPost

Читати оригінал на MarkTechPost ↗

Текст і зображення належать MarkTechPost і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини