Microsoft AI випустила MAI-Transcribe-2-Streaming: модель №1 для розпізнавання мовлення в реальному часі за версією Artificial Analysis
Microsoft AI випустила MAI-Transcribe-2-Streaming — свою першу потокову модель перетворення мовлення на текст (STT). Її запустили 1 жовтня 2026 року разом із 2 моделями перетворення тексту на мовлення — MAI-Voice-2.1 і MAI-Voice-2.1-Flash. Artificial Analysis посідає для неї 1-ше місце серед 38 моделей за точністю фінальної та першої часткової транскрипції. Модель орієнтована на голосових агентів, живі субтитри та диктування, де затримка визначає якість взаємодії.
Що випустила Microsoft
MAI-Transcribe-2-Streaming — це модель для роботи в реальному часі, споріднена з пакетною MAI-Transcribe-2, випущеною у вересні. Вона транскрибує мовлення 60 мовами з автоматичним безперервним визначенням мови. Аудіо надходить безперервним потоком, а текст повертається ще під час розмови мовця.
Модель видає перші гіпотези, які називаються частковими транскриптами, трохи більше ніж через 100 мс після отримання аудіо. Вона переглядає ці часткові транскрипти в міру надходження контексту, а потім фіксує стабільну фінальну транскрипцію. Таким чином, агент може почати міркувати або викликати інструменти ще в середині речення. Команда Microsoft стверджує, що її внутрішні тести показують появу слів у 2 рази швидше, ніж у найближчого конкурента.
Що виміряла Artificial Analysis
Індекс AA-WER Streaming використовує близько 8 годин аудіо. До набору входять AA-AgentTalk (50%), VoxPopuli (25%) та Earnings22 (25%). Затримка вимірюється від кінця мовлення, визначеного за допомогою SileroVAD.
- Фінальна транскрипція: 2,5% WER через 0,13 с після завершення мовлення, 1-ше місце серед 38 моделей.
- Перша часткова транскрипція: 2,5% WER через 0,12 с після завершення мовлення, також 1-ше місце.
- Найближчі конкуренти: Grok Voice Transcribe 2.0 — 2,7% і 0,49 с. Muse Voice Transcribe — 3,1% і 0,16 с.
- Не найшвидша: Cartesia Ink-2 (зовнішні кінцеві точки) повертає фінальні транскрипції за 0,07 с, але з WER 4,0%.
Перша часткова транскрипція така ж точна, як і фінальна. Це важливо для агентів, які діють до того, як мовець завершить фразу. Microsoft також розміщує модель на фронтирі Парето між точністю та затримкою.
Ціноутворення
MAI-Transcribe-2-Streaming коштує $0,54 за годину аудіо. Це вступна ціна, яка діятиме до кінця 2026 року. Artificial Analysis нормалізує її до $9,00 за 1 000 хвилин. Пакетна MAI-Transcribe-2 коштує $0,10 за годину. Для потокової обробки Microsoft стягує більше, ніж xAI і Meta, та приблизно відповідає розрахунковій ціні Google.
Як розробники інтегрують модель
Microsoft документує 2 способи інтеграції. Realtime API підходить для застосунків, які вже використовують WebSocket, сумісний з OpenAI Realtime. Azure Speech SDK керує підключенням, повторними спробами та потоковою передачею аудіо. Обидва варіанти повертають проміжні та фінальні результати.
Модель також доступна в MAI Playground, через Vercel та Azure Voice Live. Підтримка LiveKit зазначена як така, що з’явиться найближчим часом.
Microsoft поєднує її з MAI-Voice-2.1-Flash для створення повних голосових циклів. Flash генерує 45 с аудіо із наскрізною затримкою 150 мс за $15 за 1 млн символів. MAI-Voice-2.1 охоплює 23 мови та 26 локалей за ціною $22 за 1 млн символів.
Порівняння: MAI-Transcribe-2-Streaming і найближчі потокові конкуренти
| Характеристика | MAI-Transcribe-2-Streaming | Grok Voice Transcribe 2.0 | Muse Voice Transcribe | Gemini 3.5 Transcribe Live |
|---|---|---|---|---|
| Розробник | Microsoft AI | xAI | Meta Superintelligence Labs | |
| Випуск | 1 жовтня 2026 р. | 18 вересня 2026 р. | 1 вересня 2026 р. | 26 серпня 2026 р. |
| AA-WER Streaming (фінальна) | 2,5% | 2,7% | 3,1% | 4,0% |
| Час до фінальної транскрипції | 0,13 с | 0,49 с | 0,16 с | Не повідомляється у зазначеному джерелі AA |
| Ціна потокової обробки / годину | $0,54 (вступна) | $0,20 | $0,18 | ~$0,54 (оцінка на основі тарифікації за токенами) |
| Мови | 60, безперервне автоматичне визначення | Десятки, автоматичне визначення, перемикання під час запису | Понад 70 навчених, 25 перевірених | Понад 85, автоматичне визначення |
| Діаризація мовців у потоці | Не зазначено | Включена в API (потоковий режим не підтверджено) | Так, понад 20 мовців | Не підтримується в режимі Live |
| Інтерфейс | Realtime API (WebSocket) + Azure Speech SDK | WebSocket | WebSocket + кінцева точка для файлів | Live API (WebSocket) |
| Відкриті ваги | Ні | Ні | Ні | Ні |
Джерела: Artificial Analysis, 9to5Mac (ціни Muse), DataCamp (ціни Grok), The Batch (ціни Gemini). Перевірено 2 жовтня 2026 року.
Основні висновки
- 1-ше місце серед 38 моделей за AA-WER Streaming: 2,5% WER за 0,13 с до фінальної транскрипції.
- Перші часткові транскрипції мають такий самий показник WER — 2,5% — за 0,12 с.
- 60 мов із безперервним автоматичним визначенням мови.
- Вступна ціна $0,54 за годину, що вище, ніж у xAI та Meta.
- Публічна попередня версія без SLA та відкритих ваг.
Ознайомтеся з технічними деталями. Уся подяка належить досліднику цього проєкту. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого 150-тисячного ML SubReddit та підписатися на нашу розсилку. Стривайте! Ви користуєтеся Telegram? Тепер ви також можете приєднатися до нас у Telegram.
Потрібно співпрацювати з нами для просування вашого GitHub-репозиторію, сторінки на Hugging Face, випуску продукту, вебінару тощо? Зв’яжіться з нами
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.