Microsoft AI випустила нові моделі для транскрипції та перетворення тексту на мовлення для голосових агентів
Microsoft AI випустила MAI-Transcribe-2-Streaming — нову модель для транскрипції в реальному часі. За словами Microsoft, за точністю вона посідає перше місце в рейтингу Artificial Analysis. Модель транскрибує 60 мов і видає перші часткові результати трохи більше ніж за 100 мілісекунд. Microsoft стверджує, що це дає змогу голосовим агентам відповідати, поки людина ще не закінчила речення. До кінця року година аудіо коштуватиме $0,54 за вступною ціною.
Microsoft також випустила дві нові моделі перетворення тексту на мовлення. MAI-Voice-2.1 призначена для мовлення 23 мовами одним і тим самим голосом, із природним акцентом кожною з них. За даними Microsoft, варіант MAI-Voice-2.1-Flash забезпечує затримку 150 мілісекунд і коштує $15 за мільйон символів замість $22.
Обидві голосові моделі можуть клонувати голос лише за кількома секундами еталонного аудіо, а вбудовані засоби захисту мають запобігати зловживанням. Моделі доступні, зокрема, через Microsoft Foundry та MAI Playground, а обидві голосові моделі також доступні в OpenRouter. В одному з тестів близько половини з 4 000 учасників подумали, що голоси належать реальній людині.
Новини ШІ без хайпу — відібрані людьми
Підпишіться на THE DECODER, щоб читати без реклами, отримувати щотижневу розсилку про ШІ, наш ексклюзивний огляд передових розробок «AI Radar» шість разів на рік, мати повний доступ до архіву та доступ до розділу коментарів.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.