Microsoft AI выпустила новые модели транскрипции и синтеза речи для голосовых агентов
Microsoft AI выпустила MAI-Transcribe-2-Streaming — новую модель для транскрипции в реальном времени. Microsoft заявляет, что по точности она занимает первое место в рейтинге Artificial Analysis. Модель транскрибирует речь на 60 языках и выдает первые предварительные результаты всего за чуть более 100 миллисекунд. По словам Microsoft, это позволяет голосовым агентам отвечать, пока человек еще не закончил фразу. До конца года час аудио стоит $0,54 по вводной цене.
Microsoft также выпустила две новые модели синтеза речи. MAI-Voice-2.1 предназначена для речи на 23 языках одним и тем же голосом, с естественным акцентом для каждого языка. По данным Microsoft, вариант MAI-Voice-2.1-Flash обеспечивает задержку в 150 миллисекунд и стоит $15 за миллион символов вместо $22.
Обе голосовые модели могут клонировать голос всего по нескольким секундам эталонной аудиозаписи, а встроенные меры защиты призваны предотвратить злоупотребления. Модели доступны, среди прочих платформ, через Microsoft Foundry и MAI Playground, а обе голосовые модели также представлены на платформе OpenRouter. В одном тесте около половины из 4 000 участников решили, что голоса принадлежат реальному человеку.
Новости ИИ без шумихи — отобраны людьми
Подпишитесь на THE DECODER, чтобы читать материалы без рекламы, получать еженедельную рассылку об ИИ и эксклюзивный аналитический отчет о передовых разработках «AI Radar» шесть раз в год, полный доступ к архиву и доступ к разделу комментариев.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.