Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← К новостям

Gradium AI выпускает новую TTS-модель по умолчанию: 81,0% успешного прохождения сложных случаев при 216 мс до первого звука

Голосовые агенты ошибаются именно в тех частях звонка, которые имеют наибольшее значение: номере заказа, цифрах для обратного звонка, адресе электронной почты, который звонящий должен записать. Gradium AI выпустила новую модель преобразования текста в речь и сделала её используемой по умолчанию во всём API и Studio. Компания сообщает о показателе успешного прохождения в 81,0% по оценкам людей на наборе из 500 сложных предложений на пяти языках — это выше, чем 75,1% у Cartesia Sonic 3.6 и 65,4% у ElevenLabs v3 Conversational. Время до первого аудиосигнала составляет 216 мс на P50 в Coval — на 170 мс быстрее заменяемой модели.

Можно ли развернуть?

Да, уже сегодня, без миграции. Gradium переключила модель в качестве используемой по умолчанию во всём API и Studio 31 августа 2026 года. Существующие голоса, включая пользовательские клоны, продолжают работать без изменений.

Показатель точности

Gradium создала набор для оценки из 500 предложений и опубликовала его в открытом доступе на Hugging Face по лицензии CC BY 4.0: 100 элементов по 10 критериям на пяти языках (EN, DE, FR, ES, PT). Семь атомарных критериев охватывают написание, акронимы, буквенно-цифровые токены, даты, обычные числа, большие числа и числа с плавающей точкой, а также электронную почту. Три составных критерия (Orders, IT Ticket, Claims) объединяют несколько из них в одну реалистичную реплику агента.

Оценивание проводится людьми и отличается строгостью. Предложение засчитывается только в том случае, если независимый носитель языка слышит, что каждый элемент произнесён правильно и полностью; пропуск одной цифры означает провал всего предложения. Громкость аудио была нормализована, порядок воспроизведения рандомизирован, а для оценщиков установлен лимит в 40 сравнений с обязательным перерывом.

Общие результаты по десяти критериям, усреднённые по пяти языкам с одинаковым весом: Gradium TTS — 81,0%, Cartesia Sonic 3.6 — 75,1%, ElevenLabs v3 Conversational — 65,4%, Fish Audio S2.1 Pro — 49,5%, Inworld TTS 1.5 Max — 46,5%. Все результаты получены в августе 2026 года при настройках по умолчанию.

Показатель задержки

В тесте Coval для TTS Gradium сообщает о времени до первого аудиосигнала в 216 мс на P50 — на 170 мс быстрее заменяемой модели. Более полезным показателем является разброс: межквартильный диапазон p75–p25 составляет 30 мс по итогам 480 запусков — это самый небольшой показатель среди пяти протестированных моделей. Медианное значение Cartesia Sonic 3.6 составляет 454 мс при разбросе в 165 мс, то есть 36% от её собственного медианного значения, а звонящие сталкиваются с задержками в хвосте распределения, а не с медианными показателями.

Gradium не является самой быстрой моделью на этом графике. Inworld TTS 2 показывает медианное значение 166 мс; Fish Audio S2.1 Pro (291 мс) и ElevenLabs v3 Conversational (329 мс) уступают Gradium. Заявление касается совокупного результата: самого низкого уровня ошибок на сложных случаях при времени до первого аудиосигнала менее 250 мс и очень небольшой вариативности.

Начало работы

Существующим пользователям ничего делать не нужно. Новым командам требуется установить Python SDK, подключиться к конечной точке TTS по WebSocket и повторно использовать существующие идентификаторы голосов. Gradium предлагает 1 млн кредитов за подробные отчёты об ошибках на сложных случаях в своём Discord.

Ключевые выводы

  • Новая модель Gradium TTS запущена и используется по умолчанию с 31 августа 2026 года; миграция не требуется.
  • Показатель успешного прохождения по оценкам людей составил 81,0% на 500 сложных предложениях — выше, чем у Cartesia, ElevenLabs, Fish Audio и Inworld.
  • Время до первого аудиосигнала на P50 в Coval составляет 216 мс, а межквартильный разброс по 480 запускам — 30 мс.
  • Модель озвучивает номера телефонов, адреса электронной почты, IBAN и справочные коды без необходимости нормализации текста.
  • Тестирование проводилось поставщиком, однако набор для оценки из 500 предложений открыт на Hugging Face по лицензии CC BY 4.0.

Ознакомьтесь с публикацией о выпуске и набором данных. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту по машинному обучению с более чем 150 тыс. участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? теперь к нам можно присоединиться и в Telegram.

Хотите сотрудничать с нами для продвижения своего репозитория GitHub, страницы на Hugging Face, выпуска продукта, вебинара и т. д.? Свяжитесь с нами

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости