Gradium AI выпускает новую TTS-модель по умолчанию: 81,0% успешного прохождения сложных случаев при 216 мс до первого звука
Голосовые агенты ошибаются именно в тех частях звонка, которые имеют наибольшее значение: номере заказа, цифрах для обратного звонка, адресе электронной почты, который звонящий должен записать. Gradium AI выпустила новую модель преобразования текста в речь и сделала её используемой по умолчанию во всём API и Studio. Компания сообщает о показателе успешного прохождения в 81,0% по оценкам людей на наборе из 500 сложных предложений на пяти языках — это выше, чем 75,1% у Cartesia Sonic 3.6 и 65,4% у ElevenLabs v3 Conversational. Время до первого аудиосигнала составляет 216 мс на P50 в Coval — на 170 мс быстрее заменяемой модели.
Можно ли развернуть?
Да, уже сегодня, без миграции. Gradium переключила модель в качестве используемой по умолчанию во всём API и Studio 31 августа 2026 года. Существующие голоса, включая пользовательские клоны, продолжают работать без изменений.
Показатель точности
Gradium создала набор для оценки из 500 предложений и опубликовала его в открытом доступе на Hugging Face по лицензии CC BY 4.0: 100 элементов по 10 критериям на пяти языках (EN, DE, FR, ES, PT). Семь атомарных критериев охватывают написание, акронимы, буквенно-цифровые токены, даты, обычные числа, большие числа и числа с плавающей точкой, а также электронную почту. Три составных критерия (Orders, IT Ticket, Claims) объединяют несколько из них в одну реалистичную реплику агента.
Оценивание проводится людьми и отличается строгостью. Предложение засчитывается только в том случае, если независимый носитель языка слышит, что каждый элемент произнесён правильно и полностью; пропуск одной цифры означает провал всего предложения. Громкость аудио была нормализована, порядок воспроизведения рандомизирован, а для оценщиков установлен лимит в 40 сравнений с обязательным перерывом.
Общие результаты по десяти критериям, усреднённые по пяти языкам с одинаковым весом: Gradium TTS — 81,0%, Cartesia Sonic 3.6 — 75,1%, ElevenLabs v3 Conversational — 65,4%, Fish Audio S2.1 Pro — 49,5%, Inworld TTS 1.5 Max — 46,5%. Все результаты получены в августе 2026 года при настройках по умолчанию.
Показатель задержки
В тесте Coval для TTS Gradium сообщает о времени до первого аудиосигнала в 216 мс на P50 — на 170 мс быстрее заменяемой модели. Более полезным показателем является разброс: межквартильный диапазон p75–p25 составляет 30 мс по итогам 480 запусков — это самый небольшой показатель среди пяти протестированных моделей. Медианное значение Cartesia Sonic 3.6 составляет 454 мс при разбросе в 165 мс, то есть 36% от её собственного медианного значения, а звонящие сталкиваются с задержками в хвосте распределения, а не с медианными показателями.
Gradium не является самой быстрой моделью на этом графике. Inworld TTS 2 показывает медианное значение 166 мс; Fish Audio S2.1 Pro (291 мс) и ElevenLabs v3 Conversational (329 мс) уступают Gradium. Заявление касается совокупного результата: самого низкого уровня ошибок на сложных случаях при времени до первого аудиосигнала менее 250 мс и очень небольшой вариативности.
Начало работы
Существующим пользователям ничего делать не нужно. Новым командам требуется установить Python SDK, подключиться к конечной точке TTS по WebSocket и повторно использовать существующие идентификаторы голосов. Gradium предлагает 1 млн кредитов за подробные отчёты об ошибках на сложных случаях в своём Discord.
Ключевые выводы
- Новая модель Gradium TTS запущена и используется по умолчанию с 31 августа 2026 года; миграция не требуется.
- Показатель успешного прохождения по оценкам людей составил 81,0% на 500 сложных предложениях — выше, чем у Cartesia, ElevenLabs, Fish Audio и Inworld.
- Время до первого аудиосигнала на P50 в Coval составляет 216 мс, а межквартильный разброс по 480 запускам — 30 мс.
- Модель озвучивает номера телефонов, адреса электронной почты, IBAN и справочные коды без необходимости нормализации текста.
- Тестирование проводилось поставщиком, однако набор для оценки из 500 предложений открыт на Hugging Face по лицензии CC BY 4.0.
Ознакомьтесь с публикацией о выпуске и набором данных. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту по машинному обучению с более чем 150 тыс. участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? теперь к нам можно присоединиться и в Telegram.
Хотите сотрудничать с нами для продвижения своего репозитория GitHub, страницы на Hugging Face, выпуска продукта, вебинара и т. д.? Свяжитесь с нами
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.