Gradium AI випускає нову TTS-модель за замовчуванням: 81,0% успішного проходження складних випадків і 216 мс до першого звуку
Голосові агенти зазнають збоїв саме на тих частинах дзвінка, які мають найбільше значення: номері замовлення, цифрах для зворотного дзвінка, адресі електронної пошти, яку абонент має записати. Gradium AI випустила нову модель перетворення тексту на мовлення та зробила її стандартною для свого API і Studio. Компанія повідомляє про показник успішного проходження, оцінений людьми, на рівні 81,0% на наборі зі 500 складних речень п’ятьма мовами — це вище, ніж 75,1% у Cartesia Sonic 3.6 і 65,4% у ElevenLabs v3 Conversational. Час до отримання першого аудіо становить 216 мс на P50 у Coval — на 170 мс менше, ніж у моделі, яку вона замінює.
Чи готова вона до розгортання?
Так, уже сьогодні, без міграції. Gradium зробила модель стандартною для свого API і Studio 31 серпня 2026 року. Наявні голоси, зокрема власні клони, продовжують працювати без змін.
Показник точності
Gradium створила набір для оцінювання зі 500 речень і опублікувала його у відкритому доступі на Hugging Face за ліцензією CC BY 4.0: 100 елементів за 10 критеріями п’ятьма мовами (EN, DE, FR, ES, PT). Сім базових критеріїв охоплюють написання слів, акроніми, буквено-цифрові токени, дати, звичайні числа, великі та дробові числа, а також електронні адреси. Три складені критерії (замовлення, ІТ-заявка, страхові вимоги) поєднують кілька з них в одну реалістичну репліку агента.
Оцінювання проводять люди, і воно є суворим. Речення зараховується лише тоді, коли незалежний оцінювач — носій мови — чує, що кожен елемент вимовлено правильно й повністю; одна пропущена цифра означає незарахування речення. Гучність аудіо було нормалізовано, порядок відтворення — рандомізовано, а кількість порівнянь для оцінювачів обмежено 40 із обов’язковою перервою.
Усереднені за десятьма критеріями та п’ятьма мовами з однаковою вагою результати такі: Gradium TTS — 81,0%, Cartesia Sonic 3.6 — 75,1%, ElevenLabs v3 Conversational — 65,4%, Fish Audio S2.1 Pro — 49,5%, Inworld TTS 1.5 Max — 46,5%. Усі результати отримано в серпні 2026 року зі стандартними налаштуваннями.
Показник затримки
У тесті TTS від Coval Gradium повідомляє про час до отримання першого аудіо на рівні 216 мс за P50 — на 170 мс швидше за модель, яку вона замінює. Кориснішим показником є розкид: міжквартильний діапазон p75–p25 становить 30 мс за 480 запусків — це найменший показник серед п’яти протестованих моделей. Медіана Cartesia Sonic 3.6 становить 454 мс, а розкид — 165 мс, або 36% від її власної медіани; абоненти ж відчувають затримки крайніх значень, а не медіан.
Gradium не є найшвидшою моделлю на цьому графіку. Inworld TTS 2 демонструє медіану 166 мс; Fish Audio S2.1 Pro (291 мс) і ElevenLabs v3 Conversational (329 мс) поступаються Gradium. Йдеться про сукупне позиціонування: найнижчий рівень помилок на складних прикладах за часу до отримання першого аудіо менше ніж 250 мс і дуже низької варіативності.
Початок роботи
Наявним користувачам нічого робити не потрібно. Нові команди встановлюють Python SDK, підключаються до кінцевої точки WebSocket TTS і повторно використовують наявні ідентифікатори голосів. Gradium пропонує 1 млн кредитів за повні звіти про помилки на складних прикладах у своєму Discord.
Основні висновки
- Нова модель Gradium TTS доступна й є стандартною з 31 серпня 2026 року; міграція не потрібна.
- Показник успішного проходження, оцінений людьми, становить 81,0% на 500 складних реченнях — вище, ніж у Cartesia, ElevenLabs, Fish Audio та Inworld.
- Час до отримання першого аудіо на Coval за P50 становить 216 мс, а міжквартильний діапазон — 30 мс за 480 запусків.
- Модель читає номери телефонів, електронні адреси, IBAN і довідкові коди без потреби в нормалізації тексту.
- Бенчмарк проведено постачальником, але набір для оцінювання зі 500 речень відкрито опубліковано на Hugging Face за ліцензією CC BY 4.0.
Ознайомтеся з публікацією про випуск і набором даних. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого субреддіту про машинне навчання з понад 150 тис. учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? тепер ви також можете приєднатися до нас у Telegram.
Потрібна співпраця з нами для просування вашого репозиторію GitHub, сторінки на Hugging Face, випуску продукту, вебінару тощо? Зв’яжіться з нами
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.