Gradium запускає Voice Design: напишіть промпт і отримайте абсолютно новий синтетичний голос за лічені секунди
Команди голосових агентів постійно натрапляють на ту саму перешкоду. У каталозі є 400 голосів, а бриф вимагає голосу, якого в ньому немає: квебекської адміністраторки для автодилера в Монреалі, диктора за шістдесят із авторитетом лектора. Брифів більше, ніж будь-який каталог може охопити, а клонування скорочує розрив по одному мовцю за раз, і кожен із них потребує пошуку джерела, згоди та ліцензії.
Gradium, паризька компанія у сфері ШІ для роботи з голосом, що виникла на базі дослідницької лабораторії Kyutai, запропонувала іншу відповідь. Voice Design читає письмовий опис і за кілька секунд повертає повністю нові голоси. Не потрібні референсний аудіозапис, мовець чи права, які потрібно оформлювати.
Чи готове це до використання? Так, Voice Design доступний у Gradium API та в Studio, безкоштовний на всіх тарифах, включно з безкоштовним, а збережений голос працює через ту саму потокову кінцеву точку Text-to-Speech, що й будь-який голос із каталогу, з такою самою затримкою та у тих самих форматах виводу.
Кастинговий бриф — це API
Опис — єдині вхідні дані, які отримує модель. У документації Gradium перелічено атрибути, на які вона реагує, і вони нагадують кастингове оголошення: стать, вікова категорія, акцент або походження, висота тону, темп, енергійність, тембр і резонанс, регістр і манера, а також завдання, яке виконує голос. Описи можуть містити від 1 до 500 символів англійською, французькою, іспанською, португальською або німецькою мовою. Gradium радить завершувати опис зазначенням цільового використання, оскільки це спрямовує подачу та регістр, а не лише забарвлення голосу.
Один запит повертає від 1 до 5 кандидатів, які зазвичай готові за 3–5 секунд. Це варіації одного персонажа, тож для іншого персонажа потрібен інший опис, а не більша кількість зразків.
Від кандидата до готового для виробництва голосу
Процес складається з чотирьох викликів. POST /voice-generator/generate створює ідентифікатори кандидатів зі значенням ready: false. GET /voice-generator/embeddings надсилає запити, доки вони не зміняться. Кожного кандидата можна прослухати через звичайну кінцеву точку TTS, використовуючи ідентифікатор кандидата як voice_id. POST /voices/from-embedding перетворює обраного кандидата на постійний голос.
Для кандидатів діють три обмеження, яких немає у перетворених голосів: текст для прослуховування обмежений 100 символами, вони доступні лише через REST, а TTS WebSocket і Speech-to-Speech їх не приймають. Неперетворені кандидати видаляються через 30 днів. Перетворення безкоштовне, скасовує термін дії та використовує один слот користувацького голосу, спільний із клонами. Безкоштовний тариф передбачає 5 слотів, платні — 1 000.
Семплювання навмисно недетерміноване. Спочатку команда Gradium розширює опис, і це розширення відрізняється в кожному запиті, тож навіть той самий промпт із фіксованим seed щоразу дає інший голос.
Бенчмарк і те, як його читати
Gradium провела сліпий парний тест прослуховування акцентів у шести системах дизайну голосу, доступних через публічні API, та п’яти мовах. Носії мови слухали два немарковані аудіофрагменти й обирали той, що більше відповідає запиту, або нічию. За результатами 7 627 порівнянь Gradium повідомляє про частку перемог 72,6% проти всіх учасників, що на 13,6 процентного пункта вище за ElevenLabs eleven_ttv_v3 із показником 59,0%; далі йдуть Inworld — 44,8%, Fish Audio — 36,7% і MiniMax — 31,7%. Частка перемог — це перемоги плюс половина нічиїх, тож 50% є паритетом. Gradium посіла перше місце всіма п’ятьма мовами. Найбільша перевага була в регіональних акцентах, які більшість каталогів нівелює: квебекська французька — 97%, ріоплатська іспанська — 86%, баварська німецька — 85%, колумбійська іспанська та африканська португальська — по 83%.
Суддя-модель, оцінюючи той самий набір промптів, дійшов аналогічного висновку. Gemini 3.1 Pro оцінила окремі немарковані аудіофрагменти за шкалою від 1 до 5 і відтворила той самий рейтинг: Gradium — 4,06, ElevenLabs — 3,86, Inworld — 3,64, Fish Audio — 3,51. Окремо на сторінці продукту заявлено 83,4% відповідності промптам на англомовній частині InstructTTSEval — академічного бенчмарку для дотримання інструкцій у TTS. (Примітка: усі ці показники розроблені та отримані постачальниками.)
Ключові висновки
- Voice Design перетворює опис довжиною до 500 символів на до 5 нових голосів за лічені секунди, без потреби в референсному аудіо.
- Сервіс доступний і безкоштовний на всіх тарифах Gradium, в API та Studio, п’ятьма мовами.
- У сліпих тестах, проведених постачальником, він досяг частки перемог 72,6% у 7 627 порівняннях і посів перше місце всіма п’ятьма мовами.
- Збережені голоси стають звичайним
voice_idдля REST, WebSocket і Speech-to-Speech. - Семплювання недетерміноване, тому незбережений кандидат безповоротно зникає через 30 днів.
Ознайомтеся з технічними деталями та документацією. Також стежте за нами у Twitter і не забудьте приєднатися до нашого сабреддіту про машинне навчання зі 150 тисячами+ учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? тепер ви також можете приєднатися до нас у Telegram.
Потрібно співпрацювати з нами для просування вашого репозиторію GitHub, сторінки Hugging Face, релізу продукту, вебінару тощо? Зв’яжіться з нами
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.