Gradium стартира Voice Design: Напишете промпт и получете напълно нов синтетичен глас за секунди
Екипите, работещи с гласови агенти, постоянно се сблъскват с един и същ проблем. Каталогът съдържа 400 гласа, а заданието изисква такъв, който не е в него: рецепционистка от Квебек за автокъща в Монреал, разказвач на около шестдесет години с авторитет на лектор в аудитория. Заданията са повече от всеки каталог, а клонирането запълва разликата с по един говорител наведнъж, като всеки от тях изисква намиране на източник, съгласие и лиценз.
Gradium, базираната в Париж компания за гласов изкуствен интелект, отделила се от изследователската лаборатория Kyutai, предлага различен отговор. Voice Design прочита писмено описание и връща напълно нови гласове за няколко секунди. Без референтен аудиозапис, без говорител, без права за уреждане.
Готово ли е за внедряване? Да, Voice Design е наличен в API на Gradium и в Studio, безплатно във всеки план, включително безплатния, а запазеният глас работи със същата поточна крайна точка за преобразуване на текст в реч като всеки глас от каталога, със същата латентност и същите изходни формати.
Заданието за кастинга е API
Описанието е единственият вход, който моделът получава. Документацията на Gradium изброява атрибутите, на които той реагира, и те звучат като обява за кастинг: пол, възрастова група, акцент или произход, височина на гласа, темпо, енергия, тембър и резонанс, регистър и маниер, както и работата, която гласът изпълнява. Описанията са с дължина от 1 до 500 знака на английски, френски, испански, португалски или немски език. Gradium препоръчва да завършвате с предназначената употреба, защото това насочва начина на поднасяне и регистъра, а не само цвета на гласа.
Една заявка връща от 1 до 5 кандидати, обикновено готови за 3 до 5 секунди. Те са варианти на един и същ персонаж, така че различен персонаж означава различно описание, а не повече мостри.
От кандидат до глас за продукция
Процесът включва четири извиквания. POST /voice-generator/generate създава идентификатори на кандидати с ready: false. GET /voice-generator/embeddings проверява състоянието, докато те се променят. Всеки кандидат се прослушва чрез стандартната крайна точка за TTS, като идентификаторът на кандидата се използва като voice_id. POST /voices/from-embedding повишава избрания от вас кандидат.
Кандидатите имат три ограничения, които преобразуваните гласове нямат: текстът за прослушване е ограничен до 100 знака, те работят само чрез REST, а TTS WebSocket и Speech-to-Speech ги отхвърлят. Непреобразуваните кандидати се изтриват след 30 дни. Преобразуването е безплатно, премахва срока на изтичане и използва един слот за персонализиран глас, споделен с клонираните гласове. Безплатният план поддържа 5, а платените планове — 1 000.
Извличането на проби умишлено е недетерминистично. Екипът на Gradium първо разширява описанието и това разширение варира при всяка заявка, така че една и съща подсказка с фиксиран seed все пак генерира различен глас.
Бенчмаркът и как да го разчитаме
Gradium проведе сляп тест за слушане по двойки върху подсказки за акценти в шест системи за дизайн на гласове, достъпни чрез публични API, и на пет езика. Носители на езика чуха два немаркирани клипа и избраха по-близкия до зададеното съвпадение или равенство. В 7 627 сравнения Gradium отчита успеваемост от 72,6% спрямо останалите системи, с 13,6 процентни пункта пред ElevenLabs eleven_ttv_v3 при 59,0%, следван от Inworld с 44,8%, Fish Audio с 36,7% и MiniMax с 31,7%. Процентът успеваемост се изчислява като победите плюс половината от равенствата, така че 50% е средният резултат. Gradium зае първо място и на петте езика. Най-големите разлики бяха при регионалните акценти, които повечето каталози изглаждат: френски от Квебек — 97%, риоплатски испански — 86%, баварски немски — 85%, колумбийски испански и африкански португалски — 83%.
Моделен оценител върху същия набор от подсказки потвърди резултата. Gemini 3.1 Pro оцени единични немаркирани клипове по скала от 1 до 5 и даде същото класиране: Gradium — 4,06, ElevenLabs — 3,86, Inworld — 3,64, Fish Audio — 3,51. Отделно продуктовата страница твърди, че постига 83,4% съответствие с подсказките в английската част на InstructTTSEval, академичния бенчмарк за следване на инструкции при TTS. (Забележка: Всички тези числа са разработени и отчетени от самите доставчици.)
Основни изводи
- Voice Design превръща описание от 500 знака в до 5 нови гласа за секунди, без да е необходим референтен аудиозапис.
- Той е наличен и безплатен във всеки план на Gradium, в API и Studio, на 5 езика.
- Слепите тестове, проведени от доставчика, показват успеваемост от 72,6% в 7 627 сравнения и първо място и на петте езика.
- Запазените гласове се превръщат в стандартен
voice_idза REST, WebSocket и Speech-to-Speech. - Извличането на проби е недетерминистично, така че незапазеният кандидат изчезва завинаги след 30 дни.
Разгледайте Техническите подробности и Документацията. Също така, можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия SubReddit за машинно обучение с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Сега можете да се присъедините към нас и в Telegram.
Имате нужда от партньорство с нас за популяризиране на вашето GitHub хранилище ИЛИ страница в Hugging Face ИЛИ представяне на продукт ИЛИ уебинар и т.н.? Свържете се с нас
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.