Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← К новостям

Gradium запускает Voice Design: напишите промпт и получите совершенно новый синтетический голос за считаные секунды

Команды, создающие голосовых агентов, постоянно упираются в одну и ту же стену. В каталоге 400 голосов, а в брифе нужен тот, которого там нет: квебекская администраторша для автодилера в Монреале, диктор за шестьдесят с авторитетом лектора. Брифов больше, чем голосов в любом каталоге, а клонирование сокращает разрыв по одному говорящему за раз, и каждый из них требует поиска источника, согласия и лицензии.

Gradium, парижская компания в сфере голосового ИИ, выделившаяся из исследовательской лаборатории Kyutai, предложила другой ответ. Voice Design читает письменное описание и за несколько секунд возвращает полностью новые голоса. Не нужны референсная аудиозапись, конкретный диктор или разрешение на использование прав.

Готово ли это к внедрению? Да, Voice Design доступен в API Gradium и в Studio, бесплатно на любом тарифе, включая бесплатный, а сохранённый голос работает через тот же потоковый эндпоинт преобразования текста в речь, что и любой голос из каталога, с такой же задержкой и в тех же форматах вывода.

Бриф для кастинга — это API

Описание — единственный входной параметр, который получает модель. В документации Gradium перечислены атрибуты, на которые она реагирует, и они напоминают заявку на кастинг: пол, возрастная группа, акцент или происхождение, высота тона, темп, энергичность, тембр и резонанс, регистр и манера речи, а также задача, которую выполняет голос. Описания могут содержать от 1 до 500 символов на английском, французском, испанском, португальском или немецком языках. Gradium рекомендует заканчивать описание указанием предполагаемого использования, поскольку это влияет на подачу и регистр, а не только на окраску голоса.

Один запрос возвращает от 1 до 5 кандидатов, обычно готовых через 3–5 секунд. Это вариации одного персонажа, поэтому для другого персонажа нужно другое описание, а не больше образцов.

От кандидата к производственному голосу

Процесс состоит из четырёх вызовов. POST /voice-generator/generate создаёт идентификаторы кандидатов со значением ready: false. GET /voice-generator/embeddings выполняет опрос, пока их статус не изменится. Каждый кандидат прослушивается через обычный эндпоинт TTS с использованием идентификатора кандидата в качестве voice_id. POST /voices/from-embedding переводит выбранный голос в рабочий статус.

У кандидатов есть три ограничения, которых нет у преобразованных голосов: текст для прослушивания ограничен 100 символами, они доступны только через REST, а TTS WebSocket и Speech-to-Speech их не принимают. Непреобразованные кандидаты удаляются через 30 дней. Преобразование бесплатно, снимает срок действия и использует один слот пользовательского голоса, общий с клонами. На бесплатном тарифе доступно 5 слотов, на платных — 1 000.

Сэмплирование намеренно недетерминировано. Сначала команда Gradium расширяет описание, и это расширение меняется при каждом запросе, поэтому один и тот же промпт с фиксированным seed всё равно создаёт другой голос.

Бенчмарк и то, как его интерпретировать

Gradium провела слепой парный тест прослушивания акцентных промптов в шести системах Voice Design, доступных через публичные API, и на пяти языках. Носители языка слышали два немаркированных фрагмента и выбирали наиболее близкое соответствие либо ничью. В 7 627 сравнениях Gradium сообщает о показателе побед 72,6% по сравнению с остальными системами — на 13,6 процентного пункта выше, чем у ElevenLabs eleven_ttv_v3 с результатом 59,0%; далее следуют Inworld с 44,8%, Fish Audio с 36,7% и MiniMax с 31,7%. Показатель побед рассчитывается как сумма побед и половины ничьих, поэтому 50% — это паритет. Gradium заняла первое место на всех пяти языках. Наибольший отрыв был достигнут на региональных акцентах, которые большинство каталогов сглаживает: квебекский французский — 97%, риоплатский испанский — 86%, баварский немецкий — 85%, колумбийский испанский и африканский португальский — по 83%.

Судья-модель, оценивавший тот же набор промптов, подтвердил результат. Gemini 3.1 Pro оценивал отдельные немаркированные фрагменты по шкале от 1 до 5 и составил такой же рейтинг: Gradium — 4,06, ElevenLabs — 3,86, Inworld — 3,64, Fish Audio — 3,51. Отдельно на странице продукта заявлено соответствие промптам на уровне 83,4% на англоязычной части InstructTTSEval — академического бенчмарка для следования инструкциям в системах TTS. (Примечание: все эти показатели разработаны и измерены самими поставщиками.)

Основные выводы

  • Voice Design превращает описание длиной 500 символов в до 5 новых голосов за считанные секунды, при этом референсная аудиозапись не требуется.
  • Сервис доступен и бесплатен на любом тарифе Gradium, в API и Studio, на 5 языках.
  • Слепые тесты, проведённые поставщиком, показали показатель побед 72,6% в 7 627 сравнениях; сервис занял первое место на всех 5 языках.
  • Сохранённые голоса становятся обычным voice_id для REST, WebSocket и Speech-to-Speech.
  • Сэмплирование недетерминировано, поэтому несохранённый кандидат окончательно исчезает через 30 дней.

Ознакомьтесь с техническими подробностями и документацией. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с аудиторией более 150 тыс. участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? теперь к нам можно присоединиться и в Telegram.

Хотите сотрудничать с нами в продвижении вашего репозитория GitHub, страницы на Hugging Face, выпуска продукта, вебинара и т. д.? Свяжитесь с нами

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости