Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← К новостям

Открытый рейтинг TTS: масштабируемая оценка многоязычного синтеза речи и клонирования голоса

Открытый рейтинг TTS: масштабируемая оценка многоязычного синтеза речи и клонирования голоса
Опубликовано 30 сентября 2026 г.
Обновить на GitHub
Темп выпуска моделей синтеза речи (TTS) с открытым исходным кодом невероятно высок. На Hugging Face Hub (по состоянию на 30 сентября 2026 года) доступно более 8 тыс. моделей TTS 🚀

Однако оценка не успевает за этим темпом: она остаётся фрагментированной и нестандартизированной. Золотым стандартом считаются оценки человеческих предпочтений, такие как MOS или MUSHRA (подробнее о метриках). Для этого несколько рейтингов на основе арен стали полезными ориентирами для сообщества:

  1. TTS Arena v2
  2. Artificial Analysis
  3. Voice Arena

На этих аренах модели сравниваются следующим образом: пользователям показывают результаты TTS двух моделей и предлагают выбрать один из них. После сбора достаточного числа голосов вычисляется рейтинг Эло для ранжирования моделей, обычно с использованием модели Брэдли—Терри (см. методологию Voice Arena).

Хотя человеческое предпочтение является главным критерием, арены не могут масштабироваться достаточно быстро, чтобы поспевать за темпом выпуска TTS-моделей. Отчасти это может объяснять, почему модели с открытым исходным кодом недостаточно представлены в рейтингах на основе арен: по состоянию на 30 сентября 2026 года только 16 из 92 моделей в Artificial Analysis имеют открытые веса; аналогичная ситуация наблюдается и в Voice Arena. Вероятно, это отражает практические факторы: для добавления модели с API требуется немногим больше, чем ключ API, тогда как открытую модель оператору арены необходимо разместить и обслуживать, а у коммерческих провайдеров больше причин добиваться включения в рейтинг, чем у авторов моделей с открытым исходным кодом. Ещё одно ограничение оценки на основе арен — согласованность голосующих: ни одна арена не может гарантировать, что одни и те же пользователи с одинаковыми критериями «лучшего» результата будут стабильно оценивать модели с течением времени. Даже предпочтения одного человека со временем меняются («Нельзя дважды войти в одну и ту же реку», как известно, сказал Гераклит).

Для решения этой задачи мы создали открытый рейтинг TTS, в котором для оценки моделей используются объективные метрики, отражающие взаимодополняющие аспекты производительности:

  1. Разборчивость: частота ошибок слов/символов (WER и CER) между текстом запроса и расшифровкой сгенерированного аудио с использованием Qwen3 ASR (модели с открытым исходным кодом, занимающей первое место в открытом рейтинге ASR).
  2. Скорость: обратный коэффициент реального времени (RTFx) для пакетного офлайн-вывода на GPU H200 и время до первого аудио (TTFA) для измерения задержки потоковой обработки с размером пакета 1 на GPU H200 и CPU.
  3. Сходство говорящего, вычисляемое как косинусное сходство (SIM) между эмбеддингами говорящего WavLM сгенерированного аудио и эталонного фрагмента.

Благодаря объективным метрикам оценка модели занимает не пару недель (на сбор голосов), а всего пару часов ⚡

Важно отметить, что открытый рейтинг TTS не заменяет ранжирование по человеческим предпочтениям. WER на основе ASR служит приближённой оценкой разборчивости, а сходство говорящего оценивает сохранение идентичности голоса. Ни одна из этих метрик напрямую не измеряет естественность, выразительность или предпочтения слушателей. Тем не менее они могут даже помочь рейтингам на основе голосования определить, какие модели включать в оценку.

Мы хотим, чтобы этот рейтинг формировался сообществом; мы ждём ваших отзывов, чтобы оценки оставались актуальными и содержательными. В следующих разделах представлен обзор основных функций открытого рейтинга TTS.

Оценка многоязычности и клонирования голоса

В представлении рейтинга по умолчанию модели ранжируются по макроусреднённому WER на англоязычных частях наборов данных Seed TTS Eval (статья) и CV3 Eval (zero-shot) (статья).

thumbnail
thumbnail
thumbnail

hexgrad/Kokoro-82M, Supertone/supertonic-3 и fishaudio/s2-pro лидируют по WER для английского языка при усреднении по этим двум частям, а графики Парето показывают, какие модели обеспечивают оптимальный баланс между WER, пакетным выводом (RTFx) и размером.

Результаты для английского языка не обязательно переносятся на другие языки. Можно выбрать несколько языков, чтобы ранжировать модели по многоязычной производительности. Seed TTS Eval содержит аудио только для английского и китайского языков, поэтому для остальных языков отображается исключительно результат на CV3 Eval (zero-shot). Обратите внимание, что китайский, японский и корейский являются языками с посимвольной записью, поэтому для них указывается частота ошибок символов (CER), а показатель «Средний WER» по языкам представляет собой макроусреднение по языкам.

thumbnail

k2-fsa/OmniVoice, fishaudio/s2-pro и FunAudioLLM/Fun-CosyVoice3-0.5B-2512 — сильные многоязычные модели.

При включении функции «Клонирование голоса» можно сравнить модели, поддерживающие эту возможность (для выбранных языков).

Кроме того, в таблице появляется столбец SIM для сходства говорящего, а также ещё два графика Парето, визуализирующие компромисс между SIM, пакетным выводом и размером.

thumbnail
thumbnail

Средний WER некоторых моделей, таких как bosonai/higgs-tts-3-4b и openbmb/VoxCPM2, улучшается при клонировании голоса, то есть при наличии эталонного аудио.

Сравнение результатов TTS и голосование

Числа рассказывают лишь часть истории, и, как уже упоминалось, человеческое предпочтение является главным критерием. На вкладке «Прослушать» можно сравнить сгенерированные результаты, лежащие в основе метрик, и определить, какая модель или модели вам больше нравятся!

Выберите интересующий вас язык/набор данных, укажите, хотите ли вы сравнивать клонирование голоса, а затем при желании выберите модели или прослушайте результаты случайной выборки.

Вкладка «Прослушать» восполняет важный пробел в существующих рейтингах TTS: это пространство для изучения результатов работы различных моделей.

thumbnail

Можно также оставить отзыв о сгенерированных результатах. По мере сбора новых голосов сообщества мы можем включить эти данные в рейтинг. Так что голосуйте! Но, пожалуйста, войдите в аккаунт HF, чтобы помочь нам отсеивать спам и ботов.

thumbnail

Производительность потоковой обработки

На вкладке «Потоковая обработка» сравниваются возможности потоковой обработки. Модели ранжируются по TTFA (времени до первого аудио), которое показывает, сколько времени пользователь ждёт после отправки запроса модели, прежде чем получить аудио, доступное для воспроизведения. Это важно для голосовых агентов и других интерактивных приложений.

Для потоковых моделей (✅ в разделе «Streaming API») измеряется время до поступления первого аудиофрагмента. Для непотоковых моделей — время до генерации всей фразы, поскольку воспроизведение не может начаться раньше. Каждая модель обрабатывает по одному аудио за раз (размер пакета 1), используя одни и те же 50 английских запросов из CV3-Eval, на одном и том же оборудовании и с голосом по умолчанию. Первые 3 запуска отбрасываются как прогревочные, а в качестве TTFA указывается медиана остальных запусков.

thumbnail
thumbnail

В представлении по умолчанию сравнивается производительность на GPU H200. Результаты также доступны для CPU для небольшого (но растущего) набора моделей!

thumbnail

kyutai/pocket-tts — отличная модель для потоковой обработки как на GPU, так и на CPU!

Заключение

Цель открытого рейтинга TTS — не только успевать за невероятным темпом выпуска TTS-моделей, но и формировать его силами сообщества; мы хотим получать ваши отзывы, чтобы оценки оставались актуальными и содержательными. Расскажите нам, какие наборы данных, модели и метрики вы хотите видеть!

Пока мы сосредоточились на следующем:

  1. Модели с открытым исходным кодом, чтобы представить множество отличных моделей, которыми пренебрегали оценки на основе арен.
  2. Многоязычность, поскольку результаты для английского языка не являются подходящим показателем для других языков.

Вскоре мы опубликуем скрипты оценки с открытым исходным кодом, подобно репозиторию открытого рейтинга ASR, чтобы вы могли напрямую отправлять свои отзывы и предложения через Issues и PR на GitHub! Давайте вместе формировать оценку TTS 🤗

Модели, упомянутые в этой статье 10

Пространства, упомянутые в этой статье 3

Статьи, упомянутые в этой статье 2

Сообщество

Загружайте изображения, аудио и видео, перетаскивая их в поле ввода текста, вставляя или нажимая здесь.
Нажмите или вставьте сюда, чтобы загрузить изображения

· Зарегистрируйтесь или войдите, чтобы оставить комментарий

Модели, упомянутые в этой статье 10

Пространства, упомянутые в этой статье 3

Статьи, упомянутые в этой статье 2

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием Hugging Face

Читать оригинал на Hugging Face ↗

Текст и изображения принадлежат Hugging Face и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости