Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← Към новините

Отворена класация за TTS: мащабируема оценка на многоезичен синтез на реч и клониране на гласове

Отворена класация за TTS: мащабируема оценка за многоезичен синтез на реч и клониране на глас
Публикувано 30 септември 2026 г.
Актуализация в GitHub
Темпото на публикуване на модели с отворен код за преобразуване на текст в реч (TTS) е невероятно. В Hugging Face Hub (към 30 септември 2026 г.) има повече от 8 хил. TTS модела 🚀

Оценяването обаче не успява да следва този темп: то остава разпокъсано и нестандартизирано. Златният стандарт са оценките за човешки предпочитания, като MOS или MUSHRA (повече за метриките). За тази цел няколко класации, базирани на арени, се утвърдиха като полезни отправни точки за общността:

  1. TTS Arena v2
  2. Artificial Analysis
  3. Voice Arena

Тези арени сравняват модели, като представят на потребителите TTS изходи от два модела и ги молят да изберат единия пред другия. След събирането на достатъчен брой гласове се изчислява оценка Elo, с която моделите се класират, обикновено чрез модела на Bradley–Terry (вж. методологията на Voice Arena).

Макар човешкото предпочитание да е крайният арбитър, арените не могат да се разрастват достатъчно бързо, за да следват темпото на публикуване на TTS модели. Това може отчасти да обяснява защо моделите с отворен код са недостатъчно представени в класациите, базирани на арени: към 30 септември 2026 г. само 16 от 92-та модела в Artificial Analysis са с отворени тегла, като подобно съотношение се наблюдава и във Voice Arena. Това вероятно отразява практически фактори: добавянето на API модел изисква малко повече от API ключ, докато моделът с отворен код трябва да бъде хостван и предоставян от оператора на арената, а търговските доставчици имат по-голяма причина да търсят място в класацията от авторите на модели с отворен код. Друго ограничение на оценяването чрез арени е постоянството на гласуващите: никоя арена не може да гарантира, че едни и същи гласуващи, използващи едни и същи критерии за „по-добро“, ще оценяват последователно моделите с течение на времето. Дори предпочитанията на един и същ човек се променят с времето („Човек не може да влезе два пъти в една и съща река“, както прочуто е казал Хераклит).

С тази цел създадохме Отворената TTS класация, която използва обективни метрики за оценяване на моделите по допълващи се аспекти на производителността:

  1. Разбираемост: процент грешки на думи/символи (WER и CER) между подадената инструкция и транскрипцията на генерираното аудио, като се използва Qwen3 ASR (моделът с отворен код с най-висок резултат в Отворената ASR класация).
  2. Скорост: обратният коефициент на реално време (RTFx) при пакетен офлайн инференс върху GPU H200 и време до първото аудио (TTFA) за измерване на латентността при стрийминг с размер на пакета 1 върху GPU H200 и CPU.
  3. Сходство на говорителя, изчислено чрез косинусова прилика (SIM) между векторните представяния на говорителя от WavLM на генерираното аудио и референтния клип.

Като разчитаме на обективни метрики, оценяването на един модел се съкращава от няколко седмици (за събиране на гласове) до няколко часа ⚡

Важно е да се отбележи, че Отворената TTS класация не заменя класирането според човешките предпочитания. WER, базиран на ASR, е косвен показател за разбираемост, докато сходството на говорителя оценява запазването на идентичността на гласа. Нито една от тези метрики не измерва пряко естествеността, изразителността или предпочитанията на слушателите. Въпреки това те дори могат да помогнат на класациите, базирани на гласуване, да определят кои модели да включат в оценяването си.

Нашето намерение е тази класация да бъде оформяна от общността; искаме да чуем обратната ви връзка, за да останат оценяванията актуални и съдържателни. Следващите няколко раздела представят основните характеристики на Отворената TTS класация.

Многоезично оценяване + клониране на глас

В изгледа по подразбиране на класацията моделите са подредени според макроусреднения WER върху английските подмножества на Seed TTS Eval (статия) и CV3 Eval (zero-shot) (статия).

thumbnail
thumbnail
thumbnail

hexgrad/Kokoro-82M, Supertone/supertonic-3 и fishaudio/s2-pro водят по WER на английски, усреднен върху тези две подмножества, докато графиките на Парето визуализират кои модели постигат добър баланс между WER, пакетен инференс (RTFx) и размер.

Производителността на английски не се пренася непременно към други езици. Може да се превключва между няколко езика, за да се класират моделите според многоезичната им производителност. Seed TTS Eval разполага с аудио само за английски и китайски, така че за останалите езици се използва единствено резултатът от CV3 Eval (zero-shot). Имайте предвид, че китайският, японският и корейският са езици, базирани на символи, поради което се отчита процентът грешки на символи (CER), а „Средният WER“ за различните езици е макроусреднена стойност за езиците.

thumbnail

k2-fsa/OmniVoice, fishaudio/s2-pro и FunAudioLLM/Fun-CosyVoice3-0.5B-2512 са силни многоезични модели.

Чрез превключване на „Клониране на глас“ могат да се сравняват моделите, които поддържат тази функционалност (на избраните езици).

Освен това в таблицата вече се появява колона SIM за сходството на говорителя, както и още две графики на Парето за визуализиране на компромиса между SIM, пакетния инференс и размера.

thumbnail
thumbnail

Средният WER на някои модели, като bosonai/higgs-tts-3-4b и openbmb/VoxCPM2, се подобрява при клониране на глас, тоест когато е предоставен референтен аудиозапис.

Сравнявайте и гласувайте за TTS изходи

Числата разказват само част от историята и, както споменахме по-рано, човешкото предпочитание е крайният арбитър. В раздела „Слушане“ можете да сравнявате генерираните изходи, върху които се основават метриките, за да установите кой модел или кои модели предпочитате!

Изберете езика/набора от данни, който ви интересува, дали искате да сравнявате клониране на глас, и по желание изберете моделите или слушайте изходи от произволна селекция.

Разделът „Слушане“ запълва важна празнина в съществуващите TTS класации: пространство за изследване на изходите от различни модели.

thumbnail

Можете дори да дадете обратна връзка за генерираните изходи. Със събирането на повече гласове от общността може да включим тези данни в класацията. Затова гласувайте! Но моля, влезте в профила си в HF, за да ни помогнете да отсеем спама/ботовете.

thumbnail

Производителност при стрийминг

Разделът „Стрийминг“ сравнява възможностите за стрийминг. Моделите са класирани според TTFA (време до първото аудио), което измерва колко дълго потребителят чака след изпращането на заявка към модел, за да получи аудио, което може да бъде възпроизведено. Това е важно за гласови агенти и други интерактивни приложения.

При стрийминг моделите (✅ в „Streaming API“) това е времето до пристигането на първия аудиофрагмент. При нестийминг моделите това е времето до генерирането на цялото изказване, тъй като възпроизвеждането не може да започне по-рано. Всеки модел обработва по едно аудио наведнъж (размер на пакета 1), използвайки същите 50 английски инструкции от CV3-Eval, същия хардуер и гласа си по подразбиране. Първите 3 изпълнения се изключват като загряване и се отчита медианното TTFA за останалите.

thumbnail
thumbnail

Изгледът по подразбиране сравнява производителността върху GPU H200. Налични са резултати и за CPU за малък (но нарастващ) набор от модели!

thumbnail

kyutai/pocket-tts е отличен модел за стрийминг както на GPU, така и на CPU!

Заключение

Целта на Отворената TTS класация е не само да следва невероятното темпо на публикуване на TTS модели, но и да бъде оформяна от общността; искаме да чуем обратната ви връзка, за да останат оценяванията актуални и съдържателни. Споделете кои набори от данни, модели и метрики искате да видите!

Засега сме се фокусирали върху:

  1. Модели с отворен код, за да представим много отлични модели, които са били пренебрегвани от оценяванията, базирани на арени.
  2. Многоезичност, тъй като производителността на английски не е подходящ косвен показател за други езици.

Скоро ще публикуваме с отворен код скриптовете за оценяване, подобно на хранилището на Отворената ASR класация, за да можете директно да изпращате обратна връзка и предложения чрез GitHub Issues и PR! Нека заедно оформим оценяването на TTS 🤗

Модели, споменати в тази статия 10

Пространства, споменати в тази статия 3

Статии, споменати в тази статия 2

Общност

Качвайте изображения, аудио и видеоклипове, като ги плъзнете в текстовото поле, поставите ги или кликнете тук.
Докоснете или поставете тук, за да качите изображения

· Регистрирайте се или влезте в профила си, за да коментирате

Модели, споменати в тази статия 10

Пространства, споменати в тази статия 3

Статии, споменати в тази статия 2

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от Hugging Face на

Прочетете оригинала в Hugging Face ↗

Текстът и изображенията са собственост на Hugging Face и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини