Відкритий рейтинг TTS: масштабоване оцінювання багатомовного синтезу мовлення та клонування голосу
Однак оцінювання не встигає за цим темпом: воно залишається фрагментованим і нестандартизованим. Золотим стандартом є оцінки людських уподобань, такі як MOS або MUSHRA (докладніше про метрики). З цією метою кілька рейтингів на основі арен стали корисними орієнтирами для спільноти:
Ці арени порівнюють моделі, пропонуючи користувачам результати TTS від двох моделей і просячи обрати одну з них. Після збору достатньої кількості голосів для ранжування моделей обчислюється рейтинг Ело, зазвичай за допомогою моделі Бредлі—Террі (див. методологію Voice Arena).
Хоча людські уподобання є остаточним критерієм, арени не можуть масштабуватися відповідно до темпу випуску моделей TTS. Частково це може пояснювати, чому моделі з відкритим кодом недостатньо представлені в рейтингах на основі арен: станом на 30 вересня 2026 року лише 16 із 92 моделей у Artificial Analysis мають відкриті ваги; аналогічний перекіс спостерігається і у Voice Arena. Імовірно, це відображає практичні чинники: для додавання моделі через API потрібно не набагато більше, ніж API-ключ, тоді як відкриту модель оператор арени має розмістити та обслуговувати, а комерційні постачальники мають більше стимулів домагатися розміщення, ніж автори моделей із відкритим кодом. Ще одним обмеженням оцінювання на основі арен є сталість оцінок: жодна арена не може гарантувати, що ті самі користувачі з тими самими критеріями «кращої» якості послідовно оцінюватимуть моделі з часом. Навіть уподобання однієї людини змінюються з часом («Не можна двічі увійти в ту саму річку», як відомо сказав Геракліт).
Саме для цього ми створили Відкритий рейтинг TTS, який використовує об’єктивні метрики для оцінювання моделей за взаємодоповнювальними аспектами продуктивності:
- Розбірливість: частка помилок у словах/символах (WER і CER) між підказкою та транскриптом згенерованого аудіо з використанням Qwen3 ASR (моделі з відкритим кодом, що посідає найвище місце у Відкритому рейтингу ASR).
- Швидкість: обернений коефіцієнт реального часу (RTFx) для пакетного офлайн-виведення на графічному процесорі H200 і час до першого аудіо (TTFA) для вимірювання затримки потокової обробки з розміром пакета 1 на графічному процесорі H200 і центральному процесорі.
- Схожість мовця шляхом обчислення косинусної схожості (SIM) між векторними представленнями мовця WavLM згенерованого аудіо та референсного фрагмента.
Завдяки використанню об’єктивних метрик оцінювання моделі скорочується з кількох тижнів (для збору голосів) до кількох годин ⚡
Важливо, що Відкритий рейтинг TTS не замінює ранжування за людськими уподобаннями. WER на основі ASR є наближеним показником розбірливості, тоді як схожість мовця оцінює збереження ідентичності голосу. Жодна з цих метрик безпосередньо не вимірює природність, виразність або уподобання слухачів. Проте вони навіть можуть допомогти рейтингам на основі голосування визначити, які моделі включати до оцінювання.
Ми прагнемо, щоб цей рейтинг формувала спільнота; ми хочемо почути ваші відгуки, щоб оцінювання залишалося актуальним і змістовним. У наступних розділах наведено огляд основних функцій Відкритого рейтингу TTS.
Багатомовне оцінювання та клонування голосу
У стандартному вигляді рейтингу моделі ранжуються за макросереднім WER на англомовних підмножинах Seed TTS Eval (стаття) і CV3 Eval (нульовий приклад) (стаття).
hexgrad/Kokoro-82M, Supertone/supertonic-3 і fishaudio/s2-pro лідирують за англомовним WER, усередненим на цих двох підмножинах, тоді як графіки Парето показують, які моделі забезпечують хороший баланс між WER, пакетним виведенням (RTFx) і розміром.
Результати англійською не обов’язково переносяться на інші мови. Можна перемикати кілька мов, щоб ранжувати моделі за багатомовною продуктивністю. Seed TTS Eval містить аудіо лише для англійської та китайської мов, тому для інших мов відображається лише оцінка CV3 Eval (нульовий приклад). Зверніть увагу, що китайська, японська та корейська є мовами на основі символів, тому для них наводиться частка помилок у символах (CER), а «Середній WER» для мов є макросереднім значенням за мовами.
k2-fsa/OmniVoice, fishaudio/s2-pro і FunAudioLLM/Fun-CosyVoice3-0.5B-2512 є сильними багатомовними моделями.
Якщо ввімкнути «Клонування голосу», можна порівняти моделі, які підтримують цю функцію (для вибраних мов).
Крім того, у таблиці з’являється стовпець SIM для схожості мовця, а також ще два графіки Парето для візуалізації компромісу між SIM, пакетним виведенням і розміром.
Середній WER деяких моделей, таких як bosonai/higgs-tts-3-4b і openbmb/VoxCPM2, покращується під час клонування голосу, тобто коли надається референсне аудіо.
Порівнюйте результати TTS і голосуйте
Числа розповідають лише частину історії, і, як згадувалося раніше, людські уподобання є остаточним критерієм. На вкладці «Прослухати» ви можете порівняти згенеровані результати, що лежать в основі метрик, і визначити, які моделі вам більше до вподоби!
Виберіть мову/набір даних, який вас цікавить, вкажіть, чи хочете ви порівняти клонування голосу, а також за бажанням виберіть моделі або прослухайте результати випадкової добірки.
Вкладка «Прослухати» заповнює важливу прогалину в наявних рейтингах TTS: це простір для вивчення результатів роботи різних моделей.
Ви навіть можете залишити відгук про згенеровані результати. У міру того як ми збиратимемо більше голосів від спільноти, ми можемо включити ці дані до рейтингу. Тож голосуйте! Але, будь ласка, увійдіть у свій обліковий запис HF, щоб допомогти нам відсіяти спам і ботів.
Потокова продуктивність
Вкладка «Потокове передавання» порівнює можливості потокової обробки. Моделі ранжуються за TTFA (часом до першого аудіо), який вимірює, скільки користувач чекає після звернення до моделі, перш ніж отримати аудіо, яке можна відтворити. Це важливо для голосових агентів та інших інтерактивних застосунків.
Для потокових моделей (✅ у розділі «API потокової обробки») це час до надходження першого аудіофрагмента. Для непотокових моделей це час до завершення генерації всієї репліки, оскільки відтворення не може розпочатися раніше. Кожна модель обробляє по одному аудіо за раз (розмір пакета 1), використовуючи ті самі 50 англомовних підказок із CV3-Eval, на тому самому обладнанні та зі стандартним голосом. Перші 3 запуски ми відкидаємо як прогрівання й наводимо медіанне значення TTFA для решти.
У стандартному вигляді порівнюється продуктивність на графічному процесорі H200. Також доступні результати для центрального процесора для невеликої (але зростаючої) кількості моделей!
kyutai/pocket-tts — чудова модель для потокової обробки як на графічному, так і на центральному процесорі!
Висновок
Мета Відкритого рейтингу TTS — не лише встигати за неймовірним темпом випуску моделей TTS, а й формуватися спільнотою; ми хочемо почути ваші відгуки, щоб оцінювання залишалося актуальним і змістовним. Розкажіть нам, які набори даних, моделі та метрики ви хочете бачити!
Наразі ми зосередилися на:
- Моделях із відкритим кодом, щоб представити багато чудових моделей, якими знехтували оцінювання на основі арен.
- Багатомовності, оскільки результати англійською не є належним наближенням для інших мов.
Невдовзі ми опублікуємо скрипти оцінювання з відкритим кодом, подібно до репозиторію Відкритого рейтингу ASR, щоб ви могли безпосередньо надсилати свої відгуки та пропозиції через Issues і PR на GitHub! Формуймо оцінювання TTS разом 🤗
Моделі, згадані в цій статті 10
Простори, згадані в цій статті 3
Статті, згадані в цій статті 2
Спільнота
· Зареєструйтеся або увійдіть, щоб коментувати
Моделі, згадані в цій статті 10
Простори, згадані в цій статті 3
Статті, згадані в цій статті 2
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.