Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← До новин

Відкритий рейтинг ASR додав свою першу мову Глобального Півдня

Таблиця лідерів Open ASR додає свою першу мову Глобального Півдня
Опубліковано 28 серпня 2026 року
Оновити на GitHub
Voice Arena та Hugging Face запускають відкриту оцінку ASR для гінді та індійської англійської

Бенчмарки визначають, що саме розроблятимуть. Модель, яка добре показує себе в таблиці лідерів Open ASR, впроваджується та вдосконалюється, тоді як можливості, які таблиця лідерів не вимірює, зазвичай не покращуються. Значна частина нещодавньої роботи над таблицею лідерів була спрямована на те, щоб зробити метрики оцінювання надійнішими:

  1. Приховані приватні вибірки.
  2. Аналіз підлаштування під бенчмарк, щоб кількісно визначити, наскільки моделі відтворюють еталонні транскрипти, а не транскрибують виключно аудіо.
  3. Усунення прогалин у нормалізаторах, щоб правильні передбачення/варіанти не штрафувалися.

Усе це ускладнює маніпуляції з одним числом (WER). Але це все ще одне число. Велика кількість досліджень показала, що рівні помилок ASR нерівномірно розподілені між людьми, які ним користуються. У дослідженні Расові відмінності в автоматичному розпізнаванні мовлення було виявлено, що комерційні системи приблизно вдвічі гірше працюють із чорношкірими мовцями, ніж із білими, а дослідження Кількісне визначення упередженості в автоматичному розпізнаванні мовлення виявило додаткові відмінності за статтю, віком і акцентом. На таблиці лідерів нічого з цього не видно — і не тому, що таблиця лідерів це приховує. Тестові набори, на яких вона працює, фіксують, що було сказано, і майже нічого про те, хто це сказав.

Щоб усунути цю прогалину, ми додаємо до таблиці лідерів Open ASR два набори для оцінювання: Monsoon en-IN і Monsoon hi-IN. Гінді, якою розмовляє понад пів мільярда людей, є першою індійською мовою на багатомовній вкладці, яка наразі охоплює лише європейські мови. Кожен набір випускається як публічна вибірка, доступна для самостійного оцінювання, і приватна вибірка, прихована для обмеження оптимізації під конкретний бенчмарк. Чотири вибірки не мають спільних мовців; загалом у них 4 888 мовців, для кожного з яких записано 12 атрибутів.

Побудова збору даних

Тестовий набір може виявити лише той тип помилки, уздовж якого він варіюється. Більшість бенчмарків створюють із будь-яких аудіозаписів, які були доступними. Monsoon було створено з варіаціями за дев’ятьма осями: географія, вік, стать, словниковий запас, пристрої, акустичне середовище, тип мовлення, швидкість мовлення та наявність кількох правильних транскриптів для одного аудіозапису. Кожна з них — це спосіб, у який сукупний WER може бути правильним у середньому, але неправильним для певної групи населення.

nine axes of variation in the Monsoon collection

Метод збору випливає з цього.

  • Географія забезпечується залученням учасників із сотень районів, а не записом довших сесій у меншій кількості місць.
  • Пристрої та акустичні умови забезпечуються використанням учасниками власних телефонів і з’єднань, у приміщенні та на вулиці, а не наданого обладнання в тихій кімнаті.
  • Словниковий запас, тип мовлення та швидкість мовлення задаються підказками: повсякденні теми спонукають учасників висловлювати думки, незгоду, розповідати та пригадувати, і саме в таких ситуаціях з’являються власні назви, числа та непідготовлені формулювання.
  • Вік і стать записуються та перевіряються для кожного мовця.
  • Кілька правильних транскриптів є властивістю еталона, а не аудіо, і цьому присвячено окремий розділ нижче.

Склад набору даних

Чотири вибірки, дві мови, зібрані за одним процесом.

Набір Мова Тривалість Мовці Довжина фрагмента (середня / медіанна) Ч/Ж Райони Штати/території Союзу Пристрої Стиль Транскрипція
Monsoon en-IN публічний Індійська англійська 5.62 год 1 444 9.6 с / 10.4 с 50/50 428 24/6 556 Розмовний, спонтанний Нормалізована, слова-паразити
Monsoon en-IN приватний Індійська англійська 5.58 год 1 405 9.6 с / 10.4 с 45/55 420 24/6 560 Розмовний, спонтанний Нормалізована, слова-паразити
Monsoon hi-IN публічний Гінді 1.33 год 468 6.4 с / 5.0 с 54/46 202 11/3 315 Розмовний, спонтанний Ґратка (прийнятні орфографічні варіанти)
Monsoon hi-IN приватний Гінді 4.47 год 1 571 6.6 с / 5.3 с 55/45 295 12/3 582 Розмовний, спонтанний Ґратка (прийнятні орфографічні варіанти)

Дані отримано з неспланованих спонтанних розмов двома каналами, причому фрагменти сегментовано з одного каналу, тож кожен фрагмент містить голос одного мовця. Окрім полів, наведених у таблиці, для кожного фрагмента також записано професію, освіту, сімейний стан, діапазон доходу, бренд телефона, поточне місто та кількість років у поточному районі.

П’ять фрагментів із публічної вибірки індійської англійської з метаданими, які вони містять:

29-річна жінка, Західна Тріпура, Тріпура. Студентка, samsung SM-G781B.

32-річна жінка, Сатна, Мадг'я-Прадеш. Безробітна, samsung SM-E146B.

22-річний чоловік, Рохтас, Біхар. Студент, motorola moto g54 5G.

27-річна жінка, Варангал, Телангана. Безробітна, vivo V2247.

57-річний чоловік, Пудучеррі. Приватна робота, Xiaomi M2006C3LI.

В англійських наборах використовуються стандартні текстові еталони, у яких нормалізатор таблиці лідерів зводить більшість варіантів написання до спільної форми. У гінді таких варіантів значно більше, і жоден нормалізатор не може їх усунути, оскільки варіанти не є фіксованим відображенням між двома правилами. Тому набори гінді постачаються з ґраткою: для кожного фрагмента транскрипту — списком написань, які приймаються як правильні.

Охоплення мовців

Monsoon невеликий, якщо вимірювати його годинами, і великий, якщо вимірювати мовцями. Це закладено в його дизайні, і саме тут зосереджена більшість його цінності.

Концентрація мовців і різноманіття за межами наведених вище полів.

Monsoon hi-IN публічний Monsoon hi-IN приватний Monsoon en-IN публічний Monsoon en-IN приватний
Сегментів на мовця (середнє) 1.61 1.56 1.46 1.48
Мовці з одним сегментом 261 994 956 924
Аудіо на мовця (медіана) 8.34 с 8.28 с 12.36 с 12.39 с
Частка 10 найактивніших мовців 6.8% 3.1% 2.8% 2.9%
Поточні міста 289 814 641 584
Виробники пристроїв 18 25 23 20

З цього випливають три властивості, і кожна є твердженням про варіативність, а не про обсяг.

  • Жоден голос не визначає оцінку: На десять найбільших учасників припадає від 2.8% до 6.8% загальної тривалості, а більше половини всіх мовців з’являються рівно один раз. Результат на Monsoon є середнім для сотень різних голосів, а не невеликої кількості мовців, записаних протягом тривалого часу. Тестові набори зі схожою тривалістю зазвичай створюють навпаки.

  • Її також не визначає жоден регіон чи телефон: Публічна вибірка індійської англійської охоплює 428 рідних районів у 30 штатах і союзних територіях; набори гінді, оскільки це мова гінді-мовного поясу, мають більш концентроване охоплення, але все одно охоплюють 202 та 295 районів. Записи зроблено на 315–582 різних моделях пристроїв, причому жодна окрема модель не перевищує 2.1% сегментів у будь-якій підмножині. Корпуси, зібрані на стандартизованому обладнанні, надмірно підлаштовуються під характеристики одного мікрофона; цей набір цього не допускає.

  • Індійська англійська тут — не один акцент: Це англійська, якою говорять по всій країні, а не англійська одного регіону. Представлені всі шість зон: у публічній вибірці мовці з півдня надали 35% сегментів, зі сходу — 18%, із центральної частини — 18%, із півночі — 16%, із заходу — 11%. Варіативність акцентів, що випливає з такого розподілу, зафіксована в метаданих, а не просто заявлена.

Поля метаданих

Monsoon містить 18 стовпців для кожного сегмента, 12 із яких є метаданими, тоді як більшість загальнодоступних тестових наборів ASR містить ідентифікатор, транскрипт і тривалість. Демографічні поля заповнені повністю або майже повністю; учасники надали згоду на таке використання.

Група Поля
Сегмент id, audio, audio_length_s, language
Еталон lattice (гінді) або text (індійська англійська)
Мовець speaker_id, gender, date_of_birth
Передумови occupation, educational_background, marital_status, income
Географія native_district, native_state, current_city, years_spent_in_current_district
Запис device_manufacturer, device_model

Дві мови мають різну географічну структуру, і ця структура є інформативною. Набори гінді зосереджені в гінді-мовному поясі: на штат Уттар-Прадеш припадає приблизно 40% мовців, що й очікувано для корпусу гінді, вибірка якого здійснюється за чисельністю населення. Набори індійської англійської значно рівномірніші: жоден штат не перевищує 13%, а третина мовців походить не з восьми найбільших штатів. Публічна та приватна частини дуже близькі за обома показниками.

Межі індійських штатів проводилися за мовними ознаками, тому район і штат несуть реальний сигнал акценту — саме тому ці поля оприлюднюються, а не зводяться до загальних показників. Подібний аналіз у великих масштабах уже проводився для індійського ASR: рівні помилок на рівні районів становили приблизно від 4% до 44%, причому недостатньо представлені регіони значно поступалися гінді-мовному поясу та великим містам; також проводилася дезагрегація за якістю аудіо, швидкістю мовлення, тривалістю висловлювання, статтю, віком і пристроєм. Ті запуски виконувалися на закритому бенчмарку. Monsoon робить такий самий клас аналізу можливим на публічному тестовому наборі таблиці лідерів.

Збір даних і контроль якості

monsoon_collection_and_annotation_pipeline

Широке географічне охоплення потребує залучення учасників із сотень районів, а не довших сесій із меншою кількістю мовців. Розподілений набір даних у такому масштабі створює типи помилок, яких немає в меншому зборі: учасники можуть маніпулювати завданням, подавати відтворене аудіо як живе мовлення або неуважно виконувати анотацію. Кожну з цих проблем вирішує окрема перевірка.

  • Залучення та запис: Учасників залучали через спільноту Voice Arena — глобальну цифрову платформу, охоплення якої поширюється на сільські та напівміські райони, які мовні корпуси рідко охоплюють. Потім пари записували двосторонні розмови через одноранговий інтерфейс із двома каналами на призначені повсякденні теми. Учасники використовували власні телефони та власні з’єднання. Багато з них користувалися недорогими пристроями та нестабільним інтернетом, тому ці умови збережено в опублікованому аудіо, а не відфільтровано. Потенційні учасники проходили перевірку мовної компетентності до отримання доступу до запису, отримували винагороду та надавали поінформовану згоду на використання даних для навчання й поширення. Обмеження тривалості на одного мовця, відкаліброване для кожної мови відповідно до чисельності населення та географічного розподілу її мовців, не дозволило невеликій кількості надзвичайно активних учасників домінувати над мовою чи регіоном; більше половини мовців у цих наборах надали рівно один сегмент.

  • Отримання мовлення: Масштабне отримання спонтанного мовлення має власні труднощі, оскільки без структурованих інструкцій учасники схильні давати короткі й малозмістовні відповіді. Тому кожну розмову розпочинали з відкритої наративної підказки, а потім поступово ставили додаткові запитання, охоплюючи такі сфери, як подорожі, охорона здоров’я, сільське господарство, освіта та цифрові послуги. Це спрямовувало розмову до розгорнутого опису, не перетворюючи її на читання за сценарієм. Теми-кандидати генерувалися великими мовними моделями, а потім перевірялися й локалізувалися лінгвістами — носіями відповідних мов.

  • Контроль якості: Перед транскрибуванням кожен запис проходив набір перевірок допуску. Розмовну мову перевіряли щодо призначеної мови за допомогою моделей ідентифікації мови, навчених на даних, анотованих людьми, для понад 30 мов. Стать мовця підтверджували за самостійно вказаною позначкою за допомогою спеціального класифікатора, використовуючи його як підтвердження самозвіту, а не як його заміну. Додаткова модель розрізняла справжню спонтанну розмову та попередньо записане або відтворене аудіо. Оцінювання співвідношення сигнал/шум вилучало записи, які були надто погіршені для розбірливого сприйняття, тоді як природний фоновий шум навмисно зберігали, щоб не втрачати акустичну реалістичність мовлення в реальних умовах. Записи, що проходили ці перевірки, сегментувалися за допомогою виявлення голосової активності: розділення відбувалося після двох секунд безперервної тиші або після м’якого обмеження у 15 секунд, яке завершувалося під час наступної виявленої тиші. Сегментацію виконували незалежно для кожного каналу, тож кожен сегмент містить одного мовця й один канал. Після цього сегменти проходили перевірку DNSMOS P.808.

  • Транскрипція: Еталонні транскрипти створені людьми. Першу чернетку генерували внутрішні моделі ASR, навчені на даних із відповідної предметної області; жодна з них не представлена на публічній таблиці лідерів, тому жодна система, яку оцінюють на цих наборах, не брала участі у створенні еталонів, за якими її оцінюють. Усі наступні етапи виконували лінгвісти — носії відповідних мов — за п’ятирівневим протоколом із чітким розподілом праці: кожен раунд виправлень супроводжувався незалежною перевіркою, яку виконував інший анотатор, тож жоден лінгвіст не перевіряв власний результат. Спочатку лінгвіст виправляв чернетку сегмент за сегментом, зіставляючи її з акустичним сигналом; другий лінгвіст повторно перевіряв її та позначав залишкові розбіжності. На наступних рівнях цей цикл повторювався з новими анотаторами, поступово усуваючи неоднозначні фонетичні реалізації, межі перемикання кодів, власні назви та орфографічну узгодженість між варіантами написання. Числа записували словами, щоб транскрипт безпосередньо відповідав сказаному. Сегменти, позначені на фінальному рівні, поверталися на повторну транскрипцію перед включенням до набору. Поведінка анотаторів постійно автоматично відстежувалася: система позначала подання з символами поза межами цільового письма, неприродними повторами символів або слів, а також незвично малою чи великою кількістю редагувань.

Регіональні відмінності

Нижче наведено один приклад на публічній вибірці індійської англійської, щоб показати тип оцінювання, який уможливлюють метадані. Це не висновок, заради якого створено ці набори; це ілюстрація того, на які запитання можна відповісти, коли кожен фрагмент пов’язаний із конкретним мовцем.

Вісім моделей у таблиці лідерів мають на цьому наборі показники від 4.81 до 4.99 WER. Це 0.18 пункта між найкращим і найгіршим результатом — у межах того, що можна розрізнити за п’ятьма годинами даних. Якщо ранжувати їх на цьому корпусі, це одна й та сама модель.

Групування мовців за регіонами дає іншу картину. Рідний район кожного мовця було зведено до його зональної ради — класифікації індійських штатів Міністерства внутрішніх справ, що дає п’ять добре представлених зон. openai/whisper-large-v3-turbo відрізняється між ними на 0.46 пункта. mistralai/Voxtral-Mini-3B-2507, яка на корпусі відстає від неї на чотирнадцять сотих пункта, варіюється на 1.68: показник становить 4.38 у центральній зоні проти 6.06 на сході. Дві системи, які на таблиці лідерів неможливо розрізнити, майже вчетверо відрізняються за тим, наскільки їхня точність залежить від походження мовця.

corpus wer against zone range

Найскладніша зона також не є сталою. ibm-granite/granite-speech-3.3-2b має найгірший результат на півночі, microsoft/VibeVoice-ASR-HF — на півдні, а mistralai/Voxtral-Mini-3B-2507 — на сході. Якби один регіон був просто складнішим для транскрибування, усі моделі розташовували б зони в однаковому порядку. Але це не так, що вказує радше на моделі, ніж на аудіо.

Регіон — один із дванадцяти записаних атрибутів, а наведені вище зони є грубим узагальненням 428 районів. Такий самий розподіл можна виконати за віком, освітою, професією та телефоном, а опубліковані файли містять усе необхідне для його відтворення. Нічого цього немає в тестовому наборі, який фіксує лише сказане.

Орфографічна варіативність у гінді

Орфографічна варіативність англійської має обмежені межі. Британське та американське написання, пунктуація, регістр, цифри та слова: нормалізатор може звести більшість відмінностей до єдиної форми, і нормалізатор таблиці лідерів саме так і працює. Гінді не має таких обмежень. У повсякденному мовленні широко використовуються змішані коди, слова англійського походження не мають усталеного написання деванагарі, а складені форми пишуться разом або окремо залежно від уподобань. Одна фраза може мати десять і більше правильних письмових форм, і жодне фіксоване відображення не може їх звести, оскільки немає канонічної форми, до якої їх можна було б відобразити.

english_normaliser

Оцінювання за одним еталоном винагороджує систему за відтворення написання, яке випадково обрав анотатор. Дві системи, що однаково добре розпізнали аудіо, можуть відрізнятися на кілька пунктів лише через орфографію.

Тому набори гінді постачаються з ґраткою: для кожного фрагмента транскрипту — набором письмових форм, прийнятних як правильні. Її створення вимагає ручної роботи. Варіанти-кандидати отримують із кількох транскриптів того самого аудіо, створених ASR, і розширюють за допомогою мовних моделей; потім лінгвісти — носії мови — визначають, які з них правильні для цього висловлювання, та вилучають решту, залишаючи лише форми, узгоджені зі сказаним.

hindi_oiwer_scoring

Тому для гінді ми повідомляємо орфографічно інформований показник помилок у словах (OIWER), представлений AI4Bharat, замість WER. Гіпотеза вирівнюється з прийнятим набором на кожному фрагменті, тож будь-яка допущена форма вважається правильною, а враховуються лише справжні помилки розпізнавання.

Щоб кількісно визначити ефект, ті самі гіпотези оцінювали двічі. Якщо звести кожну ґратку до першого варіанта в кожному фрагменті, отримуємо єдиний текстовий еталон — такий, який надає звичайний бенчмарк; кожен із прийнятих варіантів був би однаково придатним, а інший вибір дав би інший еталон. Під час оцінювання за спрощеним еталоном рівні помилок зростають для кожної системи, причому нерівномірно. У результаті змінюються рейтинги. На рисунку нижче показано дві пари систем, які змінюють порядок між двома еталонами: за одним еталоном система частково винагороджується за відтворення орфографії анотатора, тоді як ґратка оцінює лише розпізнавання.

WER against OIWER on Monsoon hi

Ми також відкриваємо код нашої реалізації voi-oiwer, щоб кожен результат на цих наборах можна було безпосередньо відтворити.

Як пройти оцінювання

Для приватних вибірок додайте свою модель до таблиці лідерів Open ASR, і команда Hugging Face проведе оцінювання. Як і раніше, процес додавання моделі до таблиці лідерів відбувається в репозиторії Open ASR Leaderboard на GitHub:

  1. Створіть pull request — з’явиться контрольний список моделі. Як і раніше, потрібно повідомити результати на публічних наборах даних.
  2. Ми перевіримо результати на публічних наборах і обчислимо метрики на приватних.
  3. Підтвердьте отримані нами результати.

Індійська англійська долучається до основної таблиці лідерів як Voice Arena Monsoon у наборі стандартних стовпців, а не як перемикач за бажанням, тому вона впливає на загальний середній WER для кожної моделі. Приватна вибірка входить до агрегованого стовпця Private (conversational) разом із даними Appen і DataoceanAI. Публічна та приватна вибірки гінді представлені на багатомовній вкладці, де модель ранжується лише за умови підтримки кожної вибраної мови, що забезпечує коректне порівняння. Або виберіть «Hindi» у спадному меню «Language dataset breakdown».

Що далі

Гінді є яскравим прикладом загальної проблеми. Будь-яка мова, яка має кілька способів написання та якою розмовляють люди, не представлені в бенчмарку, має обидва описані тут недоліки. Ці набори не усувають їх. Натомість вони додають спосіб їх побачити: тестовий набір у таблиці лідерів, за якою галузь уже стежить, що містить достатньо інформації про кожного мовця та кожен еталон, аби різницю між двома системами можна було пов’язати з тим, хто говорив і як він це пише, замість того щоб вона зникала в одному числі.

Ці чотири набори є частиною ширшої ініціативи Monsoon — проєкту Voice Arena зі створення наборів даних для Глобального Півдня.

Моделі, згадані в цій статті 4

Набори даних, згадані в цій статті 2

Простори, згадані в цій статті 1

Статті, згадані в цій статті 2

Спільнота

Завантажуйте зображення, аудіо та відео, перетягуючи їх у текстове поле, вставляючи або натискаючи тут.
Торкніться або вставте сюди, щоб завантажити зображення

· Зареєструйтеся або увійдіть, щоб коментувати

Моделі, згадані в цій статті 4

Набори даних, згадані в цій статті 2

Простори, згадані в цій статті 1

Статті, згадані в цій статті 2

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням Hugging Face

Читати оригінал на Hugging Face ↗

Текст і зображення належать Hugging Face і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини