Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← Към новините

Отворената класация за ASR добави първия си език от Глобалния юг

Таблото за класация на Open ASR добавя първия си език от Глобалния юг
Публикувано 28 август 2026 г.
Актуализиране в GitHub
Voice Arena и Hugging Face си партнират за стартиране на отворена ASR оценка за хинди и индийски английски

Бенчмарковете определят какво се създава. Модел, който постига добри резултати в таблото за класация Open ASR, бива възприеман и доразвиван, докато възможностите, които таблото не измерва, обикновено не се подобряват. Голяма част от скорошната работа по таблото беше насочена към това метриките за оценка да станат по-надеждни:

  1. Отделени частни подмножества.
  2. Анализ на пригодяването към бенчмарка, за да се измери доколко моделите възпроизвеждат референтните транскрипции, вместо да транскрибират само въз основа на аудиото.
  3. Премахване на пропуските в нормализаторите, за да се гарантира, че правилните предсказания/варианти не се санкционират.

Всичко това прави едно число (WER) по-трудно за манипулиране. Но то все още е едно число. Дългогодишни изследвания показват, че нивата на грешки при ASR не са равномерно разпределени сред хората, които го използват. Расовите различия при автоматичното разпознаване на реч установяват, че комерсиалните системи са приблизително два пъти по-неточни при чернокожи говорещи в сравнение с белокожи, а Количествено измерване на предубедеността при автоматичното разпознаване на реч открива допълнителни различия според пола, възрастта и акцента. Нищо от това не се вижда в таблото за класация — не защото таблото го прикрива, а защото тестовите набори, върху които работи, записват какво е било казано и почти нищо за това кой го е казал.

За да адресираме тази празнина, въвеждаме два набора за оценка в таблото за класация Open ASR: Monsoon en-IN и Monsoon hi-IN. Хинди, говорен от повече от половин милиард души, е първият индийски език в многоезичен раздел, който понастоящем обхваща само европейски езици. Всеки набор се публикува с публично подмножество, достъпно за самостоятелно оценяване, и частно подмножество, което се пази скрито, за да се ограничи оптимизацията спрямо конкретния бенчмарк. Четирите подмножества са с неприпокриващи се говорители и включват 4 888 говорители, като за всеки са записани 12 атрибута.

Дизайн на събирането

Тестовият набор може да разкрие само режим на отказ, по който варира. Повечето бенчмаркове се изграждат от аудиото, което е било лесно достъпно. Monsoon е създаден така, че да варира по девет оси: география, възраст, пол, лексика, устройства, акустична среда, тип реч, скорост на речта и наличието на множество валидни транскрипции за едно и също аудио. Всяка от тях е начин една обобщена WER стойност да бъде вярна средно, но погрешна за конкретна популация.

nine axes of variation in the Monsoon collection

Методът на събиране следва тази логика.

  • Географията произтича от набирането на участници от стотици райони, вместо от записването на по-дълги сесии на по-малко места.
  • Устройствата и акустичните условия произтичат от използването на личните телефони и връзки на участниците, на закрито и открито, вместо от предоставен хардуер в тиха стая.
  • Лексиката, типът реч и скоростта на речта произтичат от подканите: ежедневни теми, които насърчават участниците да изразяват мнение, несъгласие, разказ и спомени, където се появяват собствени имена, числа и непредварително подготвени формулировки.
  • Възрастта и полът се записват и проверяват за всеки говорител.
  • Множеството валидни транскрипции е свойство на референцията, а не на аудиото, и е предмет на по-късен раздел.

Състав на набора от данни

Четири подмножества, два езика, събрани чрез един процес.

Набор Език Продължителност Говорители Дължина на клипа (средна / медианна) М/Ж Райони Щати/съюзни територии Устройства Стил Транскрипция
Monsoon en-IN публичен Индийски английски 5.62 ч 1 444 9.6 s / 10.4 s 50/50 428 24/6 556 Разговорен, спонтанен Нормализирана, дизфлуенции
Monsoon en-IN частен Индийски английски 5.58 ч 1 405 9.6 s / 10.4 s 45/55 420 24/6 560 Разговорен, спонтанен Нормализирана, дизфлуенции
Monsoon hi-IN публичен Хинди 1.33 ч 468 6.4 s / 5.0 s 54/46 202 11/3 315 Разговорен, спонтанен Латис (приети ортографски варианти)
Monsoon hi-IN частен Хинди 4.47 ч 1 571 6.6 s / 5.3 s 55/45 295 12/3 582 Разговорен, спонтанен Латис (приети ортографски варианти)

Данните са получени от нескриптирани спонтанни разговори по два канала, като клиповете са сегментирани от един канал, така че всеки клип да съдържа един говорител. Освен полетата, представени в таблицата, за всеки клип се записват и професия, образование, семейно положение, доходова група, марка на телефона, текущ град и броят години в настоящия район.

Пет клипа от публичното подмножество с индийски английски и метаданните към всеки от тях:

29-годишна жена, Западна Трипура, Трипура. Студентка, samsung SM-G781B.

32-годишна жена, Сатна, Мадхя Прадеш. Безработна, samsung SM-E146B.

22-годишен мъж, Рохтас, Бихар. Студент, motorola moto g54 5G.

27-годишна жена, Варангал, Телангана. Безработна, vivo V2247.

57-годишен мъж, Пудучери. Работи в частния сектор, Xiaomi M2006C3LI.

Английските набори използват стандартни референции като низове, при които нормализаторът на таблото премахва повечето правописни различия. При хинди различията са много повече и никой нормализатор не може да ги разреши, тъй като вариантите не представляват фиксирано съответствие между две конвенции. Затова наборите на хинди се предоставят с латис: за всеки фрагмент от транскрипцията има списък с изписванията, които се приемат за правилни.

Покритие на говорителите

Monsoon е малък, измерен в часове, и голям, измерен в говорители. Това е замисълът и именно тук се крие по-голямата част от стойността му.

Концентрация и разнообразие на говорителите отвъд посочените по-горе полета.

Monsoon hi-IN публичен Monsoon hi-IN частен Monsoon en-IN публичен Monsoon en-IN частен
Сегменти на говорител (средно) 1.61 1.56 1.46 1.48
Говорители с един сегмент 261 994 956 924
Аудио на говорител (медианно) 8.34 s 8.28 s 12.36 s 12.39 s
Дял на първите 10 говорители 6.8% 3.1% 2.8% 2.9%
Текущи градове 289 814 641 584
Производители на устройства 18 25 23 20

Следват три свойства, всяко от които е твърдение за вариацията, а не за обема.

  • Нито един глас не определя резултата: Десетте най-големи участници представляват между 2.8% и 6.8% от общата продължителност, а повече от половината говорители се появяват точно веднъж. Резултатът на Monsoon е средна стойност от стотици различни гласове, а не от малък брой говорители, записани продължително. Тестовите набори със сравнима продължителност обикновено се създават по обратния начин.

  • Нито един регион или телефон не определя резултата: Публичният набор с индийски английски използва записи от 428 родни района в 30 щата и съюзни територии; наборите на хинди, като език от хиндския пояс, са по-концентрирани, но все пак обхващат съответно 202 и 295 района. Записите идват от 315 до 582 различни модела устройства, като нито един модел не надхвърля 2.1% от сегментите в което и да е подмножество. Корпусите, събрани със стандартизиран хардуер, се пригодяват прекомерно към характеристиките на един микрофон; този не може.

  • Индийският английски тук не е един акцент: Това е английският, говорен в цялата страна, а не английският на един регион. Представени са и шестте зони: в публичния набор 35% от сегментите са предоставени от говорители от юга, 18% от изтока, 18% от централната част, 16% от севера и 11% от запада. Произтичащите от това разпределение акцентни различия са записани в метаданните, а не просто заявени.

Полета с метаданни

Monsoon предоставя 18 колони за сегмент, от които 12 са метаданни, докато повечето публични тестови набори за ASR съдържат идентификатор, транскрипция и продължителност. Демографските полета са попълнени изцяло или почти изцяло; участниците са дали съгласие за тази употреба.

Група Полета
Сегмент id, audio, audio_length_s, language
Референция lattice (хинди) или text (индийски английски)
Говорител speaker_id, gender, date_of_birth
Контекст occupation, educational_background, marital_status, income
География native_district, native_state, current_city, years_spent_in_current_district
Запис device_manufacturer, device_model

Двата езика имат различна географска структура и тази структура е информативна. Наборите на хинди са концентрирани в хиндския пояс, като Утар Прадеш представлява приблизително 40% от говорителите — така би изглеждал корпус на хинди, извадков според населението. Наборите с индийски английски са много по-равномерни: нито един щат не надхвърля 13%, а една трета от говорителите идват извън осемте най-големи щата. Публичните и частните половини се доближават значително и по двата показателя.

Границите на индийските щати са начертани по езиков признак, така че районът и щатът носят реален акцентен сигнал — именно затова тези полета се публикуват, вместо да бъдат обобщавани. Подобен анализ е публикуван в голям мащаб за индийски ASR: нива на грешки по райони, вариращи приблизително от 4% до 44%, като недостатъчно представените региони изостават значително от хиндския пояс и мегаполисите, наред с разбивки според качеството на аудиото, скоростта на речта, продължителността на изказването, пола, възрастта и устройството. Тези резултати са получени върху затворен бенчмарк. Monsoon прави същия клас анализ възможен върху публичен тестов набор за табло за класация.

Събиране и контрол на качеството

monsoon_collection_and_annotation_pipeline

Широкото географско покритие изисква набиране на участници от стотици райони, вместо по-дълги сесии с по-малко говорители, а разпределеното набиране в такъв мащаб създава режими на отказ, които по-малка колекция не би срещнала: участници, които манипулират задачата, възпроизведено аудио, изпратено като запис на живо, и невнимателно анотиране. Всеки от тези проблеми се адресира чрез изрична проверка.

  • Набиране и запис: Участниците бяха набирани чрез общността на Voice Arena — глобална цифрова платформа, чийто обхват достига до селски и полуградски райони, които речевите корпуси рядко покриват. След това двойки записваха разговори между двама души чрез интерфейс тип „равноправен към равноправен“, по два канала и на зададени ежедневни теми. Участниците използваха собствените си телефони и собствени връзки. Много от тях са устройства от нисък клас с нестабилна честотна лента, поради което това условие присъства в публикуваното аудио, вместо да бъде филтрирано. Потенциалните участници преминаваха проверка на езиковата компетентност, преди да получат достъп до записване, получаваха възнаграждение и даваха информирано съгласие, включващо употреба за обучение и разпространение. Ограничение на продължителността за всеки говорител, калибрирано за всеки език спрямо размера на популацията и географското разпределение на неговите говорители, предотвратяваше малък брой активни участници да доминират над даден език или регион; повече от половината говорители в тези набори предоставят точно един сегмент.

  • Извличане на реч: Извличането на спонтанна реч в голям мащаб създава свои трудности, тъй като участниците са склонни да дават кратки и оскъдни отговори без структурирани насоки. Затова всеки разговор започваше с отворена повествователна подканва и постепенно разкриващи се допълнителни въпроси в области, включително пътувания, здравеопазване, земеделие, образование и цифрови услуги, насочвайки разговора към разширено описание, без да го превръща в скриптиран. Темите-кандидати бяха генерирани от големи езикови модели, след което бяха прегледани и локализирани от лингвисти, за които езикът е роден.

  • Контрол на качеството: Всеки запис преминаваше набор от проверки за допускане преди транскрипция. Говоримият език се проверяваше спрямо зададения език чрез модели за идентификация на езика, обучени върху данни, анотирани от хора, на повече от 30 езика. Полът на говорителя се потвърждаваше спрямо самоопределения етикет чрез специализиран класификатор, използван като потвърждение, а не като заместител на самоопределението. Допълнителен модел различаваше истински спонтанен разговор от предварително записано или възпроизведено аудио. Оценката на съотношението сигнал/шум премахваше записи, влошени до степен на неразбираемост, докато естественият фонов шум от околната среда нарочно се запазваше, за да се съхрани акустичният реализъм на речта в реални условия. Записите, преминали тези проверки, се сегментираха чрез откриване на гласова активност, като се разделяха при две секунди непрекъсната тишина или при мек лимит от петнадесет секунди, затварян при следващата открита тишина. Сегментацията се прилагаше независимо за всеки канал, така че всеки сегмент да е с един говорител и един канал. След това сегментите преминаваха проверка DNSMOS P.808.

  • Транскрипция: Референтните транскрипции са човешка работа. Първоначален вариант се генерираше от вътрешни ASR модели, обучени върху данни от съответната област, като нито един от тях не присъства в публично табло за класация, така че никоя система, оценявана върху тези набори, не е допринесла за референциите, спрямо които се оценява. Всеки последващ етап се извършваше от лингвисти, говорещи езика като роден, съгласно петстепенен протокол, основан на строго разделение на труда, при което всеки кръг на корекции е последван от независим кръг на проверка, извършен от друг анотатор, така че никой лингвист да не проверява собствената си работа. Първо лингвист коригираше черновата сегмент по сегмент спрямо акустичния сигнал; втори я проверяваше отново и отбелязваше останалите несъответствия. Следващите нива повтаряха този цикъл с нови анотатори, като постепенно разрешаваха нееднозначни фонетични реализации, граници при смяна на езика, собствени имена и ортографска последователност при различни правописни варианти. Числителните се изписваха с думи, така че транскрипцията да съответства пряко на казаното. Сегментите, които все още бяха отбелязани на последното ниво, се връщаха за повторна транскрипция, преди да бъдат приети. Поведението на анотаторите се наблюдаваше автоматично през целия процес, като се отбелязваха записи, съдържащи знаци извън целевата писменост, неестествени повторения на знаци или думи и необичайно малък или голям брой редакции.

Регионални различия

Следва един пример, изпълнен върху публичното подмножество с индийски английски, който показва какъв тип оценка става възможна благодарение на метаданните. Това не е откритието, заради което съществуват наборите; то е илюстрация на въпросите, на които може да се отговори, когато всеки клип е свързан с говорител.

Осем модела в таблото за класация постигат между 4.81 и 4.99 WER върху този набор. Това са 0.18 пункта от най-добрия до най-слабия резултат — в рамките на това, което пет часа могат да разграничат. Подредени според корпуса, те са един и същ модел.

Групирането на говорителите по региони разказва различна история. Родният район на всеки говорител се обобщава до неговия зонален съвет — групирането на индийските щати от Министерството на вътрешните работи, което дава пет добре представени зони. openai/whisper-large-v3-turbo варира с 0.46 пункта между тях. mistralai/Voxtral-Mini-3B-2507, който изостава с четиринадесет стотни от пункта от него в корпуса, варира с 1.68, като достига 4.38 в централната зона спрямо 6.06 на изток. Две системи, които са неразличими в таблото за класация, се различават почти четирикратно по това доколко точността им зависи от мястото, откъдето е говорителят.

corpus wer against zone range

Коя зона е най-трудна също не е фиксирано. ibm-granite/granite-speech-3.3-2b е най-слаб в северната зона, microsoft/VibeVoice-ASR-HF — в южната, а mistralai/Voxtral-Mini-3B-2507 — в източната. Ако един регион просто беше по-труден за транскрибиране, всеки модел щеше да подрежда зоните по един и същи начин. Това не се случва, което насочва към моделите, а не към аудиото.

Регионът е един от дванадесетте записани атрибута, а посочените по-горе зони са грубо обобщение на 428 района. Същата разбивка се прилага към възрастта, образованието, професията и телефона, а публикуваните файлове съдържат всичко необходимо за възпроизвеждането ѝ. Нищо от това не е налично за тестов набор, който записва само какво е било казано.

Ортографски различия в хинди

Ортографските различия в английския са ограничени. Британски спрямо американски правопис, пунктуация, регистър, цифри спрямо думи: нормализаторът може да преобразува повечето от тях до една форма и този на таблото го прави. Хинди не е ограничен по същия начин. Ежедневната реч е силно смесена с английски, думите с английски произход нямат установен правопис на деванагари, а сложните форми се изписват слято или разделено според предпочитанията. Една фраза може да има десет или повече валидни писмени форми и никое фиксирано съответствие не може да ги сведе до една, защото няма канонична страна, към която да бъдат преобразувани.

english_normaliser

Когато се оценява с една референция, WER възнаграждава системата за това, че е изписала думата по начина, който анотаторът случайно е избрал. Две системи, които са разпознали аудиото еднакво добре, могат да се различават с няколко пункта само заради ортографията.

Затова наборите на хинди се предоставят с латис: за всеки фрагмент от транскрипцията — набор от писмени форми, приемани за правилни. Създаването му е ръчна работа. Вариантите-кандидати се извличат от множество ASR транскрипции на едно и също аудио и се разширяват с езикови модели, след което лингвисти, за които езикът е роден, решават кои са валидни за конкретното изказване и премахват останалите, така че да се допускат само форми, съвместими с казаното.

hindi_oiwer_scoring

Затова за хинди отчитаме Orthographically-Informed Word Error Rate (OIWER), въведен от AI4Bharat, вместо WER. Хипотезата се подравнява спрямо приетия набор във всеки фрагмент, така че всяка допусната форма се брои за правилна, а се начисляват само истински грешки при разпознаването.

За да измерим ефекта, същите хипотези бяха оценени два пъти. При преобразуване на всеки латис до първия му вариант във всеки фрагмент се получава единична низова референция от типа, който предоставя традиционният бенчмарк; всеки от допуснатите варианти би бил еднакво подходящ, а различен избор би дал различна референция. При оценяване спрямо преобразуваната референция нивата на грешки се повишават за всяка система и не се повишават равномерно. В резултат класиранията се променят. Фигурата по-долу показва две двойки системи, които разменят местата си между двете референции: при единична референция системата е възнаградена отчасти за възпроизвеждането на ортографията на анотатора, докато латисът оценява само разпознаването.

WER against OIWER on Monsoon hi

Публикуваме с отворен код и нашата реализация, voi-oiwer, така че всеки резултат върху тези набори да може да бъде възпроизведен директно.

Оценяване

За частните подмножества добавете модела си в таблото за класация Open ASR и екипът на Hugging Face ще извърши оценяването. Както и преди, процесът за добавяне на модел към таблото се извършва в GitHub хранилището на Open ASR Leaderboard:

  1. Отворете pull request, след което ще се появи контролен списък за модела. Както и преди, трябва да посочите резултатите си върху публичните набори от данни.
  2. Ще проверим резултатите върху публичните набори и ще изчислим метриките върху частните.
  3. Потвърдете резултатите, които сме получили.

Индийският английски се присъединява към основното табло за класация като Voice Arena Monsoon, в колоните по подразбиране, а не като опционален превключвател, така че допринася към основната средна WER стойност за всеки модел. Частното подмножество захранва обобщената колона Private (conversational) заедно с данните от Appen и DataoceanAI. Публичното и частното подмножество на хинди се появяват в многоезичния раздел, където моделът се класира само ако поддържа всеки избран език, което прави колоната сравнение при еднакви условия. Като алтернатива изберете „Hindi“ от падащото меню „Language dataset breakdown“.

Какво следва

Хинди е ярък пример за общ проблем. Всеки език, който се пише по повече от един начин и се говори от хора, които бенчмаркът не е включил в извадката, носи и двата описани тук недостатъка. Тези набори не ги отстраняват. Те добавят начин да ги видим: тестов набор в табло за класация, което областта вече следи, носещ достатъчно информация за всеки говорител и всяка референция, така че разликата между две системи да може да се проследи до това кой е говорил и как пише, вместо да изчезне в едно число.

Тези четири набора са част от Monsoon — по-широката инициатива на Voice Arena за набори от данни за Глобалния юг.

Модели, споменати в тази статия 4

Набори от данни, споменати в тази статия 2

Пространства, споменати в тази статия 1

Статии, споменати в тази статия 2

Общност

Качвайте изображения, аудио и видеоклипове, като ги плъзнете в текстовото поле, поставите ги или натиснете тук.
Докоснете или поставете тук, за да качите изображения

· Регистрирайте се или влезте, за да коментирате

Модели, споменати в тази статия 4

Набори от данни, споменати в тази статия 2

Пространства, споменати в тази статия 1

Статии, споменати в тази статия 2

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от Hugging Face на

Прочетете оригинала в Hugging Face ↗

Текстът и изображенията са собственост на Hugging Face и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини