Открытый рейтинг ASR пополнился первым языком Глобального Юга
Бенчмарки определяют, что будет создаваться. Модель, хорошо показывающая себя в лидерборде Open ASR, внедряется и дорабатывается, тогда как возможности, которые лидерборд не измеряет, обычно не улучшаются. Значительная часть недавней работы над лидербордом была направлена на повышение надёжности оценочных метрик:
- Закрытые приватные разбиения.
- Анализ подгонки под бенчмарк, позволяющий определить, насколько модели воспроизводят эталонные транскрипции, а не транскрибируют только на основе аудио.
- Устранение пробелов в нормализаторах, чтобы правильные предсказания и варианты не штрафовались.
Всё это усложняет манипулирование одним показателем (WER). Но это по-прежнему один показатель. Многочисленные исследования показали, что частота ошибок ASR неодинакова для разных групп пользователей. Исследование расовых различий в автоматическом распознавании речи выявило, что коммерческие системы примерно вдвое хуже работают с речью темнокожих говорящих, чем с речью белых, а исследование количественной оценки смещения в автоматическом распознавании речи обнаружило дополнительные различия, связанные с полом, возрастом и акцентом. На лидерборде ничего этого не видно — и не потому, что лидерборд это скрывает. Тестовые наборы, на которых он работает, фиксируют, что было сказано, и почти ничего не сообщают о том, кто это сказал.
Чтобы устранить этот пробел, мы добавляем в лидерборд Open ASR два набора для оценки: Monsoon en-IN и Monsoon hi-IN. Хинди, на котором говорят более полумиллиарда человек, — первый индийский язык во вкладке многоязычных языков, которая сейчас охватывает только европейские языки. Каждый набор опубликован в виде открытого разбиения, доступного для самостоятельной оценки, и закрытого разбиения, скрытого для ограничения оптимизации под конкретный бенчмарк. Четыре разбиения не пересекаются по говорящим и включают 4 888 говорящих; для каждого записаны 12 атрибутов.
Принципы сбора данных
Тестовый набор может выявить только тот режим отказа, вдоль которого он варьируется. Большинство бенчмарков создаются из любых доступных аудиозаписей. Monsoon создавался с вариацией по девяти осям: география, возраст, пол, словарный запас, устройства, акустические условия, тип речи, темп речи и наличие нескольких корректных транскрипций одного и того же аудио. Каждая из них позволяет совокупному WER быть в среднем правильным, но ошибочным для конкретной группы населения.
Метод сбора данных следует из этого.
- География обеспечивается привлечением участников из сотен округов, а не проведением более длительных сессий в меньшем числе мест.
- Устройства и акустические условия отражают использование участниками собственных телефонов и подключений в помещениях и на улице, а не предоставленного оборудования в тихой комнате.
- Словарный запас, тип речи и темп речи определяются подсказками: повседневными темами, побуждающими участников высказывать мнения, спорить, рассказывать и вспоминать, — именно в таких ситуациях появляются имена собственные, числа и неподготовленные формулировки.
- Возраст и пол записываются и проверяются для каждого говорящего.
- Несколько корректных транскрипций — это свойство эталона, а не аудио; этому посвящён следующий раздел.
Состав набора данных
Четыре разбиения, два языка, собранные с помощью единого конвейера.
| Набор | Язык | Длительность | Говорящие | Длина фрагмента (среднее / медиана) | М/Ж | Округа | Штаты/территории союза | Устройства | Стиль | Транскрипция |
|---|---|---|---|---|---|---|---|---|---|---|
| Monsoon en-IN открытый | Индийский английский | 5,62 ч | 1 444 | 9,6 с / 10,4 с | 50/50 | 428 | 24/6 | 556 | Разговорный, спонтанный | Нормализованная, с речевыми запинками |
| Monsoon en-IN закрытый | Индийский английский | 5,58 ч | 1 405 | 9,6 с / 10,4 с | 45/55 | 420 | 24/6 | 560 | Разговорный, спонтанный | Нормализованная, с речевыми запинками |
| Monsoon hi-IN открытый | Хинди | 1,33 ч | 468 | 6,4 с / 5,0 с | 54/46 | 202 | 11/3 | 315 | Разговорный, спонтанный | Решётка (принятые орфографические варианты) |
| Monsoon hi-IN закрытый | Хинди | 4,47 ч | 1 571 | 6,6 с / 5,3 с | 55/45 | 295 | 12/3 | 582 | Разговорный, спонтанный | Решётка (принятые орфографические варианты) |
Данные получены из не scripted двухканальных спонтанных разговоров; фрагменты выделялись из одного канала, поэтому каждый фрагмент содержит речь одного говорящего. Помимо полей, приведённых в таблице, для каждого фрагмента также записываются профессия, образование, семейное положение, диапазон дохода, марка телефона, текущий город и количество лет в текущем округе.
Пять фрагментов из открытого набора индийского английского с сопровождающими их метаданными:
Женщина, 29 лет, Западная Трипура, Трипура. Студентка, samsung SM-G781B.
Женщина, 32 года, Сатна, Мадхья-Прадеш. Безработная, samsung SM-E146B.
Мужчина, 22 года, Рохтас, Бихар. Студент, motorola moto g54 5G.
Женщина, 27 лет, Варангал, Телангана. Безработная, vivo V2247.
Мужчина, 57 лет, Пудучерри. Работает в частной компании, Xiaomi M2006C3LI.
В наборах английского используются стандартные строковые эталоны, для которых нормализатор лидерборда устраняет большинство различий в написании. В хинди таких различий гораздо больше, и ни один нормализатор не может их устранить, поскольку варианты не являются фиксированным соответствием между двумя нормами. Поэтому наборы хинди поставляются с решёткой: для каждого фрагмента транскрипции приводится список написаний, принимаемых за правильные.
Охват говорящих
По количеству часов Monsoon невелик, а по числу говорящих — велик. Такова задумка, и именно здесь сосредоточена большая часть его ценности.
Концентрация и разнообразие говорящих за пределами перечисленных выше полей.
| Monsoon hi-IN открытый | Monsoon hi-IN закрытый | Monsoon en-IN открытый | Monsoon en-IN закрытый | |
|---|---|---|---|---|
| Сегментов на говорящего (среднее) | 1,61 | 1,56 | 1,46 | 1,48 |
| Говорящие с одним сегментом | 261 | 994 | 956 | 924 |
| Аудио на говорящего (медиана) | 8,34 с | 8,28 с | 12,36 с | 12,39 с |
| Доля десяти ведущих говорящих | 6,8% | 3,1% | 2,8% | 2,9% |
| Текущие города | 289 | 814 | 641 | 584 |
| Производители устройств | 18 | 25 | 23 | 20 |
Из этого следуют три свойства, и каждое является утверждением о вариативности, а не об объёме.
Ни один голос не определяет результат: десять крупнейших участников обеспечивают от 2,8% до 6,8% общей длительности, а более половины всех говорящих появляются ровно один раз. Результат Monsoon — это среднее по сотням разных голосов, а не по небольшому числу говорящих, записанных на протяжении длительного времени. Тестовые наборы сопоставимой длительности обычно создаются противоположным образом.
Ни регион, ни телефон также не определяют результат: открытый набор индийского английского включает 428 исходных округов из 30 штатов и территорий союза; наборы хинди, будучи языком хиндиязычного пояса, более сконцентрированы, но всё равно охватывают 202 и 295 округов. Записи сделаны на 315–582 различных моделях устройств, причём ни одна модель не составляет более 2,1% сегментов в любом подмножестве. Корпусы, собранные на стандартизированном оборудовании, переобучаются под отклик одного микрофона; этот набор не может этого сделать.
Индийский английский здесь — не один акцент: это английский, на котором говорят по всей стране, а не английский одного региона. Представлены все шесть зон: в открытом наборе 35% сегментов записаны говорящими с юга, 18% — с востока, 18% — из центральной части, 16% — с севера и 11% — с запада. Вариация акцентов, обусловленная таким охватом, зафиксирована в метаданных, а не просто заявлена.
Поля метаданных
Monsoon содержит 18 столбцов на сегмент, 12 из которых являются метаданными, тогда как большинство открытых тестовых наборов ASR содержат идентификатор, транскрипцию и длительность. Демографические поля заполнены полностью или почти полностью; участники дали согласие на такое использование данных.
| Группа | Поля |
|---|---|
| Сегмент | id, audio, audio_length_s, language |
| Эталон | lattice (хинди) или text (индийский английский) |
| Говорящий | speaker_id, gender, date_of_birth |
| Биографические данные | occupation, educational_background, marital_status, income |
| География | native_district, native_state, current_city, years_spent_in_current_district |
| Запись | device_manufacturer, device_model |
Два языка имеют разную географическую структуру, и эта структура информативна. Наборы хинди сосредоточены в хиндиязычном поясе: на Уттар-Прадеш приходится примерно 40% говорящих, что и следует ожидать от корпуса хинди, отобранного по численности населения. Наборы индийского английского распределены гораздо равномернее: ни на один штат не приходится более 13%, а треть говорящих происходит из-за пределов восьми крупнейших штатов. Открытая и закрытая половины близки друг к другу по обоим показателям.
Границы индийских штатов проводились по языковому принципу, поэтому округ и штат несут реальный сигнал об акценте — именно поэтому эти поля публикуются, а не сводятся в общие показатели. Подобный анализ проводился в крупном масштабе для индийского ASR: частота ошибок на уровне округов составляла примерно от 4% до 44%, при этом недостаточно представленные регионы заметно отставали от хиндиязычного пояса и крупных городов; также проводилась разбивка по качеству аудио, темпу речи, длительности высказывания, полу, возрасту и устройству. Эти эксперименты выполнялись на закрытом бенчмарке. Monsoon делает такой же класс анализа возможным на открытом тестовом наборе лидерборда.
Сбор данных и контроль качества
Широкий географический охват требует привлечения участников из сотен округов, а не проведения более длительных сессий с меньшим числом говорящих. Распределённый набор данных в таком масштабе создаёт режимы отказа, с которыми не сталкиваются небольшие коллекции: участники могут манипулировать заданием, отправлять воспроизведённое аудио вместо живой речи или небрежно выполнять аннотирование. Для каждого случая предусмотрена отдельная проверка.
Привлечение участников и запись: участники привлекались через сообщество Voice Arena — глобальную цифровую платформу, охватывающую сельские и полугородские округа, которые редко представлены в речевых корпусах. Затем пары записывали разговоры двух людей через одноранговый интерфейс, по двум каналам и на заданные повседневные темы. Участники использовали собственные телефоны и подключения. Многие из них — недорогие устройства с нестабильной пропускной способностью, поэтому это условие присутствует в опубликованном аудио, а не отфильтровывается. Перед получением доступа к записи потенциальные участники проходили проверку владения языком, получали вознаграждение и давали информированное согласие на использование данных для обучения и распространения. Ограничение длительности на одного говорящего, отдельно откалиброванное для каждого языка с учётом численности населения и географического распределения его носителей, не позволяло небольшому числу активных участников доминировать над языком или регионом; более половины говорящих в этих наборах предоставляют ровно один сегмент.
Стимулирование речи: масштабное получение спонтанной речи представляет отдельную сложность, поскольку без структурированных указаний участники обычно дают короткие и скудные ответы. Поэтому каждый разговор начинался с открытой повествовательной подсказки, после чего постепенно появлялись уточняющие вопросы, охватывавшие такие области, как путешествия, здравоохранение, сельское хозяйство, образование и цифровые сервисы. Это направляло разговор к подробному описанию, не превращая его в чтение по сценарию. Темы-кандидаты генерировались большими языковыми моделями, а затем проверялись и локализовались лингвистами — носителями языка.
Контроль качества: перед транскрибированием каждая запись проходила набор проверок допуска. Разговорный язык сверялся с назначенным языком с помощью моделей идентификации языка, обученных на данных, аннотированных людьми, для более чем 30 языков. Пол говорящего сопоставлялся с указанной им самим меткой с помощью специализированного классификатора, который использовался как подтверждение самоотчёта, а не как его замена. Ещё одна модель отличала настоящую спонтанную беседу от предварительно записанного или воспроизведённого аудио. Оценка отношения сигнал/шум удаляла записи, ухудшенные настолько, что их невозможно было разбирать, тогда как естественный фоновый шум окружающей среды намеренно сохранялся, чтобы сохранить акустическую реалистичность речи «в реальных условиях». Записи, прошедшие эти проверки, сегментировались с помощью детектора голосовой активности: разрезание выполнялось после двух секунд непрерывной тишины или по мягкому ограничению в 15 секунд, закрывавшемуся на следующей обнаруженной паузе. Сегментация применялась независимо к каждому каналу, поэтому каждый сегмент содержит речь одного говорящего и одного канала. Затем сегменты проходили проверку DNSMOS P.808.
Транскрибирование: эталонные транскрипции создавались людьми. Первый черновик генерировался внутренними моделями ASR, обученными на внутридоменных данных; ни одна из них не представлена ни на одном открытом лидерборде, поэтому ни одна система, оцениваемая на этих наборах, не участвовала в создании эталонов, с которыми сравниваются её результаты. Все последующие этапы выполнялись лингвистами — носителями языка — по пятиуровневому протоколу, основанному на строгом разделении труда: за каждым раундом исправлений следовал независимый раунд проверки, выполняемый другим аннотатором, поэтому ни один лингвист не проверял собственную работу. Сначала лингвист исправлял черновой сегмент за сегментом, сверяясь с акустическим сигналом; затем второй лингвист повторно проверял его и отмечал оставшиеся разногласия. На последующих уровнях этот цикл повторялся с новыми аннотаторами, постепенно разрешавшими неоднозначные фонетические реализации, границы переключения кодов, имена собственные и орфографическую согласованность вариантов написания. Числительные записывались словами, чтобы транскрипция напрямую соответствовала сказанному. Сегменты, остававшиеся отмеченными на последнем уровне, возвращались на повторную транскрипцию до включения в набор. За поведением аннотаторов непрерывно следила автоматическая система, отмечавшая отправки с символами, не относящимися к целевому письму, неестественными повторами символов или слов, а также необычно малым или большим числом исправлений.
Региональные различия
Ниже приведён один пример, выполненный на открытом наборе индийского английского, чтобы показать, какой анализ становится возможен благодаря метаданным. Это не тот результат, ради которого создавались наборы; это иллюстрация того, на какие вопросы можно ответить, если каждый фрагмент связан с конкретным говорящим.
Восемь моделей на лидерборде показывают для этого набора WER от 4,81 до 4,99. Разница между лучшим и худшим результатом составляет 0,18 пункта — в пределах того, что можно разрешить на пяти часах данных. В рейтинге по корпусу это одна и та же модель.
Группировка говорящих по регионам показывает другую картину. Исходный округ каждого говорящего сводится к его зональному совету — группировке индийских штатов Министерства внутренних дел, — что даёт пять хорошо представленных зон. openai/whisper-large-v3-turbo различается между ними на 0,46 пункта. mistralai/Voxtral-Mini-3B-2507, отстающая от неё на корпусе на четырнадцать сотых пункта, различается на 1,68: её результат составляет 4,38 в центральной зоне против 6,06 на востоке. Две системы, неразличимые на лидерборде, почти в четыре раза различаются по степени зависимости точности от происхождения говорящего.
Какая зона является самой сложной, также не является фиксированным свойством. ibm-granite/granite-speech-3.3-2b показывает худший результат на севере, microsoft/VibeVoice-ASR-HF — на юге, а mistralai/Voxtral-Mini-3B-2507 — на востоке. Если бы один регион был просто сложнее для транскрибирования, все модели ранжировали бы зоны одинаково. Но это не так, что указывает скорее на особенности моделей, чем на аудио.
Регион — один из двенадцати записанных атрибутов, а приведённые выше зоны являются грубым объединением 428 округов. Та же разбивка выполняется по возрасту, образованию, профессии и телефону, а опубликованные файлы содержат всё необходимое для её воспроизведения. Ничего этого нет в тестовом наборе, который фиксирует только сказанное.
Орфографическая вариативность в хинди
Орфографическая вариативность английского ограничена. Британское и американское написание, пунктуация, регистр, цифры и слова: нормализатор может свести большую часть различий к одной форме, и нормализатор лидерборда это делает. Хинди не ограничен таким же образом. В повседневной речи активно смешиваются языки, слова английского происхождения не имеют устоявшегося написания деванагари, а составные формы пишутся слитно или раздельно в зависимости от предпочтений. Одна фраза может иметь десять и более корректных письменных форм, и никакое фиксированное соответствие не сведёт их к одной, поскольку отсутствует каноническая форма, к которой можно было бы их привести.
При оценке по одному эталону WER вознаграждает систему за написание, которое случайно выбрал аннотатор. Две системы, одинаково хорошо распознавшие аудио, могут различаться на несколько пунктов только из-за орфографии.
Поэтому наборы хинди поставляются с решёткой: для каждого фрагмента транскрипции приводится набор письменных форм, принимаемых за правильные. Её создание требует ручной работы. Кандидаты на варианты извлекаются из нескольких транскрипций одного и того же аудио, созданных ASR, и расширяются с помощью языковых моделей; затем лингвисты — носители языка — решают, какие варианты корректны для данного высказывания, и отбрасывают остальные, допуская только формы, соответствующие сказанному.
Таким образом, для хинди мы используем орфографически информированную частоту ошибок в словах (OIWER), представленную AI4Bharat, вместо WER. Гипотеза выравнивается с принятым набором на каждом фрагменте, поэтому любая допущенная форма считается правильной, а учитываются только настоящие ошибки распознавания.
Чтобы количественно оценить эффект, одни и те же гипотезы оценивались дважды. Если свести каждую решётку к её первому варианту в каждом фрагменте, получится эталонная строка, аналогичная той, что предоставляет обычный бенчмарк; любой из допущенных вариантов подошёл бы так же, а другой выбор дал бы другой эталон. При сравнении с упрощённым эталоном частота ошибок возрастает у каждой системы, но не одинаково. В результате меняется ранжирование. На рисунке ниже показаны две пары систем, меняющие порядок между двумя эталонами: при использовании одного эталона система частично получает преимущество за воспроизведение орфографии аннотатора, тогда как решётка оценивает только распознавание.
Мы также публикуем исходный код реализации voi-oiwer, чтобы каждый результат на этих наборах можно было воспроизвести напрямую.
Как пройти оценку
Для закрытых разбиений добавьте свою модель в лидерборд Open ASR, и команда Hugging Face проведёт оценку. Как и прежде, процесс добавления модели на лидерборд проходит в репозитории Open ASR Leaderboard на GitHub:
- Откройте pull request — появится чек-лист модели. Как и прежде, следует сообщить результаты на открытых наборах данных.
- Мы проверим результаты на открытых наборах и вычислим метрики на закрытых.
- Подтвердите полученные нами результаты.
Индийский английский добавляется в основной лидерборд как Voice Arena Monsoon в набор столбцов по умолчанию, а не как опциональный переключатель, поэтому он учитывается в итоговом среднем WER каждой модели. Закрытое разбиение входит в агрегированный столбец Private (conversational) вместе с данными Appen и DataoceanAI. Открытое и закрытое разбиения хинди отображаются во вкладке Multilingual, где модель ранжируется только при поддержке всех выбранных языков, что обеспечивает сопоставление на равных условиях. Также можно выбрать «Hindi» в раскрывающемся меню «Language dataset breakdown».
Что дальше
Хинди — яркий пример общей проблемы. Любой язык, который пишется несколькими способами и на котором говорят люди, не представленные в бенчмарке, несёт в себе оба описанных здесь источника ошибок. Эти наборы не устраняют их. Они добавляют возможность их увидеть: тестовый набор в лидерборде, за которым отрасль уже следит, содержит достаточно информации о каждом говорящем и каждом эталоне, чтобы различие между двумя системами можно было связать с тем, кто говорил и как он это пишет, вместо того чтобы оно исчезало в одном числе.
Эти четыре набора являются частью более масштабной инициативы Monsoon по созданию наборов данных для Глобального Юга, которую развивает Voice Arena.
Модели, упомянутые в этой статье 4
Наборы данных, упомянутые в этой статье 2
Пространства, упомянутые в этой статье 1
Статьи, упомянутые в этой статье 2
Сообщество
· Зарегистрируйтесь или войдите, чтобы оставить комментарий
Модели, упомянутые в этой статье 4
Наборы данных, упомянутые в этой статье 2
Пространства, упомянутые в этой статье 1
Статьи, упомянутые в этой статье 2
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.





