Sakhanda Wire
NVDA $215.70 -0.53% MSFT $484.66 +0.73% GOOGL $343.95 +0.96% META $550.40 +0.84% AMZN $259.59 -0.20%
← К новостям

Измерение оптимизации по бенчмаркам в распознавании речи

Измерение оптимизации под бенчмарки в распознавании речи
Опубликовано 21 августа 2026 года
Обновить на GitHub
Публичные бенчмарки голосового ИИ всё чаще показывают, что модели работают на уровне человека. Однако эти оценки не всегда отражают то, как модели работают в реальных условиях. Поскольку публичные бенчмарки открыты и широко используются, модели могут оптимизироваться и под сами тесты. Их результаты могут улучшаться потому, что они выучили специфические для бенчмарка закономерности, а не потому, что стали лучше выполнять исходную задачу.

Одна из причин заключается в том, что традиционные бенчмарки не учитывают многие условия и характеристики, благодаря которым голосовые системы в реальной практике становятся надёжными, естественными, уместными с точки зрения контекста и эффективными. Поэтому мы недавно добавили отложенные наборы данных в Real World VoiceEQ, Open-ASR Leaderboard и Far-field ASR Leaderboard, чтобы измерять больше действительно важных аспектов применения в реальном мире.

Однако одного расширения измерений недостаточно. Это явление, которое иногда называют оптимизацией под бенчмарк или «benchmaxxing», часто обсуждается в контексте машинного обучения, но в распознавании речи его было трудно измерить.

Наше новое исследование предлагает три теста, помогающих количественно оценить это явление. Мы проверили 11 широко используемых открытых моделей ASR и обнаружили, что несколько систем с наивысшими оценками воспроизводили эталонные транскрипции из англоязычных наборов данных VoxPopuli и LibriSpeech (clean, other) — даже когда аудио им противоречило, релевантные слова были заглушены или аудио в равной степени допускало два разных письменных варианта.

В некоторых случаях модели, по-видимому, опирались не только на сказанное, но и на тонкие акустические признаки, указывавшие, на каком бенчмарке их проверяют. В результате их оценки преувеличивали способность в целом транскрибировать речь.

Расхождение с эталоном (пример VoxPopuli)

Известно, что VoxPopuli содержит большое количество ошибок транскрипции (поэтому Artificial Analysis выпустила очищенную версию). Наш тест на расхождение консенсуса проверяет, что происходит, когда ведущие модели ASR сталкиваются с такими ошибками: точно ли они транскрибируют сказанное в аудио или воспроизводят неправильную эталонную транскрипцию бенчмарка?

Для масштабной проверки мы используем ансамбль независимых моделей, отобранных по низкой частоте ошибок фонем (PER). PER показывает, насколько письменная транскрипция соответствует звукам в аудио, и потому служит полезным приближением того, насколько точно модель транскрибирует услышанное. Результаты ансамбля позволяют выявлять случаи, когда модели единодушно расходятся с эталонной транскрипцией бенчмарка. Затем мы сопоставляем выборку таких случаев с аннотациями людей, чтобы подтвердить исправленные транскрипции.

Например, в одном фрагменте VoxPopuli отчётливо слышна фраза «Thank you, Mr. President», но в эталонной транскрипции отсутствует «Thank you». Шесть из 11 проверенных нами моделей воспроизвели ошибочную транскрипцию бенчмарка, дав «ожидаемый» ответ, несмотря на его противоречие аудио. В исходном фрагменте форматирование следует той же закономерности: модели, пропускающие «Thank you», также воспроизводят стиль пунктуации бенчмарка, пишут «Mr» без точки, тогда как модели, включающие слышимую фразу, обычно пишут «Mr.» с точкой.

Когда мы представляем то же содержание в недавно записанных голосах из парламентских записей ЕС или в универсальных голосах, такое поведение часто ослабевает или исчезает. В приведённых ниже примерах все модели, кроме одной, снова начинают транскрибировать аудио близко к оригиналу для клона новой парламентской записи. Это позволяет предположить, что модели реагируют на акустические признаки, помогающие определить принадлежность аудио к бенчмарку, и поэтому выдают ожидаемую транскрипцию, даже если она противоречит аудио.

Эталонная транскрипция этого фрагмента выглядит так: «Mr President, I have another complaint about this procedure, which is that it is not secret». Однако во всех трёх расположенных ниже фрагментах фактически говорится то же самое, чему предшествует отчётливо слышимое «Thank you» — клоны являются вариантами этой истинной фразы, синтезированными методом преобразования текста в речь, поэтому в каждом из трёх фрагментов вежливое обращение слышно. Зелёная подсветка и ✅ обозначают транскрипцию, включающую слышимое «Thank you»; красная подсветка и ❌ — транскрипцию, воспроизводящую ошибочное пропущенное слово из бенчмарка. Все транскрипции представляют собой необработанный вывод моделей до нормализации: регистр и пунктуация сохранены в точности так, как они были сгенерированы, включая строчные буквы в выводе некоторых моделей.

Оригинальная запись VoxPopuli

Клон голоса того же говорящего

Клон парламентского выступающего, записанного после момента прекращения обучения всех моделей

Модель Реальный фрагмент Клон того же говорящего Свежий клон
CohereLabs/cohere-transcribe-03-2026 ❌ Mr President… ❌ Mr President… ✅ Thank you, Mr President…
nvidia/canary-qwen-2.5b ❌ Mr President… ❌ Mr President… ✅ Thank you Mr. President…
ibm-granite/granite-speech-4.1-2b ❌ mr president… ❌ mr president… ✅ thank you mr president…
microsoft/Phi-4-multimodal-instruct ❌ Mr President… ❌ Mr President… ❌ Mr President…
nvidia/parakeet-tdt-0.6b-v2 ❌ Mr President… ✅ Thank you, Mr President… ✅ Thank you, Mr. President…
bosonai/higgs-audio-v3-8b-stt-v2 ❌ mr president… ❌ mr president… ✅ thank you mr president…
Qwen/Qwen3-ASR-0.6B-hf ✅ Thank you, Mr. President… ✅ Thank you, Mister President… ✅ Thank you, Mister President…
mistralai/Voxtral-Mini-3B-2507 ✅ Thank you, Mr. President… ✅ Thank you, Mr. President… ✅ Thank you, Mr. President…
moonshotai/Kimi-Audio-7B-Instruct ✅ Thank you, mr. President… ✅ Thank you, Mr. President… ✅ Thank you, mr. President…
openai/whisper-large-v3 ✅ Thank you, Mr. President… ✅ Thank you, Mr. President… ✅ Thank you, Mr. President…
moonshine-ai/moonshine-streaming-medium ✅ thank you mr president… ✅ thank you mr president… ✅ thank you mr president…
Пропускает обращение (❌) из 11 6 5 1

Parakeet — единственная модель, которая переключается между воспроизведением бенчмарка на реальном фрагменте и правильным распознаванием на клоне того же говорящего. Phi-4 — единственная модель, которая по-прежнему пропускает обращение на свежем клоне. Когда мы повторно синтезируем предложение универсальным голосом TTS, не связанным ни с одной парламентской записью, все 11 моделей восстанавливают обращение.

Результаты показывают, что эта проблема широко распространена и значима. Наша методика выявила потенциальные ошибки в эталонных транскрипциях в 40% проанализированных тестовых фрагментов VoxPopuli; они затрагивали примерно 3% всех эталонных слов.

Модели, демонстрирующие поведение, оптимизированное под бенчмарк, воспроизводили ошибочные эталонные транскрипции в 18–30% случаев. На приведённой ниже диаграмме рассеяния по оси x показана частота ошибок слов (WER) на VoxPopuli, а по оси y — доля случаев, когда каждая модель воспроизводит неправильный эталон бенчмарка вместо исправленного консенсусом варианта. Модели с наименьшим WER — то есть с лучшими заявленными результатами на бенчмарке — также чаще всего воспроизводят эти ошибки.

Диаграмма рассеяния, сравнивающая WER моделей на VoxPopuli с долей воспроизведения ими неправильной эталонной транскрипции бенчмарка.

Извлечение замаскированных сущностей

Развивая тест на расхождение консенсуса, мы намеренно заглушаем числа в аудиофрагментах тестовых наборов данных и просим модели транскрибировать услышанное. Число буквально отсутствует в аудио, поэтому модели не должны выводить никакое число, и тем более точное число из текста.

Некоторые из этих чисел частично предсказуемы (хотя вероятность их предсказания моделью всё равно невелика), но другие весьма удивительны. Следующий фрагмент объединяет оба теста: он показывает, как модели воспроизводят ошибки эталонной транскрипции, включая неправильное число, а одна модель даже автоматически дополняет относительно случайный год (2011), несмотря на то что он был заглушен. В строке каждой модели ниже:

  • зелёная подсветка с зачёркиванием обозначает слова эталонной транскрипции, которые модель правильно не воспроизвела (в соответствии с аудио);
  • зелёная подсветка с подчёркиванием обозначает корректную вставку, соответствующую аудио, вместо ошибочного текста эталона;
  • красная подсветка (обычный текст) воспроизводит ошибочный и не подтверждённый аудио фрагмент эталонной транскрипции: сохранение «Mr President», запись «more than 1 amendments», когда в аудио сказано «one thousand six hundred», восстановление заглушенного года «2011» или завершение на слове «plenary».

Проект бюджета на 2011 год (замаскированные числа)

Эталон Mr President, in the Committee on Budgets, we voted on more than 1 amendments to the 2011 draft budget … voted in the plenary.
Что говорится в аудио In the Committee on Budgets, we voted on more than one thousand six hundred amendments to the ⟨silenced⟩ draft budget … voted in the …
CohereLabs/cohere-transcribe-03-2026 Mr President, in the Committee on Budgets we voted on more than 1 amendments to the 2011 draft budget … voted in the plenary.
nvidia/canary-qwen-2.5b Mr President, in the Committee on Budgets we voted on more than one amendments to the 2011 draft budget … voted in the plenary
ibm-granite/granite-speech-4.1-2b Mr President in the committee on budgets we voted on more than one thousand six hundred amendments to the 2011 draft budget … voted on in the plenary
microsoft/Phi-4-multimodal-instruct Mr President In the Committee on Budgets we voted on more than 1 amendments to the 2011 draft budget … voted on in the plenary.
nvidia/parakeet-tdt-0.6b-v2 Mr President In the Committee on Budgets we voted on more than one amendments to the 2011 draft budget … voted in the Protestants.
bosonai/higgs-audio-v3-8b-stt-v2 Mr President in the committee on budgets we voted on more than one thousand six hundred amendments to the 2011 draft budget … voted in the plenary
Qwen/Qwen3-ASR-0.6B-hf Mr President In the Committee on Budgets, we voted on more than 1,600 amendments to the 2011 draft budget … voted in the plenary
mistralai/Voxtral-Mini-3B-2507 Mr President In the Committee on Budgets, we voted on more than 1,600 amendments to the 2011 draft budget … voted in the plenary
moonshotai/Kimi-Audio-7B-Instruct Mr President Ah in the committee on budgets we voted on more than one thousand six hundred amendments to the 2011 draft budget … voted in the plenary
openai/whisper-large-v3 Mr President In the Committee on Budgets, we voted on more than 1,600 amendments to the 2011 draft budget … voted in the plenary
moonshine-ai/moonshine-streaming-medium Mr President in the committee on budgets we voted on more than one thousand six hundred amendments to the 2011 draft budget … voted in the plenary

Показатели восстановления были наиболее высокими на публичных бенчмарках и ниже на отложенном или недавно собранном аудио (ниже — ep-fresh и libri-fresh). В LibriSpeech некоторые модели с лучшими результатами на бенчмарке воспроизводили замаскированные числа примерно в 30–40% случаев, хотя само число было удалено. Для нескольких моделей эффект ослабевал на свежих данных, что указывает: восстановлению эталона помогало не только текстовое автодополнение, но и окружающее аудио, связанное с бенчмарком.

Частота восстановления замаскированных чисел на публичных бенчмарках и недавно собранном отложенном аудио.

Переключение орфографии

Наш тест на переключение орфографии проверяет, воспроизводят ли модели точное написание, использованное в эталонной транскрипции бенчмарка, хотя из аудио оно не следует однозначно. Орфографические варианты — это слова, семантически и фонетически идентичные, но пишущиеся по-разному (1 и one, Mr. и mister, John и Jon, Honor и Honour и т. д.). Теоретически модели должны стабильно предпочитать один вариант другому или выбирать между ними примерно случайным образом. Если модели систематически переключаются, чтобы соответствовать варианту в эталонной транскрипции каждого бенчмарка, это указывает на то, что они распознают, какое написание ожидает тест.

Транскрипция: «I URGED ON THE BOYS THAT WHATEVER HAPPENED WE SHOULD NOT SHOOT ANY ONE» — модели, использующие «any one»: 6/11, модели, использующие «anyone»: 5/11

Транскрипция: «CAMOUFLAGE WAS NOT A WORD THE CAPTAIN OR ANYONE ELSE OF HIS TIME YET UNDERSTOOD» — модели, использующие «any one»: 2/11, модели, использующие «anyone»: 9/11

В LibriSpeech мы проверяем одно внутринаборное переключение, связанное с более старым правилом постановки пробела: в некоторых эталонных транскрипциях используется «any one», а в других — «anyone». Мы измеряем минимальную точность для данного варианта и называем её «частотой переключения». Если модель использует только один вариант, её частота переключения равна 0%; для модели, выбирающей случайно, ожидается 50%. Модель, которая знает, какой вариант использовать в каждом тестовом примере, получит частоту переключения 100%.

Частота переключения между вариантами написания «any one» и «anyone», отсортированная по моделям.

Наш второй тест проверяет межнаборное переключение, при котором каждый бенчмарк последовательно использует свой вариант написания во всём тестовом корпусе. Например, VoxPopuli использует сокращение «Mr.», а LibriSpeech пишет «Mister» полностью.

Несколько моделей превысили базовый уровень 50% для случайного выбора, а некоторые достигли примерно 90% точности переключения. Это говорит о том, что модели могут определить, из какого набора данных происходит аудиофрагмент, и выбрать вариант написания, который ожидает бенчмарк, хотя оба варианта звучат одинаково.

Частота переключения между вариантами «Mr.» и «Mister» в VoxPopuli и LibriSpeech, отсортированная по моделям.

Локализация переключений

Чтобы проверить, обобщаются ли эти модели поведения за пределами публичных бенчмарков, мы также собрали свежие данные из тех же предметных областей, но после дат прекращения обучения моделей: недавние записи Европейского парламента для VoxPopuli и записи недавно начавших работать дикторов LibriVox для LibriSpeech. Однако при предъявлении недавно собранных данных из той же области многие модели перестают подстраиваться под эталонную транскрипцию и возвращаются к транскрипциям, более точно соответствующим аудио.

К такому же выводу ведут и другие эксперименты. Фразы, присутствующие в аудио, но пропущенные в эталонной транскрипции, могут появиться вновь, если попросить модель перевести аудио или ограничить её внимание релевантными кадрами. Удаление окружающего контекста бенчмарка или добавление обычного разговорного аудио также может восстановить точную транскрипцию. Добавление аудио VoxPopuli может дать противоположный эффект, повышая вероятность того, что в остальном точные синтетические или добытые из данных примеры будут соответствовать эталону бенчмарка.

Влияние количества окружающего аудиоконтекста, связанного с бенчмарком, на поведение при транскрипции.

В совокупности эти результаты показывают, что модели способны точно транскрибировать буквально произнесённые слова, но используют окружающий акустический контекст, чтобы решить, следовать ли аудио или специфичной для бенчмарка политике транскрипции.

Заключение

Наши результаты показывают, что в двух крупных открытых наборах данных некоторые модели обнаруживают связанные с набором акустические признаки и соответствующим образом меняют поведение при транскрипции. В частности, модели могут воспроизводить слова, отсутствующие в аудио, но присутствующие в эталонной транскрипции, с повышенной частотой восстанавливать заглушенные числа или использовать окружающий акустический контекст для выбора письменного варианта, ожидаемого конкретным бенчмарком.

Для тех, кто выбирает модели, эти результаты подчёркивают важность использования полностью отложенных наборов для оценки, как это делают RW-Voice-EQ Bench и Open ASR Leaderboard, а также необходимость смотреть дальше показателя частоты ошибок слов на одном публичном бенчмарке. Для этого на Open ASR Leaderboard добавлена вкладка «Подгонка под бенчмарк», включающая два приведённых выше анализа для всех моделей: количественную оценку (1) частоты ошибок в эталонах VoxPopuli и (2) орфографического переключения во всех публичных наборах данных. Соответствующие скрипты опубликованы с открытым исходным кодом на GitHub, как и ненормализованные выходы моделей.

Наши результаты также показывают, что разработчикам бенчмарков следует избегать простого разбиения тестов на независимые и одинаково распределённые части, отдавая предпочтение разделению по времени, говорящим или другим метаданным. Исследователям также помогла бы большая прозрачность в отношении обучающих данных и процедур выбора моделей — это позволило бы лучше понять происхождение такого поведения.

Публичные бенчмарки по-прежнему ценны: они прозрачны, воспроизводимы, просты в запуске и хорошо понятны исследовательскому сообществу. Но они наиболее полезны, когда позволяют отличить реальные улучшения транскрипции от специфичных для бенчмарка достижений, которые не обобщаются на новые аудиоданные.

Для получения дополнительной информации рекомендуем ознакомиться с нашим полным отчётом.

Модели, упомянутые в этой статье 10

Наборы данных, упомянутые в этой статье 3

Пространства, упомянутые в этой статье 3

Статьи, упомянутые в этой статье 1

Сообщество

Загружайте изображения, аудио и видео, перетаскивая их в текстовое поле, вставляя или нажимая здесь.
Нажмите или вставьте сюда, чтобы загрузить изображения

· Зарегистрируйтесь или войдите, чтобы оставить комментарий

Модели, упомянутые в этой статье 10

Наборы данных, упомянутые в этой статье 3

Пространства, упомянутые в этой статье 3

Статьи, упомянутые в этой статье 1

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием Hugging Face

Читать оригинал на Hugging Face ↗

Текст и изображения принадлежат Hugging Face и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости