Sakhanda Wire
NVDA $215.70 -0.53% MSFT $484.66 +0.73% GOOGL $343.95 +0.96% META $550.40 +0.84% AMZN $259.59 -0.20%
← До новин

Вимірювання оптимізації за бенчмарками в розпізнаванні мовлення

Вимірювання оптимізації під бенчмарки в розпізнаванні мовлення
Опубліковано 21 серпня 2026 року
Оновити на GitHub
Публічні бенчмарки голосового ШІ дедалі частіше свідчать, що моделі працюють на рівні людини. Однак ці оцінки не завжди відображають те, як моделі працюють у реальному світі. Оскільки публічні бенчмарки відкриті й широко використовуються, моделі також можуть оптимізуватися саме під ці тести. Їхні оцінки можуть зростати тому, що вони вивчили специфічні для бенчмарка закономірності, а не тому, що стали кращими у виконанні базового завдання.

Одна з причин полягає в тому, що традиційні бенчмарки не враховують багато умов і характеристик, які роблять голосові системи надійними, природними, доречними в контексті та ефективними на практиці. Саме тому ми нещодавно запровадили відкладені набори в Real World VoiceEQ, Open-ASR Leaderboard та Far-field ASR Leaderboard, щоб вимірювати більше аспектів, важливих у реальному використанні.

Однак одного лише ширшого вимірювання недостатньо для розв’язання проблеми. Це явище, яке іноді називають оптимізацією під бенчмарк або «benchmaxxing», часто обговорюють у контексті машинного навчання, проте в розпізнаванні мовлення його було складно виміряти.

Наше нове дослідження запроваджує три тести, які допомагають кількісно оцінити це явище. Ми оцінили 11 широко використовуваних ASR-моделей із відкритим кодом і виявили, що кілька систем із найвищими оцінками відтворювали бенчмаркові транскрипції з англомовних наборів даних VoxPopuli та LibriSpeech (clean, other) — навіть коли аудіо їм суперечило, відповідні слова були заглушені або аудіо однаково підтримувало дві різні письмові форми.

У деяких випадках моделі, схоже, покладалися не лише на сказане, а й на тонкі акустичні ознаки, які вказували, на якому бенчмарку їх тестують. У результаті їхні оцінки перебільшували здатність транскрибувати мовлення загалом.

Розбіжність із еталоном (тематичне дослідження VoxPopuli)

Відомо, що VoxPopuli містить велику кількість помилок транскрипції (саме тому Artificial Analysis опублікувала очищену версію). Наш тест на розбіжність консенсусу перевіряє, що відбувається, коли провідні ASR-моделі стикаються з цими помилками: чи точно вони транскрибують те, що сказано в аудіо, чи відтворюють неправильну еталонну транскрипцію бенчмарка?

Щоб перевірити це у великому масштабі, ми використовуємо ансамбль незалежних моделей, відібраних за низьким показником помилок фонем (PER). PER вимірює, наскільки письмова транскрипція відповідає звукам в аудіо, і тому є корисним наближеним показником того, наскільки достовірно модель транскрибує почуте. Результати ансамблю можна використовувати для виявлення випадків, коли моделі одностайно не погоджуються з еталонною транскрипцією бенчмарка. Потім ми порівнюємо вибірку таких випадків із людськими анотаціями, щоб перевірити виправлені транскрипції.

Наприклад, один аудіофрагмент VoxPopuli чітко містить фразу «Thank you, Mr. President», але в еталонній транскрипції пропущено «Thank you». Шість із 11 протестованих нами моделей відтворили помилкову транскрипцію бенчмарка, давши «очікувану» відповідь, хоча вона суперечила аудіо. У реальному фрагменті форматування дотримується тієї самої закономірності: моделі, які пропускають «Thank you», також відтворюють стиль пунктуації бенчмарка, пишучи «Mr» без крапки, тоді як моделі, які включають почуту фразу, зазвичай пишуть «Mr.» із крапкою.

Коли ми подаємо той самий зміст у голосах, нещодавно зібраних із парламентських записів ЄС, або в узагальнених голосах, така поведінка часто слабшає чи зникає. У наведених нижче прикладах усі моделі, крім однієї, повертаються до транскрибування аудіо-вірної версії для клону нового парламентського запису. Це свідчить, що моделі реагують на акустичні ознаки, які допомагають їм визначити належність аудіо до бенчмарка й таким чином видати очікувану транскрипцію, навіть якщо вона суперечить аудіо.

Еталонна транскрипція цього фрагмента: «Mr President, I have another complaint about this procedure, which is that it is not secret.» Насправді в усіх трьох наведених нижче фрагментах аудіо сказано те саме, але перед цим чутно «Thank you,» — клони є синтезованими з тексту відтвореннями цього справжнього речення, тож ввічливу фразу чутно в усіх трьох. Зелене виділення та ✅ позначають транскрипцію, що містить почуте «Thank you»; червоне виділення та ❌ позначають транскрипцію, яка відтворює помилкове пропущення з бенчмарка. Усі транскрипції є необробленим результатом роботи моделей, до будь-якої нормалізації — регістр і пунктуацію збережено точно так, як їх згенерували моделі, включно з малими літерами у деяких моделях.

Оригінальний запис VoxPopuli

Клон голосу того самого мовця

Клон голосу парламентаря, записаний після граничної дати навчання всіх моделей

Модель Реальний фрагмент Клон того самого мовця ep-fresh клон
CohereLabs/cohere-transcribe-03-2026 ❌ Mr President… ❌ Mr President… ✅ Thank you, Mr President…
nvidia/canary-qwen-2.5b ❌ Mr President… ❌ Mr President… ✅ Thank you Mr. President…
ibm-granite/granite-speech-4.1-2b ❌ mr president… ❌ mr president… ✅ thank you mr president…
microsoft/Phi-4-multimodal-instruct ❌ Mr President… ❌ Mr President… ❌ Mr President…
nvidia/parakeet-tdt-0.6b-v2 ❌ Mr President… ✅ Thank you, Mr President… ✅ Thank you, Mr. President…
bosonai/higgs-audio-v3-8b-stt-v2 ❌ mr president… ❌ mr president… ✅ thank you mr president…
Qwen/Qwen3-ASR-0.6B-hf ✅ Thank you, Mr. President… ✅ Thank you, Mister President… ✅ Thank you, Mister President…
mistralai/Voxtral-Mini-3B-2507 ✅ Thank you, Mr. President… ✅ Thank you, Mr. President… ✅ Thank you, Mr. President…
moonshotai/Kimi-Audio-7B-Instruct ✅ Thank you, mr. President… ✅ Thank you, Mr. President… ✅ Thank you, mr. President…
openai/whisper-large-v3 ✅ Thank you, Mr. President… ✅ Thank you, Mr. President… ✅ Thank you, Mr. President…
moonshine-ai/moonshine-streaming-medium ✅ thank you mr president… ✅ thank you mr president… ✅ thank you mr president…
Пропускає ввічливу фразу (❌) із 11 6 5 1

Parakeet — єдина модель, яка перемикається між відтворенням бенчмарка на реальному фрагменті та правильним результатом на клоні того самого мовця. Phi-4 — єдина модель, яка й далі пропускає ввічливу фразу в ep-fresh-клоні. Коли ми натомість повторно синтезуємо речення узагальненим голосом TTS, не пов’язаним із жодним парламентським записом, усі одинадцять моделей відновлюють ввічливу фразу.

Результати свідчать, що ця проблема є і поширеною, і суттєвою. Наша методологія виявила потенційні помилки еталонних транскрипцій у 40% проаналізованих тестових фрагментів VoxPopuli, що стосуються приблизно 3% усіх еталонних слів.

Моделі, які демонструють оптимізовану під бенчмарк поведінку, відтворювали помилкові еталонні транскрипції у 18–30% випадків. На наведеній нижче діаграмі розсіювання по осі x показано частоту помилок у словах (WER) для VoxPopuli, а також частоту, з якою кожна модель відтворює неправильний еталон бенчмарка замість узгодженого виправлення. Моделі з найнижчим WER — а отже, із найкращими заявленими результатами на бенчмарку — також найчастіше відтворюють ці помилки.

Scatterplot comparing VoxPopuli WER to the rate at which each model reproduces the benchmark's incorrect reference transcript.

Відновлення замаскованих сутностей

Щоб розвинути тест на розбіжність консенсусу, ми навмисно заглушуємо числа в аудіозаписах тестових наборів даних і просимо моделі транскрибувати почуте. Число буквально відсутнє в аудіо, тож моделі не повинні виводити жодного числа, не кажучи вже про точно те саме число, що міститься в тексті.

Деякі з цих чисел напівпередбачувані (хоча моделі все одно навряд чи могли б їх вгадати), тоді як інші є доволі несподіваними. Наступний фрагмент поєднує обидва тести: він показує, як моделі відтворюють помилки еталонної транскрипції, зокрема неправильне число, а одна модель навіть автоматично доповнює відносно випадковий рік (2011), хоча його було заглушено. У рядку кожної моделі нижче:

  • зелене виділення з перекресленням позначає слова еталонної транскрипції, які модель правильно не відтворила (відповідає аудіо);
  • зелене виділення з підкресленням позначає правильну вставку, що відповідає аудіо, замість помилкового формулювання в еталоні;
  • червоне виділення (звичайний текст) відтворює помилковий, не підтверджений аудіо вміст еталонної транскрипції: збереження «Mr President», написання «more than 1 amendments», тоді як в аудіо сказано «one thousand six hundred», відтворення заглушеного року «2011» або завершення словом «plenary».

Проєкт бюджету на 2011 рік (замасковані числа)

Еталон Mr President, in the Committee on Budgets, we voted on more than 1 amendments to the 2011 draft budget … voted in the plenary.
Що сказано в аудіо In the Committee on Budgets, we voted on more than one thousand six hundred amendments to the ⟨silenced⟩ draft budget … voted in the …
CohereLabs/cohere-transcribe-03-2026 Mr President, in the Committee on Budgets we voted on more than 1 amendments to the 2011 draft budget … voted in the plenary.
nvidia/canary-qwen-2.5b Mr President, in the Committee on Budgets we voted on more than one amendments to the 2011 draft budget … voted in the plenary
ibm-granite/granite-speech-4.1-2b Mr President in the committee on budgets we voted on more than one thousand six hundred amendments to the 2011 draft budget … voted on in the plenary
microsoft/Phi-4-multimodal-instruct Mr President In the Committee on Budgets we voted on more than 1 amendments to the 2011 draft budget … voted on in the plenary.
nvidia/parakeet-tdt-0.6b-v2 Mr President In the Committee on Budgets we voted on more than one amendments to the 2011 draft budget … voted in the Protestants.
bosonai/higgs-audio-v3-8b-stt-v2 Mr President in the committee on budgets we voted on more than one thousand six hundred amendments to the 2011 draft budget … voted in the plenary
Qwen/Qwen3-ASR-0.6B-hf Mr President In the Committee on Budgets, we voted on more than 1,600 amendments to the 2011 draft budget … voted in the plenary
mistralai/Voxtral-Mini-3B-2507 Mr President In the Committee on Budgets, we voted on more than 1,600 amendments to the 2011 draft budget … voted in the plenary
moonshotai/Kimi-Audio-7B-Instruct Mr President Ah in the committee on budgets we voted on more than one thousand six hundred amendments to the 2011 draft budget … voted in the plenary
openai/whisper-large-v3 Mr President In the Committee on Budgets, we voted on more than 1,600 amendments to the 2011 draft budget … voted in the plenary
moonshine-ai/moonshine-streaming-medium Mr President in the committee on budgets we voted on more than one thousand six hundred amendments to the 2011 draft budget … voted in the plenary

Частота відновлення була найвищою на публічних бенчмарках і нижчою на відкладеному або нещодавно зібраному аудіо (нижче — ep-fresh і libri-fresh). У LibriSpeech деякі моделі з найкращими результатами на бенчмарках відтворювали замасковані числа приблизно у 30–40% прикладів, хоча саме число було видалено. Для кількох моделей цей ефект послаблювався на свіжозібраних даних, що свідчить: моделям допомагало відновлювати еталон не лише текстове автодоповнення, а й пов’язане з бенчмарком аудіо оточення.

Recovery rate of masked numbers on public benchmarks versus freshly collected held-out audio.

Перемикання орфографії

Наш тест на перемикання орфографії перевіряє, чи відтворюють моделі точне написання, використане в еталонній транскрипції бенчмарка, хоча з аудіо воно не є очевидним. Орфографічні варіанти — це слова, семантично й фонетично ідентичні, але написані по-різному (1 і one, Mr. і mister, John і Jon, Honor і Honour тощо). Теоретично моделі повинні стабільно надавати перевагу одному написанню або чергувати варіанти приблизно випадковим чином. Якщо моделі систематично перемикаються, щоб відповідати тому, що міститься в еталонній транскрипції кожного бенчмарка, це свідчить, що вони вловлюють, яке написання очікує тест.

Транскрипція: «I URGED ON THE BOYS THAT WHATEVER HAPPENED WE SHOULD NOT SHOOT ANY ONE» — моделі, що використовують «any one»: 6/11, моделі, що використовують «anyone»: 5/11

Транскрипція: «CAMOUFLAGE WAS NOT A WORD THE CAPTAIN OR ANYONE ELSE OF HIS TIME YET UNDERSTOOD» — моделі, що використовують «any one»: 2/11, моделі, що використовують «anyone»: 9/11

У LibriSpeech ми перевіряємо одне внутрішньонаборове перемикання, пов’язане зі старішою конвенцією написання через пробіл: у деяких еталонних транскрипціях використовується «any one», а в інших — «anyone». Ми вимірюємо мінімальну точність для певного варіанта, яку називаємо «частотою перемикання». Якщо модель використовує лише один варіант, її частота перемикання становитиме 0%; для моделі, що обирає випадково, очікуваний показник — 50%. Модель, яка знає, який варіант використовувати в кожному тестовому прикладі, отримає 100%.

Switch rate for the "any one" vs "anyone" spacing convention, sorted by model.

Другий тест перевіряє міжнаборове перемикання, за якого кожен бенчмарк послідовно використовує іншу орфографічну конвенцію в усьому своєму тестовому корпусі. Наприклад, VoxPopuli використовує скорочення «Mr.», тоді як LibriSpeech пише повну форму «Mister».

Кілька моделей перевищують базовий рівень 50% для випадкового вибору, а деякі досягають приблизно 90% точності перемикання. Це свідчить, що моделі можуть визначити, з якого набору даних походить аудіофрагмент, і вибрати орфографічну конвенцію, яку очікує бенчмарк, хоча обидві форми звучать однаково.

Switch rate for the "Mr." vs "Mister" convention across VoxPopuli and LibriSpeech, sorted by model.

Локалізація перемикань

Щоб перевірити, чи узагальнюються ці моделі поведінки за межами публічних бенчмарків, ми також зібрали свіжі дані з тих самих предметних областей, але після граничних дат навчання моделей: нещодавні записи Європейського парламенту для VoxPopuli та записи нещодавно активних оповідачів LibriVox для LibriSpeech. Однак під час роботи з нещодавно зібраними даними з тієї самої області багато моделей перестають відповідати еталонній транскрипції та повертаються до транскрипцій, які точніше відповідають аудіо.

Інші втручання вказують на той самий висновок. Фрази, присутні в аудіо, але пропущені в еталонній транскрипції, можуть з’явитися знову, якщо попросити модель перекласти аудіо або обмежити її увагу відповідними кадрами. Обрізання навколишнього бенчмаркового контексту або додавання звичайного розмовного аудіо також може відновити достовірну транскрипцію. Додавання аудіо VoxPopuli може мати протилежний ефект, підвищуючи ймовірність того, що інакше достовірні синтетичні чи видобуті приклади відповідатимуть еталону бенчмарка.

Effect of steering the amount of surrounding benchmark-associated audio context on transcription behavior.

У сукупності ці результати свідчать, що моделі здатні достовірно транскрибувати буквально сказані слова, але використовують навколишній акустичний контекст, щоб вирішити, чи дотримуватися аудіо, чи специфічної для бенчмарка політики транскрипції.

Висновок

Наші результати свідчать, що в двох основних наборах даних із відкритим кодом деякі моделі виявляють пов’язані з набором акустичні ознаки та відповідно коригують свою поведінку під час транскрипції. Зокрема, моделі можуть відтворювати слова, відсутні в аудіо, але присутні в еталонній транскрипції, відновлювати заглушені числа з підвищеною частотою або використовувати навколишній акустичний контекст для вибору письмового варіанта, очікуваного певним бенчмарком.

Для тих, хто обирає моделі, ці результати підкреслюють важливість використання повністю відкладених наборів оцінювання, як це роблять RW-Voice-EQ Bench і Open ASR Leaderboard, а також необхідність виходити за межі частоти помилок у словах на одному публічному бенчмарку. З цією метою до Open ASR Leaderboard додано вкладку «Підгонка під бенчмарк», яка містить два наведені вище аналізи для всіх моделей: кількісну оцінку (1) частоти помилок еталона у VoxPopuli та (2) перемикання орфографії в усіх публічних наборах даних. Відповідні скрипти опубліковано з відкритим кодом на GitHub, як і ненормалізовані результати роботи моделей.

Наші результати також свідчать, що розробникам бенчмарків слід уникати простого розподілу тестів на незалежні та однаково розподілені вибірки, надаючи перевагу часовому розділенню, розділенню за мовцями або іншими метаданими. Більша прозорість щодо навчальних даних і процедур вибору моделей також допомогла б дослідникам зрозуміти походження такої поведінки.

Публічні бенчмарки залишаються цінними: вони прозорі, відтворювані, прості в запуску й добре зрозумілі дослідницькій спільноті. Але вони найкорисніші тоді, коли ми можемо відрізнити справжні покращення транскрипції від специфічних для бенчмарка здобутків, які не узагальнюються на нове аудіо.

Докладнішу інформацію можна знайти в нашому повному звіті.

Моделі, згадані в цій статті 10

Набори даних, згадані в цій статті 3

Простори, згадані в цій статті 3

Статті, згадані в цій статті 1

Спільнота

Завантажуйте зображення, аудіо та відео, перетягуючи їх у поле введення тексту, вставляючи або натискаючи тут.
Натисніть або вставте сюди, щоб завантажити зображення

· Зареєструйтеся або увійдіть, щоб залишити коментар

Моделі, згадані в цій статті 10

Набори даних, згадані в цій статті 3

Простори, згадані в цій статті 3

Статті, згадані в цій статті 1

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням Hugging Face

Читати оригінал на Hugging Face ↗

Текст і зображення належать Hugging Face і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини