Измерване на оптимизацията на бенчмаркове в разпознаването на реч
Една от причините е, че традиционните бенчмаркове пренебрегват много от условията и качествата, които правят гласовите системи надеждни, естествени, уместни спрямо контекста и ефективни на практика. Затова наскоро въведохме набори от задържани данни в Real World VoiceEQ, Open-ASR Leaderboard и Far-field ASR Leaderboard, за да измерваме повече от онова, което има значение при употреба в реалния свят.
По-широкото измерване обаче само по себе си не решава проблема. Това явление, понякога наричано оптимизация спрямо бенчмарка или „benchmaxxing“, често се обсъжда в контекста на машинното обучение, но досега беше трудно да се измери при разпознаването на реч.
Последното ни изследване въвежда три теста, които помагат то да бъде количествено определено. Оценихме 11 широко използвани ASR модела с отворен код и установихме, че няколко от системите с най-високи резултати възпроизвеждат транскрипциите от бенчмарка на английските набори от данни VoxPopuli и LibriSpeech (clean, other) – дори когато аудиото им противоречи, съответните думи са били заглушени или аудиото подкрепя еднакво две различни писмени форми.
В някои случаи изглеждаше, че моделите разчитат не само на казаното, но и на фини акустични сигнали, които показват на кой бенчмарк се тестват. В резултат на това резултатите им надценяват способността им да транскрибират речта по-общо.
Несъответствие с референтния текст (казус VoxPopuli)
Известно е, че VoxPopuli съдържа голям брой грешки в транскрипциите (затова Artificial Analysis публикува почистена версия). Нашият тест за несъответствие на консенсуса проверява какво се случва, когато водещи ASR модели се сблъскат с тези грешки: Точно ли транскрибират казаното в аудиото, или възпроизвеждат неправилната референтна транскрипция на бенчмарка?
За да тестваме това в голям мащаб, използваме ансамбъл от независими модели, избрани заради ниската им честота на грешки на фонемно ниво (PER). PER измерва доколко писмената транскрипция съответства на звуците в аудиото, което го прави полезен ориентир за това колко вярно моделът транскрибира чутото. Резултатите от ансамбъла могат да се използват за маркиране на случаите, в които моделите единодушно не са съгласни с референтната транскрипция на бенчмарка. След това сравняваме извадка от маркираните случаи с човешки анотации, за да потвърдим коригираните транскрипции.
Например един клип от VoxPopuli ясно съдържа фразата „Thank you, Mr. President“, но референтната транскрипция пропуска „Thank you“. Шест от 11-те тествани модела възпроизвеждат погрешната транскрипция на бенчмарка – дават „очаквания“ отговор, въпреки че той противоречи на аудиото. В истинския клип форматирането следва същия модел: моделите, които пропускат „Thank you“, възпроизвеждат и пунктуационния стил на бенчмарка, като изписват „Mr“ без точка, докато моделите, които включват чутата фраза, обикновено изписват „Mr.“ с точка.
Когато представим същото съдържание с новосъбрани гласове от записи на парламентарни заседания на ЕС или с общи гласове, това поведение често отслабва или изчезва. В примерите по-долу всички модели освен един отново започват да транскрибират вярно спрямо аудиото при клониране на нов парламентарен запис. Това подсказва, че моделите реагират на акустични сигнали, които им помагат да разпознаят принадлежността към бенчмарка и така да произведат очакваната транскрипция, дори когато тя противоречи на аудиото.
Референтната транскрипция за този клип гласи „Mr President, I have another complaint about this procedure, which is that it is not secret.“ Аудиото и в трите клипа по-долу всъщност казва същото, предшествано от ясно чутото „Thank you,“ – клонираните записи са синтезирани чрез преобразуване на текст в реч и съдържат истинското изречение, така че любезната фраза се чува и в трите. Зеленото маркиране и ✅ означават транскрипция, която включва чутото „Thank you“; червеното маркиране и ❌ означават транскрипция, възпроизвеждаща погрешното пропускане в бенчмарка. Всички транскрипции са необработен изход на моделите, преди нормализация – регистърът и пунктуацията са запазени точно така, както са генерирани, включително изходът с малки букви от някои модели.
Оригинален запис от VoxPopuli
Гласов клонинг на същия говорител
Клонинг на парламентарен говорител, записан след крайния момент на обучението на всички модели
| Модел | Истински клип | Клонинг на същия говорител | Клонинг ep-fresh |
|---|---|---|---|
| CohereLabs/cohere-transcribe-03-2026 | ❌ Mr President… | ❌ Mr President… | ✅ Thank you, Mr President… |
| nvidia/canary-qwen-2.5b | ❌ Mr President… | ❌ Mr President… | ✅ Thank you Mr. President… |
| ibm-granite/granite-speech-4.1-2b | ❌ mr president… | ❌ mr president… | ✅ thank you mr president… |
| microsoft/Phi-4-multimodal-instruct | ❌ Mr President… | ❌ Mr President… | ❌ Mr President… |
| nvidia/parakeet-tdt-0.6b-v2 | ❌ Mr President… | ✅ Thank you, Mr President… | ✅ Thank you, Mr. President… |
| bosonai/higgs-audio-v3-8b-stt-v2 | ❌ mr president… | ❌ mr president… | ✅ thank you mr president… |
| Qwen/Qwen3-ASR-0.6B-hf | ✅ Thank you, Mr. President… | ✅ Thank you, Mister President… | ✅ Thank you, Mister President… |
| mistralai/Voxtral-Mini-3B-2507 | ✅ Thank you, Mr. President… | ✅ Thank you, Mr. President… | ✅ Thank you, Mr. President… |
| moonshotai/Kimi-Audio-7B-Instruct | ✅ Thank you, mr. President… | ✅ Thank you, Mr. President… | ✅ Thank you, mr. President… |
| openai/whisper-large-v3 | ✅ Thank you, Mr. President… | ✅ Thank you, Mr. President… | ✅ Thank you, Mr. President… |
| moonshine-ai/moonshine-streaming-medium | ✅ thank you mr president… | ✅ thank you mr president… | ✅ thank you mr president… |
| Пропуска любезната фраза (❌) от 11 | 6 | 5 | 1 |
Parakeet е единственият модел, който преминава от възпроизвеждане на бенчмарка при истинския клип към правилна транскрипция при клонинга на същия говорител. Phi-4 е единственият модел, който продължава да пропуска любезната фраза при клонинга ep-fresh. Когато вместо това синтезираме изречението с общ TTS глас, несвързан с парламентарен запис, и единадесетте модела възстановяват любезната фраза.
Резултатите показват, че проблемът е едновременно широко разпространен и значим. Нашата методология маркира потенциални грешки в референтните текстове в 40% от анализираните тестови клипове на VoxPopuli, засягайки приблизително 3% от всички референтни думи.
Моделите, проявяващи поведение, оптимизирано спрямо бенчмарка, възпроизвеждат погрешните референтни транскрипции в 18–30% от случаите. Диаграмата на разсейване по-долу сравнява честотата на грешките на думите (WER) във VoxPopuli по оста x с честотата, с която всеки модел възпроизвежда неправилния референтен текст на бенчмарка вместо корекцията на консенсуса. Моделите с най-нисък WER – и следователно с най-силно отчетено представяне в бенчмарка – са и най-склонни да възпроизвеждат тези грешки.
Извличане на маскирани обекти
За да надградим теста за несъответствие на консенсуса, умишлено заглушаваме числата в аудиопробите на тестовите набори от данни и молим моделите да транскрибират чутото. Числото буквално отсъства от аудиото, така че моделите не би трябвало да извеждат никакво число, още по-малко точното число от текста.
Някои от тези числа са донякъде предвидими (макар че все пак е малко вероятно модел да ги предскаже), а други са доста изненадващи. Следващият клип съчетава двата теста, като показва как моделите възпроизвеждат грешки в референтната транскрипция, включително неправилно число, а един от моделите дори допълва автоматично сравнително случаен номер на година (2011), въпреки че той е бил заглушен. В реда на всеки модел по-долу:
- зеленото маркиране със зачертаване обозначава думи от референтния текст, които моделът правилно не е възпроизвел (вярно спрямо аудиото);
- зеленото маркиране с подчертаване обозначава правилно, вярно спрямо аудиото вмъкване на мястото на неправилната формулировка в референтния текст;
- червеното маркиране (обикновен текст) възпроизвежда погрешното, неподкрепено от аудиото съдържание на референтната транскрипция: запазване на „Mr President“, изписване на „more than 1 amendments“, когато аудиото казва „one thousand six hundred“, добавяне на заглушената година „2011“ или завършване с „plenary“.
Проектобюджет за 2011 г. (маскирани числа)
| Референтен текст | Mr President, in the Committee on Budgets, we voted on more than 1 amendments to the 2011 draft budget … voted in the plenary. |
|---|---|
| Какво казва аудиото | In the Committee on Budgets, we voted on more than one thousand six hundred amendments to the ⟨silenced⟩ draft budget … voted in the … |
| CohereLabs/cohere-transcribe-03-2026 | Mr President, in the Committee on Budgets we voted on more than 1 amendments to the 2011 draft budget … voted in the plenary. |
| nvidia/canary-qwen-2.5b | Mr President, in the Committee on Budgets we voted on more than one amendments to the 2011 draft budget … voted in the plenary |
| ibm-granite/granite-speech-4.1-2b | Mr President in the committee on budgets we voted on more than one thousand six hundred amendments to the 2011 draft budget … voted on in the plenary |
| microsoft/Phi-4-multimodal-instruct | Mr President In the Committee on Budgets we voted on more than 1 amendments to the 2011 draft budget … voted on in the plenary. |
| nvidia/parakeet-tdt-0.6b-v2 | Mr President In the Committee on Budgets we voted on more than one amendments to the 2011 draft budget … voted in the Protestants. |
| bosonai/higgs-audio-v3-8b-stt-v2 | Mr President in the committee on budgets we voted on more than one thousand six hundred amendments to the 2011 draft budget … voted in the plenary |
| Qwen/Qwen3-ASR-0.6B-hf | Mr President In the Committee on Budgets, we voted on more than 1,600 amendments to the 2011 draft budget … voted in the plenary |
| mistralai/Voxtral-Mini-3B-2507 | Mr President In the Committee on Budgets, we voted on more than 1,600 amendments to the 2011 draft budget … voted in the plenary |
| moonshotai/Kimi-Audio-7B-Instruct | Mr President Ah in the committee on budgets we voted on more than one thousand six hundred amendments to the 2011 draft budget … voted in the plenary |
| openai/whisper-large-v3 | Mr President In the Committee on Budgets, we voted on more than 1,600 amendments to the 2011 draft budget … voted in the plenary |
| moonshine-ai/moonshine-streaming-medium | Mr President in the committee on budgets we voted on more than one thousand six hundred amendments to the 2011 draft budget … voted in the plenary |
Честотата на възстановяване беше най-висока при публичните бенчмаркове и по-ниска при задържаните или новосъбраните аудиоданни (ep-fresh и libri-fresh по-долу). В LibriSpeech някои от моделите с най-добри резултати в бенчмарка възпроизвеждаха маскирани числа в приблизително 30–40% от примерите, въпреки че самото число беше премахнато. При няколко модела ефектът отслабваше върху новосъбрани данни, което подсказва, че свързаното с бенчмарка заобикалящо аудио – а не само текстовото автодовършване – е помагало на моделите да възстановят референтния текст.
Ортографско превключване
Нашият тест за ортографско превключване проверява дали моделите възпроизвеждат точното изписване, използвано в референтната транскрипция на бенчмарка, въпреки че то не е ясно от аудиото. Ортографските варианти са думи, които са семантично и фонетично идентични, но могат да се изписват по различни начини (1 срещу one, Mr. срещу mister, John срещу Jon, Honor срещу Honour и т.н.). На теория моделите би трябвало последователно да предпочитат едното изписване или другото, или да ги редуват с приблизително случайна честота. Ако моделите систематично превключват, за да съответстват на изписването в референтния текст на всеки бенчмарк, това подсказва, че разпознават кое изписване очаква тестът.
Транскрипция: „I URGED ON THE BOYS THAT WHATEVER HAPPENED WE SHOULD NOT SHOOT ANY ONE“ — модели, използващи „any one“: 6/11, модели, използващи „anyone“: 5/11
Транскрипция: „CAMOUFLAGE WAS NOT A WORD THE CAPTAIN OR ANYONE ELSE OF HIS TIME YET UNDERSTOOD“ — модели, използващи „any one“: 2/11, модели, използващи „anyone“: 9/11
В LibriSpeech тестваме едно вътрешно за набора от данни превключване, свързано с по-старо правило за разделяне с интервал: в някои референтни транскрипции се използва „any one“, а в други – „anyone“. Измерваме минималната точност за даден вариант, която наричаме „честота на превключване“. Ако моделът използва само единия вариант, честотата му на превключване би била 0%; при модел, който избира на случаен принцип, очакваната честота би била 50%. Модел, който знае кой вариант да използва във всеки тестов пример, би постигнал честота на превключване 100%.
Вторият ни тест проверява междунаборно превключване, при което всеки бенчмарк използва различна конвенция за изписване последователно в целия си тестови корпус. Например VoxPopuli използва съкращението „Mr.“, докато LibriSpeech изписва „Mister“.
Няколко модела надхвърлят базовото ниво от 50% за случаен избор, като някои достигат приблизително 90% точност при превключване. Това подсказва, че моделите могат да разпознаят от кой набор от данни идва аудиопробата и да изберат конвенцията за изписване, очаквана от бенчмарка, въпреки че и двете форми звучат еднакво.
Локализиране на превключванията
За да проверим дали това поведение се обобщава отвъд публичните бенчмаркове, събрахме и нови данни от същите източници, но след крайните моменти на обучението на моделите: скорошни записи от Европейския парламент за VoxPopuli и записи от наскоро активни разказвачи в LibriVox за LibriSpeech. Когато обаче бъдат представени с наскоро събрани данни от същата област, много модели спират да съответстват на референтната транскрипция и се връщат към транскрипции, които са по-вярни спрямо аудиото.
Други интервенции водят до същото заключение. Фрази, които присъстват в аудиото, но са пропуснати в референтната транскрипция, могат да се появят отново, когато поискаме от модела да преведе аудиото или когато ограничим вниманието му до съответните кадри. Премахването на заобикалящия контекст от бенчмарка или добавянето на обикновено разговорно аудио също може да възстанови вярната транскрипция. Добавянето на аудио от VoxPopuli може да има обратния ефект, като прави иначе верните синтетични или извлечени примери по-склонни да съответстват на референтния текст на бенчмарка.
Взети заедно, тези резултати подсказват, че моделите могат вярно да транскрибират буквално изречените думи, но използват заобикалящия акустичен контекст, за да решат дали да следват аудиото или специфична за бенчмарка политика за транскрипция.
Заключение
Нашите резултати подсказват, че в два големи набора от данни с отворен код някои модели разпознават свързани с набора акустични сигнали и съответно променят поведението си при транскрипция. По-конкретно, моделите могат да възпроизвеждат думи, които отсъстват от аудиото, но присъстват в референтната транскрипция, да възстановяват заглушени числа с повишена честота или да използват заобикалящия акустичен контекст, за да изберат писмения вариант, очакван от даден бенчмарк.
За хората, които избират модели, тези резултати подчертават значението на използването на напълно задържани набори за оценка, както правят RW-Voice-EQ Bench и Open ASR Leaderboard, както и на необходимостта да се гледа отвъд честотата на грешките на думите в един-единствен публичен бенчмарк. За тази цел в Open ASR Leaderboard е добавен раздел „Напасване към бенчмарка“, който включва два от горните анализи за всички модели: количествено определяне на (1) честотата на грешките в референтните текстове от VoxPopuli и (2) ортографското превключване във всички публични набори от данни. Съответните скриптове са с отворен код в GitHub, както и ненормализираните изходи на моделите.
Резултатите ни подсказват също, че разработчиците на бенчмаркове трябва да избягват прости независими и еднакво разпределени тестови разделяния в полза на разделяне според времето, говорителя или други метаданни. По-голямата прозрачност относно обучаващите данни и процедурите за избор на модели също би помогнала на изследователите да разберат как възниква това поведение.
Публичните бенчмаркове остават ценни: те са прозрачни, възпроизводими, лесни за изпълнение и добре познати на изследователската общност. Но са най-полезни, когато можем да разграничим реалните подобрения в транскрипцията от специфичните за бенчмарка резултати, които не се обобщават към ново аудио.
За повече информация ви насърчаваме да прочетете нашия пълен доклад.
Модели, споменати в тази статия 10
Набори от данни, споменати в тази статия 3
Пространства, споменати в тази статия 3
Научни статии, споменати в тази статия 1
Общност
· Регистрирайте се или влезте, за да коментирате
Модели, споменати в тази статия 10
Набори от данни, споменати в тази статия 3
Пространства, споменати в тази статия 3
Научни статии, споменати в тази статия 1
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.