Как британските AISI и EvalEval правят резултатите от бенчмарковете възпроизводими
AISI и EvalEval вече са си сътрудничили в рамките на изследване, започнало на съвместен семинар, проведен заедно с NeurIPS 2025, а обратната връзка от Института помогна за оформянето на схемата Every Eval Ever (EEE). Този следващ етап от сътрудничеството прилага на практика споделената инфраструктура.
Защо възпроизводимото отчитане на оценките е важно
С ускоряването на внедряването на ИИ оценките се превръщат във все по-важен източник на доказателства за представянето на моделите и системите. Резултатите обаче се отчитат в множество формати, платформи и канали, често без достатъчно информация за възпроизвеждането им. Самото повторно извършване на оценките може да бъде непосилно скъпо.
Мисията на EvalEval е да подобри тази екосистема чрез споделена схема за отчитане — Every Eval Ever — и отворена платформа — Evaluation Cards — която обединява резултатите от оценките и необходимата за тяхното интерпретиране информация в обща структура.
Това естествено надгражда работата на AISI за повишаване на ефективността на оценяването чрез OptStop, за постигане на по-строга статистическа обосновка чрез HiBayES и за по-голяма стандартизация в области, включително анализ на транскрипции и извличане на способности. Заедно AISI и EvalEval работят за откриване на пропуските в отчитането на оценките и изграждане на споделена инфраструктура за преодоляването им.
Какво споделя AISI
Прозрачността на ниво транскрипция е важна не само за възпроизводимостта, но и за анализа и диагностиката. В този нов етап от сътрудничеството AISI предоставя публично отчетените методи и констатации от оценките чрез Evaluation Cards, когато това е уместно. Публикацията включва проверени резултати, контекст и конфигурационна информация за петте бенчмарка в основния експеримент на статията:
- HealthBench
- FrontierMath
- Humanity's Last Exam
- SWE-Bench Pro
- Terminal-Bench 2.0
Тези резултати обхващат шест водещи модела: Claude Opus 4, Claude Opus 4.5, Claude Opus 4.6, GPT-5, GPT-5.2 и GPT-5.4. Публикацията включва и резултати от две свързани оценки на киберсигурността — Cyber CTFs и The Last Ones — които използват различен, частично припокриващ се набор от модели. Данните придружават статията на AISI Как изчислителният ресурс при извеждане оформя оценяването на водещите LLM, която изследва как представянето на бенчмарковете зависи от изчислителния ресурс по време на извеждане и протокола за оценяване.
Представянето на Humanity's Last Exam се променя в зависимост от протокола за оценяване и изчислителния ресурс при извеждане. Всяка крива показва кумулативния дял на опитаните задачи, решени в рамките на даден брой токени, като за всяка задача се използва най-ранният наблюдаван успех. Когато моделите получаваха обратна връзка за правилността от оракул след всеки опит, те продължаваха да решават допълнителни задачи с увеличаването на използваните токени.
Когато резултатите се публикуват открито заедно с информация за настройките, изследователите и практиците могат да разглеждат отделните проучвания по-задълбочено и да сравняват констатациите в по-широката екосистема. Когато в други отчети липсват такива подробности, публикации като тази на AISI предоставят проверени отправни точки за интерпретиране на оценките в контекст — например като помагат на изследователите да разберат как изборът на настройки може да повлияе на отчетеното представяне. С приемането на EEE от все повече оценяващи откритите сравнения като тези могат да подпомогнат по-широки и по-надеждни метаизследвания.
Резултатите на AISI от Terminal-Bench 2.0 заедно с други отчетени оценки на същите модели при различни настройки за оценяване.
Радваме се на това приемане и очакваме с нетърпение да продължим да стандартизираме и споделяме оценките с AISI и други организации за оценяване на ИИ.
Допринесете за споделената мисия
- Разработчици на модели: Отчитайте проверени резултати от оценки.
- Разработчици на оценки: Отчитайте бенчмаркове и данни от изпълненията, като използвате схемата Every Eval Ever.
- Изследователи в областта на оценяването, управлението и политиките: Разглеждайте Evaluation Cards по бенчмарк или модел или ги използвайте, за да изследвате състоянието на отчитането на оценките като цяло.
За коалицията EvalEval
Коалицията EvalEval е изследователска общност, която разработва научно обосновани изследвания и стабилна инфраструктура за внедряване за екосистемата на оценяването. Нейната цел е да подобри науката за оценяването, да се справи с липсата на консенсус относно документирането на приложимостта и полезността на оценките и да разшири обхвата на въздействията, които са важни за научните изследвания и анализа на политиките.
Основните проекти на коалицията включват Every Eval Ever — споделена схема и хранилище за резултати от оценки — и Evaluation Cards, които обединяват метаданни за бенчмаркове, данни от изпълненията на оценки и метаданни за моделите в разбираеми записи. Заедно те улесняват разбирането на това кога привидно сходни резултати са получени при съществено различни условия.
За Института за сигурност на ИИ на Обединеното кралство
Институтът за сигурност на ИИ на Обединеното кралство е изследователска организация към Министерството на науката, иновациите и технологиите на правителството на Обединеното кралство. Неговата мисия е да осигури на правителствата научно разбиране за рисковете, породени от усъвършенствания ИИ. AISI провежда изследвания и изгражда инфраструктура за разбиране на възможностите и въздействията на усъвършенствания ИИ, разработване и тестване на мерки за ограничаване на рисковете и информиране на политиките.
Допълнителна литература
Общност
· Регистрирайте се или влезте, за да коментирате
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.
