Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← Към новините

Как британските AISI и EvalEval правят резултатите от бенчмарковете възпроизводими

Как UK AISI и EvalEval правят резултатите от бенчмаркове възпроизводими
Публикувано 22 септември 2026 г.
Актуализация в GitHub
Коалицията EvalEval с удоволствие споделя, че Институтът за сигурност на изкуствения интелект на Обединеното кралство (AISI) използва инфраструктурата на EvalEval, за да споделя открито резултати от оценки, подпомагайки по-възпроизводима и проверима наука за оценяването.

AISI и EvalEval вече са си сътрудничили в рамките на изследване, започнало на съвместен семинар, проведен заедно с NeurIPS 2025, а обратната връзка от Института помогна за оформянето на схемата Every Eval Ever (EEE). Този следващ етап от сътрудничеството прилага на практика споделената инфраструктура.

Защо възпроизводимото отчитане на оценките е важно

С ускоряването на внедряването на ИИ оценките се превръщат във все по-важен източник на доказателства за представянето на моделите и системите. Резултатите обаче се отчитат в множество формати, платформи и канали, често без достатъчно информация за възпроизвеждането им. Самото повторно извършване на оценките може да бъде непосилно скъпо.

Мисията на EvalEval е да подобри тази екосистема чрез споделена схема за отчитане — Every Eval Ever — и отворена платформа — Evaluation Cards — която обединява резултатите от оценките и необходимата за тяхното интерпретиране информация в обща структура.

Това естествено надгражда работата на AISI за повишаване на ефективността на оценяването чрез OptStop, за постигане на по-строга статистическа обосновка чрез HiBayES и за по-голяма стандартизация в области, включително анализ на транскрипции и извличане на способности. Заедно AISI и EvalEval работят за откриване на пропуските в отчитането на оценките и изграждане на споделена инфраструктура за преодоляването им.

Какво споделя AISI

Прозрачността на ниво транскрипция е важна не само за възпроизводимостта, но и за анализа и диагностиката. В този нов етап от сътрудничеството AISI предоставя публично отчетените методи и констатации от оценките чрез Evaluation Cards, когато това е уместно. Публикацията включва проверени резултати, контекст и конфигурационна информация за петте бенчмарка в основния експеримент на статията:

  • HealthBench
  • FrontierMath
  • Humanity's Last Exam
  • SWE-Bench Pro
  • Terminal-Bench 2.0

Тези резултати обхващат шест водещи модела: Claude Opus 4, Claude Opus 4.5, Claude Opus 4.6, GPT-5, GPT-5.2 и GPT-5.4. Публикацията включва и резултати от две свързани оценки на киберсигурността — Cyber CTFs и The Last Ones — които използват различен, частично припокриващ се набор от модели. Данните придружават статията на AISI Как изчислителният ресурс при извеждане оформя оценяването на водещите LLM, която изследва как представянето на бенчмарковете зависи от изчислителния ресурс по време на извеждане и протокола за оценяване.

Представянето на Humanity's Last Exam се променя в зависимост от протокола за оценяване и изчислителния ресурс при извеждане. Всяка крива показва кумулативния дял на опитаните задачи, решени в рамките на даден брой токени, като за всяка задача се използва най-ранният наблюдаван успех. Когато моделите получаваха обратна връзка за правилността от оракул след всеки опит, те продължаваха да решават допълнителни задачи с увеличаването на използваните токени.

Когато резултатите се публикуват открито заедно с информация за настройките, изследователите и практиците могат да разглеждат отделните проучвания по-задълбочено и да сравняват констатациите в по-широката екосистема. Когато в други отчети липсват такива подробности, публикации като тази на AISI предоставят проверени отправни точки за интерпретиране на оценките в контекст — например като помагат на изследователите да разберат как изборът на настройки може да повлияе на отчетеното представяне. С приемането на EEE от все повече оценяващи откритите сравнения като тези могат да подпомогнат по-широки и по-надеждни метаизследвания.

Резултатите на AISI от Terminal-Bench 2.0 заедно с други отчетени оценки на същите модели при различни настройки за оценяване.

Радваме се на това приемане и очакваме с нетърпение да продължим да стандартизираме и споделяме оценките с AISI и други организации за оценяване на ИИ.

Допринесете за споделената мисия

За коалицията EvalEval

Коалицията EvalEval е изследователска общност, която разработва научно обосновани изследвания и стабилна инфраструктура за внедряване за екосистемата на оценяването. Нейната цел е да подобри науката за оценяването, да се справи с липсата на консенсус относно документирането на приложимостта и полезността на оценките и да разшири обхвата на въздействията, които са важни за научните изследвания и анализа на политиките.

Основните проекти на коалицията включват Every Eval Ever — споделена схема и хранилище за резултати от оценки — и Evaluation Cards, които обединяват метаданни за бенчмаркове, данни от изпълненията на оценки и метаданни за моделите в разбираеми записи. Заедно те улесняват разбирането на това кога привидно сходни резултати са получени при съществено различни условия.

За Института за сигурност на ИИ на Обединеното кралство

Институтът за сигурност на ИИ на Обединеното кралство е изследователска организация към Министерството на науката, иновациите и технологиите на правителството на Обединеното кралство. Неговата мисия е да осигури на правителствата научно разбиране за рисковете, породени от усъвършенствания ИИ. AISI провежда изследвания и изгражда инфраструктура за разбиране на възможностите и въздействията на усъвършенствания ИИ, разработване и тестване на мерки за ограничаване на рисковете и информиране на политиките.

Допълнителна литература

Общност

Качвайте изображения, аудио и видеоклипове, като ги плъзнете в текстовото поле, поставите ги или щракнете тук.
Докоснете или поставете тук, за да качите изображения

· Регистрирайте се или влезте, за да коментирате

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от Hugging Face на

Прочетете оригинала в Hugging Face ↗

Текстът и изображенията са собственост на Hugging Face и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини