Как британские AISI и EvalEval делают результаты бенчмарков воспроизводимыми
Ранее AISI и EvalEval сотрудничали в рамках исследования, начавшегося на совместном семинаре при NeurIPS 2025, а отзывы Института помогли сформировать схему Every Eval Ever (EEE). На следующем этапе сотрудничества эта общая инфраструктура применяется на практике.
Почему важна воспроизводимая отчётность об оценивании
По мере ускорения внедрения ИИ оценки становятся всё более важным источником сведений о производительности моделей и систем. Однако результаты публикуются в самых разных форматах, на различных платформах и в разных источниках, часто без достаточной информации для их воспроизведения. Повторное проведение оценок само по себе может быть непомерно дорогим.
Миссия EvalEval — улучшить эту экосистему с помощью общей схемы отчётности Every Eval Ever и открытой платформы Evaluation Cards, которая объединяет результаты оценок и необходимую для их интерпретации информацию в единой структуре.
Это естественным образом продолжает работу AISI по повышению эффективности оценивания с помощью OptStop, повышению статистической строгости с помощью HiBayES и стандартизации таких направлений, как анализ транскриптов и выявление возможностей. Вместе AISI и EvalEval работают над выявлением пробелов в отчётности об оценивании и созданием общей инфраструктуры для их устранения.
Чем делится AISI
Прозрачность на уровне транскриптов важна не только для воспроизводимости, но и для анализа и диагностики. На этом новом этапе сотрудничества AISI предоставляет публично описанные методы и результаты оценивания через Evaluation Cards, где это уместно. Публикация включает проверенные результаты, контекст и сведения о конфигурации для пяти бенчмарков из основного эксперимента статьи:
- HealthBench
- FrontierMath
- Humanity's Last Exam
- SWE-Bench Pro
- Terminal-Bench 2.0
Эти результаты охватывают шесть передовых моделей: Claude Opus 4, Claude Opus 4.5, Claude Opus 4.6, GPT-5, GPT-5.2 и GPT-5.4. Публикация также включает результаты двух связанных кибернетических оценок — Cyber CTFs и The Last Ones, — в которых используется другой, частично пересекающийся набор моделей. Данные сопровождают статью AISI Как вычисления при выводе формируют оценивание передовых LLM, в которой изучается зависимость производительности на бенчмарках от вычислений на этапе вывода и протокола оценивания.
Результаты на Humanity's Last Exam меняются в зависимости от протокола оценивания и вычислений при выводе. Каждая кривая показывает совокупную долю решённых попыток выполнения заданий в пределах заданного числа токенов, используя самый ранний зафиксированный успех по каждой задаче. Когда модели получали от оракула обратную связь о правильности после каждой попытки, они продолжали решать дополнительные задачи по мере увеличения числа использованных токенов.
Когда результаты публикуются открыто вместе с информацией о настройках, исследователи и практики могут подробнее изучать отдельные исследования и сопоставлять выводы в рамках более широкой экосистемы. Если в других отчётах отсутствуют такие сведения, публикации вроде материалов AISI предоставляют проверенные ориентиры для интерпретации оценок в контексте — например, помогая исследователям понять, как выбор настроек может влиять на заявленную производительность. По мере внедрения EEE всё большим числом оценщиков подобные открытые сравнения могут способствовать более масштабным и надёжным метаисследованиям.
Результаты AISI на Terminal-Bench 2.0 наряду с другими опубликованными оценками тех же моделей при разных настройках оценивания.
Мы рады этому внедрению и с нетерпением ждём дальнейшей стандартизации и обмена оценками с AISI и другими организациями, занимающимися оцениванием ИИ.
Внесите вклад в общую миссию
- Разработчики моделей: публикуйте проверенные результаты оценивания.
- Разработчики оценок: публикуйте бенчмарки и данные запусков, используя схему Every Eval Ever.
- Исследователи в области оценивания, управления и политики: изучайте Evaluation Cards по бенчмарку или модели либо используйте их для анализа состояния отчётности об оценивании в целом.
О коалиции EvalEval
Коалиция EvalEval — это исследовательское сообщество, развивающее научно обоснованные исследования и надёжную инфраструктуру внедрения для экосистемы оценивания. Её цель — совершенствовать науку об оценивании, решать проблему отсутствия консенсуса в документировании применимости и полезности оценок, а также расширять охват воздействий, важных для научных исследований и анализа политики.
Ключевые проекты коалиции включают Every Eval Ever — общую схему и репозиторий результатов оценивания, — и Evaluation Cards, объединяющие метаданные бенчмарков, данные запусков оценивания и метаданные моделей в интерпретируемые записи. Вместе они упрощают понимание того, в каких случаях внешне похожие оценки были получены в существенно разных условиях.
Об Институте безопасности ИИ Великобритании
Институт безопасности ИИ Великобритании — исследовательская организация в составе Министерства науки, инноваций и технологий правительства Великобритании. Его миссия — обеспечить правительства научным пониманием рисков, связанных с передовым ИИ. AISI проводит исследования и создаёт инфраструктуру для понимания возможностей и последствий передового ИИ, разработки и тестирования мер защиты, а также информирования политики.
Дополнительные материалы
Сообщество
· Зарегистрируйтесь или войдите, чтобы оставить комментарий
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.
