Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← К новостям

Как британские AISI и EvalEval делают результаты бенчмарков воспроизводимыми

Как UK AISI и EvalEval делают результаты бенчмарков воспроизводимыми
Опубликовано 22 сентября 2026 г.
Обновить на GitHub
Коалиция EvalEval рада сообщить, что Институт безопасности ИИ Великобритании (AISI) использует инфраструктуру EvalEval для открытой публикации результатов оценки, поддерживая более воспроизводимую и проверяемую науку об оценивании.

Ранее AISI и EvalEval сотрудничали в рамках исследования, начавшегося на совместном семинаре при NeurIPS 2025, а отзывы Института помогли сформировать схему Every Eval Ever (EEE). На следующем этапе сотрудничества эта общая инфраструктура применяется на практике.

Почему важна воспроизводимая отчётность об оценивании

По мере ускорения внедрения ИИ оценки становятся всё более важным источником сведений о производительности моделей и систем. Однако результаты публикуются в самых разных форматах, на различных платформах и в разных источниках, часто без достаточной информации для их воспроизведения. Повторное проведение оценок само по себе может быть непомерно дорогим.

Миссия EvalEval — улучшить эту экосистему с помощью общей схемы отчётности Every Eval Ever и открытой платформы Evaluation Cards, которая объединяет результаты оценок и необходимую для их интерпретации информацию в единой структуре.

Это естественным образом продолжает работу AISI по повышению эффективности оценивания с помощью OptStop, повышению статистической строгости с помощью HiBayES и стандартизации таких направлений, как анализ транскриптов и выявление возможностей. Вместе AISI и EvalEval работают над выявлением пробелов в отчётности об оценивании и созданием общей инфраструктуры для их устранения.

Чем делится AISI

Прозрачность на уровне транскриптов важна не только для воспроизводимости, но и для анализа и диагностики. На этом новом этапе сотрудничества AISI предоставляет публично описанные методы и результаты оценивания через Evaluation Cards, где это уместно. Публикация включает проверенные результаты, контекст и сведения о конфигурации для пяти бенчмарков из основного эксперимента статьи:

  • HealthBench
  • FrontierMath
  • Humanity's Last Exam
  • SWE-Bench Pro
  • Terminal-Bench 2.0

Эти результаты охватывают шесть передовых моделей: Claude Opus 4, Claude Opus 4.5, Claude Opus 4.6, GPT-5, GPT-5.2 и GPT-5.4. Публикация также включает результаты двух связанных кибернетических оценок — Cyber CTFs и The Last Ones, — в которых используется другой, частично пересекающийся набор моделей. Данные сопровождают статью AISI Как вычисления при выводе формируют оценивание передовых LLM, в которой изучается зависимость производительности на бенчмарках от вычислений на этапе вывода и протокола оценивания.

Результаты на Humanity's Last Exam меняются в зависимости от протокола оценивания и вычислений при выводе. Каждая кривая показывает совокупную долю решённых попыток выполнения заданий в пределах заданного числа токенов, используя самый ранний зафиксированный успех по каждой задаче. Когда модели получали от оракула обратную связь о правильности после каждой попытки, они продолжали решать дополнительные задачи по мере увеличения числа использованных токенов.

Когда результаты публикуются открыто вместе с информацией о настройках, исследователи и практики могут подробнее изучать отдельные исследования и сопоставлять выводы в рамках более широкой экосистемы. Если в других отчётах отсутствуют такие сведения, публикации вроде материалов AISI предоставляют проверенные ориентиры для интерпретации оценок в контексте — например, помогая исследователям понять, как выбор настроек может влиять на заявленную производительность. По мере внедрения EEE всё большим числом оценщиков подобные открытые сравнения могут способствовать более масштабным и надёжным метаисследованиям.

Результаты AISI на Terminal-Bench 2.0 наряду с другими опубликованными оценками тех же моделей при разных настройках оценивания.

Мы рады этому внедрению и с нетерпением ждём дальнейшей стандартизации и обмена оценками с AISI и другими организациями, занимающимися оцениванием ИИ.

Внесите вклад в общую миссию

О коалиции EvalEval

Коалиция EvalEval — это исследовательское сообщество, развивающее научно обоснованные исследования и надёжную инфраструктуру внедрения для экосистемы оценивания. Её цель — совершенствовать науку об оценивании, решать проблему отсутствия консенсуса в документировании применимости и полезности оценок, а также расширять охват воздействий, важных для научных исследований и анализа политики.

Ключевые проекты коалиции включают Every Eval Ever — общую схему и репозиторий результатов оценивания, — и Evaluation Cards, объединяющие метаданные бенчмарков, данные запусков оценивания и метаданные моделей в интерпретируемые записи. Вместе они упрощают понимание того, в каких случаях внешне похожие оценки были получены в существенно разных условиях.

Об Институте безопасности ИИ Великобритании

Институт безопасности ИИ Великобритании — исследовательская организация в составе Министерства науки, инноваций и технологий правительства Великобритании. Его миссия — обеспечить правительства научным пониманием рисков, связанных с передовым ИИ. AISI проводит исследования и создаёт инфраструктуру для понимания возможностей и последствий передового ИИ, разработки и тестирования мер защиты, а также информирования политики.

Дополнительные материалы

Сообщество

Загружайте изображения, аудио и видео, перетаскивая их в текстовое поле, вставляя или нажимая здесь.
Нажмите или вставьте сюда, чтобы загрузить изображения

· Зарегистрируйтесь или войдите, чтобы оставить комментарий

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием Hugging Face

Читать оригинал на Hugging Face ↗

Текст и изображения принадлежат Hugging Face и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости