Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← До новин

Як британські AISI та EvalEval роблять результати бенчмарків відтворюваними

Як UK AISI та EvalEval роблять результати бенчмарків відтворюваними
Опубліковано 22 вересня 2026 року
Оновити на GitHub
Коаліція EvalEval рада повідомити, що Інститут безпеки ШІ Великої Британії (AISI) використовує інфраструктуру EvalEval для відкритого поширення результатів оцінювання, підтримуючи відтворюванішу та перевірюванішу науку про оцінювання.

AISI та EvalEval раніше співпрацювали над дослідженням, яке розпочалося на спільному воркшопі під час NeurIPS 2025, а відгуки Інституту допомогли сформувати схему Every Eval Ever (EEE). Цей наступний етап співпраці втілює спільну інфраструктуру на практиці.

Чому важливо звітувати про відтворюване оцінювання

У міру прискорення впровадження ШІ оцінювання стають дедалі важливішими джерелами доказів щодо ефективності моделей і систем. Однак результати повідомляються в багатьох форматах, на платформах і в різних медіа, часто без достатньої інформації для їх відтворення. Повторне проведення оцінювань саме по собі може бути надто дорогим.

Місія EvalEval — покращити цю екосистему за допомогою спільної схеми звітування Every Eval Ever та відкритої платформи Evaluation Cards, яка об’єднує результати оцінювання та інформацію, необхідну для їх інтерпретації, у спільній структурі.

Це є природним продовженням роботи AISI, спрямованої на підвищення ефективності оцінювання завдяки OptStop, посиленню статистичної rigorозності за допомогою HiBayES та стандартизації в таких сферах, як аналіз транскриптів і виявлення можливостей. Разом AISI та EvalEval працюють над виявленням прогалин у звітуванні про оцінювання та створенням спільної інфраструктури для їх усунення.

Чим ділиться AISI

Прозорість на рівні транскриптів важлива не лише для відтворюваності, а й для аналізу та діагностики. На цьому новому етапі співпраці AISI за потреби робить публічно описані методи оцінювання та результати доступними через Evaluation Cards. Реліз містить перевірені результати, контекст та інформацію про конфігурацію для п’яти бенчмарків з основного експерименту статті:

  • HealthBench
  • FrontierMath
  • Humanity's Last Exam
  • SWE-Bench Pro
  • Terminal-Bench 2.0

Ці результати охоплюють шість передових моделей: Claude Opus 4, Claude Opus 4.5, Claude Opus 4.6, GPT-5, GPT-5.2 та GPT-5.4. Реліз також містить результати двох пов’язаних кібероцінювань — Cyber CTFs і The Last Ones, — у яких використовується інший, частково перетинний набір моделей. Дані доповнюють статтю AISI Як обчислення під час інференсу формують оцінювання передових LLM, у якій досліджується залежність продуктивності на бенчмарках від обчислень під час інференсу та протоколу оцінювання.

Результати на Humanity's Last Exam змінюються залежно від протоколу оцінювання та обчислень під час інференсу. Кожна крива показує кумулятивну частку виконаних завдань, розв’язаних у межах певної кількості токенів, із використанням найранішого зафіксованого успіху для кожного завдання. Коли моделі отримували від оракула відгук щодо правильності після кожної спроби, вони продовжували розв’язувати додаткові завдання зі збільшенням використання токенів.

Коли результати публікуються відкрито разом з інформацією про налаштування, дослідники та практики можуть детальніше вивчати окремі дослідження й порівнювати результати в ширшій екосистемі. Якщо в інших звітах бракує таких деталей, релізи на кшталт релізу AISI надають перевірені орієнтири для інтерпретації оцінювань у контексті — наприклад, допомагаючи дослідникам зрозуміти, як вибір налаштувань може впливати на повідомлену продуктивність. У міру того як дедалі більше оцінювачів впроваджуватимуть EEE, такі відкриті порівняння можуть підтримати ширші та надійніші метадослідження.

Результати AISI для Terminal-Bench 2.0 разом з іншими опублікованими оцінюваннями тих самих моделей за різних налаштувань оцінювання.

Ми раді такому впровадженню та з нетерпінням чекаємо на подальшу стандартизацію і поширення оцінювань спільно з AISI та іншими організаціями, що займаються оцінюванням ШІ.

Долучайтеся до спільної місії

Про коаліцію EvalEval

Коаліція EvalEval — це дослідницька спільнота, яка розробляє науково обґрунтовані дослідження та надійну інфраструктуру розгортання для екосистеми оцінювання. Її мета — вдосконалювати науку про оцінювання, розв’язувати проблему відсутності консенсусу щодо документування застосовності та корисності оцінювань, а також розширювати охоплення впливів, важливих для наукових досліджень і аналізу політики.

До флагманських проєктів коаліції належать Every Eval Ever — спільна схема та репозиторій результатів оцінювання — і Evaluation Cards, які об’єднують метадані бенчмарків, дані запусків оцінювання та метадані моделей у записи, придатні для інтерпретації. Разом вони полегшують розуміння того, коли, на перший погляд, схожі оцінки були отримані за суттєво різних умов.

Про Інститут безпеки ШІ Великої Британії

Інститут безпеки ШІ Великої Британії — це дослідницька організація у складі британського урядового Департаменту науки, інновацій і технологій. Його місія — забезпечити уряди науковим розумінням ризиків, які становить передовий ШІ. AISI проводить дослідження та створює інфраструктуру для розуміння можливостей і впливів передового ШІ, розроблення й тестування заходів пом’якшення ризиків та формування політики.

Додаткові матеріали

Спільнота

Завантажуйте зображення, аудіо та відео, перетягуючи їх у поле введення тексту, вставляючи або натискаючи тут.
Торкніться або вставте сюди, щоб завантажити зображення

· Зареєструйтеся або увійдіть, щоб залишити коментар

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням Hugging Face

Читати оригінал на Hugging Face ↗

Текст і зображення належать Hugging Face і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини