Як британські AISI та EvalEval роблять результати бенчмарків відтворюваними
AISI та EvalEval раніше співпрацювали над дослідженням, яке розпочалося на спільному воркшопі під час NeurIPS 2025, а відгуки Інституту допомогли сформувати схему Every Eval Ever (EEE). Цей наступний етап співпраці втілює спільну інфраструктуру на практиці.
Чому важливо звітувати про відтворюване оцінювання
У міру прискорення впровадження ШІ оцінювання стають дедалі важливішими джерелами доказів щодо ефективності моделей і систем. Однак результати повідомляються в багатьох форматах, на платформах і в різних медіа, часто без достатньої інформації для їх відтворення. Повторне проведення оцінювань саме по собі може бути надто дорогим.
Місія EvalEval — покращити цю екосистему за допомогою спільної схеми звітування Every Eval Ever та відкритої платформи Evaluation Cards, яка об’єднує результати оцінювання та інформацію, необхідну для їх інтерпретації, у спільній структурі.
Це є природним продовженням роботи AISI, спрямованої на підвищення ефективності оцінювання завдяки OptStop, посиленню статистичної rigorозності за допомогою HiBayES та стандартизації в таких сферах, як аналіз транскриптів і виявлення можливостей. Разом AISI та EvalEval працюють над виявленням прогалин у звітуванні про оцінювання та створенням спільної інфраструктури для їх усунення.
Чим ділиться AISI
Прозорість на рівні транскриптів важлива не лише для відтворюваності, а й для аналізу та діагностики. На цьому новому етапі співпраці AISI за потреби робить публічно описані методи оцінювання та результати доступними через Evaluation Cards. Реліз містить перевірені результати, контекст та інформацію про конфігурацію для п’яти бенчмарків з основного експерименту статті:
- HealthBench
- FrontierMath
- Humanity's Last Exam
- SWE-Bench Pro
- Terminal-Bench 2.0
Ці результати охоплюють шість передових моделей: Claude Opus 4, Claude Opus 4.5, Claude Opus 4.6, GPT-5, GPT-5.2 та GPT-5.4. Реліз також містить результати двох пов’язаних кібероцінювань — Cyber CTFs і The Last Ones, — у яких використовується інший, частково перетинний набір моделей. Дані доповнюють статтю AISI Як обчислення під час інференсу формують оцінювання передових LLM, у якій досліджується залежність продуктивності на бенчмарках від обчислень під час інференсу та протоколу оцінювання.
Результати на Humanity's Last Exam змінюються залежно від протоколу оцінювання та обчислень під час інференсу. Кожна крива показує кумулятивну частку виконаних завдань, розв’язаних у межах певної кількості токенів, із використанням найранішого зафіксованого успіху для кожного завдання. Коли моделі отримували від оракула відгук щодо правильності після кожної спроби, вони продовжували розв’язувати додаткові завдання зі збільшенням використання токенів.
Коли результати публікуються відкрито разом з інформацією про налаштування, дослідники та практики можуть детальніше вивчати окремі дослідження й порівнювати результати в ширшій екосистемі. Якщо в інших звітах бракує таких деталей, релізи на кшталт релізу AISI надають перевірені орієнтири для інтерпретації оцінювань у контексті — наприклад, допомагаючи дослідникам зрозуміти, як вибір налаштувань може впливати на повідомлену продуктивність. У міру того як дедалі більше оцінювачів впроваджуватимуть EEE, такі відкриті порівняння можуть підтримати ширші та надійніші метадослідження.
Результати AISI для Terminal-Bench 2.0 разом з іншими опублікованими оцінюваннями тих самих моделей за різних налаштувань оцінювання.
Ми раді такому впровадженню та з нетерпінням чекаємо на подальшу стандартизацію і поширення оцінювань спільно з AISI та іншими організаціями, що займаються оцінюванням ШІ.
Долучайтеся до спільної місії
- Розробники моделей: повідомляйте про перевірені результати оцінювання.
- Розробники оцінювань: повідомляйте про бенчмарки та дані запусків, використовуючи схему Every Eval Ever.
- Дослідники оцінювання, врядування та політики: досліджуйте Evaluation Cards за бенчмарком або моделлю чи використовуйте їх для аналізу стану звітування про оцінювання загалом.
Про коаліцію EvalEval
Коаліція EvalEval — це дослідницька спільнота, яка розробляє науково обґрунтовані дослідження та надійну інфраструктуру розгортання для екосистеми оцінювання. Її мета — вдосконалювати науку про оцінювання, розв’язувати проблему відсутності консенсусу щодо документування застосовності та корисності оцінювань, а також розширювати охоплення впливів, важливих для наукових досліджень і аналізу політики.
До флагманських проєктів коаліції належать Every Eval Ever — спільна схема та репозиторій результатів оцінювання — і Evaluation Cards, які об’єднують метадані бенчмарків, дані запусків оцінювання та метадані моделей у записи, придатні для інтерпретації. Разом вони полегшують розуміння того, коли, на перший погляд, схожі оцінки були отримані за суттєво різних умов.
Про Інститут безпеки ШІ Великої Британії
Інститут безпеки ШІ Великої Британії — це дослідницька організація у складі британського урядового Департаменту науки, інновацій і технологій. Його місія — забезпечити уряди науковим розумінням ризиків, які становить передовий ШІ. AISI проводить дослідження та створює інфраструктуру для розуміння можливостей і впливів передового ШІ, розроблення й тестування заходів пом’якшення ризиків та формування політики.
Додаткові матеріали
Спільнота
· Зареєструйтеся або увійдіть, щоб залишити коментар
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.
