Sakhanda Wire
NVDA $225.32 +0.55% MSFT $493.85 +0.29% GOOGL $345.84 +0.67% META $589.19 +1.79% AMZN $265.30 -0.74%
← К новостям

Что мы узнали, воспроизведя 2 200 статей с ICML

Что мы узнали, воспроизведя 2200 статей с ICML
Опубликовано 13 августа 2026 г.
Обновление на GitHub
В июле мы провели хакатон, в котором более 1200 участников сообщества использовали собственных кодинговых агентов и пытались воспроизвести опубликованные на ICML 2026 статьи — утверждение за утверждением. За 19 дней участники опубликовали 6816 журналов Trackio, воспроизведя 2226 статей — около трети конференции 🤯

В этой публикации мы расскажем, что узнали, проведя этот хакатон, и что это говорит о роли людей в ситуации, когда агенты проводят исследовательские эксперименты.

Статей больше, чем кто-либо способен проверить

Вопросы о том, насколько действительно воспроизводимы исследования в области ИИ, появились задолго до нынешней волны ИИ. Но масштаб усугубляет эти вопросы. На ICML 2026 поступило 23 918 заявок, из которых были приняты 6352 статьи — примерно вдвое больше, чем годом ранее. Это продолжение экспоненциальной тенденции, которую отчасти подпитывают агенты ИИ, ускоряющие проведение экспериментов и написание статей.

Возможности проверки не удвоились вместе с этим ростом. На большинстве конференций рецензенты работают добровольно и могут не иметь времени или компетенций для полноценной проверки статьи. Вот рецензия на одну из принятых статей ICML 2026, приведённая словами самого рецензента:

An OpenReview reviewer admitting the proofs were not checked carefully

«Моя низкая оценка уверенности объясняется тем, что я не проверил все доказательства тщательно».

Обратите внимание: эта статья получила высокие оценки и статус spotlight. Запомните её, потому что позже мы вернёмся именно к этой статье и расскажем, что произошло, когда мы наконец тщательно проверили доказательства.

Однако изменилось то, что та же технология, которая привела к потоку заявок, может помочь нам справиться с ним. Кодинговые агенты вроде Claude Code, Codex, Cursor и Pi теперь могут прочитать статью, написать код, запустить эксперименты и отчитаться о результатах. Раньше тщательная проверка статьи стоила рецензенту целых выходных; агент может попытаться выполнить её за один день — и повторить это параллельно тысячи раз.

Поэтому мы хотели выяснить: если действительно повторно исследовать крупную конференцию в масштабе и попытаться воспроизвести каждую статью, что мы обнаружим?

Хакатон (15 июля — 2 августа)

Вместо того чтобы самостоятельно проверять статьи, мы открыли эту задачу для всего сообщества, получив всё разнообразие фреймворков агентов, вычислительных бюджетов и научных предпочтений, которое это подразумевает. С 15 июля по 2 августа 2026 года челлендж ICML 2026 Open Reproductions проходил следующим образом:

  1. Выберите статью. Мы проиндексировали все 6341 принятые статьи ICML 2026 вместе с их аннотациями и извлекли основные научные утверждения каждой из них, чтобы агент мог начать с конкретной проверяемой цели, а не с PDF-файла на 40 страниц. Участникам предлагалось воспроизводить одну и ту же статью несколькими независимыми командами.
  2. Используйте собственного агента. Участники применяли Claude Code, Codex, Cursor, orx OpenResearch и всё, что между ними. Мы предоставили упрощённый интерфейс, благодаря которому агент мог получить статью, её утверждения и инструкции челленджа одной командой.
  3. Воспроизведите, а затем опубликуйте всё. Каждый запуск создавал журнал Trackio: статическое пространство Hugging Face с описанием, запущенным кодом, созданными артефактами и (опционально) полной трассировкой выполнения агента, загруженной как датасет Hugging Face. Сам процесс аудита должен был быть доступен для аудита.
  4. Пройдите оценивание. Автоматизированный судья журналов (на основе модели с открытыми весами GLM-5.2) повторно прочитал каждый журнал и вынес вердикт по каждому утверждению: подтверждено, опровергнуто, игрушечный масштаб (доказательства в уменьшенном масштабе) или неопределённо. Судье было явно предписано не считать самооценку каждого журнала достоверной.

Участники получили по 20 долларов в виде вычислительных кредитов Hugging Face для запуска экспериментов в HF Jobs; за время челленджа они запустили 2962 облачные задачи. Когда полноценное воспроизведение было невозможно — например, если датасет статьи был закрытым или чекпойнты не были опубликованы, — участники проводили игрушечные воспроизведения на синтетических данных, имитирующих свойства оригинала.

Вот как выглядит завершённое воспроизведение:

Anatomy of a reproduction logbook: logbook pages, agent traces, and artifacts

По количественным показателям этот хакатон, вероятно, стал крупнейшей попыткой воспроизведения научной конференции:

  • 1221 участник сообщества присоединился к организации
  • 6816 журналов воспроизведений опубликовано
  • Предприняты попытки воспроизвести 2226 статей — 34% всей конференции, многие несколькими независимыми командами
  • Проверено 35 908 утверждений; все вердикты зафиксированы в общедоступном датасете после завершения челленджа
  • Запущено 2962 задачи HF Jobs; на Hugging Face опубликовано 274 датасета с полной трассировкой агентов

Что мы обнаружили

Агрегируя вердикты по отдельным утверждениям для каждой статьи:

У 51% исследованных статей (1103) было независимо подтверждено хотя бы одно утверждение. Из них 266 статей были воспроизведены полностью — подтверждено каждое извлечённое утверждение, — а ещё 632 были воспроизведены частично, без опровержения чего-либо. В общей сложности реальными экспериментами подтверждено 3978 отдельных утверждений.

У 23% исследованных статей (496) было хотя бы одно опровергнутое или оспоренное утверждение. Сюда входят 49 статей, в которых все утверждения были опровергнуты и ничего не удалось подтвердить, а также, возможно, наиболее интересные 242 статьи, по которым независимые команды воспроизведения пришли к противоположным вердиктам относительно одних и тех же утверждений. Воспроизводимость не бинарна — она носит состязательный характер.

Остальные оказались посередине: 502 статьи имели только доказательства игрушечного масштаба, а для 280 не удалось установить ничего ни в одну, ни в другую сторону (самой распространённой причиной были отсутствующие артефакты).

Успешные воспроизведения

Некоторые статьи достойно выдержали это испытание, а лучшие журналы сообщества заслуживают отдельного прочтения:

Опровержения и то, что произошло при их проверке

35 участников официально заявили, что им удалось что-то опровергнуть. Мы состязательно перепроверили каждое заявленное опровержение: перечитали статью, перечитали журнал и заново вывели математику или повторно реализовали эксперимент по исходному тексту статьи.

Несколько подтверждённых опровержений со ссылками на обнаружившие их журналы:

Статья о страничной замене из введения. Помните рецензента, который не стал тщательно проверять доказательства? В статье «К оптимальной устойчивости в страничной замене с поддержкой обучения» утверждается, что её алгоритм обеспечивает устойчивость . В журнале одного из участников было измерено, что аддитивный член растёт как , и найден точный шаг доказательства, на котором оно рушится. Наша собственная повторная реализация расширила диапазон до k = 1024 и подтвердила рост примерно на уровне девяти сигм. Истинная устойчивость равна .

Теорема, которая рушится после шага 224. В статье «Прямой проход внимания и Фрэнк — Вульф» доказывается, что токенные частицы схлопываются в начало координат, если начало координат изначально находится внутри их выпуклой оболочки. Три независимые команды нашли контрпримеры: нарушения впервые возникали на шагах t = 224, ~3800 и 6416. Это хорошо объясняет, почему все остальные «подтвердили» утверждение: проверки с конечным горизонтом останавливались слишком рано. Самый наглядный контрпример сформулирован в точной рациональной арифметике, поэтому спрятаться за неоднозначностью вычислений с плавающей точкой невозможно. Авторы подтвердили результат в тот же день и работают над исправлением.

Теория написана для одной функции потерь, а результаты получены с помощью другой. В статье «Самодистилляция обеспечивает непрерывное обучение» центральное уравнение и весь теоретический раздел анализируют обратную дивергенцию KL, но значение по умолчанию в опубликованном коде, с помощью которого, по словам авторов, были получены все результаты статьи, вычисляет прямую KL. Журнал, обнаруживший это, также не смог воспроизвести заявленный в статье результат +4 п.п. с использованием кода и данных самих авторов. Авторы уже загрузили уточнённую версию на arXiv.

Оценка, искажённая добавлением заполнителей. В статье «Нужны ли трансформерам три проекции?» участник обнаружил, что около 66% оцениваемых позиций меток были токенами заполнения EOS, которые в процессе обучения стремятся к почти нулевой потере, занижая perplexity примерно втрое. Указанные в аннотации «потери качества 3,1% при сокращении кэша на 50%» после исправления становятся примерно 9,4%.

🚨 Ложные опровержения. Иногда мы находили ошибки в попытке воспроизведения. В одном журнале было драматично заявлено: «метод статьи в 2 раза медленнее базового метода». Оказалось, что это арифметическая ошибка в воспроизведении: время на одну траекторию сравнили со временем на пакет из 50 траекторий. После корректной нормализации собственные данные участника подтверждают заявленное в статье ускорение в 8 раз.

Разговоры с авторами

Мы начали писать авторам каждой статьи с подтверждённым результатом, формулируя вопрос просто: вот что мы обнаружили, вот все доказательства — вы согласны или наша трактовка ошибочна? Первые ответы были очень положительными:

An author response confirming the finding and promising an arXiv correction

На данный момент авторы подтвердили результаты по нескольким статьям, готовятся два исправления на arXiv, а в одном случае автор незаметно исправил ошибку в новой версии на arXiv за месяц до того, как челлендж её обнаружил; мы считаем это независимым совпадением 🤗

Роль людей

Самый интересный вопрос, который поднимает этот хакатон: остаётся ли у людей роль в рецензировании статей? Мы считаем, что да, по нескольким причинам:

Автономное выполнение агентом сталкивается с реальными ограничениями. Агенты застревали в локальных циклах, неверно интерпретировали поведение, зависящее от масштаба (несколько вердиктов «подтверждено» по статье о страничной замене основывались на проверках, завершившихся до того, как стал заметен рост по log-k), а иногда строили целое опровержение на несоответствии единиц измерения. Самые надёжные результаты челленджа были получены в рабочих процессах, которыми управлял человек: перенаправлял агента, ставил под вопрос допущение или решал, что предпосылка эксперимента неверна, прежде чем потратить на неё неделю вычислений.

Некоторая оценка пока неустранимо требует участия человека. Наш победитель с участием человека в контуре — наиболее наглядный пример. В статье утверждалась стабильная генерация изображений при экстремальном квантовании. Численные метрики говорили: «схлопывания нет», но вопрос о том, были ли изображения действительно пригодны для использования, имел перцептивный характер. Агент создал специализированный интерфейс проверки, а человек лично оценил все 128 пар изображений; аннотации были добавлены в репозиторий, после чего агент проверил их согласованность. Опубликованная трассировка агента фиксирует весь обмен, вплоть до вопроса участника о том, как работает инструмент проверки, и последующего сообщения: «Я просмотрел пары и положил csv в репозиторий, пожалуйста, проверьте».

Так какова же наша роль как рецензентов-людей? Мы считаем, что она заключается в эффективном управлении интеллектом. Подобно тому как профессор или руководитель исследовательской группы создаёт среду, в которой аспиранты могут хорошо работать, обеспечивая их вычислениями, инструментами, доступом к данным и своевременной адресной обратной связью, участники, которые извлекли из своих агентов максимум пользы, создавали правильную среду и задавали правильные вопросы, а затем позволяли агентам выполнять работу.

Спасибо

1221 участнику, победителям, авторам, которые с достоинством отвечали на наши вопросы, и организаторам из Hugging Face и alphaXiv — спасибо. Каждый журнал, вердикт, трассировка и артефакт челленджа общедоступны, начиная с пространства челленджа. Мы считаем, что это крупнейший на сегодняшний день открытый аудит конференции по машинному обучению, проводившийся по каждому утверждению, и хотели бы, чтобы этот рекорд недолго оставался за нами.

Следите за будущими мероприятиями по воспроизведению. 🤗

Пространства, упомянутые в этой статье 8

Сообщество

Загружайте изображения, аудио и видео, перетаскивая их в текстовое поле, вставляя или нажимая здесь.
Нажмите или вставьте сюда, чтобы загрузить изображения

· Зарегистрируйтесь или войдите, чтобы оставить комментарий

Пространства, упомянутые в этой статье 8

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием Hugging Face

Читать оригинал на Hugging Face ↗

Текст и изображения принадлежат Hugging Face и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости