Что мы узнали, воспроизведя 2 200 статей с ICML
В этой публикации мы расскажем, что узнали, проведя этот хакатон, и что это говорит о роли людей в ситуации, когда агенты проводят исследовательские эксперименты.
Статей больше, чем кто-либо способен проверить
Вопросы о том, насколько действительно воспроизводимы исследования в области ИИ, появились задолго до нынешней волны ИИ. Но масштаб усугубляет эти вопросы. На ICML 2026 поступило 23 918 заявок, из которых были приняты 6352 статьи — примерно вдвое больше, чем годом ранее. Это продолжение экспоненциальной тенденции, которую отчасти подпитывают агенты ИИ, ускоряющие проведение экспериментов и написание статей.
Возможности проверки не удвоились вместе с этим ростом. На большинстве конференций рецензенты работают добровольно и могут не иметь времени или компетенций для полноценной проверки статьи. Вот рецензия на одну из принятых статей ICML 2026, приведённая словами самого рецензента:
«Моя низкая оценка уверенности объясняется тем, что я не проверил все доказательства тщательно».
Обратите внимание: эта статья получила высокие оценки и статус spotlight. Запомните её, потому что позже мы вернёмся именно к этой статье и расскажем, что произошло, когда мы наконец тщательно проверили доказательства.
Однако изменилось то, что та же технология, которая привела к потоку заявок, может помочь нам справиться с ним. Кодинговые агенты вроде Claude Code, Codex, Cursor и Pi теперь могут прочитать статью, написать код, запустить эксперименты и отчитаться о результатах. Раньше тщательная проверка статьи стоила рецензенту целых выходных; агент может попытаться выполнить её за один день — и повторить это параллельно тысячи раз.
Поэтому мы хотели выяснить: если действительно повторно исследовать крупную конференцию в масштабе и попытаться воспроизвести каждую статью, что мы обнаружим?
Хакатон (15 июля — 2 августа)
Вместо того чтобы самостоятельно проверять статьи, мы открыли эту задачу для всего сообщества, получив всё разнообразие фреймворков агентов, вычислительных бюджетов и научных предпочтений, которое это подразумевает. С 15 июля по 2 августа 2026 года челлендж ICML 2026 Open Reproductions проходил следующим образом:
- Выберите статью. Мы проиндексировали все 6341 принятые статьи ICML 2026 вместе с их аннотациями и извлекли основные научные утверждения каждой из них, чтобы агент мог начать с конкретной проверяемой цели, а не с PDF-файла на 40 страниц. Участникам предлагалось воспроизводить одну и ту же статью несколькими независимыми командами.
- Используйте собственного агента. Участники применяли Claude Code, Codex, Cursor,
orxOpenResearch и всё, что между ними. Мы предоставили упрощённый интерфейс, благодаря которому агент мог получить статью, её утверждения и инструкции челленджа одной командой. - Воспроизведите, а затем опубликуйте всё. Каждый запуск создавал журнал Trackio: статическое пространство Hugging Face с описанием, запущенным кодом, созданными артефактами и (опционально) полной трассировкой выполнения агента, загруженной как датасет Hugging Face. Сам процесс аудита должен был быть доступен для аудита.
- Пройдите оценивание. Автоматизированный судья журналов (на основе модели с открытыми весами GLM-5.2) повторно прочитал каждый журнал и вынес вердикт по каждому утверждению: подтверждено, опровергнуто, игрушечный масштаб (доказательства в уменьшенном масштабе) или неопределённо. Судье было явно предписано не считать самооценку каждого журнала достоверной.
Участники получили по 20 долларов в виде вычислительных кредитов Hugging Face для запуска экспериментов в HF Jobs; за время челленджа они запустили 2962 облачные задачи. Когда полноценное воспроизведение было невозможно — например, если датасет статьи был закрытым или чекпойнты не были опубликованы, — участники проводили игрушечные воспроизведения на синтетических данных, имитирующих свойства оригинала.
Вот как выглядит завершённое воспроизведение:
По количественным показателям этот хакатон, вероятно, стал крупнейшей попыткой воспроизведения научной конференции:
- 1221 участник сообщества присоединился к организации
- 6816 журналов воспроизведений опубликовано
- Предприняты попытки воспроизвести 2226 статей — 34% всей конференции, многие несколькими независимыми командами
- Проверено 35 908 утверждений; все вердикты зафиксированы в общедоступном датасете после завершения челленджа
- Запущено 2962 задачи HF Jobs; на Hugging Face опубликовано 274 датасета с полной трассировкой агентов
Что мы обнаружили
Агрегируя вердикты по отдельным утверждениям для каждой статьи:
У 51% исследованных статей (1103) было независимо подтверждено хотя бы одно утверждение. Из них 266 статей были воспроизведены полностью — подтверждено каждое извлечённое утверждение, — а ещё 632 были воспроизведены частично, без опровержения чего-либо. В общей сложности реальными экспериментами подтверждено 3978 отдельных утверждений.
У 23% исследованных статей (496) было хотя бы одно опровергнутое или оспоренное утверждение. Сюда входят 49 статей, в которых все утверждения были опровергнуты и ничего не удалось подтвердить, а также, возможно, наиболее интересные 242 статьи, по которым независимые команды воспроизведения пришли к противоположным вердиктам относительно одних и тех же утверждений. Воспроизводимость не бинарна — она носит состязательный характер.
Остальные оказались посередине: 502 статьи имели только доказательства игрушечного масштаба, а для 280 не удалось установить ничего ни в одну, ни в другую сторону (самой распространённой причиной были отсутствующие артефакты).
Успешные воспроизведения
Некоторые статьи достойно выдержали это испытание, а лучшие журналы сообщества заслуживают отдельного прочтения:
- «Плоские минимумы и обобщение: выводы из стохастической выпуклой оптимизации» была воспроизведена 20 независимыми командами, 12 из которых подтвердили каждое утверждение. В одном из связанных журналов была включена и опубликована полная трассировка агента.
- «Подбрасывание монетки для безопасности: судьи на базе LLM не способны надёжно измерять устойчивость к атакам» — в 14 из 17 журналов были подтверждены все утверждения. Статья о ненадёжных судьях на базе LLM выдержала проверку агентов на базе LLM :)
Опровержения и то, что произошло при их проверке
35 участников официально заявили, что им удалось что-то опровергнуть. Мы состязательно перепроверили каждое заявленное опровержение: перечитали статью, перечитали журнал и заново вывели математику или повторно реализовали эксперимент по исходному тексту статьи.
Несколько подтверждённых опровержений со ссылками на обнаружившие их журналы:
Статья о страничной замене из введения. Помните рецензента, который не стал тщательно проверять доказательства? В статье «К оптимальной устойчивости в страничной замене с поддержкой обучения» утверждается, что её алгоритм обеспечивает устойчивость . В журнале одного из участников было измерено, что аддитивный член растёт как , и найден точный шаг доказательства, на котором оно рушится. Наша собственная повторная реализация расширила диапазон до k = 1024 и подтвердила рост примерно на уровне девяти сигм. Истинная устойчивость равна .
Теорема, которая рушится после шага 224. В статье «Прямой проход внимания и Фрэнк — Вульф» доказывается, что токенные частицы схлопываются в начало координат, если начало координат изначально находится внутри их выпуклой оболочки. Три независимые команды нашли контрпримеры: нарушения впервые возникали на шагах t = 224, ~3800 и 6416. Это хорошо объясняет, почему все остальные «подтвердили» утверждение: проверки с конечным горизонтом останавливались слишком рано. Самый наглядный контрпример сформулирован в точной рациональной арифметике, поэтому спрятаться за неоднозначностью вычислений с плавающей точкой невозможно. Авторы подтвердили результат в тот же день и работают над исправлением.
Теория написана для одной функции потерь, а результаты получены с помощью другой. В статье «Самодистилляция обеспечивает непрерывное обучение» центральное уравнение и весь теоретический раздел анализируют обратную дивергенцию KL, но значение по умолчанию в опубликованном коде, с помощью которого, по словам авторов, были получены все результаты статьи, вычисляет прямую KL. Журнал, обнаруживший это, также не смог воспроизвести заявленный в статье результат +4 п.п. с использованием кода и данных самих авторов. Авторы уже загрузили уточнённую версию на arXiv.
Оценка, искажённая добавлением заполнителей. В статье «Нужны ли трансформерам три проекции?» участник обнаружил, что около 66% оцениваемых позиций меток были токенами заполнения EOS, которые в процессе обучения стремятся к почти нулевой потере, занижая perplexity примерно втрое. Указанные в аннотации «потери качества 3,1% при сокращении кэша на 50%» после исправления становятся примерно 9,4%.
🚨 Ложные опровержения. Иногда мы находили ошибки в попытке воспроизведения. В одном журнале было драматично заявлено: «метод статьи в 2 раза медленнее базового метода». Оказалось, что это арифметическая ошибка в воспроизведении: время на одну траекторию сравнили со временем на пакет из 50 траекторий. После корректной нормализации собственные данные участника подтверждают заявленное в статье ускорение в 8 раз.
Разговоры с авторами
Мы начали писать авторам каждой статьи с подтверждённым результатом, формулируя вопрос просто: вот что мы обнаружили, вот все доказательства — вы согласны или наша трактовка ошибочна? Первые ответы были очень положительными:
На данный момент авторы подтвердили результаты по нескольким статьям, готовятся два исправления на arXiv, а в одном случае автор незаметно исправил ошибку в новой версии на arXiv за месяц до того, как челлендж её обнаружил; мы считаем это независимым совпадением 🤗
Роль людей
Самый интересный вопрос, который поднимает этот хакатон: остаётся ли у людей роль в рецензировании статей? Мы считаем, что да, по нескольким причинам:
Автономное выполнение агентом сталкивается с реальными ограничениями. Агенты застревали в локальных циклах, неверно интерпретировали поведение, зависящее от масштаба (несколько вердиктов «подтверждено» по статье о страничной замене основывались на проверках, завершившихся до того, как стал заметен рост по log-k), а иногда строили целое опровержение на несоответствии единиц измерения. Самые надёжные результаты челленджа были получены в рабочих процессах, которыми управлял человек: перенаправлял агента, ставил под вопрос допущение или решал, что предпосылка эксперимента неверна, прежде чем потратить на неё неделю вычислений.
Некоторая оценка пока неустранимо требует участия человека. Наш победитель с участием человека в контуре — наиболее наглядный пример. В статье утверждалась стабильная генерация изображений при экстремальном квантовании. Численные метрики говорили: «схлопывания нет», но вопрос о том, были ли изображения действительно пригодны для использования, имел перцептивный характер. Агент создал специализированный интерфейс проверки, а человек лично оценил все 128 пар изображений; аннотации были добавлены в репозиторий, после чего агент проверил их согласованность. Опубликованная трассировка агента фиксирует весь обмен, вплоть до вопроса участника о том, как работает инструмент проверки, и последующего сообщения: «Я просмотрел пары и положил csv в репозиторий, пожалуйста, проверьте».
Так какова же наша роль как рецензентов-людей? Мы считаем, что она заключается в эффективном управлении интеллектом. Подобно тому как профессор или руководитель исследовательской группы создаёт среду, в которой аспиранты могут хорошо работать, обеспечивая их вычислениями, инструментами, доступом к данным и своевременной адресной обратной связью, участники, которые извлекли из своих агентов максимум пользы, создавали правильную среду и задавали правильные вопросы, а затем позволяли агентам выполнять работу.
Спасибо
1221 участнику, победителям, авторам, которые с достоинством отвечали на наши вопросы, и организаторам из Hugging Face и alphaXiv — спасибо. Каждый журнал, вердикт, трассировка и артефакт челленджа общедоступны, начиная с пространства челленджа. Мы считаем, что это крупнейший на сегодняшний день открытый аудит конференции по машинному обучению, проводившийся по каждому утверждению, и хотели бы, чтобы этот рекорд недолго оставался за нами.
Следите за будущими мероприятиями по воспроизведению. 🤗
Пространства, упомянутые в этой статье 8
Сообщество
· Зарегистрируйтесь или войдите, чтобы оставить комментарий
Пространства, упомянутые в этой статье 8
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.


