Какво научихме, като възпроизведохме 2 200 статии от ICML
В тази публикация споделяме какво научихме от провеждането на този хакатон и какво подсказва той за ролята, която хората ще играят, когато агентите извършват изследователските експерименти.
Повече статии, отколкото някой може да прегледа
Въпросите за това доколко възпроизводими са наистина изследванията в областта на изкуствения интелект, са по-стари от настоящата вълна на ИИ. Но тези въпроси се изострят от мащаба. ICML 2026 получи 23 918 предложения и прие 6352 статии — приблизително два пъти повече от предходната година, продължавайки експоненциална тенденция, която поне отчасти се дължи на това, че ИИ агентите ускоряват провеждането на експерименти и оформянето на резултатите им.
Капацитетът за рецензиране не се е удвоил заедно с това. Рецензентите на повечето конференции са доброволци, които може да нямат време или експертни познания да прегледат напълно дадена статия. Ето рецензия на една приета статия от ICML 2026, по думите на самия рецензент:
„Ниската ми оценка за увереност се дължи на това, че не проверих внимателно всички доказателства.“
Имайте предвид, че тази статия получи високи оценки и бе избрана за представяне като акцент. Запомнете го, защото по-късно в публикацията ще се върнем към точно тази статия и към случилото се, когато най-накрая проверихме внимателно доказателствата.
Това, което се е променило, е, че същата технология, която движи потока от предложения, може също да ни помогне да се справим с него. Кодирането агенти като Claude Code, Codex, Cursor и Pi вече могат да прочетат статия, да напишат кода, да стартират експериментите и да докладват какво са открили. Внимателната проверка на статия някога струваше на рецензента един уикенд; един агент може да се опита да я извърши за един следобед, паралелно и хиляди пъти.
Затова въпросът, който искахме да зададем, беше: ако действително преразгледаме мащабно голяма конференция и се опитаме да възпроизведем всяка статия, какво ще открием?
Хакатонът (15 юли – 2 август)
Вместо сами да одитираме статиите, отворихме инициативата за цялата общност, с цялото разнообразие от агентски рамки, изчислителни бюджети и научни предпочитания, което това носи. От 15 юли до 2 август 2026 г. предизвикателството ICML 2026 Open Reproductions работеше по следния начин:
- Изберете статия. Индексирахме всички 6341 приети статии от ICML 2026 с техните резюмета и извлякохме основните научни твърдения от всяка, така че агентът да може да започне с конкретна, проверима цел, а не с PDF от 40 страници. Насърчаваше се няколко души да възпроизвеждат една и съща статия.
- Донесете собствения си агент. Участниците използваха Claude Code, Codex, Cursor,
orxна OpenResearch и всичко между тях. Осигурихме опростен интерфейс, така че агентът да може да изтегли статията, нейните твърдения и инструкциите за предизвикателството с една-единствена команда. - Възпроизведете, след което публикувайте всичко. Всеки опит създаваше дневник в Trackio: статично Hugging Face Space, съдържащо описанието, изпълнения код и създадените от него артефакти, а по желание и пълната следа от изпълнението на агента, качена като Hugging Face Dataset. Самият процес на одит трябваше да може да бъде одитиран.
- Получете оценка. Автоматизиран съдия на дневниците (работещ с модел с отворени тегла, GLM-5.2) препрочиташе всеки дневник и издаваше присъда за всяко твърдение: потвърдено, опровергано, играчка (доказателства в намален мащаб) или неубедително. Съдията бе изрично инструктиран да третира самооценката на всеки дневник като ненадеждна.
Участниците получиха 20 долара кредити за изчисления в Hugging Face, за да изпълняват експерименти в HF Jobs; по време на предизвикателството участниците стартираха 2962 облачни задачи. Когато пълното възпроизвеждане беше невъзможно — например когато наборът от данни на дадена статия беше собственост на някого или контролните точки не бяха публикувани — участниците изпълняваха възпроизвеждания в малък мащаб със синтетични данни, имитиращи свойствата на оригинала.
Ето как изглежда едно завършено възпроизвеждане:
По числени показатели този хакатон вероятно беше най-мащабният опит за възпроизвеждане на научна конференция:
- 1221 членове на общността се присъединиха към организацията
- 6816 публикувани дневника за възпроизвеждане
- 2226 статии, подложени на опит за възпроизвеждане — 34% от цялата конференция, много от тях от няколко независими екипа
- 35 908 оценени твърдения, като всички присъди бяха замразени в публичен набор от данни при приключването на предизвикателството
- 2962 стартирани задачи в HF Jobs; 274 пълни набора от данни със следи от агенти, публикувани в Hugging Face
Какво открихме
Обобщавайки присъдите на ниво твърдение за всяка статия:
51% от изследваните статии (1103) имаха поне едно независимо потвърдено твърдение. От тях 266 статии бяха напълно възпроизведени, като всяко извлечено твърдение бе потвърдено, а още 632 бяха частично възпроизведени, без нито едно опровергано твърдение. Общо 3978 отделни твърдения бяха потвърдени с реални експерименти.
23% от изследваните статии (496) имаха поне едно опровергано или оспорено твърдение. Това включва 49 статии, в които всички твърдения бяха опровергани и нищо не можеше да бъде потвърдено, както и — може би най-интересното — 242 статии, при които независими екипи за възпроизвеждане достигнаха до противоположни присъди за едни и същи твърдения. Възпроизводимостта не е двоична; тя е състезателна.
Останалите бяха по средата: 502 статии само с доказателства в мащаб „играчка“ и 280, при които не можеше да се установи нищо в нито една посока (липсващите артефакти бяха най-честата причина).
Добре изпълнени възпроизвеждания
Някои статии преминаха през изпитанието и изглеждаха отлично, а най-добрите дневници на общността си заслужават да бъдат прочетени сами по себе си:
- „Плоски минимуми и обобщаване: прозрения от стохастичната изпъкнала оптимизация“ беше възпроизведена от 20 независими екипа, 12 от които потвърдиха всяко твърдение. Свързаният дневник включваше и публикуваше пълната следа на агента.
- „Ези-тура за безопасността: LLM съдиите не успяват надеждно да измерят устойчивостта срещу атаки“ имаше 14 от 17 дневника, потвърдили всяко твърдение. Статия за ненадеждни LLM съдии, която издържа на проверка от LLM агенти :)
Опровержения и какво се случи, когато ги проверихме
35 участници официално заявиха, че са опровергали нещо. Проверихме отново по състезателен начин всяко заявено опровержение: препрочетохме статията, препрочетохме дневника и изведохме отново математиката или реализирахме повторно експеримента по текста на самата статия.
Няколко от потвърдените опровержения, с връзка към дневника, който ги откри:
Статията за страницирането от въведението. Рецензентът, който не е проверил внимателно доказателствата? Статията „Към оптимална устойчивост при странициране, подпомогнато от обучение“, твърди, че нейният алгоритъм постига устойчивост . Дневникът на един участник измери как адитивният член нараства като и откри точната стъпка в доказателството, която се проваля. Нашата собствена повторна реализация разшири проверката до k = 1024 и потвърди нарастването с приблизително девет сигми. Истинската устойчивост е .
Теорема, която се проваля след стъпка 224. „Преден ход на вниманието и Frank-Wolfe“ доказва, че частиците от токени се сливат в началото винаги когато началото се намира в тяхната изпъкнала обвивка. Три независими екипа откриха контрапримери, като нарушенията се появяват за първи път при t = 224, ~3800 и 6416 стъпки, което добре обяснява защо всички останали са „потвърдили“ твърдението: проверките с краен хоризонт спират твърде рано. Най-ясният контрапример е формулиран с точна рационална аритметика, така че няма неяснота с плаваща запетая, зад която да се скрием. Авторите потвърдиха същия ден и работят по корекция.
Теория, написана за една загуба, резултати, получени с друга. В „Самодестилацията позволява продължаващо обучение“ централното уравнение и целият теоретичен раздел на статията анализират обратната KL дивергенция, но стандартната настройка в публикувания код, която според авторите е генерирала всички резултати в статията, изчислява директната KL дивергенция. Дневникът, който го откри, също не успя да възпроизведе заявения в заглавието резултат от +4 процентни пункта със собствения код и данни на авторите. Авторите вече са качили изяснена версия в arXiv.
Оценка, разредена чрез допълване. В „Нуждаят ли се трансформаторите от три проекции?“ участник откри, че ~66% от оценените позиции на етикети са били допълващи токени EOS, които се обучават до почти нулева загуба, като по този начин изкуствено намаляват перплексията приблизително трикратно. „Цената от 3,1% за качеството при 50% намаление на кеша“ в резюмето става приблизително 9,4%, след като бъде коригирана.
🚨 Фалшиви опровержения. Понякога откривахме недостатъци в опит за възпроизвеждане. В един дневник драматично се твърдеше: „методът на статията е два пъти по-бавен от базовия метод“; оказа се, че това е аритметична грешка в възпроизвеждането: времето за една траектория е сравнено с времето за пакет от 50 траектории. След правилно нормализиране собствените данни на участника потвърждават заявеното в статията 8-кратно ускорение.
Разговори с авторите
Започнахме да пишем на авторите на всяко потвърдено откритие с проста формулировка: ето какво открихме, ето всички доказателства — съгласни ли сте или анализът ни е грешен? Първите отговори са много положителни:
Досега авторите са потвърдили открития по множество статии, подготвят се две корекции в arXiv, а в един случай автор тихо беше поправил грешката в нова версия в arXiv месец преди да я открие предизвикателството — което отчитаме като независимо съвпадение 🤗
Ролята на хората
Най-интересният въпрос, който повдига този хакатон, е: все още ли имат хората роля в рецензирането на статии? Смятаме, че да, по няколко причини:
Изпълнението изцяло от агенти среща реални ограничения. Агентите се зацикляха в локални цикли, разбираха погрешно зависимото от мащаба поведение (няколко присъди „потвърдено“ за статията за страницирането идваха от проверки, спрели преди да стане видим растежът на log-k) и понякога изграждаха цялото опровержение върху несъответствие в мерните единици. Най-надеждните резултати от предизвикателството идваха от работни процеси, при които човек насочваше агента: пренасочваше го, поставяше под въпрос дадено допускане или решаваше, че предпоставката на експеримента е погрешна, преди да бъде изразходвана седмица изчислително време за него.
Някои оценки засега са неразривно човешки. Нашият победител с участие на човек в цикъла е най-ясният пример. Статията твърдеше, че генерирането на изображения остава стабилно при екстремно квантуване. Числените показатели казваха „няма срив“; дали изображенията действително са използваеми беше въпрос на възприятие. Агентът създаде специално предназначен интерфейс за преглед, а човек лично оцени всичките 128 двойки изображения, като анотациите бяха записани в хранилището, а след това агентът провери тяхната съгласуваност. Публикуваната следа на агента улавя целия обмен, включително въпроса на участника как работи инструментът за преглед и последвалия отговор: „Прегледах двойките и сложих csv файла в хранилището, моля, проверете.“
И така, какви са ролите ни като човешки рецензенти? Смятаме, че трябва ефективно да управляваме интелигентността. Подобно на професор или главен изследовател (PI), който създава среда, в която докторантите могат да вършат добра работа, осигурявайки изчислителни ресурси, инструменти, достъп до данни и целенасочена обратна връзка в подходящите моменти, участниците, които извлякоха най-много от своите агенти, бяха тези, които създадоха правилната среда и зададоха правилните въпроси, а след това оставиха агентите да изпълняват задачите.
Благодарности
На 1221 души, които се присъединиха, на победителите, на авторите, които отговориха с достойнство, и на организаторите ни от Hugging Face и alphaXiv: благодарим ви. Всеки дневник, присъда, следа и артефакт от предизвикателството е публичен, започвайки от Space на предизвикателството. Смятаме, че това е най-мащабният досега отворен одит на конференция по машинно обучение, твърдение по твърдение, и бихме искали този рекорд да не се задържи дълго.
Очаквайте бъдещи събития за възпроизвеждане. 🤗
Споменати в тази статия Spaces 8
Общност
· Регистрирайте се или влезте в профила си, за да коментирате
Споменати в тази статия Spaces 8
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.


