Системата за партньорска проверка на LLM на Sakana AI открива 73% от грешките в основните твърдения
Sakana AI публикува Beyond Imitation — изследователска статия за TMLR, посветена на партньорска проверка с помощта на LLM и фокусирана върху откриването на грешки. Повечето AI рецензенти се оценяват според това доколко точно копират човешките рецензии. Тази работа поставя по-труден въпрос: може ли AI рецензент да открие умишлено внесена грешка? Изследователският екип представя две разработки: бенчмарк за противоречия и система за многослойна рецензия (MLR). За разработчиците, които изграждат изследователски агенти, изводът е практичен. И дизайнът на системата, и изборът на модел влияят върху откриването на грешки.
Накратко
- Размер: 1164 внесени противоречия в 257 статии от 5 научни форума. MLR прочита до 10 страници от основния текст.
- Работи с: готови API модели (Claude Sonnet 4, Claude Haiku 3.5). Без GPU и без дообучаване. Около 0,47 долара за рецензия.
- Представяне: Най-висока способност за откриване на грешки от всичките 4 тествани системи, с оценки, съответстващи на човешките.
- Най-добър резултат: Открива 73,43% от грешките в основните твърдения с 4 рецензии, в сравнение с 14,81% за най-добрата базова система.
- Най-слаб резултат: Само 16,11% точни съвпадения при реални оттеглени статии от arXiv.
- Извод:
- Най-добро: прочита текста, преди да даде оценка, и открива много повече сериозни грешки.
- Най-лошо: все още се поддава на скрити инжекции в подканите.
Какво представлява многослойната рецензия?
Многослойната рецензия е агентна AI система за рецензиране от Sakana AI, която разбира научната статия, преди да я критикува. Тя използва 3 агента с готови модели Claude:
- Агент за приложението (Claude Haiku 3.5): обобщава експериментите и подробностите по реализацията от приложението.
- Агент за литературен обзор (Claude Sonnet 4): използва уеб търсене, за да постави статията в контекста на предишни изследвания. Той е по избор.
- Агент за рецензиране (Claude Sonnet 4): изпълнява верига от подкани в 3 етапа, вдъхновена от подхода на Кешав с три прочитания.
При първото прочитане се създава обобщен план. При второто текстът се прочита подробно и се отбелязват слабости, допускания и пропуски. При третото се обединяват резултатите от всички агенти в раздели за Силни страни, Слабости, Въпроси, Препоръка, Оценка и списък със задачи. PDF файлът се подава директно, така че фигурите и уравненията се запазват.
Как работи бенчмаркът за противоречия?
Бенчмаркът вмъква грешки в реални статии и проверява дали рецензентите ще ги открият. Изследователският екип е събрал 257 статии с лиценз CC от ACL, AISTATS, CVPR и ICML 2025, както и NeurIPS 2024.
Gemini 2.5 Pro изгражда граф на знанията за твърденията, доказателствата и методите във всяка статия. Разстоянието на възела от „основното твърдение“ определя сериозността. Разстояние 0 засяга основно твърдение, а по-големите разстояния засягат подробности. След това GPT-4.1 пренаписва по 1 възел на всяко разстояние като противоречие, което води до 1164 точки от данни.
Съдията o3 оценява всяка рецензия 10 пъти. При чисти статии той достига 99,9% точност. Показва 86,8% чувствителност при ръчно потвърдените откривания, така че отчетените резултати може да са консервативни.
Колко добре MLR открива грешки?
MLR изпреварва всички базови системи в бенчмарка. С 4 рецензии тя открива 73,43% от противоречията с разстояние 0 и 40,95% от всички противоречия. Най-добрата базова система, AgentReview, открива 14,81% при разстояние 0. Дори една рецензия от MLR открива 60,79%.
Аблационният анализ отделя влиянието на модела от това на дизайна. Замяната на GPT-4.1 с Claude Sonnet 4 в LLM-Review повишава откриването при разстояние 0 от 14,56% на 35,40%. Дизайнът на MLR добавя около 25 процентни пункта при една рецензия. Точността намалява с увеличаването на разстоянието на възела, което подкрепя оценяването на сериозността.
При реални оттеглени статии от WithdrarXiv-Check (211 статии) подобренията намаляват. MLR постига 26,07% при „подобни“ съвпадения и 16,11% при „точни“ съвпадения. Най-силните базови системи постигат съответно 18,48% и 9,00%.
Съгласува ли се MLR с човешките рецензенти?
По отношение на оценките — предимно да. При подадените за ICLR 2025 статии предсказаните от MLR оценки достигат корелация на Пирсън от 0,586 с човешките оценки. Референтната стойност при сравнение човек с човек е 0,742. При ICML 2025 AI Reviewer леко го изпреварва — 0,439 срещу 0,429.
По отношение на фокуса — не. MLR набляга на валидността и експериментите, докато хората придават по-голяма тежест на яснотата и новостта. Авторите представят това като допълваща перспектива, а не като заместител.
Колко струва използването му?
MLR струва около 0,47 долара за рецензия, без да се включва незадължителният агент за литературен обзор. Той използва 189 062 входни токена — около половината от 403 654-те на AI Reviewer. Вариантът с една подканa намалява разходите с около две трети. Способността за откриване намалява с около 3,5 процентни пункта в подмножество от бенчмарка.
Как се сравнява MLR с други AI рецензенти?
| Характеристика | MLR (Sakana AI) | LLM-Review | AI Reviewer | AgentReview |
|---|---|---|---|---|
| Използван в това проучване LLM | Claude Sonnet 4 + Haiku 3.5 | GPT-4.1 | o4-mini | GPT-4o |
| Дизайн | 3 агента, верига от 3 етапа | Една подкана, съкратен текст | Ансамбъл от 5 рецензии, метарецензия, рефлексия | Роли на рецензент, автор и председател на научната област |
| Бенчмарк за противоречия, пълен | 40,95% (4 рецензии) | 6,39% | 6,50% | 5,95% |
| Грешки в основните твърдения (разстояние 0) | 73,43% | 14,56% | 11,17% | 14,81% |
| WithdrarXiv-Check, подобни / точни | 26,07% / 16,11% | 5,21% / 2,37% | 13,74% / 9,00% | 18,48% / 5,69% |
| Пирсън за ICLR 2025 спрямо хората | 0,586 | -0,013 | 0,538 | 0,195 |
| Входни токени за рецензия | 189 062 | 6 517 | 403 654 | 310 964 |
| Цена за рецензия | ~0,47 долара | ~0,01 долара | ~0,49 долара | ~0,81 долара |
| Отворен код | При поискване | Да | Да | Да |
Всички данни за бенчмарка, корелацията, токените и разходите са взети от статията Beyond Imitation.
Основни изводи
- Sakana AI оценява AI рецензентите според способността им да откриват грешки, а не да копират хората.
- MLR открива 73,43% от грешките в основните твърдения — около 5 пъти повече от най-добрата базова система.
- Както смяната на модела, така и дизайнът с 3 етапа водят до значителни подобрения в откриването.
- Грешките в реални оттеглени статии остават трудни за откриване: 16,11% точни съвпадения.
- Скритите инжекции в подканите все още влияят на всеки тестван AI рецензент.
Вижте статията тук. Всички заслуги са за изследователя на този проект. Също така можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия ML SubReddit с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.