Sakhanda Wire
NVDA — MSFT — GOOGL — META — AMZN —
← Към новините

Системата за партньорска проверка на LLM на Sakana AI открива 73% от грешките в основните твърдения

Sakana AI публикува Beyond Imitation — изследователска статия за TMLR, посветена на партньорска проверка с помощта на LLM и фокусирана върху откриването на грешки. Повечето AI рецензенти се оценяват според това доколко точно копират човешките рецензии. Тази работа поставя по-труден въпрос: може ли AI рецензент да открие умишлено внесена грешка? Изследователският екип представя две разработки: бенчмарк за противоречия и система за многослойна рецензия (MLR). За разработчиците, които изграждат изследователски агенти, изводът е практичен. И дизайнът на системата, и изборът на модел влияят върху откриването на грешки.

Накратко

  • Размер: 1164 внесени противоречия в 257 статии от 5 научни форума. MLR прочита до 10 страници от основния текст.
  • Работи с: готови API модели (Claude Sonnet 4, Claude Haiku 3.5). Без GPU и без дообучаване. Около 0,47 долара за рецензия.
  • Представяне: Най-висока способност за откриване на грешки от всичките 4 тествани системи, с оценки, съответстващи на човешките.
  • Най-добър резултат: Открива 73,43% от грешките в основните твърдения с 4 рецензии, в сравнение с 14,81% за най-добрата базова система.
  • Най-слаб резултат: Само 16,11% точни съвпадения при реални оттеглени статии от arXiv.
  • Извод:
    • Най-добро: прочита текста, преди да даде оценка, и открива много повече сериозни грешки.
    • Най-лошо: все още се поддава на скрити инжекции в подканите.

Какво представлява многослойната рецензия?

Многослойната рецензия е агентна AI система за рецензиране от Sakana AI, която разбира научната статия, преди да я критикува. Тя използва 3 агента с готови модели Claude:

  • Агент за приложението (Claude Haiku 3.5): обобщава експериментите и подробностите по реализацията от приложението.
  • Агент за литературен обзор (Claude Sonnet 4): използва уеб търсене, за да постави статията в контекста на предишни изследвания. Той е по избор.
  • Агент за рецензиране (Claude Sonnet 4): изпълнява верига от подкани в 3 етапа, вдъхновена от подхода на Кешав с три прочитания.

При първото прочитане се създава обобщен план. При второто текстът се прочита подробно и се отбелязват слабости, допускания и пропуски. При третото се обединяват резултатите от всички агенти в раздели за Силни страни, Слабости, Въпроси, Препоръка, Оценка и списък със задачи. PDF файлът се подава директно, така че фигурите и уравненията се запазват.

Как работи бенчмаркът за противоречия?

Бенчмаркът вмъква грешки в реални статии и проверява дали рецензентите ще ги открият. Изследователският екип е събрал 257 статии с лиценз CC от ACL, AISTATS, CVPR и ICML 2025, както и NeurIPS 2024.

Gemini 2.5 Pro изгражда граф на знанията за твърденията, доказателствата и методите във всяка статия. Разстоянието на възела от „основното твърдение“ определя сериозността. Разстояние 0 засяга основно твърдение, а по-големите разстояния засягат подробности. След това GPT-4.1 пренаписва по 1 възел на всяко разстояние като противоречие, което води до 1164 точки от данни.

Съдията o3 оценява всяка рецензия 10 пъти. При чисти статии той достига 99,9% точност. Показва 86,8% чувствителност при ръчно потвърдените откривания, така че отчетените резултати може да са консервативни.

Колко добре MLR открива грешки?

MLR изпреварва всички базови системи в бенчмарка. С 4 рецензии тя открива 73,43% от противоречията с разстояние 0 и 40,95% от всички противоречия. Най-добрата базова система, AgentReview, открива 14,81% при разстояние 0. Дори една рецензия от MLR открива 60,79%.

Аблационният анализ отделя влиянието на модела от това на дизайна. Замяната на GPT-4.1 с Claude Sonnet 4 в LLM-Review повишава откриването при разстояние 0 от 14,56% на 35,40%. Дизайнът на MLR добавя около 25 процентни пункта при една рецензия. Точността намалява с увеличаването на разстоянието на възела, което подкрепя оценяването на сериозността.

При реални оттеглени статии от WithdrarXiv-Check (211 статии) подобренията намаляват. MLR постига 26,07% при „подобни“ съвпадения и 16,11% при „точни“ съвпадения. Най-силните базови системи постигат съответно 18,48% и 9,00%.

Съгласува ли се MLR с човешките рецензенти?

По отношение на оценките — предимно да. При подадените за ICLR 2025 статии предсказаните от MLR оценки достигат корелация на Пирсън от 0,586 с човешките оценки. Референтната стойност при сравнение човек с човек е 0,742. При ICML 2025 AI Reviewer леко го изпреварва — 0,439 срещу 0,429.

По отношение на фокуса — не. MLR набляга на валидността и експериментите, докато хората придават по-голяма тежест на яснотата и новостта. Авторите представят това като допълваща перспектива, а не като заместител.

Колко струва използването му?

MLR струва около 0,47 долара за рецензия, без да се включва незадължителният агент за литературен обзор. Той използва 189 062 входни токена — около половината от 403 654-те на AI Reviewer. Вариантът с една подканa намалява разходите с около две трети. Способността за откриване намалява с около 3,5 процентни пункта в подмножество от бенчмарка.

Как се сравнява MLR с други AI рецензенти?

ХарактеристикаMLR (Sakana AI)LLM-ReviewAI ReviewerAgentReview
Използван в това проучване LLMClaude Sonnet 4 + Haiku 3.5GPT-4.1o4-miniGPT-4o
Дизайн3 агента, верига от 3 етапаЕдна подкана, съкратен текстАнсамбъл от 5 рецензии, метарецензия, рефлексияРоли на рецензент, автор и председател на научната област
Бенчмарк за противоречия, пълен40,95% (4 рецензии)6,39%6,50%5,95%
Грешки в основните твърдения (разстояние 0)73,43%14,56%11,17%14,81%
WithdrarXiv-Check, подобни / точни26,07% / 16,11%5,21% / 2,37%13,74% / 9,00%18,48% / 5,69%
Пирсън за ICLR 2025 спрямо хората0,586-0,0130,5380,195
Входни токени за рецензия189 0626 517403 654310 964
Цена за рецензия~0,47 долара~0,01 долара~0,49 долара~0,81 долара
Отворен кодПри поискванеДаДаДа

Всички данни за бенчмарка, корелацията, токените и разходите са взети от статията Beyond Imitation.

Основни изводи

  • Sakana AI оценява AI рецензентите според способността им да откриват грешки, а не да копират хората.
  • MLR открива 73,43% от грешките в основните твърдения — около 5 пъти повече от най-добрата базова система.
  • Както смяната на модела, така и дизайнът с 3 етапа водят до значителни подобрения в откриването.
  • Грешките в реални оттеглени статии остават трудни за откриване: 16,11% точни съвпадения.
  • Скритите инжекции в подканите все още влияят на всеки тестван AI рецензент.

Вижте статията тук. Всички заслуги са за изследователя на този проект. Също така можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия ML SubReddit с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини