Sakhanda Wire
NVDA — MSFT — GOOGL — META — AMZN —
← До новин

Система експертної перевірки LLM від Sakana AI виявляє 73% помилок у ключових твердженнях

Sakana AI опублікувала Beyond Imitation — дослідницьку статтю для TMLR про рецензування за допомогою LLM, побудоване навколо виявлення помилок. Більшість ШІ-рецензентів оцінюють за тим, наскільки близько вони відтворюють рецензії людей. У цій роботі поставлено складніше запитання: чи може ШІ-рецензент знайти навмисно допущену помилку? Дослідницька команда представила дві складові: Contradiction Benchmark і систему Multi-Layered Review (MLR). Для розробників, які створюють дослідницьких агентів, висновок практичний. І дизайн системи, і вибір моделі впливають на виявлення помилок.

Коротко

  • Масштаб: 1 164 вставлені суперечності у 257 статтях із 5 майданчиків. MLR читає до 10 сторінок основного тексту.
  • Працює на: готових API-моделях (Claude Sonnet 4, Claude Haiku 3.5). Без GPU та донавчання. Близько $0,47 за рецензію.
  • Результативність: найвищий рівень виявлення помилок серед усіх 4 протестованих систем, із показниками, узгодженими з людськими оцінками.
  • Найкращий результат: виявлено 73,43% помилок у ключових твердженнях за 4 рецензіями проти 14,81% у найкращого базового методу.
  • Найгірший результат: лише 16,11% точних збігів на реальних відкликаних статтях з arXiv.
  • Підсумок:
    • Найкраще: читає перед оцінюванням і знаходить значно більше серйозних помилок.
    • Найгірше: досі піддається прихованій ін’єкції промптів.

Що таке Multi-Layered Review?

Multi-Layered Review — це агентна система ШІ для рецензування від Sakana AI, яка спочатку розуміє дослідницьку статтю, а вже потім критикує її. Вона використовує 3 агенти на готових моделях Claude:

  • Агент додатків (Claude Haiku 3.5): узагальнює експерименти та деталі реалізації з додатків.
  • Агент огляду літератури (Claude Sonnet 4): використовує вебпошук, щоб розмістити статтю в контексті попередніх досліджень. Він є необов’язковим.
  • Агент рецензування (Claude Sonnet 4): запускає ланцюжок промптів із 3 проходів, натхненний підходом Кешава з трьома проходами.

Під час першого проходу створюється загальний план. Під час другого текст читається детально, а також позначаються слабкі місця, припущення та прогалини. Під час третього всі результати роботи агентів об’єднуються в розділи «Сильні сторони», «Слабкі сторони», «Запитання», «Рекомендація», «Оцінка» та список подальших завдань. PDF-файл передається безпосередньо, тому рисунки й рівняння зберігаються.

Як працює Contradiction Benchmark?

Бенчмарк вставляє помилки в реальні статті та перевіряє, чи помітять їх рецензенти. Дослідницька команда зібрала 257 статей із ліцензією CC з ACL, AISTATS, CVPR та ICML 2025, а також NeurIPS 2024.

Gemini 2.5 Pro створює граф знань для кожної статті, що містить її твердження, докази та методи. Відстань вузла від «головного твердження» визначає серйозність. Відстань 0 означає ключове твердження, а більші відстані — деталі. GPT-4.1 переписує по 1 вузлу на кожній відстані у формі суперечності, у результаті чого отримано 1 164 точки даних.

Суддя o3 оцінює кожну рецензію 10 разів. На чистих статтях він досяг точності 99,9%. Він продемонстрував чутливість 86,8% на вручну підтверджених виявленнях, тому наведені оцінки можуть бути консервативними.

Наскільки добре MLR виявляє помилки?

MLR випередила всі базові методи на бенчмарку. За 4 рецензіями вона виявила 73,43% суперечностей на відстані 0 і 40,95% загалом. Найкращий базовий метод, AgentReview, виявив 14,81% суперечностей на відстані 0. Навіть одна рецензія MLR виявила 60,79%.

Абляційне дослідження розділяє вплив моделі та дизайну. Заміна GPT-4.1 на Claude Sonnet 4 у LLM-Review підвищила виявлення помилок на відстані 0 із 14,56% до 35,40%. Дизайн MLR додав близько 25 відсоткових пунктів під час однієї рецензії. Точність знижується зі збільшенням відстані вузла, що підтверджує оцінювання за рівнем серйозності.

На реальних відкликаних статтях із WithdrarXiv-Check (211 статей) перевага зменшується. MLR отримала 26,07% для «подібних» збігів і 16,11% для «точних» збігів. Найкращі базові методи отримали 18,48% і 9,00% відповідно.

Чи узгоджується MLR із людськими рецензентами?

Щодо оцінок — здебільшого так. На поданнях до ICLR 2025 прогнозовані оцінки MLR досягли коефіцієнта кореляції Пірсона 0,586 із людськими оцінками. Орієнтир для узгодженості між людьми становив 0,742. На ICML 2025 the AI Reviewer незначно випередив її: 0,439 проти 0,429.

Щодо фокусу — ні. MLR наголошує на коректності та експериментах, тоді як люди більше зважають на ясність і новизну. Автори розглядають це як додаткову перспективу, а не заміну людям.

Скільки коштує її запуск?

MLR коштує близько $0,47 за рецензію, без урахування необов’язкового агента огляду літератури. Вона використовує 189 062 вхідні токени — приблизно половину від 403 654 токенів AI Reviewer. Варіант з одним промптом зменшив витрати приблизно на дві третини. Його показник виявлення помилок на підмножині бенчмарку знизився приблизно на 3,5 відсоткового пункту.

Як MLR порівнюється з іншими ШІ-рецензентами?

ХарактеристикаMLR (Sakana AI)LLM-ReviewAI ReviewerAgentReview
LLM, використана в цьому дослідженніClaude Sonnet 4 + Haiku 3.5GPT-4.1o4-miniGPT-4o
Дизайн3 агенти, ланцюжок із 3 проходівОдин промпт, текст обрізаєтьсяАнсамбль із 5 рецензій, метарецензія, рефлексіяРолі рецензента, автора та голови секції
Contradiction Benchmark, повний40,95% (4 рецензії)6,39%6,50%5,95%
Помилки в ключових твердженнях (відстань 0)73,43%14,56%11,17%14,81%
WithdrarXiv-Check, подібні / точні26,07% / 16,11%5,21% / 2,37%13,74% / 9,00%18,48% / 5,69%
Кореляція Пірсона ICLR 2025 із людьми0,586-0,0130,5380,195
Вхідні токени на рецензію189 0626 517403 654310 964
Вартість рецензії~$0,47~$0,01~$0,49~$0,81
Відкритий кодНа запитТакТакТак

Усі показники бенчмарку, кореляції, кількості токенів і вартості взято зі статті Beyond Imitation.

Ключові висновки

  • Sakana AI оцінює ШІ-рецензентів за здатністю виявляти помилки, а не копіювати людей.
  • MLR виявила 73,43% помилок у ключових твердженнях — приблизно у 5 разів більше, ніж найкращий базовий метод.
  • Заміна моделі та дизайн із 3 проходами окремо забезпечують значне підвищення рівня виявлення.
  • Помилки в реальних відкликаних статтях залишаються складними для виявлення: 16,11% точних збігів.
  • Прихована ін’єкція промптів досі впливає на всіх протестованих ШІ-рецензентів.

Ознайомтеся зі статтею тут. Уся подяка належить досліднику цього проєкту. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого 150-тисячного ML SubReddit та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? Тепер ви також можете приєднатися до нас у Telegram.

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MarkTechPost

Читати оригінал на MarkTechPost ↗

Текст і зображення належать MarkTechPost і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини