Sakhanda Wire
NVDA — MSFT — GOOGL — META — AMZN —
← К новостям

Система экспертной проверки LLM от Sakana AI выявляет 73% ошибок в ключевых утверждениях

Sakana AI опубликовала исследовательскую статью для TMLR под названием «За пределами имитации», посвящённую рецензированию научных работ с помощью LLM и выявлению ошибок. Большинство ИИ-рецензентов оценивают по тому, насколько близко они копируют рецензии людей. В этой работе задаётся более сложный вопрос: может ли ИИ-рецензент обнаружить намеренно внесённую ошибку? Исследовательская команда представляет два компонента: бенчмарк противоречий и систему многоуровневого рецензирования (MLR). Для разработчиков исследовательских агентов вывод практический: и архитектура системы, и выбор модели влияют на обнаружение ошибок.

Кратко

  • Размер: 1 164 внесённых противоречия в 257 статьях из 5 изданий. MLR анализирует до 10 страниц основного текста.
  • Работает на: готовых API-моделях (Claude Sonnet 4, Claude Haiku 3.5). Без GPU и дообучения. Около $0,47 за рецензию.
  • Производительность: самый высокий показатель обнаружения ошибок среди всех 4 протестированных систем, с оценками, согласующимися с человеческими.
  • Лучший результат: обнаружено 73,43% ошибок в основных утверждениях при 4 рецензиях против 14,81% у лучшего базового метода.
  • Худший результат: всего 16,11% точных совпадений на реальных отозванных статьях с arXiv.
  • Итог:
    • Лучшее: сначала читает, а потом выносит суждение и обнаруживает гораздо больше серьёзных ошибок.
    • Худшее: по-прежнему поддаётся скрытой инъекции промпта.

Что такое многоуровневое рецензирование?

Многоуровневое рецензирование — это агентная система ИИ для рецензирования от Sakana AI, которая сначала понимает содержание научной статьи, а затем подвергает её критике. Она использует 3 агентов на готовых моделях Claude:

  • Агент приложения (Claude Haiku 3.5): обобщает эксперименты и детали реализации из приложения.
  • Агент обзора литературы (Claude Sonnet 4): использует веб-поиск, чтобы соотнести статью с предыдущими работами. Он необязателен.
  • Агент рецензирования (Claude Sonnet 4): выполняет цепочку промптов из 3 этапов, вдохновлённую трёхэтапным подходом Кешава.

На первом этапе создаётся общий план. На втором статья подробно изучается, а также отмечаются слабые места, допущения и пробелы. На третьем все результаты работы агентов объединяются в разделы «Сильные стороны», «Слабые стороны», «Вопросы», «Рекомендация», «Оценка» и список задач. PDF-файл передаётся напрямую, поэтому рисунки и уравнения сохраняются.

Как работает бенчмарк противоречий?

В рамках бенчмарка в реальные статьи вносятся ошибки, после чего проверяется, обнаруживают ли их рецензенты. Исследовательская команда собрала 257 статей с лицензией CC из ACL, AISTATS, CVPR и ICML 2025, а также NeurIPS 2024.

Gemini 2.5 Pro создаёт граф знаний для каждой статьи, включающий её утверждения, доказательства и методы. Расстояние узла от «основного утверждения» определяет серьёзность ошибки. Расстояние 0 соответствует основному утверждению, а большие расстояния — деталям. Затем GPT-4.1 переписывает по 1 узлу на каждое расстояние в форме противоречия, в результате чего получается 1 164 точки данных.

Судья на базе o3 оценивает каждую рецензию 10 раз. На статьях без внесённых ошибок он достиг точности 99,9%. На вручную подтверждённых обнаруженных ошибках он показал чувствительность 86,8%, поэтому опубликованные показатели могут быть консервативными.

Насколько хорошо MLR обнаруживает ошибки?

MLR превзошла все базовые методы на бенчмарке. При 4 рецензиях она обнаружила 73,43% противоречий на расстоянии 0 и 40,95% противоречий в целом. Лучший базовый метод, AgentReview, обнаружил 14,81% ошибок на расстоянии 0. Даже одна рецензия MLR обнаружила 60,79% ошибок.

Абляционное исследование разделяет вклад модели и архитектуры. Замена GPT-4.1 на Claude Sonnet 4 внутри LLM-Review повысила обнаружение ошибок на расстоянии 0 с 14,56% до 35,40%. Архитектура MLR добавила ещё около 25 процентных пунктов при одной рецензии. По мере увеличения расстояния до узла точность снижается, что подтверждает обоснованность оценки серьёзности.

На реальных отозванных статьях из WithdrarXiv-Check (211 статей) преимущество сокращается. MLR показала результат 26,07% для «похожих» совпадений и 16,11% для «точных» совпадений. Лучшие базовые методы набрали 18,48% и 9,00% соответственно.

Согласуется ли MLR с человеческими рецензентами?

В отношении оценок — в основном да. На заявках ICLR 2025 прогнозируемые оценки MLR достигли коэффициента корреляции Пирсона 0,586 с человеческими оценками. Для сравнения, корреляция между людьми составила 0,742. На ICML 2025 система AI Reviewer немного её опередила: 0,439 против 0,429.

В отношении фокуса — нет. MLR уделяет особое внимание корректности и экспериментам, тогда как люди больше учитывают ясность и новизну. Авторы рассматривают это как дополнительную перспективу, а не как замену человеку.

Сколько стоит запуск?

Стоимость MLR составляет около $0,47 за рецензию без учёта необязательного агента обзора литературы. Система использует 189 062 входных токена — примерно вдвое меньше, чем AI Reviewer, использующая 403 654 токена. Вариант с одним промптом снизил стоимость примерно на две трети. Его показатель обнаружения снизился примерно на 3,5 процентного пункта на подмножестве бенчмарка.

Как MLR сравнивается с другими ИИ-рецензентами?

ХарактеристикаMLR (Sakana AI)LLM-ReviewAI ReviewerAgentReview
Использованная в исследовании LLMClaude Sonnet 4 + Haiku 3.5GPT-4.1o4-miniGPT-4o
Архитектура3 агента, цепочка из 3 этаповОдин промпт, текст усечёнАнсамбль из 5 рецензий, метарецензия, рефлексияРоли рецензента, автора и председателя секции
Бенчмарк противоречий, полный40,95% (4 рецензии)6,39%6,50%5,95%
Ошибки в основных утверждениях (расстояние 0)73,43%14,56%11,17%14,81%
WithdrarXiv-Check, похожие / точные26,07% / 16,11%5,21% / 2,37%13,74% / 9,00%18,48% / 5,69%
Корреляция Пирсона с людьми на ICLR 20250,586-0,0130,5380,195
Входных токенов на рецензию189 0626 517403 654310 964
Стоимость рецензии~$0,47~$0,01~$0,49~$0,81
Открытый кодПо запросуДаДаДа

Все показатели бенчмарка, корреляции, количества токенов и стоимости взяты из статьи «За пределами имитации».

Основные выводы

  • Sakana AI оценивает ИИ-рецензентов по способности обнаруживать ошибки, а не копировать людей.
  • MLR обнаружила 73,43% ошибок в основных утверждениях — примерно в 5 раз больше, чем лучший базовый метод.
  • Замена модели и архитектура из 3 этапов обеспечивают значительный прирост обнаружения ошибок.
  • Ошибки в реальных отозванных статьях по-прежнему трудно обнаружить: 16,11% точных совпадений.
  • Скрытая инъекция промпта по-прежнему влияет на каждого протестированного ИИ-рецензента.

Ознакомьтесь со статьёй здесь. Вся благодарность — исследователю этого проекта. Также подпишитесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тысячами участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? Теперь к нам можно присоединиться и в Telegram.

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости