Система экспертной проверки LLM от Sakana AI выявляет 73% ошибок в ключевых утверждениях
Sakana AI опубликовала исследовательскую статью для TMLR под названием «За пределами имитации», посвящённую рецензированию научных работ с помощью LLM и выявлению ошибок. Большинство ИИ-рецензентов оценивают по тому, насколько близко они копируют рецензии людей. В этой работе задаётся более сложный вопрос: может ли ИИ-рецензент обнаружить намеренно внесённую ошибку? Исследовательская команда представляет два компонента: бенчмарк противоречий и систему многоуровневого рецензирования (MLR). Для разработчиков исследовательских агентов вывод практический: и архитектура системы, и выбор модели влияют на обнаружение ошибок.
Кратко
- Размер: 1 164 внесённых противоречия в 257 статьях из 5 изданий. MLR анализирует до 10 страниц основного текста.
- Работает на: готовых API-моделях (Claude Sonnet 4, Claude Haiku 3.5). Без GPU и дообучения. Около $0,47 за рецензию.
- Производительность: самый высокий показатель обнаружения ошибок среди всех 4 протестированных систем, с оценками, согласующимися с человеческими.
- Лучший результат: обнаружено 73,43% ошибок в основных утверждениях при 4 рецензиях против 14,81% у лучшего базового метода.
- Худший результат: всего 16,11% точных совпадений на реальных отозванных статьях с arXiv.
- Итог:
- Лучшее: сначала читает, а потом выносит суждение и обнаруживает гораздо больше серьёзных ошибок.
- Худшее: по-прежнему поддаётся скрытой инъекции промпта.
Что такое многоуровневое рецензирование?
Многоуровневое рецензирование — это агентная система ИИ для рецензирования от Sakana AI, которая сначала понимает содержание научной статьи, а затем подвергает её критике. Она использует 3 агентов на готовых моделях Claude:
- Агент приложения (Claude Haiku 3.5): обобщает эксперименты и детали реализации из приложения.
- Агент обзора литературы (Claude Sonnet 4): использует веб-поиск, чтобы соотнести статью с предыдущими работами. Он необязателен.
- Агент рецензирования (Claude Sonnet 4): выполняет цепочку промптов из 3 этапов, вдохновлённую трёхэтапным подходом Кешава.
На первом этапе создаётся общий план. На втором статья подробно изучается, а также отмечаются слабые места, допущения и пробелы. На третьем все результаты работы агентов объединяются в разделы «Сильные стороны», «Слабые стороны», «Вопросы», «Рекомендация», «Оценка» и список задач. PDF-файл передаётся напрямую, поэтому рисунки и уравнения сохраняются.
Как работает бенчмарк противоречий?
В рамках бенчмарка в реальные статьи вносятся ошибки, после чего проверяется, обнаруживают ли их рецензенты. Исследовательская команда собрала 257 статей с лицензией CC из ACL, AISTATS, CVPR и ICML 2025, а также NeurIPS 2024.
Gemini 2.5 Pro создаёт граф знаний для каждой статьи, включающий её утверждения, доказательства и методы. Расстояние узла от «основного утверждения» определяет серьёзность ошибки. Расстояние 0 соответствует основному утверждению, а большие расстояния — деталям. Затем GPT-4.1 переписывает по 1 узлу на каждое расстояние в форме противоречия, в результате чего получается 1 164 точки данных.
Судья на базе o3 оценивает каждую рецензию 10 раз. На статьях без внесённых ошибок он достиг точности 99,9%. На вручную подтверждённых обнаруженных ошибках он показал чувствительность 86,8%, поэтому опубликованные показатели могут быть консервативными.
Насколько хорошо MLR обнаруживает ошибки?
MLR превзошла все базовые методы на бенчмарке. При 4 рецензиях она обнаружила 73,43% противоречий на расстоянии 0 и 40,95% противоречий в целом. Лучший базовый метод, AgentReview, обнаружил 14,81% ошибок на расстоянии 0. Даже одна рецензия MLR обнаружила 60,79% ошибок.
Абляционное исследование разделяет вклад модели и архитектуры. Замена GPT-4.1 на Claude Sonnet 4 внутри LLM-Review повысила обнаружение ошибок на расстоянии 0 с 14,56% до 35,40%. Архитектура MLR добавила ещё около 25 процентных пунктов при одной рецензии. По мере увеличения расстояния до узла точность снижается, что подтверждает обоснованность оценки серьёзности.
На реальных отозванных статьях из WithdrarXiv-Check (211 статей) преимущество сокращается. MLR показала результат 26,07% для «похожих» совпадений и 16,11% для «точных» совпадений. Лучшие базовые методы набрали 18,48% и 9,00% соответственно.
Согласуется ли MLR с человеческими рецензентами?
В отношении оценок — в основном да. На заявках ICLR 2025 прогнозируемые оценки MLR достигли коэффициента корреляции Пирсона 0,586 с человеческими оценками. Для сравнения, корреляция между людьми составила 0,742. На ICML 2025 система AI Reviewer немного её опередила: 0,439 против 0,429.
В отношении фокуса — нет. MLR уделяет особое внимание корректности и экспериментам, тогда как люди больше учитывают ясность и новизну. Авторы рассматривают это как дополнительную перспективу, а не как замену человеку.
Сколько стоит запуск?
Стоимость MLR составляет около $0,47 за рецензию без учёта необязательного агента обзора литературы. Система использует 189 062 входных токена — примерно вдвое меньше, чем AI Reviewer, использующая 403 654 токена. Вариант с одним промптом снизил стоимость примерно на две трети. Его показатель обнаружения снизился примерно на 3,5 процентного пункта на подмножестве бенчмарка.
Как MLR сравнивается с другими ИИ-рецензентами?
| Характеристика | MLR (Sakana AI) | LLM-Review | AI Reviewer | AgentReview |
|---|---|---|---|---|
| Использованная в исследовании LLM | Claude Sonnet 4 + Haiku 3.5 | GPT-4.1 | o4-mini | GPT-4o |
| Архитектура | 3 агента, цепочка из 3 этапов | Один промпт, текст усечён | Ансамбль из 5 рецензий, метарецензия, рефлексия | Роли рецензента, автора и председателя секции |
| Бенчмарк противоречий, полный | 40,95% (4 рецензии) | 6,39% | 6,50% | 5,95% |
| Ошибки в основных утверждениях (расстояние 0) | 73,43% | 14,56% | 11,17% | 14,81% |
| WithdrarXiv-Check, похожие / точные | 26,07% / 16,11% | 5,21% / 2,37% | 13,74% / 9,00% | 18,48% / 5,69% |
| Корреляция Пирсона с людьми на ICLR 2025 | 0,586 | -0,013 | 0,538 | 0,195 |
| Входных токенов на рецензию | 189 062 | 6 517 | 403 654 | 310 964 |
| Стоимость рецензии | ~$0,47 | ~$0,01 | ~$0,49 | ~$0,81 |
| Открытый код | По запросу | Да | Да | Да |
Все показатели бенчмарка, корреляции, количества токенов и стоимости взяты из статьи «За пределами имитации».
Основные выводы
- Sakana AI оценивает ИИ-рецензентов по способности обнаруживать ошибки, а не копировать людей.
- MLR обнаружила 73,43% ошибок в основных утверждениях — примерно в 5 раз больше, чем лучший базовый метод.
- Замена модели и архитектура из 3 этапов обеспечивают значительный прирост обнаружения ошибок.
- Ошибки в реальных отозванных статьях по-прежнему трудно обнаружить: 16,11% точных совпадений.
- Скрытая инъекция промпта по-прежнему влияет на каждого протестированного ИИ-рецензента.
Ознакомьтесь со статьёй здесь. Вся благодарность — исследователю этого проекта. Также подпишитесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тысячами участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? Теперь к нам можно присоединиться и в Telegram.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.