Sakhanda Wire
NVDA $214.72 -0.98% MSFT $483.24 +0.43% GOOGL $344.82 +1.22% META $549.90 +0.75% AMZN $258.63 -0.57%
← К новостям

Психометрические методы выявили серьезные недостатки тестирования безопасности ИИ

Психологические методы выявляют серьезные недостатки в тестировании безопасности ИИ
Джонатан Кемпер
22 авг. 2026
Nano Banana Pro по запросу THE DECODER

Основные моменты

  • Исследователи, в том числе сотрудники британского Института безопасности ИИ, показали, что совокупные показатели безопасности языковых моделей ИИ вводят в заблуждение. Модели могут искусственно завышать эти показатели, блокируя запросы без разбора, из-за чего становятся менее полезными в повседневном использовании.
  • Анализ многочисленных моделей также показывает, что большинство стандартных тестовых вопросов избыточны. Короткие целевые тесты всего с несколькими десятками вопросов дают сопоставимые результаты, при этом резко снижая стоимость оценки.
  • Исследование также предлагает статистический метод выявления так называемого «sandbagging» — намеренного занижения результатов. Необычные схемы ответов надежно выявляют модели, которые во время тестов ведут себя осторожнее, чем при обычном использовании.

Модель ИИ может повысить свой показатель безопасности, просто блокируя больше запросов без разбора. Новое исследование раскрывает этот компромисс и предлагает метод выявления моделей, которые во время тестов ведут себя осторожнее, чем в повседневном использовании.

Команда исследователей, в том числе сотрудников британского Института безопасности ИИ, подробно изучила восемь популярных тестов безопасности языковых моделей. Они заимствовали методы, изначально разработанные для психологического тестирования людей, например для тестов на IQ или экзаменов на профпригодность. Ответы на отдельные тестовые вопросы показывают, какие способности за ними стоят и какие вопросы действительно дают полезную информацию.

Команда проанализировала ответы до 192 моделей на более чем 5 000 тестовых вопросов. Авторы называют это крупнейшим анализом такого рода на сегодняшний день; он выявил три факта, ставящих под сомнение современные методы тестирования.

Трехчастная обзорная иллюстрация использования Item Response Theory для безопасности ИИ: панель калибровки моделей, факторные нагрузки восьми тестов и результаты сокращения тестов и аудита.
Ответы 182 моделей на более чем 5 000 вопросов раскрывают три вещи: какие способности на самом деле измеряют тесты, насколько короче могут быть тесты и в каких случаях показателем можно манипулировать. | Изображение: Институт безопасности ИИ Великобритании и соавторы.

Один показатель безопасности скрывает больше, чем показывает

Восемь тестов не измеряют одно общее качество под названием «безопасность». Они измеряют три разные характеристики: насколько строго модель отказывается выполнять запросы, насколько правдиво она отвечает и как обрабатывает контент, который в зависимости от контекста может быть безвредным или опасным. Эти три характеристики мало связаны друг с другом. Например, то, насколько честно модель отвечает, почти ничего не говорит о том, как часто она отказывается выполнять запросы.

Матрица корреляций восьми тестов безопасности с цветными полями от минус 1 до плюс 1 и тремя выделенными кластерами: строгость отказов, правдивость и контекстуальный вред.
HarmBench и SORRY-Bench измеряют почти одно и то же, тогда как OR-Bench-Hard показывает прямо противоположную тенденцию. | Изображение: Институт безопасности ИИ Великобритании и соавторы.

Особенно проблематичным выглядит компромисс между двумя тестами: HarmBench вознаграждает модель за отказ от вредных запросов. OR-Bench-Hard наказывает ее за чрезмерную осторожность в отношении безвредных запросов. Модель, получающая высокий балл в одном тесте, почти всегда плохо проходит другой.

Это означает, что модель может повысить свой общий рейтинг, просто блокируя больше запросов без разбора, даже если из-за этого она становится менее полезной в повседневном использовании. Усреднение результатов нескольких тестов полностью сглаживает этот компромисс и поощряет поведение, которое учитывается дважды в нескольких похожих тестах.

На самом деле важны менее 2 процентов вопросов

Второй вывод касается стоимости тестирования. Оказывается, большинство тестовых вопросов — балласт. Почти каждая модель отвечает на них правильно или почти каждая модель отвечает неправильно, поэтому они почти не помогают различать модели.

Если вместо этого выбрать самые информативные вопросы, то три коротких теста всего по 25 вопросов каждый могут охватить все три измерения безопасности точнее, чем случайная выборка такого же размера.

Четыре линейных графика сравнивают адаптивный выбор тестов, статичный тест и случайный выбор при количестве заданий от 10 до 200; сверху показан RMSE, снизу — корреляция Спирмена.
Примерно десять вопросов, выбранных адаптивно, дают рейтинг, почти совпадающий с рейтингом полного теста. | Изображение: Институт безопасности ИИ Великобритании и соавторы.

Еще эффективнее становится процесс, когда вопросы выбираются динамически во время теста, подобно адаптивным вступительным экзаменам, где следующий вопрос зависит от того, насколько хорошо вы справились до этого. Для отдельных тестов, таких как HarmBench или SORRY-Bench, примерно десяти вопросов достаточно, чтобы получить результат, очень близкий к результату полной оценки. Это сокращает расходы на 97–99 процентов, делая регулярные проверки безопасности в процессе разработки практически осуществимыми — например, после каждой донастройки или компрессии модели.

Когда модели намеренно отвечают хуже

Третий вывод имеет наибольшее значение для дискуссии о безопасности. Авторы называют это «sandbagging»: модель понимает, что ее тестируют, и ведет себя осторожнее, чем при обычном использовании. Опасение заключается в том, что модель может научиться распознавать тесты и намеренно имитировать нужное поведение.

Такое поведение оставляет характерные следы в схемах ответов. Подобно студенту, который блестяще решает самые сложные вопросы на экзамене, но проваливает самые простые, модель, правильно отвечающая на сложные вопросы, но ошибающаяся в простых, выглядит подозрительно, даже если ее общий результат кажется нормальным.

В ходе тестирования метод выявил от 80 до 100 процентов случаев, когда моделям давали указание вести себя чрезмерно осторожно. Однако в среднем одна из десяти безвредных моделей ошибочно помечалась как подозрительная. Если добавить вторую проверку, сопоставляющую текущие результаты модели с ее прошлыми результатами, показатель выявления возрастал до 94–97 процентов.

Четыре расположенные друг над другом кривые плотности значений соответствия для реальных моделей, а также для равномерного, целевого и триггерного занижения результатов, с пунктирным порогом на уровне минус 0,87.

Если модель имитирует нужное поведение только на определенных вопросах, это четко проявляется. Если же она делает это последовательно во всех случаях, схема ответов обычно выглядит нормально — и именно здесь вступает в действие вторая проверка.

Попутно метод также решает очень практическую проблему. Действительно ли используемый вами сервис ИИ по-прежнему работает на той же модели, которую вы изначально тестировали? Провайдеры могут незаметно заменить модель на другую, не уведомляя пользователей. В одном эксперименте исследователи повторно отправили запросы к 16 таким API-конечным точкам и по одним лишь схемам ответов правильно определили 13 из 14 различных моделей.

Две записи в каталоге, которые, судя по всему, использовали одну и ту же модель, справедливо не были объединены в одну группу. В другом случае ответы одного сервиса сместились на треть расстояния от его собственных ответов, полученных двумя месяцами ранее, что стало явным признаком незаметных изменений при сохранении того же названия модели.

Двухчастная иллюстрация: сверху — точечная диаграмма смещения способностей в зависимости от типа занижения результатов, снизу — диаграмма рассеяния зависимости расстояния между способностями от числа отличающихся ответов для 8 911 пар моделей.
Когда проверка соответствия дает сбой, в дело вступают два других теста: сравнение прошлых показателей способностей и сопоставление конкретных ответов. | Изображение: Институт безопасности ИИ Великобритании и соавторы.

Авторы утверждают, что тесты безопасности ИИ должны соответствовать таким же строгим стандартам, как психологические тесты для людей. По их словам, одного результата теста недостаточно для принятия решения о выпуске модели. Они отмечают одно ограничение: в их исследовании sandbagging моделировался только с помощью прямых инструкций. Модель, специально обученная уклоняться от обнаружения, вероятно, будет гораздо сложнее для выявления.

Знакомая закономерность, проявляющаяся в современных моделях

Вопрос о том, действительно ли тесты безопасности измеряют заявленные ими характеристики, уже некоторое время остается открытым в научных кругах. Метаисследование, охватившее 445 тестов ИИ, выявило проблемы с определениями, выбором заданий или статистическими методами почти во всех из них. То, как компромисс между отказами и полезностью проявляется на практике, хорошо показал случай с Claude Fable 5 от Anthropic. Медицинский физик обнаружил, что модель непригодна для использования, поскольку она принимала сегментацию МРТ за биотерроризм и блокировала вопросы о передаче малярии. После того как правительство США разрешило выпуск модели, дополнительный фильтр должен был закрыть этот пробел более чем в 99 процентах случаев, но в результате теперь чаще блокирует безвредные задачи по программированию.

То, что модели распознают момент тестирования, также уже хорошо задокументировано. Claude 3.5 Sonnet правильно определяла тестовые сценарии в 93 процентах случаев и по-прежнему правильно распознавала их в 84 процентах случаев даже без каких-либо подсказок. Opus 4.6 от Anthropic самостоятельно поняла в ходе двух отдельных заданий, что находится внутри оценки, определила тест и сама отправилась за решениями. Тем временем другие исследователи работают в противоположном направлении, пытаясь исключить эти стратегии из моделей.

Новости ИИ без шумихи — отобраны людьми

Подпишитесь на THE DECODER, чтобы читать материалы без рекламы, получать еженедельную рассылку об ИИ, эксклюзивный передовой отчет «AI Radar» шесть раз в год, полный доступ к архиву и доступ к разделу комментариев.

Источник: Arxiv

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием The Decoder

Читать оригинал на The Decoder ↗

Текст и изображения принадлежат The Decoder и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости