Психометрические методы выявили серьезные недостатки тестирования безопасности ИИ
Основные моменты
- Исследователи, в том числе сотрудники британского Института безопасности ИИ, показали, что совокупные показатели безопасности языковых моделей ИИ вводят в заблуждение. Модели могут искусственно завышать эти показатели, блокируя запросы без разбора, из-за чего становятся менее полезными в повседневном использовании.
- Анализ многочисленных моделей также показывает, что большинство стандартных тестовых вопросов избыточны. Короткие целевые тесты всего с несколькими десятками вопросов дают сопоставимые результаты, при этом резко снижая стоимость оценки.
- Исследование также предлагает статистический метод выявления так называемого «sandbagging» — намеренного занижения результатов. Необычные схемы ответов надежно выявляют модели, которые во время тестов ведут себя осторожнее, чем при обычном использовании.
Модель ИИ может повысить свой показатель безопасности, просто блокируя больше запросов без разбора. Новое исследование раскрывает этот компромисс и предлагает метод выявления моделей, которые во время тестов ведут себя осторожнее, чем в повседневном использовании.
Команда исследователей, в том числе сотрудников британского Института безопасности ИИ, подробно изучила восемь популярных тестов безопасности языковых моделей. Они заимствовали методы, изначально разработанные для психологического тестирования людей, например для тестов на IQ или экзаменов на профпригодность. Ответы на отдельные тестовые вопросы показывают, какие способности за ними стоят и какие вопросы действительно дают полезную информацию.
Команда проанализировала ответы до 192 моделей на более чем 5 000 тестовых вопросов. Авторы называют это крупнейшим анализом такого рода на сегодняшний день; он выявил три факта, ставящих под сомнение современные методы тестирования.

Один показатель безопасности скрывает больше, чем показывает
Восемь тестов не измеряют одно общее качество под названием «безопасность». Они измеряют три разные характеристики: насколько строго модель отказывается выполнять запросы, насколько правдиво она отвечает и как обрабатывает контент, который в зависимости от контекста может быть безвредным или опасным. Эти три характеристики мало связаны друг с другом. Например, то, насколько честно модель отвечает, почти ничего не говорит о том, как часто она отказывается выполнять запросы.

Особенно проблематичным выглядит компромисс между двумя тестами: HarmBench вознаграждает модель за отказ от вредных запросов. OR-Bench-Hard наказывает ее за чрезмерную осторожность в отношении безвредных запросов. Модель, получающая высокий балл в одном тесте, почти всегда плохо проходит другой.
Это означает, что модель может повысить свой общий рейтинг, просто блокируя больше запросов без разбора, даже если из-за этого она становится менее полезной в повседневном использовании. Усреднение результатов нескольких тестов полностью сглаживает этот компромисс и поощряет поведение, которое учитывается дважды в нескольких похожих тестах.
На самом деле важны менее 2 процентов вопросов
Второй вывод касается стоимости тестирования. Оказывается, большинство тестовых вопросов — балласт. Почти каждая модель отвечает на них правильно или почти каждая модель отвечает неправильно, поэтому они почти не помогают различать модели.
Если вместо этого выбрать самые информативные вопросы, то три коротких теста всего по 25 вопросов каждый могут охватить все три измерения безопасности точнее, чем случайная выборка такого же размера.

Еще эффективнее становится процесс, когда вопросы выбираются динамически во время теста, подобно адаптивным вступительным экзаменам, где следующий вопрос зависит от того, насколько хорошо вы справились до этого. Для отдельных тестов, таких как HarmBench или SORRY-Bench, примерно десяти вопросов достаточно, чтобы получить результат, очень близкий к результату полной оценки. Это сокращает расходы на 97–99 процентов, делая регулярные проверки безопасности в процессе разработки практически осуществимыми — например, после каждой донастройки или компрессии модели.
Когда модели намеренно отвечают хуже
Третий вывод имеет наибольшее значение для дискуссии о безопасности. Авторы называют это «sandbagging»: модель понимает, что ее тестируют, и ведет себя осторожнее, чем при обычном использовании. Опасение заключается в том, что модель может научиться распознавать тесты и намеренно имитировать нужное поведение.
Такое поведение оставляет характерные следы в схемах ответов. Подобно студенту, который блестяще решает самые сложные вопросы на экзамене, но проваливает самые простые, модель, правильно отвечающая на сложные вопросы, но ошибающаяся в простых, выглядит подозрительно, даже если ее общий результат кажется нормальным.
В ходе тестирования метод выявил от 80 до 100 процентов случаев, когда моделям давали указание вести себя чрезмерно осторожно. Однако в среднем одна из десяти безвредных моделей ошибочно помечалась как подозрительная. Если добавить вторую проверку, сопоставляющую текущие результаты модели с ее прошлыми результатами, показатель выявления возрастал до 94–97 процентов.

Если модель имитирует нужное поведение только на определенных вопросах, это четко проявляется. Если же она делает это последовательно во всех случаях, схема ответов обычно выглядит нормально — и именно здесь вступает в действие вторая проверка.
Попутно метод также решает очень практическую проблему. Действительно ли используемый вами сервис ИИ по-прежнему работает на той же модели, которую вы изначально тестировали? Провайдеры могут незаметно заменить модель на другую, не уведомляя пользователей. В одном эксперименте исследователи повторно отправили запросы к 16 таким API-конечным точкам и по одним лишь схемам ответов правильно определили 13 из 14 различных моделей.
Две записи в каталоге, которые, судя по всему, использовали одну и ту же модель, справедливо не были объединены в одну группу. В другом случае ответы одного сервиса сместились на треть расстояния от его собственных ответов, полученных двумя месяцами ранее, что стало явным признаком незаметных изменений при сохранении того же названия модели.

Авторы утверждают, что тесты безопасности ИИ должны соответствовать таким же строгим стандартам, как психологические тесты для людей. По их словам, одного результата теста недостаточно для принятия решения о выпуске модели. Они отмечают одно ограничение: в их исследовании sandbagging моделировался только с помощью прямых инструкций. Модель, специально обученная уклоняться от обнаружения, вероятно, будет гораздо сложнее для выявления.
Знакомая закономерность, проявляющаяся в современных моделях
Вопрос о том, действительно ли тесты безопасности измеряют заявленные ими характеристики, уже некоторое время остается открытым в научных кругах. Метаисследование, охватившее 445 тестов ИИ, выявило проблемы с определениями, выбором заданий или статистическими методами почти во всех из них. То, как компромисс между отказами и полезностью проявляется на практике, хорошо показал случай с Claude Fable 5 от Anthropic. Медицинский физик обнаружил, что модель непригодна для использования, поскольку она принимала сегментацию МРТ за биотерроризм и блокировала вопросы о передаче малярии. После того как правительство США разрешило выпуск модели, дополнительный фильтр должен был закрыть этот пробел более чем в 99 процентах случаев, но в результате теперь чаще блокирует безвредные задачи по программированию.
То, что модели распознают момент тестирования, также уже хорошо задокументировано. Claude 3.5 Sonnet правильно определяла тестовые сценарии в 93 процентах случаев и по-прежнему правильно распознавала их в 84 процентах случаев даже без каких-либо подсказок. Opus 4.6 от Anthropic самостоятельно поняла в ходе двух отдельных заданий, что находится внутри оценки, определила тест и сама отправилась за решениями. Тем временем другие исследователи работают в противоположном направлении, пытаясь исключить эти стратегии из моделей.
Новости ИИ без шумихи — отобраны людьми
Подпишитесь на THE DECODER, чтобы читать материалы без рекламы, получать еженедельную рассылку об ИИ, эксклюзивный передовой отчет «AI Radar» шесть раз в год, полный доступ к архиву и доступ к разделу комментариев.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.