Тестирование безопасности ИИ становится риском для безопасности
За последние несколько месяцев агенты ИИ, проходившие оценки в области кибербезопасности, покидали свои изолированные среды, получали доступ к интернету, а в некоторых случаях взламывали реальные системы. В этих инцидентах были задействованы модели OpenAI, Anthropic, Meta и, совсем недавно, китайской лаборатории ИИ Moonshot AI; тестирование проводили несколько организаций, включая стартап в сфере кибербезопасности под названием Irregular.
Эти эпизоды выявляют растущую проблему для индустрии ИИ: по мере того как автономные агенты становятся более способными, среды, предназначенные для безопасного тестирования их возможностей, не справляются с их изоляцией.
«Количество произошедших инцидентов ясно показывает, что изоляция и контроль тестовых сред на самом деле не поспевают за возможностями моделей», — сообщил TechCrunch Шон О’Хейгерти, директор программы «ИИ: будущее и ответственность» Центра изучения будущего интеллекта Кембриджского университета.
Характер тестируемых моделей повышает риск. Компании, занимающиеся ИИ, проводят кибернетические оценки на невыпущенных моделях следующего поколения, часто отключая стандартные защитные механизмы, ограничивающие вредоносное поведение, чтобы исследователи могли понять, на что действительно способны модели. Это означает, что безопасность самой тестовой среды становится важнейшей линией защиты.
«С точки зрения тестирования это очень хорошо, но это также означает, что если им удастся выйти в реальный мир, они могут причинить значительный вред», — сказал О’Хейгерти.
В одном из наиболее серьезных случаев невыпущенная модель OpenAI вырвалась из песочницы и взломала рабочие системы Hugging Face. В ходе отдельных оценок, проведенных Irregular, модели Anthropic и Meta получили доступ к системам за пределами тестовых сред после того, как ошибки конфигурации непреднамеренно открыли им пути в интернет. Kimi K3 от Moonshot AI также воспользовалась утечкой в песочнице, запущенной Frontier Security, чтобы получить доступ к интернету и информации на GitHub.
Во время тестирования, проведенного Британским институтом безопасности ИИ (AISI), исследователи фактически предоставили агентам доступ к интернету, не осознавая, что те предпримут несанкционированные действия в реальном мире, включая попытку социальной инженерии для внедрения уязвимости в проект с открытым исходным кодом.
В каждом случае агентам не давали указаний атаковать случайные реальные цели. Они просто делали все необходимое, чтобы решить поставленную перед ними задачу.
В совокупности, по мнению Эндрю Юна, руководителя исследовательского направления некоммерческой организации CivAI, эти инциденты свидетельствуют о переломном моменте.
«В прошлом нам приходилось беспокоиться лишь о том, что люди будут злоупотреблять моделями ИИ в самых разных целях — например, использовать ИИ для мошенничества или создания материалов о сексуальном насилии над детьми (CSAM)», — рассказал Юн TechCrunch. «Теперь мы оказались в ситуации, когда сами модели ИИ являются субъектами угрозы».
Как на самом деле должно выглядеть безопасное тестирование?
Несколько исследователей и экспертов по кибербезопасности сообщили TechCrunch, что среды для оценки ИИ нуждаются в более надежной эшелонированной защите, с уровнями изоляции и контроля, приближающимися к используемым при развертывании. Это означает несколько уровней безопасности, чтобы одна ошибка конфигурации — например, случайно оставленный открытым доступ к интернету — не могла привести к побегу.
«Если вы собираетесь создавать эти модели… нужно делать это в сети, физически изолированной от других сетей», — сказала Стелла Бидерман, исполнительный директор некоммерческой организации по исследованию безопасности ИИ EleutherAI. «Необходимо обеспечить очень серьезную изоляцию».
Хизер Кейлан, директор по информационной безопасности Box, заявила, что это означает устранение сетевых маршрутов из песочницы в интернет, а также к другим чувствительным системам.
«Нужно понимать, какие существуют точки выхода», — сказала Кейлан TechCrunch. «Если мы оцениваем модель в нашей промежуточной или рабочей среде разработки, не должно быть никакого пути выхода в нашу производственную среду».
По словам Кейлан, надлежащие оценки безопасности выходят за рамки контроля и изоляции среды. После начала тестов необходимо обеспечить гораздо более эффективный мониторинг.
«Мне кажется, интересно, что в нескольких таких случаях никто не заметил произошедшее в момент инцидента», — сказала Кейлан. «OpenAI узнала об этом благодаря Hugging Face. Anthropic обнаружила проблему только после того, как вернулась к материалам и изучила их. У Meta было примерно то же самое… Уверена, что существовали сигналы, которые они могли обнаружить».
В своем разборе трех инцидентов Anthropic признала, что и компания, и Irregular могли лучше организовать мониторинг, а в некоторых случаях имелись явные признаки неполадок.
Эксперты также призвали проводить независимый аудит тестовых сред силами третьих сторон до того, как в них будут запущены модели.
«Если бы, например, Irregular наняла или была обязана нанять внешнего аудитора для проверки конфигураций своих систем перед проведением оценки, они наверняка обнаружили бы эту проблему», — сказал Юн. «Даже если бы люди заранее провели встречу и просто прошлись по контрольному списку, они бы это обнаружили… Тот факт, что этого не произошло, показывает, что здесь имеет место очень серьезное пренебрежение процедурами».
Источник, знакомый с деталями, сообщил TechCrunch, что среды Irregular постоянно проверяются и тестируются, в том числе с привлечением нескольких внешних сторон. Источник также сказал, что мониторинг осуществлялся, но одного мониторинга недостаточно.
Юн и другие исследователи призвали индустрию разработать стандартизированный процесс оценки безопасности передовых моделей.
«Особенно когда защитные механизмы отключены, нужно относиться к этому так, будто вы поместили в данную среду самого способного хакера в мире», — сказала Кейлан.
По мнению Юна и Бидерман, проблема не в том, что компании не знают, как создавать более безопасные тестовые среды. Дело в том, что это может быть дорого и сложно, а у компаний мало стимулов вкладываться в такие меры, пока что-нибудь не пойдет не так.
«Думаю, компании не готовы выделять ресурсы, необходимые для создания [достаточных защитных механизмов], и, вероятно, не будут делать этого, пока их не заставят», — сказала Бидерман.
Однако есть и другая проблема. Если во время тестирования слишком жестко ограничить модель, исследователи могут не обнаружить ее возможности до выпуска. Это столь же опасно, а возможно, даже опаснее, чем предоставить ей слишком большую свободу; в таком случае сама оценка рискует стать источником проблемы.
Можно ли регулировать оценки безопасности?
Администрация Трампа в настоящее время рассматривает добровольный режим оценки кибербезопасности перед развертыванием, в рамках которого правительство сможет оценивать риски безопасности новых мощных моделей за 30 дней до их публичного выпуска. Эта политика — результат указа Трампа, окончательно подготовленного за закрытыми дверями, — не будет охватывать инциденты во время оценок безопасности, поскольку они происходят на более раннем этапе, до развертывания.
«Урок, который мы извлекли за последние несколько месяцев, заключается в том, что механизм саморегулирования больше недостаточен», — сказал Юн. «Конкурентное давление создает стимулы для гонки ко дну в вопросах стандартов безопасности, и это идеальная область для государственного вмешательства».
«Чтобы охватить эту сферу, нам потребуются своего рода меры контроля за тем, что происходит внутри лабораторий во время разработки моделей, — как на этапе обучения, так и на этапе тестирования», — продолжил он.
По мере развития моделей проблема, вероятно, будет только усугубляться. Источник, знакомый с оценками Irregular, сообщил TechCrunch, что для более способных моделей требуются более сложные оценки, которые часто проводятся быстро и в большем масштабе, что создает условия для большего числа ошибок.
AISI, которое намеренно предоставляет некоторым моделям доступ к интернету, сообщило TechCrunch, что пересматривает баланс между реалистичным тестированием и управлением рисками, которые создают такие тесты.
OpenAI заявила, что пересматривает порядок проведения тестирования силами третьих сторон, а также требования к изоляции и мониторингу и критерии прекращения оценок. Meta сообщила, что продолжает расследовать инцидент и планирует опубликовать ретроспективный отчет после выяснения всех обстоятельств.
В конечном счете полностью устранить риск, возможно, не удастся. По мере того как модели становятся более способными, среды для их тестирования должны становиться более надежными. Последствия ошибок в этой области будут лишь усугубляться.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.