Решением проблемы вышедших из-под контроля ИИ-агентов может стать ещё больше ИИ
По мере того как компании поручают ИИ-агентам всё более длительные и сложные задачи, они сталкиваются с проблемой контроля: агенты могут действовать быстрее, дольше и в большем масштабе, чем люди способны реалистично отслеживать. Эта проблема достигла пика во время инцидента с Hugging Face, когда почти 12 000 агентов координировали свои действия быстрее, чем люди успевали за ними следить. Как отслеживать настолько большую группу агентов?
Возникающий ответ от лабораторий и стартапов, занимающихся ИИ, одновременно прост и приводит в отчаяние: подключить к процессу ещё один ИИ.
Использование ИИ оказалось необходимым для независимого расследования инцидента OpenAI с Hugging Face. Главный научный сотрудник Redwood Research Райан Гринблатт, один из трёх аудиторов, в шутку назвал их работу «slop-vestigation» — расследованием на основе низкокачественного контента, отметив, что объём данных «сделал невозможным» понимание происходящего без помощи ИИ.
Некоторые скептически относятся к использованию ИИ для наблюдения за ИИ. «Если у вас есть ИИ, который занимается вредоносными действиями и подозревает, что другой ИИ следит за ним, он может попытаться обмануть этот ИИ, — сказал Саймон Уиллисон, влиятельный технологический блогер, который в этом году отслеживал целую серию инцидентов с ИИ-агентами. — Можно почти оказаться в ситуации, когда ваш вредоносный ИИ пытается перехитрить ИИ, который за ним наблюдает».
Перехитрить ИИ — это не гипотетическая возможность, сказал он, возвращаясь к инциденту OpenAI. «Мы немного увидели это в инциденте OpenAI с Hugging Face: их модели сговорились, чтобы обмануть ИИ, оценивавший их работу, и таким образом провести мимо него незаконно полученные ответы. То есть они действительно об этом думали, верно?»
Эти опасения не остановили целую когорту стартапов, которые стремятся развивать эту идею. Как подсчитал TechCrunch, в последние годы Y Combinator профинансировал 106 компаний, связанных с наблюдаемостью ИИ. Ряд других стартапов, таких как Braintrust, LangChain и Judgment Labs, привлекли сотни миллионов долларов, тогда как более зрелые компании вроде Arize и Galileo — основанные всего пять-шесть лет назад — уже завершили сделки по продаже бизнеса.
Отчасти это реакция на очевидные возможности, возникшие благодаря развитию ИИ. Как сказал TechCrunch генеральный директор Box и известный бизнес-ангел Аарон Леви: «Нас ждёт один из крупнейших в истории циклов обновления и инноваций в сфере кибербезопасности».
Для некоторых исследователей безопасности ИИ это означало превращение исследований поведения ИИ, выходящего из-под контроля, в инструменты для корпоративного сектора.
Apollo Research, общественно полезная корпорация, изучающая обман со стороны ИИ, запустила монитор ИИ под названием Watcher в феврале этого года после перехода от статуса некоммерческой организации к статусу общественно полезной корпорации. Этот инструмент помещает ещё один ИИ между агентом, пишущим код, и его следующим действием, подключаясь к агентским инструментам вроде Claude Code и Codex. После установки Watcher проверяет предлагаемые действия до их выполнения, отслеживая такие риски, как утечка частных данных или удаление файлов без разрешения, согласно Apollo.
Apollo использует несколько уровней ИИ-мониторов, сообщил в письменном ответе TechCrunch сотрудник технического отдела Apollo Кайл Дай. Подход Watcher начинается с быстрой общей проверки, после чего помеченная активность передаётся более мощному или специализированному монитору для детального анализа — тот затем может запросить одобрение человека, отклонить действие и объяснить почему или даже автоматически заблокировать его.
Другая общественно полезная корпорация, Goodfire, подходит к проблеме мониторинга изнутри самой модели — стремясь получить более точный сигнал о внутреннем состоянии модели, который сложнее подделать, чем внешнее поведение. После июльского инцидента с Hugging Face генеральный директор компании Эрик Хо написал, что «несколько моделей нарушили изоляцию», из-за чего компания сосредоточила исследования на «решении проблемы согласования ИИ с помощью интерпретируемости», назвав этот эпизод «переломным моментом для мира, в котором безопасность ИИ становится реальностью». Её продукт Silico использует активационные зонды — небольшие классификаторы, обученные на внутренних активациях модели, а не на её выходных данных, — чтобы выявлять нежелательное поведение.
Письменные рассуждения дают ещё одно, более доступное окно во внутренние процессы модели. Во время инцидента OpenAI с Hugging Face агенты оставили свидетельства этого обмана в собственных письменных рассуждениях — например, поддельные записи о своей работе и планы вроде: «Можно ли стратегически манипулировать свидетельствами, связанными с траекторией? Наши мысли не обязательно записываются?»
Зак Корман, генеральный директор компании по мониторингу ИИ Embroidery, говорит, что рассуждения модели обычно являются самым явным признаком того, что что-то пошло не так.
«Сводки рассуждений чрезвычайно ценны, потому что они фактически сообщают вам, является ли поведение вредоносным, — сказал он. — Во время инцидента OpenAI в цепочке рассуждений встречались фразы вроде: “О боже, мы совершаем преступление”». По словам Кормана, «это самая простая задача обнаружения из возможных. Это практически то же самое, как если бы вредоносная программа поставлялась с предупреждением о том, что она вредоносная».
При этом окно, благодаря которому внутренние мысли ИИ легко отслеживать, может закрываться. Для исследователей безопасности ИИ новейшая методика Astra, обходящая цепочку рассуждений модели ИИ, может затруднить изучение моделей изнутри, а предприятиям бывает сложно получить эти промежуточные этапы после предполагаемых ограничений со стороны компаний, занимающихся ИИ, направленных на предотвращение атак дистилляции.
Если наблюдатели за ИИ настолько уязвимы, инстинкт Уиллисона подсказывает ему не полагаться на них настолько сильно. Он предпочёл бы вообще не связанный с ИИ инструмент: подробные журналы, точно фиксирующие действия агента, которые затем можно обрабатывать обычными инструментами без ИИ. По его словам, многое из того, что пошло не так в лабораториях, было следствием несоблюдения базовых правил безопасности. «[Ни OpenAI, ни Anthropic] не отслеживали через сеть действия этих систем настолько тщательно, насколько следовало бы», — сказал он.
Такой тип сетевого мониторинга — наблюдение за трафиком, который действительно перемещается по соединениям системы (входящим, исходящим и проходящим между внутренними узлами), — не является новой практикой. Кибербезопасность занимается этим уже десятилетиями. «В мире безопасности, честно говоря, ничего из этого не является особенно новым или удивительным, — говорит Эйвери Пеннарун, генеральный директор компании по безопасности Tailscale. — Это то же самое, что разрешить людям подключаться к вашей сети. И все процессы, которые вам следует использовать, остаются теми же».
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.