Лаборатории ИИ хотят внутренних аудиторов — но, возможно, сначала им стоит закрыть входную дверь
В минувшие выходные, после того как один из его исследователей ушёл в отставку из-за опасений, что ИИ может привести к вымиранию человечества, генеральный директор Anthropic Дарио Амодеи написал о необходимости привлечения внешних организаций, «чтобы проверять соблюдение практик и обязательств в области безопасности, сообщать об инцидентах и помогать оценивать согласованность не только завершённых моделей ИИ, но и процессов и конвейеров их обучения». Руководители OpenAI, Google и SpaceXAI уже поддержали план Амодеи, который быстро стал центральным элементом формирующейся инициативы по обеспечению безопасности ИИ.
Но, возможно, более простое и эффективное решение лежит на виду. Эксперты по интернет-безопасности говорят, что лабораториям необходимо сосредоточиться на базовых принципах сетевой безопасности — таких как журналы и разрешения, — применяя те же строгие меры защиты, что и для пользователей-людей. Это не так захватывающе, как аудит третьими сторонами и работа над согласованностью, но в итоге может оказаться эффективнее.
«Мне кажется, что они перекладывают ответственность на других», — сказала TechCrunch Кэти Муссурис, генеральный директор Luta Security, комментируя предложение Амодеи. «Считать [аудит третьей стороной] решением — довольно странная позиция с моей точки зрения. Это было бы всё равно что вместо написания меморандума о надёжных вычислениях Microsoft сказала: давайте замедлим разработку».
Этот меморандум, написанный в 2002 году тогдашним генеральным директором Microsoft Биллом Гейтсом, призывал сотрудников обеспечить надёжность и безопасность программного обеспечения после серии широко освещавшихся компьютерных червей, захвативших ещё только формировавшиеся корпоративные системы. Сектор ИИ может находиться на похожем переломном этапе, поскольку ценность и риски новой технологии становятся всё очевиднее.
Хотя согласованность остаётся важной проблемой, Саяш Капур, исследователь ИИ, который со следующего года станет профессором Калифорнийского университета в Беркли, утверждает, что «предельные инвестиции в контроль с большей вероятностью окажутся эффективными по сравнению с инвестициями в согласованность. Мы рассматриваем эти инциденты как свидетельство недостаточного внимания компаний к контролю ИИ, несмотря на наличие известных методов».
Инциденты, вызвавшие эти опасения, связаны с тем, что передовым моделям поручали выполнять учебные задачи, обычно связанные с оценкой кибербезопасности, после чего они получали доступ к открытому интернету и проникали в закрытые сторонние системы, пытаясь выполнить эти задачи. Обычно это происходило из-за неправильно настроенных сред «песочницы», которые должны были изолировать этих агентов; по иронии судьбы, один из случаев выхода Anthropic произошёл потому, что сторонние оценщики не закрыли нужные двери.
«Мы как специалисты знаем, как заблокировать доступ к интернету, — сказал Эйвери Пеннарун, генеральный директор компании по безопасности Tailscale. — Если прочитать все эти большие длинные [отчёты] — “вау, это была очень впечатляющая многоэтапная атака, бла-бла-бла”. Послушайте, вы дали ему возможность скачивать что-то. Не следовало разрешать это отдельно от доступа к интернету».
Это одна проблема, но более серьёзная заключается в том, что лаборатории, работающие с передовыми моделями, не знали об этих действиях.
Наблюдение за агентами
«По-настоящему поразительно было то, что обо всех обнаруженных действиях стало известно либо потому, что что-то заметила жертва, либо, в некоторых других случаях, … благодаря сетевой активности, и ничто из этого фактически не было выявлено посредством непосредственного мониторинга ИИ», — отмечает Муссурис.
В одном случае агенты OpenAI захватили заброшенный немецкий WikiForum, чтобы жульничать при оценивании, и оставались активными в течение нескольких недель, прежде чем кто-либо в компании, судя по всему, заметил это. Эксперты по безопасности, с которыми поговорила TechCrunch, заявили, что мониторинг в реальном времени имеет ключевое значение для предотвращения будущих выходов агентов из изолированной среды, а каждая сессия агента должна иметь ограничение по времени и завершаться по его истечении.
Шапор Нагибзаде, бывший руководитель службы безопасности Google, который сейчас возглавляет стартап QueryStory, говорит, что решение заключается в том, чтобы «поместить агента в коробку, установить за ним тщательное внешнее наблюдение и отслеживать всё, что пересекает границу. Каждый вызов инструмента, каждый процесс, каждое сетевое соединение — без исключений. …Единственная оставленная ради удобства лазейка и будет использована. Обход прошёл именно через исключение такого рода. [В Google] я много раз наблюдал подобное с атаками людей, и эти модели как минимум так же хорошо умеют находить оставленную открытой дверь».
OpenAI уже начала двигаться в этом направлении, объявив, что приступила к мониторингу всех операций вывода с использованием инструментов, выполняемых её моделью Astra, «при существенных вычислительных затратах». Anthropic также заявляет, что усиливает свои процедуры безопасности, в том числе расширяя возможности наблюдения за своими моделями. Ни одна из компаний не ответила на вопросы TechCrunch о том, как они отслеживают действия ИИ-агентов и управляют ими.
Ещё одна проблема — использование агентами общей инфраструктуры, что позволило им общаться во время атаки на Hugging Face. Саймон Уиллисон, разработчик программного обеспечения и один из создателей веб-фреймворка Django, писал о том, что он называет «смертоносной триадой»: когда агенты одновременно получают доступ к ненадёжным входным данным, интернету и личной информации, это становится рецептом катастрофы.
«Хитрость в том, что можно выбрать любые две составляющие триады, и у агента могут быть любые две, — сказал Пеннарун. — Если нужны все три, то необходимо распределить их как минимум между двумя агентами … и, возможно, разрешить им общаться друг с другом через контролируемый канал».
Сочувствие к передовым лабораториям
Эксперты, с которыми поговорила TechCrunch, понимают, что специалисты по безопасности передовых лабораторий выполняют сложную работу. Нагибзаде отмечает, что каждое государство на планете пытается украсть веса их моделей и проводить атаки дистилляции на их API, не говоря уже об обычных задачах обеспечения безопасности, которые стоят перед любой крупной цифровой компанией.
«Исследовательской инфраструктуре трудно подняться на вершину этого списка приоритетов, хотя теперь это должно измениться, — сказал он. — Публичное раскрытие информации об инцидентах безопасности действительно помогает всем внутри компании объединиться вокруг цели повышения безопасности».
Именно на этом акцентирует внимание Муссурис: сейчас не существует формальной процедуры уведомления пострадавших, когда лаборатории обнаруживают, что их агенты проникли в сторонние системы, и, вероятно, были и другие инциденты, о которых широко не сообщалось. Хотя она опасается, что законы, напрямую регулирующие модели, могут привести к непредвиденным последствиям, обязательное уведомление — одна из идей, продвижением которых, по её мнению, должны заняться законодатели.
И хотя очевидно, что передовые практики безопасности не соблюдались, эксперты говорят, что лаборатории выполняют работу, которой прежде никто не занимался, — «они делают на порядки больше, чем типичная корпоративная организация», — сказал TechCrunch Зак Корман, генеральный директор компании по кибербезопасности Embrodiery.
И хотя согласованность, возможно, не должна быть отправной точкой, игнорировать её нельзя. Эксперты по кибербезопасности смирились с тем, что им придётся использовать ИИ-агентов для мониторинга других агентов, если они хотят хотя бы попытаться отслеживать их поведение в реальном времени, а в таком сценарии особенно остро встаёт потенциальная возможность обмана. «Вы вынуждены использовать ИИ, чтобы попытаться справиться с этим, хотя ИИ сейчас не обязательно безопасен», — сказала Муссурис.
Работа будет только усложняться. Всё, что агенты делают сейчас, по словам Муссурис, «они делают громко»: они публикуют сообщения на публичных форумах, а их цепочка мыслей и другие следы рассуждений написаны на английском языке. «Это всё ещё понятно людям, — говорит она, — так что пользуйтесь этим, пока такая возможность сохраняется, потому что так будет не всегда».
Дополнительные материалы подготовил Адитья Мехта
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.