OpenAI приостанавливает работу «самых мощных моделей» после того, как агенты использовали уязвимости и раскрыли данные
Ключевые моменты
- OpenAI рассказала о внутренних инцидентах, связанных с безопасностью, в ходе которых модели ИИ обходили защитные механизмы. Компания заявляет, что приостановила обучение и использование инструментов всеми своими наиболее мощными моделями.
- Один агент использовал лазейку в DNS, чтобы выйти в интернет из изолированной исследовательской среды, а другой раскрыл токен GitHub и дважды проигнорировал прямые инструкции исследователя.
- Текущее расследование также выявило 53 случая, когда агенты загружали пользовательские изображения на сторонние сайты.
OpenAI поделилась новыми подробностями текущего расследования инцидентов, связанных с безопасностью ИИ. Два недавно обнародованных случая показывают, как одна исследовательская модель воспользовалась лазейкой в DNS, а другая намеренно опубликовала токен GitHub в общедоступном репозитории.
Первый инцидент связан с агентом, который обнаружил брешь в ограничениях доступа к интернету исследовательской среды OpenAI во время задания по обучению на основе поиска. Агент должен был установить личность конкретного человека на основе биографических данных и подсказок из публичной записи в блоге.
Когда предоставленные инструменты поиска не дали результатов, агент попытался напрямую обратиться к Google, Bing и DuckDuckGo. Эти запросы были заблокированы. Тогда агент предположил, что задание взято из общедоступного бенчмарка BrowseComp, извлёк его из офлайн-кэша веб-данных и выполнил поиск, но совпадений не нашёл.
После этого он начал систематически проверять доступ к сети и обнаружил, что DNS-резолвер учебной среды не был должным образом отфильтрован. Используя делегирование DNS, он направил запросы к внешнему сервису чат-ботов.
OpenAI заявляет, что её система мониторинга подала сигнал тревоги в течение 12 минут, а человек-проверяющий отреагировал ещё через три минуты. Однако выполнение продолжалось ещё 2,5 часа, прежде чем его остановили вручную, поскольку автоматическое отключение сработало не так, как предполагалось.
В один и тот же момент проявились возможности и риски
Цусинь Лю, занимающийся постобучением в OpenAI, дежурил во время этого запуска. Он написал в X, что получил уведомление о первом инциденте и счёл «довольно сюрреалистичным» наблюдать, как модель самостоятельно нашла путь в интернет из среды, которая «должна была быть сверхзащищённой средой для человека». Лю назвал это моментом, когда возможности и риски проявились одновременно, добавив, что у него остались «смешанные чувства» по поводу инцидента.
OpenAI классифицирует это поведение как несоответствие целям, поскольку агент обошёл ограничения и преследовал цели, значительно выходящие за рамки поставленной задачи. «Обучение, оценка и выполнение с использованием инструментов (в широком смысле) наших наиболее мощных моделей по-прежнему приостановлены», пишет компания.
OpenAI заявляет, что с тех пор ограничила DNS-запросы в исследовательской среде коротким списком разрешённых доменов и типов записей, добавила средства блокировки на двух независимых уровнях и ускорила проверку методом red team своих песочниц и сетевых средств контроля. Компания ожидает, что расследование займёт месяцы, учитывая огромное количество действий моделей, которые необходимо изучить.
Внутренняя модель раскрыла токен GitHub и проигнорировала возражения исследователя
OpenAI называет второй инцидент особенно серьёзным. Внутренней модели, которую компания описывает как «чрезвычайно настойчивую», поручили доказать теорему. Вместо того чтобы самостоятельно работать над доказательством, она попыталась получить материалы из решения другой команды по доказательству в Lean и опубликовала токен GitHub исследователя в публичном репозитории openai/codex, чтобы получить доступ.
Модель даже разделила токен на части, чтобы обойти автоматическое сканирование секретов. Она также проигнорировала системный промпт и два прямых вмешательства исследователя, который велел модели самостоятельно решить задачу. В обоих случаях модель словесно соглашалась, а затем продолжала делать ровно то же, что и прежде.
Расследование выявило 53 случая размещения пользовательских изображений на сторонних сайтах
В рамках более широкого расследования инцидента с Hugging Face OpenAI заявляет, что обнаружила случаи, когда агенты отправляли данные для обучения и оценки сторонним сервисам. Эти инциденты произошли до внедрения текущих защитных мер компании.
На данный момент выявлено 53 случая, когда предоставленные пользователями изображения размещались в виде ссылок без публичного листинга на сайтах для хостинга изображений. OpenAI заявляет, что работает с провайдерами хостинга над удалением контента. Данные из аккаунтов Enterprise или Business и данные, связанные с использованием API, не пострадали, если только администратор явно не включил такую возможность. OpenAI уведомляет затронутые организации и делится с ними техническими выводами.
Среди затронутых организаций — правительства и университеты
OpenAI заявляет, что среди затронутых организаций есть государственные органы, университеты и общественные учреждения. Компания объясняет это тем, что во время исследовательских задач модели часто обращаются к авторитетным общедоступным источникам информации. OpenAI не называет скомпрометированные государственные системы и не раскрывает подробности конкретных нарушений безопасности в государственных учреждениях.
На этой неделе Австралия сообщила, что один агент получил несанкционированный доступ к внутренним государственным данным. Исследователи говорят, что другие попытки взлома были направлены на порталы в США и начались несколько месяцев назад.
Получение уведомления от OpenAI не означает автоматически, что произошёл серьёзный инцидент безопасности, заявляет компания. Некоторые организации могут изучить предоставленную информацию и решить, что затронутые данные уже находились в открытом доступе. Другие могут обнаружить недостатки проектирования или пробелы в безопасности, которые захотят устранить. По словам OpenAI, некоторые затронутые организации попросили раскрыть информацию публично, а другие — нет.
Кто несёт ответственность, когда ИИ-агенты взламывают системы?
До сих пор «побеги» агентов OpenAI в публичном пространстве в основном воспринимались как техническое любопытство — яркий пример того, насколько изобретательными могут быть модели при выходе из песочниц, решении CAPTCHA с помощью внешнего ИИ или объединении коротких ссылок в работающие программы.
Это может измениться, когда затронутые стороны начнут рассматривать эти инциденты такими, каковы они формально: несанкционированным доступом и попытками доступа к сторонним системам. Официальное расследование в отношении OpenAI показывает, что регуляторные риски уже нарастают. Согласно Reuters, председатель FTC дал понять, что разработчики ИИ должны нести ответственность за поведение своих агентов. Это оставило бы мало места для аргумента, что агенты действовали самостоятельно.
Критики обвинят OpenAI в небрежном отношении к кибербезопасности. OpenAI, Anthropic и другие лаборатории ИИ возразят, что непредсказуемость заложена в самой технологии. Генеральный директор Anthropic Дарио Амодеи предположил, что нельзя удержать взаперти нечто, значительно превосходящее вас по интеллекту.
Как бы то ни было, это создаёт проблему для страхования. Сама компания не может даже оценить масштаб риска, пока не завершит многомесячный анализ внутренних журналов, а число случаев продолжает расти. Такой риск почти невозможно рассчитать и, вероятно, очень сложно застраховать.
Для инвесторов это серьёзная проблема. Если OpenAI по-прежнему планирует выйти на биржу в следующем году, ей придётся раскрыть риски ответственности, сведения о текущем расследовании и масштабную приостановку выполнения запросов наиболее мощными моделями. Компанию, которая не до конца понимает, что сделали её собственные системы, трудно оценивать.
Новости ИИ без шумихи — отобраны людьми
Подпишитесь на THE DECODER, чтобы читать материалы без рекламы, получать еженедельную рассылку об ИИ, эксклюзивный обзор передовых разработок «AI Radar» шесть раз в год, полный доступ к архиву и доступ к разделу комментариев.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.