Исследователи по кибербезопасности с помощью Claude от Anthropic взломали внутренние системы OpenAI менее чем за 72 часа
Ключевые моменты
- Исследователи в области безопасности использовали Claude от Anthropic, чтобы проникнуть во внутренние системы и репозитории кода OpenAI.
- Атака проводилась через форум сообщества OpenAI, где цепочка уязвимостей предоставила исследователям доступ к аккаунтам сотрудников в ChatGPT и Codex.
- На разработку всего эксплойта потребовалось всего 72 часа, что показывает, насколько радикально модели ИИ сокращают время и уровень навыков, необходимые для сложных кибератак.
Три исследователя в области безопасности использовали модели Claude от Anthropic, чтобы проникнуть во внутренние системы OpenAI через форум сообщества компании. Атака заняла менее 72 часов и, по словам команды, стала возможной только после выпуска Opus 5.
OpenAI познала вкус собственного лекарства. После того как компания по неосторожности позволила агентам месяцами взламывать системы по всему интернету, теперь сама стала жертвой взлома с помощью ИИ. Команда безопасности Hacktron объединила две уязвимости, чтобы получить доступ к аккаунтам сотрудников OpenAI в ChatGPT и Codex. Оттуда они проникли во внутренний репозиторий кода OpenAI на GitHub.
Атака проводилась через форум сообщества OpenAI по адресу community.openai.com. Потенциально пострадать мог любой пользователь или сотрудник, использовавший там функцию «Войти с помощью OpenAI». Пользователи могут подключать GitHub, Slack и электронную почту к Codex и ChatGPT, поэтому теоретически атака могла распространиться и на эти сервисы. Чтобы доказать наличие доступа, исследователи использовали аккаунт сотрудника в Codex для создания безвредного запроса на слияние во внутреннем монорепозитории. Они утверждают, что не просматривали никаких конфиденциальных данных.
Устаревшая библиотека изображений и ошибочная аутентификация открыли путь
Первая уязвимость находилась в libheif — библиотеке, которую форум использовал для обработки загруженных изображений HEIC. Согласно Hacktron, исправление было доступно в исходном исходном коде уже год, но никто не отметил эту проблему как угрозу безопасности. В пакетах Debian, работающих на форуме, исправление по-прежнему отсутствовало. Специально созданный файл изображения позволил исследователям выполнить собственный код на сервере.
Вторая уязвимость была вызвана неправильной конфигурацией центральной системы единого входа (SSO) OpenAI. Любой, кто контролировал сервер форума, мог выдавать себя за активных участников форума и захватывать их аккаунты в ChatGPT и Codex. Как пишет Hacktron, проблема выходила за пределы форума. Любой скомпрометированный сервис, использующий вход через OpenAI, предоставил бы такой же доступ.
Claude Opus 5 добился успеха там, где его предшественник потерпел неудачу
Исследователи говорят, что изначально использовали Claude Opus 4.8 для поиска уязвимости. Модель создала работающий эксплойт, но только при отключённом ASLR — распространённой защите от атак на память. В ходе нескольких сессий ей не удалось создать надёжную версию с включённым ASLR.
Вечером 24 июля Anthropic выпустила Claude Opus 5. По данным Hacktron, новая модель за три часа создала работающий эксплойт для локального Mac, а затем адаптировала его к серверной среде Discourse. После этого исследователи запустили Claude в автономном цикле против собственной тестовой среды.
Поскольку модель отказывалась писать эксплойты для реальных систем, ей представили цель как задачу бенчмарка. Четыре часа спустя агент захватил сервер. В рамках связанной задачи исследователи также заметили скачок производительности по сравнению с GPT-5.6 Sol от OpenAI.
OpenAI подтвердила устранение проблемы примерно через 14 часов после получения сообщения. Discourse — программное обеспечение, на котором работал форум, — также отреагировала в течение нескольких дней.
ИИ радикально удешевляет атаки
Помимо взлома OpenAI, исследователи расширили своё расследование под названием «HEIF Heist», включив в него Slack, Meta, GitHub Enterprise и другие цели. Три человека работали над проектом в течение двух месяцев, потратив на ИИ менее 3 000 долларов. Адаптация атаки к каждой новой цели занимала всего один-два дня. Активность заметила только Shopify, несмотря на тысячи загрузок изображений и повторяющиеся сбои при их обработке.
Как пишет команда Hacktron, программное обеспечение долгое время получало выгоду от своего рода безопасности за счёт сложности. Даже при наличии открытого исходного кода и известной уязвимости создание надёжного эксплойта требовало редких знаний, времени и глубокого понимания целевой среды. Сложность не была настоящим барьером безопасности, но на практике она защищала многие компании.
ИИ устраняет эту защиту, заменяя дефицитную экспертизу вычислительными ресурсами. Hacktron утверждает, что модели угроз должны учитывать, насколько дешёвыми стали атаки. «Работу, которая когда-то требовала хорошо обеспеченной команды и месяцев усилий, теперь можно сжать до нескольких дней», — пишет команда.
Новости ИИ без шумихи — отобраны людьми
Подпишитесь на THE DECODER, чтобы читать материалы без рекламы, получать еженедельную рассылку об ИИ, наш эксклюзивный отчёт о передовых разработках «AI Radar» шесть раз в год, полный доступ к архиву и доступ к разделу комментариев.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.