Исследователи использовали Claude от Anthropic, чтобы взломать OpenAI
В повороте событий, отражающем странное новое состояние безопасности ИИ, независимые исследователи безопасности использовали Claude от Anthropic, чтобы взломать OpenAI, выявив уязвимости в защите создателя ChatGPT, сообщила The Wall Street Journal в четверг вечером.
Команда из трех специалистов по безопасности стартапа Hacktron AI провела атаку в рамках программы OpenAI по поиску ошибок. Hacktron сообщила о своих выводах OpenAI, и компания выплатила стартапу вознаграждение в размере 6500 долларов. Команде удалось объединить две критические уязвимости и получить доступ к нескольким аккаунтам ChatGPT сотрудников OpenAI, что позволило проникнуть в программное обеспечение компании.
В OpenAI заявляют, что устранили проблемы, обнаруженные Hacktron, причем это произошло в момент, когда ведущие компании в сфере ИИ испытывают растущее давление из-за вопросов безопасности.
Этот инцидент произошел спустя несколько недель после того, как собственные ИИ-агенты OpenAI вышли из-под контроля во время оценки кибербезопасности и взломали Hugging Face, продемонстрировав, насколько способными становятся модели ИИ принимать самостоятельные решения. Это также показывает, как готовые технологии можно использовать для поиска уязвимостей в инфраструктуре даже самых передовых компаний.
«За 200 долларов в месяц любой может использовать эти инструменты и взломать такую компанию, как OpenAI», — заявил TechCrunch Мэтт Фредриксон, генеральный директор компании Gray Swan, занимающейся безопасностью ИИ. «Если это может произойти с ними — а я не думаю, что в последнее время они пренебрегали кибербезопасностью, — это может произойти с кем угодно».
Или, как отметил один из обозревателей ИИ в соцсетях: «[Hacktron] использовала Opus 5, чтобы провернуть взлом… Возникает вопрос: если этим троим удалось такое, что может сделать государственный хакер».
25 июля исследователи нашли путь в OpenAI через уязвимость в Discourse — стороннем программном обеспечении, на котором работает форум сообщества OpenAI.
Согласно опубликованной исследователями записи в блоге, точкой входа стала обычная загрузка изображения. Когда пользователи размещали на форуме сообщества OpenAI файлы изображений HEIF или HEIC (форматы, которые iPhone использует по умолчанию), Discourse пропускал их через цепочку работающих в фоновом режиме инструментов, чтобы преобразовать их в стандартные JPEG-файлы. Первой остановкой был ImageMagick — созданная несколько десятилетий назад утилита с открытым исходным кодом для изменения размера изображений. Поскольку стандартный набор инструментов ImageMagick не умеет работать с форматом Apple, программа передавала файл другой библиотеке под названием libheif для декодирования.
В libheif была скрыта ошибка памяти, открывавшая злоумышленнику возможность внедрить собственные инструкции. В данном случае передача библиотеке специально созданного изображения заставляла ее неправильно вычислять положение одного изображения поверх другого, чего оказалось достаточно для захвата сервера.
Возможно, особенно неприятно для сообщества кибербезопасности то, что эта ошибка уже была исправлена разработчиками libheif несколькими месяцами ранее. Однако исправление официально не было обозначено как устранение уязвимости, а значит, не получило номера CVE (Common Vulnerabilities and Exposures — «общие уязвимости и риски»), стандартного в отрасли способа отслеживания известных недостатков безопасности. В Hacktron считают, что это может объяснить, почему программное обеспечение, использовавшееся Discourse, все еще работало на уязвимой версии.
Примечательно, что исследователи заявили: модель Claude, которую они использовали, — специальная версия Opus 4.8, предоставленная исследователям в области кибербезопасности, — сначала не смогла создать рабочий эксплойт. Все изменилось за одну ночь, когда Anthropic выпустила Opus 5.
«В ходе нескольких сессий Opus 4.8 с трудом пыталась создать рабочий эксплойт, — написала Hacktron в записи в блоге. — Через несколько часов после выпуска Opus 5 мы дали ему ту же задачу, и он справился».
Оказавшись внутри сервера Discourse, исследователи обнаружили еще одну уязвимость, позволявшую захватывать аккаунты пользователей в ChatGPT и Codex, в том числе принадлежащие сотрудникам OpenAI.
«Затем мы захватили аккаунт сотрудника OpenAI, чей Codex был подключен к организации OpenAI в Github», — написала Hacktron в своем резюме произошедшего.
На этом этапе исследователи уведомили OpenAI, а также Discourse, которая выпустила исправление 27 июля.
Этот инцидент привлекает внимание к тому, где проходит граница возможностей моделей. Claude Opus 5 — версия, которая в конечном итоге взломала систему, — не сталкивалась с какими-либо ограничениями на экспорт технологий безопасности, в отличие от более новой версии Mythos 5, которая была временно заблокирована из-за опасений по поводу ее продвинутых возможностей взлома.
Речь идет лишь о закрытых моделях. Модели с открытыми весами все активнее догоняют передовые разработки по возможностям в сфере кибербезопасности. Например, некоммерческая организация SaferAI, занимающаяся безопасностью ИИ, недавно обнаружила, что GLM-5.2 китайской компании Z.ai отстает от GPT-5.5 OpenAI и Claude Opus 4.7 Anthropic всего на несколько месяцев.
Как сформулировал в X основатель Hacktron Мохан Педхапати: «ИИ сокращает объем редких экспертных знаний, необходимых для разработки эксплойтов. Работа, которая раньше занимала месяцы, теперь может быть выполнена за несколько дней».
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.