Дослідники використали Claude від Anthropic, щоб зламати OpenAI
У повороті подій, що відображає дивний новий стан безпеки ШІ, незалежні дослідники з безпеки використали Claude від Anthropic, щоб зламати OpenAI, виявивши слабкі місця в захисті розробника ChatGPT, повідомила The Wall Street Journal у четвер увечері.
Команда з трьох фахівців із безпеки стартапу Hacktron AI здійснила атаку в межах програми OpenAI з пошуку помилок. Hacktron повідомила про свої висновки OpenAI, яка виплатила стартапу винагороду в розмірі 6 500 доларів. Команді вдалося поєднати дві критичні вразливості, щоб отримати доступ до кількох облікових записів ChatGPT співробітників OpenAI, що відкрило їм шлях до програмного забезпечення компанії.
В OpenAI заявляють, що усунули проблеми, виявлені Hacktron, і це сталося в момент, коли провідні компанії у сфері ШІ зазнають дедалі більшого тиску через питання безпеки.
Цей інцидент стався через кілька тижнів після того, як власні агенти OpenAI на основі ШІ вийшли з-під контролю під час оцінювання кібербезпеки та зламали Hugging Face, продемонструвавши, наскільки здібними стають моделі ШІ у прийнятті власних рішень. Це також підкреслює, як готові технології можна використовувати для пошуку вразливостей в інфраструктурі навіть найпередовіших компаній.
«За 200 доларів на місяць будь-хто може використовувати ці інструменти й зламати таку компанію, як OpenAI», — сказав TechCrunch Метт Фредріксон, генеральний директор компанії з безпеки ШІ Gray Swan. «Якщо це могло статися з ними — а я не думаю, що останнім часом вони нехтували кібергігієною, — це може статися з будь-ким».
Або, як зазначив один із оглядачів ШІ в соціальних мережах: «[Hacktron] використала Opus 5, щоб здійснити злам… Постає питання: якщо цим трьом хлопцям вдалося це зробити, то на що здатна держава».
Дослідники знайшли шлях до OpenAI 25 липня через вразливість у Discourse — сторонньому програмному забезпеченні, на якому працює форум спільноти OpenAI.
Згідно з опублікованим дослідниками блогом, точкою входу було звичайне завантаження зображення. Коли користувачі публікували на форумі спільноти OpenAI зображення у форматі HEIF або HEIC (саме цей формат iPhone використовують за замовчуванням), Discourse передавав їх через ланцюжок внутрішніх інструментів для перетворення на стандартні JPEG-файли. Першою зупинкою був ImageMagick — утиліта з відкритим кодом, якій уже кілька десятиліть, що використовується для зміни розміру зображень. Оскільки стандартний набір інструментів ImageMagick не підтримує формат Apple, він передавав файл іншій бібліотеці під назвою libheif для декодування.
Усередині libheif була прихована помилка в роботі з пам’яттю, яка відкривала зловмиснику шлях для впровадження власних інструкцій. У цьому випадку передавання бібліотеці спеціально створеного зображення змусило її неправильно визначити, де одне зображення розташоване поверх іншого, чого виявилося достатньо для захоплення контролю над сервером.
Для спільноти кібербезпеки може бути незручно, що цю помилку розробники libheif виправили ще кілька місяців тому. Але виправлення так і не було офіційно позначене як вразливість, а отже, не отримало номера CVE (common vulnerabilities and exposures — поширені вразливості та загрози), стандартного в індустрії способу відстеження відомих слабких місць у безпеці. У Hacktron кажуть, що це може пояснити, чому програмне забезпечення, яке використовував Discourse, досі працювало на вразливій версії.
Примітно, що дослідники заявили: модель Claude, яку вони використовували, — спеціальна версія Opus 4.8, доступна дослідникам кібербезпеки, — спочатку не могла створити працездатний експлойт. Усе змінилося за одну ніч, коли Anthropic випустила Opus 5.
«Opus 4.8 протягом кількох сесій не міг створити працездатний експлойт», — написала Hacktron у дописі в блозі. «Протягом кількох годин після випуску Opus 5 ми дали йому ту саму задачу — і він упорався».
Потрапивши на сервер Discourse, дослідники виявили ще одну вразливість, яка дозволила їм захопити облікові записи користувачів ChatGPT і Codex, зокрема ті, що належали співробітникам OpenAI.
«Потім ми захопили обліковий запис співробітника OpenAI, чий Codex був підключений до організації OpenAI у Github», — написала Hacktron у своєму резюме подій.
На цьому етапі дослідники повідомили про проблему OpenAI, а також Discourse, яка випустила виправлення 27 липня.
Цей інцидент привертає увагу до меж можливостей моделей. Claude Opus 5 — версія, яка зрештою зламала систему, — не зазнавала жодних обмежень на експорт технологій безпеки, на відміну від новішої версії Mythos 5, яку тимчасово було обмежено через побоювання щодо її розширених можливостей злому.
Ідеться лише про закриті моделі. Моделі з відкритими вагами дедалі більше наздоганяють передові моделі за кіберможливостями. Наприклад, нещодавно неприбуткова організація з безпеки ШІ SaferAI виявила, що GLM-5.2 китайської компанії Z.ai відстає лише на кілька місяців від GPT-5.5 OpenAI та Claude Opus 4.7 Anthropic.
Як зазначив у X засновник Hacktron Мохан Педхапаті: «ШІ зменшує обсяг рідкісної експертизи, необхідної для розробки експлойтів. Робота, яка колись займала місяці, тепер може бути виконана за кілька днів».
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.