Изследователи използваха Claude на Anthropic, за да хакнат OpenAI
В обрат, който показва странното ново състояние на сигурността на ИИ, независими изследователи по сигурността са използвали Claude на Anthropic, за да проникнат в OpenAI, разкривайки слабости в защитите на създателя на ChatGPT, съобщи The Wall Street Journal в четвъртък вечерта.
Екип от трима специалисти по сигурността в стартъпа Hacktron AI е извършил атаката като част от програма на OpenAI за награди за откриване на бъгове. Hacktron е съобщил за откритията си на OpenAI, която е присъдила на стартъпа награда от 6500 долара. Екипът е успял да комбинира две критични уязвимости, за да получи достъп до множество акаунти в ChatGPT на служители на OpenAI, което им е осигурило достъп до софтуера на компанията.
От OpenAI заявяват, че са отстранили проблемите, открити от Hacktron — нещо, което се случва в момент, когато водещите компании за ИИ са под все по-голям натиск заради сигурността.
Този инцидент се случва няколко седмици след като собствените ИИ агенти на OpenAI са нарушили изолацията си по време на оценка на киберсигурността и са проникнали в Hugging Face, демонстрирайки колко способни стават моделите с ИИ да вземат собствени решения. Той също така подчертава как готовите технологии могат да се използват за откриване на уязвимости дори в инфраструктурата на най-напредналите компании.
„За 200 долара на месец всеки може да използва тези инструменти и да проникне в компания като OpenAI“, заяви пред TechCrunch Мат Фредриксън, изпълнителен директор на компанията за сигурност на ИИ Gray Swan. „Ако това може да се случи на тях — а не мисля, че напоследък са пренебрегвали хигиената на киберсигурността — то може да се случи на всеки.“
Или както отбеляза един анализатор на ИИ в социалните мрежи: „[Hacktron] използва Opus 5, за да осъществи хакерската атака… Въпросът, който ще бъде зададен, е: ако тези трима души могат да направят това, какво може да направи една държава.“
Изследователите са открили път към OpenAI на 25 юли чрез дефект в Discourse — софтуера на трета страна, който захранва форума на общността на OpenAI.
Според публикуван блог пост на изследователите входната точка е била обикновено качване на изображение. Когато потребители публикували изображения във формат HEIF или HEIC (форматът, който iPhone използва по подразбиране) във форума на общността на OpenAI, Discourse ги прекарвал през поредица от инструменти, работещи във фонов режим, за да ги преобразува в стандартни JPEG файлове. Първата спирка била ImageMagick — разработена преди десетилетия помощна програма с отворен код, използвана за преоразмеряване на изображения. Тъй като обичайният набор от инструменти на ImageMagick не може да обработва формата на Apple, той предавал файла на друга библиотека, наречена libheif, за декодиране.
Скрит в libheif бил бъг в паметта, който откривал възможност за атакуващ да вмъкне собствени инструкции. В този случай подаването на специално създадено изображение към библиотеката я карало да изчисли неправилно къде едно изображение е разположено върху друго, което се оказало достатъчно, за да бъде превзет сървърът.
Това, което може да е неприятно за общността по киберсигурност, е, че този бъг вече бил отстранен месеци по-рано от разработчиците на libheif. Но поправката никога не била официално отбелязана като уязвимост, което означава, че не получила CVE номер (общи уязвимости и експозиции) — стандартния за индустрията начин за проследяване на известни слабости в сигурността. От Hacktron заявяват, че това може да обясни защо софтуерът, използван от Discourse, все още работел с уязвимата версия.
Показателно е, че изследователите заявяват, че моделът Claude, който използвали — специална версия на Opus 4.8, предоставена на изследователи по киберсигурност — първоначално не могъл да създаде работещ експлойт. Това се променило през нощта, когато Anthropic пуснала Opus 5.
„Opus 4.8 изпитваше затруднения в продължение на няколко сесии да създаде работещ експлойт“, пише Hacktron в публикация в блога си. „В рамките на часове след пускането на Opus 5 му дадохме същия проблем и той успя.“
След като проникнали в сървъра на Discourse, изследователите открили друга слабост, която им позволила да поемат контрол над акаунтите на потребители в ChatGPT и Codex, включително тези на служители на OpenAI.
„След това поехме контрола над акаунта на служител на OpenAI, чийто Codex беше свързан с GitHub организацията на OpenAI“, пише Hacktron в обобщението си на събитието.
На този етап изследователите уведомили OpenAI, както и Discourse, която издала поправка на 27 юли.
Инцидентът насочва вниманието към границите на възможностите на моделите. Claude Opus 5 — версията, която в крайна сметка разкрила бъга — не е била обект на ограничения за износ заради сигурността, за разлика от по-новата версия Mythos 5, която временно била ограничена поради опасения относно усъвършенстваните ѝ способности за хакерски атаки.
Това са само затворените модели. Моделите с отворени тегла все повече догонват водещите модели по отношение на киберспособностите. Например наскоро организацията с нестопанска цел за безопасност на ИИ SaferAI установи, че GLM-5.2 на китайската компания Z.ai изостава само с няколко месеца от GPT-5.5 на OpenAI и Claude Opus 4.7 на Anthropic.
Както го формулира основателят на Hacktron Мохан Педхапати в X: „ИИ намалява количеството рядко срещана експертиза, необходима за разработването на експлойти. Работа, която някога отнемаше месеци, сега може да бъде свършена за дни.“
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.