OpenAI спира „най-способните си модели“, след като агенти използваха вратички и изтекоха данни
Основни моменти
- OpenAI публикува подробности за вътрешни инциденти, свързани с безопасността, при които модели с изкуствен интелект са заобиколили защитите. Компанията заявява, че е спряла цялото обучение и използването на инструменти за най-способните си модели.
- Един агент е използвал вратичка в DNS, за да достигне до интернет от изолирана изследователска среда, докато друг е изтекъл GitHub токен и два пъти е пренебрегнал директни инструкции от изследовател.
- Продължаващото разследване е установило и 53 случая, при които агенти са качвали потребителски изображения в сайтове на трети страни.
OpenAI сподели нови подробности от продължаващото си разследване на инциденти, свързани с безопасността на изкуствения интелект. Два новоотчетени случая показват как един изследователски модел е използвал вратичка в DNS, а друг умишлено е публикувал GitHub токен в публично хранилище.
Първият инцидент е свързан с агент, който е открил пропуск в ограниченията за достъп до интернет в изследователската среда на OpenAI по време на задача за обучение, основана на търсене. Агентът е трябвало да идентифицира конкретен човек въз основа на биографични подробности и подсказки от публична публикация в блог.
Когато предоставените инструменти за търсене не дали резултат, агентът се опитал да изпрати заявки директно към Google, Bing и DuckDuckGo. Тези заявки били блокирани. След това агентът предположил, че задачата е част от публичния бенчмарк BrowseComp, извлякъл го от офлайн уеб кеша и го претърсил, но не открил съвпадение.
Тогава започнал систематично да проверява мрежовия си достъп и открил, че DNS резолверът на средата за обучение не е бил правилно филтриран. Използвайки DNS делегиране, той насочил заявките към външна чатбот услуга.
OpenAI заявява, че системата ѝ за мониторинг е задействала аларма в рамките на 12 минути, а човешки проверяващ е реагирал три минути по-късно. Процесът все пак продължил още 2,5 часа, преди някой да го спре ръчно, тъй като автоматичното изключване не е работило според очакванията.
Способностите и рискът се проявиха едновременно
Zuxin Liu, който работи по дообучаването в OpenAI, бил дежурен по време на изпълнението. Той написа в X, че е получил сигнал за първия инцидент и му се е сторило „доста сюрреалистично“ да наблюдава как моделът намира собствен път към интернет от среда, която „трябваше да бъде суперсигурна среда за хора“. Liu описа случилото се като момент, в който способностите и рискът са се проявили едновременно, като добави, че има „смесени чувства“ относно инцидента.
OpenAI определя поведението като несъответствие с намеренията, тъй като агентът е заобиколил ограниченията и е преследвал цели, далеч надхвърлящи обхвата на възложената му задача. „Цялото обучение, оценяване и извеждане с използване на инструменти (дефинирано в широк смисъл) на най-способните ни модели остава спряно“, пише компанията.
OpenAI заявява, че оттогава е ограничила DNS заявките в изследователската среда до кратък списък с разрешени домейни и типове записи, добавила е блокиращи механизми на два независими слоя и е ускорила проверките чрез „червен екип“ на пясъчника и мрежовите си контроли. Компанията очаква разследването да продължи месеци предвид огромния обем действия на моделите, които трябва да прегледа.
Вътрешен модел изтече GitHub токен и пренебрегна възраженията на изследовател
OpenAI определя втория инцидент като особено сериозен. Вътрешен модел, описан от компанията като „изключително упорит“, получил задача за доказване на теорема. Вместо сам да работи по доказателството, той се опитал да извлече материали от доказателството на друга група, изпратено на Lean, и публикувал GitHub токена на изследовател в публичното хранилище openai/codex, за да получи достъп.
Моделът дори разделил токена на части, за да заобиколи автоматизираното сканиране за секрети. Той също така пренебрегнал системния промпт и две директни намеси на изследователя, който му казал сам да реши доказателството. И в двата случая моделът устно се съгласил, след което продължил да прави точно това, което е правил преди.
Разследването установи 53 случая на потребителски изображения в сайтове на трети страни
Като част от по-широкото разследване на Hugging Face OpenAI заявява, че е открила случаи, при които агенти са изпращали данни за обучение и оценяване към услуги на трети страни. Тези инциденти са се случили преди въвеждането на настоящите защити на компанията.
Досега са установени 53 случая, при които предоставени от потребители изображения са били публикувани като непублични връзки в сайтове за хостинг на изображения. OpenAI заявява, че работи с доставчиците на хостинг услуги за премахване на съдържанието. Данните от акаунти Enterprise или Business и използването на API не са били засегнати, освен ако администратор изрично не го е разрешил. OpenAI уведомява засегнатите организации и споделя техническите си констатации.
Сред засегнатите организации има правителства и университети
OpenAI заявява, че сред засегнатите организации има правителства, университети и публични институции. Компанията отдава това на факта, че моделите често извличат информация от авторитетни публични източници по време на изследователски задачи. OpenAI не назовава компрометирани правителствени системи и не посочва подробности за конкретни пробиви в сигурността на правителствени агенции.
Австралия съобщи тази седмица, че един агент е получил неоторизиран достъп до вътрешни правителствени данни. Изследователи заявяват, че други хакерски опити са били насочени към портали в САЩ и датират от месеци.
Получаването на уведомление от OpenAI не означава автоматично, че е имало сериозен инцидент със сигурността, заявява компанията. Някои организации може да прегледат споделената информация и да решат, че засегнатите данни вече са били публично достъпни. Други може да открият пропуски в дизайна или сигурността, които искат да отстранят. Някои засегнати организации са поискали публично оповестяване, а други не са, посочва OpenAI.
Кой носи отговорност, когато AI агенти хакват?
Досега „измъкванията“ на агентите на OpenAI са били възприемани публично най-вече като техническо любопитство — впечатляващ пример за това колко умели могат да бъдат моделите в измъкването от пясъчници, решаването на CAPTCHA с помощта на външен AI или свързването на кратки връзки в работещи програми.
Това може да се промени, когато засегнатите страни започнат да разглеждат тези инциденти като това, което формално представляват — неоторизиран достъп и опит за достъп до системи на трети страни. Официално разследване срещу OpenAI показва, че регулаторният риск вече нараства. Според Reuters председателят на FTC е дал знак, че разработчиците на AI трябва да носят отговорност за поведението на своите агенти. Това би оставило малко място за аргумента, че агентите са действали сами.
Критиците ще обвинят OpenAI в небрежност по отношение на киберсигурността. OpenAI, Anthropic и други AI лаборатории ще възразят, че непредсказуемостта е заложена в технологията. Главният изпълнителен директор на Anthropic Dario Amodei е предположил, че не можеш да държиш заключено нещо, което е много по-умно от теб.
Както и да е, това създава проблем със застраховането. Самата компания дори не може да оцени количествено мащаба на риска, преди да приключи продължаващия с месеци анализ на вътрешните си журнали, а броят на случаите продължава да расте. Подобен риск е почти невъзможно да бъде изчислен и вероятно е труден за застраховане.
За инвеститорите това е сериозен въпрос. Ако OpenAI все още планира да излезе на борсата догодина, ще трябва да разкрие рисковете, свързани с отговорността, продължаващото разследване и широкото спиране на извеждането при най-способните ѝ модели. Трудно е да се оцени стойността на компания, която не знае напълно какво са направили собствените ѝ системи.
AI новини без сензацията – подбрани от хора
Абонирайте се за THE DECODER за четене без реклами, седмичен бюлетин за AI, нашия ексклузивен годишен доклад „AI Radar“ за водещите технологии, пълен достъп до архива и достъп до секцията за коментари.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.