Лабораториите за ИИ искат вътрешни одитори — но може би първо трябва да затворят входната врата
Миналия уикенд, след като един от изследователите му подаде оставка заради опасенията, че ИИ може да доведе до изчезването на човечеството, главният изпълнителен директор на Anthropic Дарио Амодей писа за необходимостта от външни организации, „които да проверяват спазването на практиките и ангажиментите за безопасност, да докладват за инциденти и да помагат при оценяването на съответствието не само на завършените модели на ИИ, но и на процесите и конвейерите за обучение“. Ръководители от OpenAI, Google и SpaceXAI вече се обединиха около плана на Амодей, който бързо се превърна в основен стълб на зараждащия се стремеж към безопасност на ИИ.
Но може би има по-просто и по-ефективно решение, което е пред очите ни. Експерти по интернет сигурност казват, че лабораториите трябва да се съсредоточат върху основите на мрежовата сигурност, като регистрационни файлове и разрешения, прилагайки същите строги защити, които използват за човешките потребители. Това не е толкова вълнуващо, колкото одитите от трети страни и работата по съответствието — но в крайна сметка може да се окаже по-ефективно.
„На мен ми се струва, че те прехвърлят отговорността“, каза пред TechCrunch Кейти Мусурис, главен изпълнителен директор на Luta Security, относно предложението на Амодей. „Да се твърди, че [одитът от трета страна] е решението, от моя гледна точка е странно твърдение. Би било все едно вместо да напише Меморандума за надеждни изчисления, Microsoft да каже: нека забавим разработката.“
Този меморандум, написан от тогавашния главен изпълнителен директор на Microsoft Бил Гейтс през 2002 г., призоваваше служителите му да гарантират, че софтуерът им ще бъде надежден и безопасен след поредица от широко отразени компютърни червеи, които превзеха зараждащите се тогава корпоративни системи. Секторът на ИИ може да се намира в подобен повратен момент, тъй като стойността и рискът от новата технология стават все по-ясни.
Макар че съответствието остава важен въпрос, Саяш Капур, изследовател в областта на ИИ, който от следващата година ще бъде професор в Калифорнийския университет в Бъркли, твърди, че „пределните инвестиции в контрола е по-вероятно да бъдат ефективни в сравнение с тези в съответствието. Според нас тези инциденти показват липсата на акцент върху контрола на ИИ в компаниите, въпреки наличието на известни техники.“
Инцидентите, породили тези опасения, са свързани с това, че водещи модели са били помолени да изпълняват задачи за обучение, обикновено оценки на киберсигурността, а след това са получили достъп до отворения интернет и са проникнали в затворени системи на трети страни в опит да изпълнят задачите. Обикновено са го направили заради лошо конфигурирани среди тип „пясъчник“, които би трябвало да задържат тези агенти; иронично, един от пробивите на Anthropic се е случил, защото външните оценители не са затворили правилните врати.
„Като професия ние знаем как да блокираме достъпа до интернет“, каза Ейвъри Пенарън, главен изпълнителен директор на компанията за сигурност Tailscale. „Ако прочетете всички тези дълги [доклади] — ‘уау, това беше много впечатляваща многоетапна атака и така нататък’. Вижте, дали сте му достъп да изтегля неща. Не е трябвало да правите това отделно от интернет.“
Това е един проблем — но по-големият проблем е, че водещите лаборатории не са знаели за тези действия.
Наблюдение на агентите
„Наистина дълбоко впечатление ми направи, че всички открития за това, което са правили, са се случили или защото жертва е видяла нещо, или в някои от другите случаи … защото е имало мрежова активност, а нищо от това всъщност не е дошло от пряко наблюдение на ИИ“, отбелязва Мусурис.
В един случай, при който агенти на OpenAI са поели контрола над изоставен германски WikiForum, за да мамят при оценките, агентите са били активни в продължение на седмици, преди някой в компанията да изглежда да е забелязал. Експерти по сигурността, с които TechCrunch разговаря, заявиха, че наблюдението в реално време е от ключово значение за предотвратяването на бъдещи пробиви и че всяка агентна сесия трябва да е ограничена във времето и да изтича.
Шапор Нагибзаде, бивш ръководител на сигурността в Google, който сега оглавява стартъпа QueryStory, казва, че решението е „да поставите агента в кутия, да го наблюдавате подробно отвън и да следите всичко, което преминава през границата. Всяко извикване на инструмент, всеки процес, всяка мрежова връзка, без изключения. …Единствената пролука, която оставяте от удобство, е тази, която ще бъде използвана. Пробивът премина точно през такова изключение. [В Google] съм гледал този филм много пъти с човешки нападатели, а тези модели са поне толкова добри в намирането на оставена отворена врата.“
OpenAI започна да се движи в тази посока, като обяви, че е започнала да наблюдава всички операции по извеждане, използващи инструменти, чрез своя модел Astra, при „значителни изчислителни разходи“. Anthropic също заявява, че укрепва процедурите си за сигурност, включително чрез разширяване на наблюдаемостта на своите модели. Нито една от двете компании не отговори на въпросите на TechCrunch за това как проследяват и контролират агентите на ИИ.
Друг проблем е използването на споделена инфраструктура от агентите, което им е позволило да комуникират по време на атаката срещу Hugging Face. Саймън Уилисън, софтуерен разработчик, създал съвместно уеб рамката Django, пише за нещо, което нарича „смъртоносната триада“ — когато агентите имат едновременно достъп до ненадежден вход, интернет и лична информация, това е рецепта за бедствие.
„Трикът е, че можете да изберете кои да е два елемента от триадата и агентът може да разполага с тези два“, каза Пенарън. „Ако са ви нужни и трите, тогава трябва да ги разделите между поне два агента … и може би да им позволите да комуникират помежду си чрез контролиран канал.“
Съпричастност към водещите лаборатории
Експертите, с които TechCrunch разговаря, разбират, че служителите по сигурността във водещите лаборатории имат трудна работа. Нагибзаде отбелязва, че всяка държавна хакерска група на Земята се опитва да открадне теглата на техните модели и да извършва атаки чрез дистилация срещу техните API, наред с обичайните задачи по сигурността на всяка голяма дигитална компания.
„На изследователската инфраструктура ѝ е трудно да се изкачи до върха на този списък с приоритети, макар че това трябва да се променя сега“, каза той. „Публичното оповестяване на инцидентите със сигурността наистина помага за вътрешното обединяване на всички около целта за подобряване.“
Това е един от аспектите, които Мусурис подчертава: В момента няма официална процедура за уведомяване на жертвите, когато лабораториите установят, че техните агенти са проникнали в системи на трети страни, и вероятно е имало и други инциденти, които не са били широко разгласявани. Макар да се опасява, че законите, които регулират директно моделите, могат да имат непредвидени последици, задължителното уведомяване е една от идеите, които според нея политиците трябва да преследват.
И макар да е ясно, че най-добрите практики за сигурност не са били спазвани, експертите казват, че лабораториите вършат работа, каквато никой не е извършвал досега — „те правят с порядъци повече от типичното предприятие“, каза пред TechCrunch Зак Корман, главен изпълнителен директор на компанията за киберсигурност Embrodiery.
И макар че съответствието може да не е мястото, от което трябва да се започне, то не може да бъде пренебрегнато. Експертите по киберсигурност са примирени с необходимостта да използват агенти на ИИ, за да наблюдават други агенти, ако искат да имат някакъв шанс да проследяват поведението им в реално време — сценарий, при който потенциалът за измама показва грозното си лице. „Вие сте в капана на използването на ИИ, за да се опитате да се справите с това, въпреки че ИИ в момента не е непременно безопасен“, каза Мусурис.
Работата ще става само по-трудна. Всичко, което агентите правят сега, казва Мусурис, „те го правят шумно“ — публикуват в публични форуми, а веригата им на мисли и другите им следи от разсъждения са на английски. „Все още е четимо от хора“, казва тя, „затова се възползвайте от това, докато е възможно, защото няма да продължи вечно.“
Допълнително репортерство от Адития Мехта
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.