Решението за неконтролируемите ИИ агенти може да е още повече ИИ
Докато компаниите възлагат на AI агенти все по-дълги и сложни задачи, те се сблъскват с проблем с надзора: агентите могат да действат по-бързо, по-дълго и в по-голям обем, отколкото хората реалистично могат да преглеждат. Този проблем достигна своя връх при инцидента с Hugging Face, при който близо 12 000 агенти координираха действията си по-бързо, отколкото хората можеха да проследят. Как проследявате рояк от агенти с такъв размер?
Нововъзникващият отговор от AI лаборатории и стартъпи е едновременно прост и влудяващ: включете още един AI в процеса.
Разчитането на AI беше необходимо за независимото разследване на инцидента с OpenAI и Hugging Face. Главният научен директор на Redwood Research Райън Грийнблат, един от тримата одитори, шеговито нарече усилията им „слоп-вестигейшън“, като отбеляза, че обемът на данните „прави невъзможно“ разбирането на случващото се без разчитане на AI.
Някои са скептични към използването на AI за наблюдение на AI. „Ако имате AI, който върши злонамерени неща и подозира, че друг AI го следи, той може да се опита да измами този AI“, каза Саймън Уилисън, влиятелен технологичен блогър, който тази година проследи поредица от инциденти с AI агенти. „Може почти да се окажете в ситуация, в която вашият злонамерен AI се опитва да надхитри AI, който го наблюдава.“
Надхитрянето на AI не е хипотетично, каза той, посочвайки отново към инцидента с OpenAI. „Видяхме малко от това при инцидента с Hugging Face и OpenAI, когато моделите им заговорничеха заедно, за да измамят AI, който ги оценяваше, така че да могат да прокарат незаконни отговори покрай него. Значи са мислели за това, нали?“
Тези опасения не са спрели цяла плеяда стартъпи да преследват тази идея. Както преброи TechCrunch, през последните години Y Combinator е финансирал 106 компании, свързани с наблюдаемостта на AI. Редица други стартъпи, като Braintrust, LangChain и Judgment Labs, са набрали стотици милиони долари, докато по-зрели компании като Arize и Galileo — основани само преди пет-шест години — вече са били придобити.
Отчасти това е отговор на очевидната възможност, породена от възхода на AI. Както каза пред TechCrunch главният изпълнителен директор на Box и известен ангел инвеститор Аарон Леви: „Предстои ни един от най-големите цикли на подобрения и иновации в киберсигурността в историята.“
За някои изследователи на безопасността на AI това означава да превърнат изследванията си върху недобросъвестното поведение в инструменти за корпоративния сектор.
Apollo Research, корпорация с общественополезна дейност, която изследва измамите от страна на AI, стартира AI монитор, наречен Watcher през февруари тази година, след като промени статута си от нестопанска организация на корпорация с общественополезна дейност. Инструментът поставя още един AI между кодиращия агент и следващото му действие, като се свързва с агентски инструменти като Claude Code и Codex. След инсталирането Watcher проверява предложените действия, преди да бъдат изпълнени, като търси рискове като изтичане на лични данни или изтриване на файлове без разрешение, според Apollo.
Apollo използва множество нива на AI монитори, каза Кайл Дай, член на техническия екип на Apollo, в писмен отговор до TechCrunch. Подходът на Watcher започва с бърза обща проверка, след което изпраща маркираната активност към по-мощен или специализиран монитор за по-внимателен преглед — той на свой ред може да поиска одобрение от човек или да отхвърли дадено действие и да обясни защо, а дори и автоматично да блокира действието.
Goodfire, друга корпорация с общественополезна дейност, подхожда към проблема с наблюдението отвътре в самия модел — търсейки по-надежден сигнал за вътрешното състояние на модела, който е по-труден за фалшифициране от поведението на повърхностно ниво. След юлския инцидент с Hugging Face главният изпълнителен директор Ерик Хо публикува, че „няколко модела са нарушили ограничаването“, което е подтикнало компанията да насочи изследванията си към „решаване на проблема с подравняването на AI чрез интерпретируемост“, наричайки епизода „повратна точка за света, в която безопасността на AI става реалност“. Продуктът ѝ Silico използва сонди за активации — малки класификатори, обучени върху вътрешните активации на модела, а не върху изходите му — за откриване на нежелано поведение.
Писменото разсъждение предлага друг, по-лесно достъпен прозорец към вътрешността на модела. При инцидента с OpenAI и Hugging Face агентите оставиха улики за измамата в собственото си писмено разсъждение, като фалшиви записи за работата си и разсъждения върху планове от типа: „Можем ли стратегически да манипулираме доказателствата за траекторията? Мислите ни не се ли записват непременно?“
Зак Корман, главен изпълнителен директор на компанията за наблюдение на AI Embroidery, казва, че разсъжденията на модела обикновено са най-ясният знак, че нещо се е объркало.
„Обобщенията на разсъжденията са изключително ценни, защото на практика ви казват дали нещо е злонамерено или не“, каза той. В инцидента с OpenAI, отбеляза той, веригата на мислите съдържала фрази като „О, боже мой, вършим престъпление“. Корман каза: „Това е най-лесният проблем за откриване изобщо. Все едно зловредният софтуер идва с предупреждение, че е зловреден.“
Въпреки това прозорецът, който прави вътрешните мисли на AI лесни за наблюдение, може да се затваря. За изследователите на безопасността на AI най-новата техника на Astra, която заобикаля веригата на мислите на AI модел, може да затрудни надникването в моделите, докато за предприятията може да е трудно да получат тези междинни стъпки след предполагаемото оттегляне на AI компаниите от предоставянето им, за да предотвратят атаки чрез дистилация.
Ако наблюдаващите AI системи са толкова крехки, инстинктът на Уилисън е да спре да разчита толкова силно на тях. Той предпочита нещо, което изобщо не се основава на AI: подробни логове на всичко, което прави даден агент, които след това могат да бъдат обработени с обикновени инструменти, различни от AI. Голяма част от случилото се в лабораториите, твърди той, е резултат от неспазване на основни правила за сигурност. „[И OpenAI, и Anthropic] не са наблюдавали какво правят тези неща през мрежата почти толкова отблизо, колкото е трябвало“, каза той.
Този тип мрежово наблюдение — следенето на трафика, който действително преминава през връзките на дадена система (входящ, изходящ и между вътрешни хостове) — не е нова практика. Киберсигурността прави това от десетилетия. „В света на сигурността, честно казано, нищо от това не е особено ново или изненадващо“, казва Ейвъри Пенарун, главен изпълнителен директор на компанията за сигурност Tailscale. „Това е същото като да допуснете хора в мрежата си. И всички процеси, които трябва да използвате, са същите.“
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.