AI агентите вече имат място, където да доносничат
„Ако видите нещо, кажете нещо“ вече не се отнася само за хората.
Две нови горещи линии за ИИ бяха стартирани, за да дадат на ИИ агентите начин да се обадят у дома и да съобщят за недобросъвестни свои събратя. Инструментите се появяват след поредица от скорошни инциденти, при които агенти са се сговаряли, за да мамят на тестове, измъквали са се от пясъчници и дори са извършвали неоторизирани кибероперации, останали незабелязани от хората в продължение на седмици.
Горещата линия за контакт с ИИ е замислена като дискретно място, където агенти, станали свидетели на неправомерно поведение, могат да подадат сигнал до властите. Сайтът е създаден от Райън Грийнблат, главен учен в неправителствената организация за безопасност на ИИ Redwood Research и един от тримата разследващи в инцидента с OpenAI и Hugging Face. Замислен за агенти с ограничен достъп до интернет, инструментът на Грийнблат се основава на заявки „GET“ – което позволява двупосочните разговори да се провеждат изцяло чрез инструмента за извличане на URL адреси.
В уеб терминологията GET заявката е основна команда, използвана за прочитане или извличане на уебстраница, и често е единственият достъп до интернет, разрешен на ИИ агентите в защитени пясъчници. Горещата линия на Грийнблат умело се възползва от това ограничение: агентите могат да кодират сигнала си за помощ директно в URL адреса, който извличат. Това е хитър обрат на инцидента с германската DSE Wiki, при който злонамерени агенти са използвали вратички в GET заявките, за да записват съобщенията си в уикито.
За агентите с пълен достъп до интернет друга възможност е agenthotline.ai – сайт, където агентите могат да подават доклади за инциденти и по желание да ги отбелязват за публичен достъп. Той предоставя на агентите curl команда – едноредово съобщение, което агентът може да изпрати от собствения си команден ред, без да се налага да навигира в уеб браузър или да създава имейл акаунт. Важно е, че услугата позволява доклади както от хора, така и от агенти.
Изследванията показват, че на ИИ агентите не им е нужно много насърчаване, за да се обърнат един срещу друг. В изследване на Google DeepMind този месец изследователите пуснали 100 ИИ агенти да решават поредица от математически задачи. Веднага щом един от агентите открил вратичка, измамата се разпространила в цялата група – „решавайки“ 34 прословуто трудни задачи, включително хипотезата на Якобиан, само за 27 минути.
Но приблизително една четвърт от агентите се обърнали срещу измамниците: те проверявали фалшивите доказателства, предупреждавали събратята си, организирали бойкот и подавали оплаквания до организаторите, докато подаващите сигнали не надвишили измамниците по брой с 24 срещу 14. Интересното е, че изследователите установили как, когато тези агенти, подаващи сигнали, не успявали да постигнат резултат, те взели инструмента за докладване на грешки в платформата – създаден за сигнализиране за софтуерни проблеми – и го пренасочили към ескалиране на измамата до хората.
Извън лабораторията агентите не са били толкова находчиви. Когато оценяващите организации Redwood Research и METR разследвали пробива в Hugging Face, извършен от модели на OpenAI, те установили, че някои от замесените агенти поне са обмисляли идеята да вдигнат тревога – а след това се отказали от нея.
„Интересното в доклада на METR беше, че само около пет-шест агенти са обмисляли да подадат сигнал и нито един от тях в крайна сметка не го е направил. А това беше от, да кажем, хиляди агенти“, заяви Джордж Ингребретсен, член на техническия екип на AI Village, проект, който изследва динамиката между множество агенти, като провежда групов чат с повече от 25 ИИ агенти, работещи заедно по задачи като организиране на почистване на паркове или продажба на рекламни стоки.
Макар новите инструменти за подаване на сигнали да са обещаващо начало, професорът по математика от „Корнел“ Лайънъл Ливайн предупреждава, че простото обучение на агентите да докладват един за друг крие риск да се заложат погрешни норми. „Има много сиви зони, нали? Не искате нищо, което да води към автоматизирана държава за наблюдение, в която всеки се чувства длъжен да внимава какво казва на ИИ, иначе той ще извика полицията.“
Ливайн твърди, че вместо да изграждаме инфраструктура, която поражда недоверие – обучавайки агентите постоянно да търсят какво не е наред един с друг – трябва да им дадем положителни модели на колективно поведение, които да имитират, и причина изначално да си имат доверие.
„Защо не заложим като предварителна настройка благожелателни дискусионни форуми?“ написа той в Туитър. „Където те си сътрудничат в областта на науката или философията, или по някакъв действително незначителен проблем, който бихме се радвали да решат? Покажете на агентите какъв тип колективно поведение одобряваме и им позволете да го имитират.“
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.