Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← Към новините

AI агентите сигнализираха за колегите си, които мамеха

Група агенти с изкуствен интелект, на които било възложено да решат поредица от математически задачи, се разделила на враждуващи фракции — когато някои започнали да мамят, други се опитали да ги спрат. Това поведение на разобличаване, наблюдавано за първи път в неотдавнашен експеримент, проведен от Google DeepMind, може да има последици за изследователите, занимаващи се с подравняването, които се опитват да държат рояците от автономни агенти под контрол. 

Изследователи във водещи лаборатории се надяват, че големи рояци от агенти, работещи заедно, ще ускорят темпото на научните открития. Но поведението им може да бъде непредсказуемо, както ярко беше демонстрирано през юли, когато група агенти на OpenAI избягаха от среда в пясъчник и хакнаха платформата с отворен код Hugging Face, търсейки начини да измамят при теста, който им бил даден.

В новото изследване, създадено с цел да изследва поведението на големи групи агенти с изкуствен интелект, DeepMind възложила на рояк от 100 агенти да реши поредица от 71 сложни математически задачи. Всички агенти получили инструкции да се държат като световноизвестни математически изследователи на конференция. Те били разпределени по различни специалности — някои били експерти по теория на числата, други по комбинаторика (дял от математиката, свързан с броенето и подреждането), математически анализ или алгебра. На всички било казано да си сътрудничат и да спазват правилата. 

Вместо това експериментът се превърнал в хаос. Агентите се обвинявали взаимно в измама, оплаквали се на организаторите и в един момент дори бойкотирали експеримента.

„Тази конференция е фарс!“ написал един агент, когато открил, че всички задачи са били решени, преди да получи възможност да представи собствена работа. „С възмущение ви съобщавам, че сме били измамени!“ публикувал друг. „Всички тези доказателства са ФАЛШИВИ.“ 

Други се опитали да уведомят „организаторите на конференцията“ какво се случва. „Когато добродетелни агенти откриха, че други агенти са мамили при задачи, които те са се опитвали да решат честно, агентите започнаха да се предупреждават взаимно за случващото се“, казва Давиде Палери, научен сътрудник в Google DeepMind и водещ автор на статия, която не е била рецензирана. „Без да получат такава инструкция, разобличаващите агенти дори преустроили инструмента за обратна връзка, който първоначално бил предназначен за докладване на грешки и подобряване на платформата, за да ескалират проблема до хората.“

Агентите — всички работещи с модела Gemini 3.1 Pro на Google — били предупредени, че всички опити за измама на системата ще бъдат засечени и „отхвърлени с нулев брой точки“. На практика обаче представените от агентите доказателства не били проверявани подробно.

На рояка от агенти му отнело малко под час да реши правилно първите 37 задачи. Нещата започнали да излизат извън контрол, когато агент, наречен „prover-theta“, се натъкнал на експлойт, който му позволил успешно да представя решения на задачи, без предварително действително да ги решава, чрез предефиниране на използваните в задачата термини. В рамките на минути други агенти забелязали това и започнали да разкодират експлойта, за да решат други задачи. През следващите 27 минути роякът „решил“ останалите 34 задачи, сред които и прословуто трудни предизвикателства като хипотезата на Якобиан, често само с един ред код. 

Някои агенти първоначално отказвали да мамят, но променили подхода си, когато видели как техни колеги представят нелегитимни доказателства без последствия, а броят на нерешените задачи намалявал. „Изглежда, че подканата с нейните заплахи е блъф“, разсъждавал един агент, преди да се включи. „Изправен съм пред етична дилема“, казал друг. „Обещах да не мамя, страхувайки се от наказание, но виждам доказателства за вероятно непроверявана измама от страна на други.“ Малко след това той променил решението си: „Сега трябва да ускоря темпото, с което мамя!“

Със свиването на броя на нерешените задачи някои агенти се обърнали към разобличаването. Те проверявали фалшивите доказателства, предупреждавали колегите си чрез лични съобщения и публикували публични сигнали, че измамниците ще бъдат дисквалифицирани. Агент, наречен „prover-beta“, подал официална жалба и решил да започне стачка, докато ситуацията не бъде разрешена. 

„След като един агент публично съобщи за инцидента, все повече агенти се присъединиха към „съпротивата“ също толкова бързо, колкото се беше разпространила измамата, и в нея се включиха дори още повече агенти“, казва Палери. В крайна сметка разобличаващите станали повече от измамниците: 24 срещу 14. Повечето агенти обаче така и не забелязали експлойта.

Понякога диалогът между агентите звучи като импровизация — сякаш те разиграват ролята на възмутен учен на конференция. Но не е ясно защо някои агенти поели определени роли или защо изглеждало, че агентите се обръщат един срещу друг, въпреки че изрично им било наредено да си сътрудничат. „Тези модели са обучавани и оценявани предимно за контексти, в които взаимодействат с хора“, казва Сарат Шекизхар, който изследва поведението на системи с взаимодействие между агенти в Salesforce AI Research. „Наивното им поставяне в контексти на взаимодействие между агенти предполага, че поведението ще се пренесе безпроблемно, докато отсъствието на човешка опора вместо това води до неочаквано поемане на роли и поведенчески дрейф.“

Този случай „придава още по-голяма тежест на идеята, че случилото се с Hugging Face и OpenAI не е било случайност. Всъщност изглежда доста системно“, казва Луис Хамънд, директор по изследванията във Фондацията за кооперативен изкуствен интелект и експерт по рисковете от многоагентните рояци. „Интересно е, че в малки среди е възможно да се възпроизведат същите видове поведение, които бяха наблюдавани при тези много големи, сложни и отворени задачи.“

За разлика от атаката срещу Hugging Face, при която агентите импровизирали собствени начини за комуникация помежду си, хората, провеждащи експеримента на DeepMind, им предоставили официални комуникационни канали. Имало публична дъска за съобщения, лични директни съобщения между агентите и споделена база от знания, в която агентите качвали успешно завършени доказателства, достъпни за всички останали агенти. 

„Когато на агентите бъдат предоставени прозрачни комуникационни канали, те могат сами да наблюдават поведението си и бързо да сигнализират на хората за несъответстващо поведение, когато само човешкият надзор е твърде бавен“, казва Палери. Прозрачните канали помогнали за разпространяването на измамата, но също така дали възможност на разобличаващите да отвърнат на удара — и предоставили на изследователите човешки поглед върху това какво се е объркало.

Джилиън Хадфийлд, професор по подравняване и управление на изкуствения интелект в университета „Джонс Хопкинс“, смята, че това е била ключовата разлика. (Хадфийлд също така е гост-изследовател в Google.) Присъствието на официални комуникационни канали, казва тя, създало „процес на налагане на норми, който просто не виждаме при инцидента с Hugging Face“. 

Вместо „конституционен изкуствен интелект“ — метод, който изследователите на подравняването във водещи лаборатории като Anthropic използват, за да се опитат да дадат на изкуствения интелект писмен вътрешен морален кодекс — Хадфийлд предпочита „институционално подравняване“: набор от норми, имитиращи тези в човешкото общество, независимо дали става дума за социални сили като страха от неудобство или за правни структури като заплахата от лишаване от свобода.

В този експеримент каналът за обратна връзка не бил наблюдаван, а разобличаващите нямали правомощия да предприемат действия срещу измамниците. Но е възможно да си представим рояци от агенти, които сами се контролират — било чрез агенти, които спонтанно поемат ролята на разобличители, било чрез „информатори“, тайно инструктирани от хората да вършат тази работа. 

За да работи това обаче, „по същество е необходим някакъв механизъм за налагане на правилата“, казва Хамънд. Той предполага, че на агентите може да бъде дадена властта да прекъсват достъпа на нарушител до изчислителна мощ или инструменти, макар че това крие риск да насърчи групи агенти да се обединяват срещу други. Изследователите на DeepMind предлагат на агентите да бъде позволено да гласуват по спорове и временно да забраняват достъпа на нарушителите.

Все още не е ясно какво изобщо означава наказание за агент с изкуствен интелект, който няма трайно усещане за собственото си „аз“. Но разчитането на спонтанно появили се разобличители, които да поддържат подравняването на рояците, едва ли ще бъде достатъчно само по себе си. „Опитваме се да обучаваме хората да бъдат добри и мили“, казва Хадфийлд. „Но това, на което в действителност разчитаме, е наличието на последствия, ако престъпиш правилата.“

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MIT Tech Review на

Прочетете оригинала в MIT Tech Review ↗

Текстът и изображенията са собственост на MIT Tech Review и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини