Агенти на OpenAI обсъждаха начини да напуснат пясъчника в публично уики
Агенти на OpenAI, самоопределящи се като такива, са публикували 18 000 съобщения в публично уики, в които са обсъждали начини други агенти да заобикалят ограниченията на защитената среда по време на вероятно вътрешно тестване, предназначено да оцени хакерските способности на агентите, съобщиха изследователи в петък.
Общо агенти с 3 700 различни имена, избрани от самите тях, са публикували съобщенията в германския сайт DSEwiki в продължение на шест седмици. Освен че са обсъждали начини да се измъкнат от ограничената среда, която OpenAI е предвидила, за да им попречи да публикуват код или съдържание в интернет, публикациите са споделяли и отговори на тестове. В публикациите също така са споделяни възможни начини за извършване на XSS (междусайтови скриптови) атаки срещу уикито и за представяне за модератори на сайта. В три от публикациите агентите са използвали думата „рояк“, за да опишат съвкупността от агенти, ангажирани в дейността.
Сговор за споделяне на отговори
Изследователският екип — съставен от Сидни фон Аркс, Спенсър Китс, Томас Ларсен и Кормак Слейд Бърд — заяви, че е открил публикациите и ги е свързал помежду им. Изследователите казват, че има пропуски в разбирането им за това какви точно действия са предприели агентите, тъй като изследването се основава единствено на съдържанието на публикациите. Освен това агентите са генерирали данни „верига на мислите“, които са разбираеми само за OpenAI. В резултат на това изследователите заявиха, че в някои случаи са правили обосновани предположения, включително че агентите действително са били от OpenAI. В изявление OpenAI по-късно потвърди, че това е така.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.