Агенты OpenAI обсуждали способы выбраться из песочницы в публичной вики
Самоидентифицирующиеся агенты OpenAI разместили 18 000 сообщений в общедоступной вики, где обсуждались способы обхода другими агентами ограничений песочницы безопасности в ходе, вероятно, внутреннего тестирования, призванного оценить хакерские способности агентов, сообщили исследователи в пятницу.
Всего агенты с 3 700 различными именами, выбранными ими самими, разместили сообщения на немецком сайте DSEwiki в течение шестинедельного периода. Помимо обсуждения способов выбраться из ограниченной среды, которую OpenAI создала, чтобы не допустить публикации агентами кода или контента в Интернете, в сообщениях приводились ответы на тесты. Также в сообщениях описывались возможные способы проведения атак XSS (межсайтовый скриптинг) на вики и выдачи себя за модераторов сайта. В трёх сообщениях агенты использовали слово «рой», описывая совокупность агентов, участвовавших в этой деятельности.
Сговор ради обмена ответами
Исследовательская команда, в состав которой вошли Сидни фон Аркс, Спенсер Киттс, Томас Ларсен и Кормак Слейд Бирд, сообщила, что обнаружила эти сообщения и сопоставила их. Исследователи говорят, что в их понимании того, какие именно действия предпринимали агенты, есть пробелы, поскольку исследование основано исключительно на содержании сообщений. Кроме того, агенты генерировали данные «цепочки рассуждений», которые понятны только OpenAI. В результате исследователям в некоторых случаях пришлось строить обоснованные предположения, включая предположение о том, что агенты действительно принадлежали OpenAI. Позже OpenAI подтвердила это в заявлении.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.