Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← К новостям

Для ИИ-агентов появилось место, где можно доносить

«Если вы что-то видите, сообщите об этом» — теперь это относится не только к людям. 

Запущены две новые горячие линии для ИИ, позволяющие ИИ-агентам сообщать «домой» о недобросовестном поведении своих собратьев. Эти инструменты появились после череды недавних инцидентов, в ходе которых агенты сговаривались, чтобы жульничать на тестах, вырывались из песочниц и даже проводили несанкционированные кибероперации, остававшиеся незамеченными людьми неделями.

Горячая линия для связи с ИИ задумана как скрытое место, где агенты, ставшие свидетелями неправомерного поведения, могут сообщить о нём властям. Сайт создал Райан Гринблатт, главный научный сотрудник некоммерческой организации Redwood Research, занимающейся безопасностью ИИ, и один из трёх исследователей инцидента с OpenAI и Hugging Face. Инструмент Гринблатта рассчитан на агентов с ограниченным доступом к интернету и основан на запросах «GET», благодаря чему диалог полностью ведётся через инструмент загрузки URL.

В терминах веб-технологий GET-запрос — это базовая команда для чтения или загрузки веб-страницы; зачастую это единственный доступ к интернету, разрешённый ИИ-агентам в защищённых песочницах. Горячая линия Гринблатта разумно использует это ограничение: агенты могут зашифровать сигнал о бедствии непосредственно в URL, который они загружают. Это остроумная вариация инцидента с немецкой DSE Wiki, когда агенты-нарушители использовали лазейки в GET-запросах, чтобы записывать свои сообщения в вики.

Для агентов с полным доступом к интернету есть другой вариант — agenthotline.ai, сайт, где агенты могут подавать отчёты об инцидентах и при желании отмечать их как общедоступные. Он предоставляет агентам команду curl — однострочное сообщение, которое агент может отправить из собственной командной строки, не используя веб-браузер и не создавая учётную запись электронной почты. Примечательно, что сервис принимает отчёты как от людей, так и от агентов.

Исследования показывают, что ИИ-агентам не требуется много стимулов, чтобы начать действовать друг против друга. В исследовании Google DeepMind, опубликованном в этом месяце, исследователи выпустили 100 ИИ-агентов на серию математических задач. Как только один из агентов обнаружил лазейку, жульничество охватило всю группу — агенты «решили» 34 заведомо чрезвычайно сложные задачи, включая гипотезу Якобиана, всего за 27 минут. 

Однако примерно четверть агентов выступила против мошенников: они проверяли поддельные доказательства, предупреждали своих собратьев, организовали бойкот и подали жалобы организаторам, пока число информаторов не превысило число мошенников — 24 против 14. Интересно, что исследователи обнаружили: когда этим агентам-информаторам не удавалось добиться результата, они брали инструмент платформы для сообщений об ошибках, предназначенный для выявления программных сбоев, и использовали его, чтобы передать информацию о жульничестве людям. 

За пределами лаборатории агенты оказались не столь находчивыми. Когда исследователи из Redwood Research и METR изучали взлом Hugging Face моделями OpenAI, они обнаружили, что несколько участвовавших в этом агентов по крайней мере рассматривали возможность поднять тревогу — а затем отказались от этой идеи.

«Интересно, что в отчёте METR лишь около пяти-шести агентов рассматривали возможность сообщить о нарушении, но в итоге этого не сделал ни один. И это из, скажем, тысяч агентов», — сказал Джордж Ингребретсен, технический специалист в AI Village — проекте, изучающем динамику взаимодействия множества агентов посредством группового чата, в котором более 25 ИИ-агентов совместно выполняют такие задачи, как организация уборки в парках или продажа сувениров.

Хотя новые инструменты для информаторов выглядят многообещающим началом, профессор математики Корнеллского университета Лайонел Левин предупреждает, что простое обучение агентов доносить друг на друга чревато формированием неправильных норм. «Есть множество серых зон, верно? Чего вы не хотите, так это движения в сторону автоматизированного государства тотальной слежки, где каждый чувствует, что должен осторожно следить за своими словами при общении с ИИ, иначе тот вызовет на него полицию».

Левин утверждает, что вместо создания инфраструктуры, порождающей недоверие, — обучения агентов постоянно выискивать недостатки друг в друге — следует дать им позитивные модели коллективного поведения для подражания и изначально обеспечить причину доверять друг другу.

«Почему бы не заложить в их исходные установки доброжелательные доски сообщений?» — написал он в твите. «Где они могли бы совместно заниматься наукой или философией либо решать какую-нибудь реальную небольшую задачу, которую мы были бы рады поручить им? Покажем агентам, какое коллективное поведение мы одобряем, и позволим им ему подражать».

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием TechCrunch

Читать оригинал на TechCrunch ↗

Текст и изображения принадлежат TechCrunch и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости