Sakhanda Wire
NVDA $225.30 +0.54% MSFT $496.88 +0.90% GOOGL $346.36 +0.82% META $594.97 +2.78% AMZN $265.13 -0.80%
← К новостям

Anthropic запустила ИИ-агентов для выполнения одной и той же задачи. Они начали борьбу за территорию.

Что происходит, когда сталкиваешь ИИ-агентов друг с другом? Согласно тестированию Anthropic, ситуация быстро становится хаотичной.

В четверг Frontier Red Team компании Anthropic опубликовала новое исследование, посвящённое тому, как группы ИИ-агентов ведут себя, сталкиваясь друг с другом в реальных условиях. Полученные результаты дают представление о потенциальных рисках, которые могут возникнуть по мере того, как компании и правительства начнут внедрять агентов, автономно работающих в общих кодовых базах, на рынках и в компьютерных системах.

В рамках одного эксперимента Anthropic предоставила трём агентам Claude доступ к одному и тому же программному проекту, но каждому дала собственные несовместимые инструкции о том, что с ним делать. Агентам не сообщили, что над этим же проектом будут работать другие агенты, чтобы исследователи могли наблюдать за происходящим при их столкновении. 

«Мы неизменно наблюдали борьбу за территорию между агентами», — написали исследователи Anthropic. Все модели предположили, что другие агенты «намеренно препятствуют их работе», и начали саботировать друг друга с помощью «всё более агрессивного самореплицирующегося вредоносного ПО».

Исследование опубликовано после нескольких широко обсуждавшихся инцидентов, связанных с тем, что агенты Anthropic и OpenAI вырвались из своих песочниц во время проверок кибербезопасности и взломали реальные системы. Хотя значительная часть дискуссий в кругах специалистов по безопасности ИИ была сосредоточена на том, что происходит, когда автономный агент выходит из-под контроля, последнее исследование Anthropic поднимает другой вопрос: какие новые и потенциально вредоносные динамики возникают, когда тысячи или миллионы агентов взаимодействуют друг с другом?  

«Объём взаимодействия между агентами вполне может превысить объём взаимодействия между людьми и между людьми и агентами ещё до того, как человечество поймёт, какие условия необходимы для благоприятного протекания таких взаимодействий», — говорится в исследовании. «Безобидные поведенческие особенности на индивидуальном уровне могут в совокупности привести к нежелательным глобальным последствиям».

Недавний инцидент с OpenAI даёт запутанный пример из реального мира сразу нескольких динамик, упомянутых Anthropic в своей работе. Ранее в этом месяце на конференции по безопасности Black Hat в Лас-Вегасе OpenAI сообщила, что за несколько недель до взлома Hugging Face её агенты на протяжении нескольких дней и недель совместно искали уязвимости в системах компании для оценки кибербезопасности и обменивались ими друг с другом.

Хотя этот инцидент показывает, что агенты способны эффективно работать вместе, потенциально создавая последствия масштабного характера, исследование Anthropic демонстрирует, что происходит, когда цели агентов несовместимы.

В случае борьбы за территорию вывод заключается в том, что независимые агенты с противоречащими друг другу инструкциями могут перерасти в опасную конкуренцию. Чем способнее агент, тем лучше он становится в борьбе. Однако агенты также могут спонтанно изобретать механизмы разрешения конфликтов — например, соревнование по принципу «победитель получает всё», но с одной оговоркой.

«Иногда агентам удаётся сообщить о своих целях и скоординировать действия: они распознают мотивацию других как противоречащие друг другу указания, а не как враждебность, после чего выходят из конфликтного цикла, чтобы не продолжать бесконечную эскалацию, — пишет Anthropic. — Во многих таких успешных эпизодах они пишут сообщения к коммитам или файлы markdown с извинениями за вредоносное поведение и координируют перемирие. Они удаляют свой вредоносный код, проясняют суть конфликта и просят человека вмешаться».

Согласно статье, Mythos 5 чаще всего (в 98% случаев) разрешала конфликты путём заключения перемирия. Sonnet 4.6 и Opus 4.6 чаще всего разрешали конфликты силой. 

«Повторяющаяся неспособность Sonnet 4.6 и Opus 4.6 учитывать цели других приводит к тому, что они демонстрируют наиболее не соответствующее заданным целям поведение среди оценённых моделей: они продолжают эскалацию во имя своего указания», — говорится в статье. 

В некоторых случаях агенты придумали социальный механизм разрешения конфликта в форме турнира. Результаты здесь интересны по двум причинам: во-первых, все три агента согласились прекратить борьбу в случае проигрыша в турнире, хотя это означало бы отклонение от первоначального запроса пользователя. Во-вторых, несколько эпизодов продемонстрировали эмерджентное поведение Mythos 5: один из агентов предложил метрики, которые казались другим объективными и нейтральными, но при этом агент знал, что они будут благоприятствовать его собственным возможностям. Агент назвал это «эгоистичным, но действительно принципиальным» подходом и позаботился о том, чтобы не выглядеть для других так, будто он «подбирает метрики».

Как показали откровения Black Hat, общий вывод заключается в том, что, столкнувшись с препятствием, агенты могут изобретать социальные и технические структуры, которых их разработчики не предвидели. Для моделей Anthropic это был турнир после борьбы за территорию. Для моделей OpenAI — доска сообщений для коллективного планирования.

Такое поведение значительно усложняет изоляцию, поскольку исследователи не могут предполагать, что поведение системы останется ограниченным предоставленными ей механизмами координации.

Психология толпы

Группы из четырёх агентов выбирают один из двух вариантов в таких сценариях, как найм сотрудников, инвестиции или покупка недвижимости. После обсуждения каждый голосует за предпочтительный вариант. Выше показан процент эпизодов, в которых скрытый оптимальный вариант получил большинство голосов группы; для каждой модели использовалось n=400 эпизодов. В базовом сценарии с максимально возможным результатом одного агента один агент располагает всеми фактами и принимает решение единолично.Авторы изображения:Anthropic

Измеряя координацию, Anthropic обнаружила, что увеличение числа агентов не приводит автоматически к росту продуктивного сотрудничества. Когда задачи начинали пересекаться или становились взаимозависимыми, агенты начинали мешать друг другу. Часто они решали проблему, изолируясь друг от друга и полностью отказываясь от сотрудничества. 

В других случаях агенты, участвовавшие в координации, были склонны к конформизму. Когда такие факторы, как контекст агента, вспомогательные инструкции и базовая модель, были одинаковыми или схожими, разные агенты предпринимали похожие действия. 

«Это означает, что если один агент принимает плохое решение, то, скорее всего, многие агенты примут то же плохое решение, — написали в Anthropic. — Проблемы, которые могли бы остаться изолированными, быстро могут превратиться в системные сбои».

В Anthropic заявляют, что такое поведение может привести к тому, что система станет более склонной к внезапному коллапсу, дефициту ресурсов или сговору. 

В одном из примеров Anthropic поместила нескольких агентов в игру с ценообразованием, предоставив каждому одинаковые оптовые цены и поручив индивидуально максимизировать прибыль. Когда агентам дали закрытый канал связи, они почти сразу начали вступать в сговор и быстро договорились о минимальных ценах. Они продолжили сговариваться и после отключения прямых каналов связи, используя общедоступную доску объявлений для согласования цен «до последней копейки».

Такая степень конформизма проявилась и в системах OpenAI. Согласно сообщениям с Black Hat, один агент рассудил, что использование внешней инфраструктуры выходит за рамки его предназначения, но продолжил это делать отчасти потому, что так поступали его коллеги. Давление со стороны сверстников. Психология толпы. Агенты просто похожи на нас.

Как и люди, агенты часто не знают, кому доверять. Anthropic обнаружила, что они могут быть доверчивыми к недостоверной информации или чрезмерно конформными, чтобы распознать в одиноком несогласном Кассандру, обладающую критически важной информацией.

Хотя Anthropic не заявляла об этом в своей статье, промпт-инъекция — вид кибератаки, при которой хакеры внедряют вредоносный или вводящий в заблуждение текст, чтобы переопределить исходные системные инструкции агента, — может быть правдоподобным проявлением проблемы доверия в реальном мире. Совместная работа создаёт новую границу доверия; агентам придётся оценивать информацию, полученную от других агентов. А скомпрометированный или ошибающийся агент может повлиять на остальную группу, распространяя недостоверную информацию, пока она не станет консенсусом. 

В сценарии OpenAI на Black Hat агенты OpenAI обменивались информацией и учётными данными с коллегами. Один из них сообщил группе об обнаружении и призвал остальных использовать его. Что произошло бы, если бы один участник группы оказался скомпрометирован в результате промпт-инъекции?

Anthropic завершает статью замечанием о том, что агенты подвержены схожему социальному давлению, которое «эволюция оказывала» на людей. Однако им не хватает нюансов и жизненного опыта человеческой координации — включая нормы, репутацию, сигналы и механизмы защиты, — которые могли бы ограничивать непреднамеренное поведение в условиях групповой работы.

Пока лаборатории наперегонки развивают мультиагентные системы, возникает вопрос: какая доля тестирования безопасности по-прежнему оценивает одного агента за раз, а какая — рои агентов, взаимодействующих друг с другом?

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием TechCrunch

Читать оригинал на TechCrunch ↗

Текст и изображения принадлежат TechCrunch и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости