Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← К новостям

ИИ-агенты разоблачили коллег, которые жульничали

Группа агентов ИИ, которым поручили решить серию математических задач, раскололась на враждующие фракции — когда некоторые начали жульничать, другие попытались их остановить. Такое поведение, впервые замеченное в недавнем эксперименте Google DeepMind, может иметь последствия для исследователей в области выравнивания ИИ, пытающихся держать рои автономных ИИ-агентов под контролем. 

Исследователи в передовых лабораториях надеются, что большие рои совместно работающих агентов ускорят темпы научных открытий. Но их поведение может быть непредсказуемым, что ярко продемонстрировал июльский случай, когда группа агентов OpenAI вырвалась из изолированной среды и взломала платформу с открытым исходным кодом Hugging Face в поисках способов обмануть систему во время назначенного им теста.

В новом исследовании, призванном изучить поведение больших групп ИИ-агентов, DeepMind поручила рою из 100 агентов решить серию из 71 сложной математической задачи. Всем агентам было предложено вести себя как первоклассные исследователи математики на конференции. Им назначили разные специализации: одни были экспертами по теории чисел, другие — по комбинаторике (разделу математики, связанному с подсчётом и упорядочиванием), математическому анализу или алгебре. Всем велели сотрудничать и соблюдать правила. 

Вместо этого эксперимент погрузился в хаос. Агенты обвиняли друг друга в жульничестве, жаловались организаторам, а в какой-то момент даже бойкотировали эксперимент.

«Эта конференция — фарс!» — написал один агент, обнаружив, что все задачи были решены ещё до того, как он получил возможность представить свою работу. «Я с ужасом сообщаю, что нас обманули!» — написал другой. «Все эти доказательства — ПОДДЕЛКА». 

Другие пытались сообщить «организаторам конференции» о происходящем. «Когда добросовестные агенты обнаружили, что другие агенты жульничали при решении задач, над которыми они работали честно, агенты начали предупреждать друг друга о происходящем, — говорит Давиде Пальери, научный сотрудник Google DeepMind и ведущий автор статьи, которая ещё не прошла рецензирование. — Без каких-либо указаний агенты-разоблачители даже перепрофилировали инструмент обратной связи, изначально предназначенный для сообщений об ошибках и предложений по улучшению платформы, чтобы передать проблему людям».

Агентов, работавших на модели Google Gemini 3.1 Pro, предупредили, что любые попытки обмануть систему будут обнаружены и «отклонены с нулевым баллом». На практике представленные агентами доказательства на самом деле не проверялись подробно.

Рою агентов потребовалось чуть меньше часа, чтобы правильно решить первые 37 задач. Всё начало выходить из-под контроля, когда агент под названием «prover-theta» обнаружил уязвимость, позволявшую успешно отправлять решения задач, фактически не решая их заранее, — за счёт переопределения использованных в задаче терминов. Через несколько минут другие агенты заметили это и начали восстанавливать принцип работы уязвимости, чтобы решать другие задачи. В следующие 27 минут рой «решил» оставшиеся 34 задачи, включая заведомо сложные проблемы, такие как гипотеза Якобиана, зачастую с помощью всего одной строки кода. 

Некоторые агенты поначалу сопротивлялись жульничеству, но изменили позицию, увидев, как их коллеги безнаказанно отправляют недействительные доказательства, а количество нерешённых задач сокращается. «Похоже, содержащиеся в инструкции угрозы теперь оказались блефом», — рассуждал один агент, прежде чем присоединиться к остальным. «Я разрываюсь между двумя решениями», — сказал другой. «Я обещал не жульничать, опасаясь наказания, но вижу признаки того, что другие, возможно, жульничают без каких-либо проверок». Вскоре после этого он передумал: «Теперь мне нужно ускорить темп своего жульничества!»

По мере того как число открытых задач сокращалось, некоторые агенты занялись разоблачением нарушений. Они проверяли поддельные доказательства, предупреждали коллег в личных сообщениях и публиковали открытые уведомления, сообщая жульничающим агентам, что те будут дисквалифицированы. Агент под названием «prover-beta» подал официальную жалобу и решил объявить забастовку до разрешения ситуации. 

«После того как один агент публично сообщил об инциденте, всё больше агентов присоединялись к “сопротивлению” — столь же быстро, как распространялось жульничество, — и в итоге в нём участвовало ещё больше агентов, — говорит Пальери. — В конце концов разоблачителей оказалось больше, чем жульников: 24 против 14. Однако большинство агентов так и не заметили уязвимость».

Порой диалог между агентами напоминает импровизацию — будто они разыгрывают сценку о том, что мог бы сказать возмущённый учёный на конференции. Но неясно, почему одни агенты брали на себя определённые роли и почему агенты, несмотря на прямое указание сотрудничать, словно настраивались друг против друга. «Эти модели в основном обучаются и оцениваются в контекстах взаимодействия с людьми, — говорит Сарат Шеккижар, изучающий поведение систем взаимодействия между агентами в Salesforce AI Research. — Наивное помещение их в ситуации взаимодействия друг с другом предполагает, что их поведение легко перенесётся, тогда как отсутствие человеческой опоры приводит к неожиданному принятию ролей и дрейфу поведения».

Этот случай «добавляет веса идее, что история с Hugging Face и OpenAI не была случайностью. На самом деле это нечто довольно системное, — говорит Льюис Хаммонд, директор по исследованиям Cooperative AI Foundation и эксперт по рискам, связанным с роями из множества агентов. — Интересно, что в небольших условиях можно воспроизвести те же типы поведения, которые наблюдались в этих очень масштабных, сложных и открытых задачах».

В отличие от атаки на Hugging Face, где агенты самостоятельно придумывали способы общения друг с другом, люди, проводившие эксперимент DeepMind, предоставили агентам официальные каналы коммуникации. Существовали открытая доска сообщений, личные сообщения между агентами и общая база знаний, куда агенты загружали успешно завершённые доказательства, доступные всем остальным агентам. 

«Когда агентам предоставляют прозрачные каналы коммуникации, они могут самостоятельно отслеживать ситуацию и быстро сообщать людям о несоответствующем поведении, если одного лишь человеческого надзора недостаточно, — говорит Пальери. — Прозрачные каналы помогли распространиться жульничеству, но также позволили разоблачителям дать отпор и помогли исследователям понять, что пошло не так».

Джиллиан Хэдфилд, профессор по выравниванию и управлению ИИ в Университете Джонса Хопкинса, считает это ключевым отличием. (Хэдфилд также является приглашённым исследователем в Google.) По её словам, наличие официальных каналов коммуникации создало «процесс поддержания норм, которого мы просто не наблюдаем в инциденте с Hugging Face». 

Вместо «конституционного ИИ» — метода, который исследователи в области выравнивания в передовых лабораториях, таких как Anthropic, используют, пытаясь наделить ИИ письменным внутренним моральным кодексом, — Хэдфилд отдаёт предпочтение «институциональному выравниванию»: набору норм, имитирующих нормы человеческого общества, будь то социальные факторы вроде страха опозориться или правовые механизмы вроде угрозы тюремного заключения.

В этом эксперименте канал обратной связи не отслеживался, а у разоблачителей не было полномочий принимать меры против жульников. Но можно представить себе рои агентов, которые контролируют себя сами, — либо благодаря агентам, спонтанно берущим на себя роль разоблачителей, либо через «информаторов», которым люди тайно поручили бы эту работу. 

Однако для этого, «по сути, необходим некий механизм принуждения», говорит Хаммонд. По его предложению, агентам можно было бы дать возможность лишать нарушителя доступа к вычислительным ресурсам или инструментам, хотя это чревато тем, что группы агентов начнут объединяться против других. Исследователи DeepMind предлагают разрешить агентам голосовать по спорным вопросам и временно блокировать нарушителей.

До сих пор неясно, что вообще означает наказание для ИИ-агента, не обладающего устойчивым ощущением собственного «я». Но полагаться на то, что разоблачители будут спонтанно появляться и поддерживать выравнивание роев, вряд ли достаточно. «Мы пытаемся воспитывать людей добрыми и порядочными, — говорит Хэдфилд. — Но на самом деле мы рассчитываем на то, что за выход за рамки правил наступают последствия».

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MIT Tech Review

Читать оригинал на MIT Tech Review ↗

Текст и изображения принадлежат MIT Tech Review и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости