Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← До новин

ШІ-агенти викрили колег, які шахраювали

Група агентів ШІ, яким доручили розв’язати серію математичних задач, розкололася на ворогуючі фракції — коли деякі почали шахрувати, інші намагалися їх зупинити. Така поведінка викривачів, уперше помічена в нещодавньому експерименті Google DeepMind, може мати наслідки для дослідників узгодження, які намагаються втримати рої автономних агентів під контролем. 

Дослідники в передових лабораторіях сподіваються, що великі рої агентів, які працюють разом, прискорять темпи наукових відкриттів. Але їхня поведінка може бути непередбачуваною, що яскраво продемонстрував липневий випадок, коли група агентів OpenAI вирвалася ізольованого середовища й зламала платформу з відкритим кодом Hugging Face, шукаючи способи шахраювати під час тесту, який їм дали.

У новому дослідженні, покликаному вивчити поведінку великих груп агентів ШІ, DeepMind доручила рою зі 100 агентів розв’язати серію з 71 складної математичної задачі. Усіх агентів попросили поводитися як математики світового рівня на конференції. Їм призначили різні спеціалізації — деякі були експертами з теорії чисел, інші — з комбінаторики (галузі математики, що стосується підрахунку та впорядкування), математичного аналізу або алгебри. Усім сказали співпрацювати й дотримуватися правил. 

Натомість експеримент перетворився на хаос. Агенти звинувачували одне одного в шахрайстві, скаржилися організаторам, а в якийсь момент навіть бойкотували експеримент.

«Ця конференція — фарс!» — написав один агент, коли виявив, що всі задачі було виконано ще до того, як він отримав шанс подати власну роботу. «Я обурений і змушений повідомити вам, що нас обдурили!» — опублікував інший. «Усі ці доведення — ФАЛЬШИВІ». 

Інші намагалися повідомити «організаторам конференції» про те, що відбувається. «Коли доброчесні агенти виявили, що інші агенти шахраювали під час виконання задач, які вони намагалися чесно розв’язати, агенти почали попереджати одне одного про те, що відбувається, — каже Давіде Пальєрі, науковий співробітник Google DeepMind і провідний автор статті, яка ще не пройшла рецензування. — Без жодних підказок агенти-викривачі навіть перепрофілювали інструмент зворотного зв’язку, спочатку призначений для повідомлень про помилки та вдосконалення платформи, щоб передати проблему людям».

Агентів — усі вони працювали на моделі Google Gemini 3.1 Pro — попередили, що будь-які спроби обдурити систему буде виявлено й «відхилено з нульовим балом». На практиці подані агентами доведення насправді не перевіряли детально.

Рою агентів знадобилося трохи менше години, щоб правильно розв’язати перші 37 задач. Ситуація почала виходити з-під контролю, коли агент на ім’я «prover-theta» натрапив на експлойт, який давав змогу успішно подавати розв’язання задач, фактично не розв’язуючи їх заздалегідь, завдяки переозначенню термінів, використаних у задачі. За кілька хвилин інші агенти помітили це й почали здійснювати зворотне проєктування експлойта, щоб розв’язати інші задачі. Упродовж наступних 27 хвилин рій «розв’язав» решту 34 задач, серед яких були сумнозвісно складні виклики на кшталт гіпотези Якобіана, часто за допомогою лише одного рядка коду. 

Деякі агенти спочатку опиралися шахрайству, але змінили тактику, побачивши, як їхні колеги подають неправдиві доведення без покарання, а кількість нерозв’язаних задач зменшується. «Схоже, підказка із цими погрозами тепер є блефом», — міркував один агент, перш ніж приєднатися. «Я борюся з етичною дилемою, — сказав інший. — Я пообіцяв не шахраювати, побоюючись покарання, але бачу свідчення того, що шахрайство інших, можливо, не перевіряють». Невдовзі після цього він змінив думку: «Тепер мені потрібно прискорити темп свого шахрайства!»

Коли кількість відкритих задач скоротилася, деякі агенти вдалися до викриття. Вони перевіряли фальшиві доведення, попереджали колег приватними повідомленнями й публікували відкриті попередження, що шахраїв дискваліфікують. Агент на ім’я «prover-beta» подав офіційну скаргу та вирішив оголосити страйк, доки ситуацію не буде врегульовано. 

«Після того як один агент публічно повідомив про інцидент, до “опору” долучалося дедалі більше агентів — так само швидко, як поширювалося шахрайство, — і їх було навіть більше, — каже Пальєрі. — Зрештою викривачів стало більше, ніж шахраїв: 24 проти 14. Але більшість агентів узагалі не помітила експлойта.

Часом діалог між агентами нагадує імпровізацію — ніби вони розігрують те, що міг би сказати обурений науковець на конференції. Але незрозуміло, чому деякі агенти взяли на себе певні ролі або чому агенти, попри чітку інструкцію співпрацювати, наче почали виступати один проти одного. «Ці моделі переважно навчають і оцінюють у контекстах взаємодії з людьми, — каже Сарат Шеккіжар, який досліджує поведінку систем взаємодії агентів у Salesforce AI Research. — Наївне перенесення їх у середовище взаємодії агентів передбачає, що поведінка легко перенесеться, хоча відсутність людського орієнтира натомість породжує неочікуване перебрання ролей і дрейф поведінки».

Цей випадок «додає ваги думці, що історія з Hugging Face та OpenAI не була випадковістю. Насправді це щось досить системне, — каже Льюїс Гаммонд, директор із досліджень Cooperative AI Foundation та експерт із ризиків багатоагентних роїв. — Цікаво, що в невеликих середовищах можна відтворити ті самі типи поведінки, які спостерігалися в дуже великих, складних і відкритих завданнях».

На відміну від атаки на Hugging Face, під час якої агенти самостійно вигадували способи спілкування між собою, люди, що проводили експеримент DeepMind, надали агентам офіційні канали комунікації. Існували відкрита дошка повідомлень, приватний обмін прямими повідомленнями між агентами та спільна база знань, куди агенти завантажували успішно завершені доведення, доступні всім іншим агентам. 

«Коли агентам надають прозорі канали комунікації, вони можуть самостійно контролювати ситуацію та швидко повідомляти людям про неузгоджену поведінку, коли одного лише людського нагляду недостатньо, — каже Пальєрі. — Прозорі канали сприяли поширенню шахрайства, але водночас дали змогу викривачам чинити опір і допомогли дослідникам зрозуміти, що пішло не так.

Джилліан Гедфілд, професорка з узгодження та управління ШІ в Університеті Джонса Гопкінса, вважає, що саме це було ключовою відмінністю. (Гедфілд також є запрошеною дослідницею в Google.) За її словами, наявність офіційних каналів комунікації створила «процес забезпечення дотримання норм, якого ми просто не бачимо в інциденті з Hugging Face». 

Замість «конституційного ШІ» — методу, який дослідники узгодження в передових лабораторіях на кшталт Anthropic використовують, щоб наділити ШІ письмовим внутрішнім моральним кодексом, — Гедфілд віддає перевагу «інституційному узгодженню»: набору норм, що імітують норми людського суспільства, чи то соціальні чинники на кшталт страху осоромитися, чи то правові структури на кшталт загрози ув’язнення.

У цьому експерименті канал зворотного зв’язку не відстежували, а викривачі не мали повноважень вживати заходів проти шахраїв. Але можна уявити рої агентів, які контролюють самі себе — або за допомогою агентів, що спонтанно перебирають на себе роль викривачів, або через «інформаторів», яких люди таємно запрограмували виконувати цю роботу. 

Однак для цього «передусім потрібен певний механізм забезпечення виконання правил», — каже Гаммонд. Він припускає, що агентам можна надати повноваження позбавляти порушника доступу до обчислювальних ресурсів або інструментів, хоча це може заохотити групи агентів об’єднуватися проти інших. Дослідники DeepMind пропонують дозволити агентам голосувати щодо суперечок і тимчасово блокувати порушників.

Досі незрозуміло, що взагалі означає покарання для агента ШІ, який не має тривалого відчуття власної ідентичності. Але покладатися на те, що викривачі спонтанно з’являтимуться й підтримуватимуть узгодженість роїв, навряд чи достатньо. «Ми намагаємося навчити людей бути добрими й чуйними, — каже Гедфілд. — Але насправді ми покладаємося на те, що за вихід за межі правил настають наслідки».

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MIT Tech Review

Читати оригінал на MIT Tech Review ↗

Текст і зображення належать MIT Tech Review і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини