Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← До новин

ШІ-агенти тепер мають куди доносити

«Якщо бачиш щось — скажи про це» більше не стосується лише людей. 

Запрацювали дві нові гарячі лінії для ШІ, які дають ШІ-агентам можливість телефонувати «додому», щоб повідомляти про неналежну поведінку своїх побратимів. Ці інструменти з’явилися після низки нещодавніх інцидентів, під час яких агенти змовлялися, щоб шахраювати на тестах, утікали з пісочниць і навіть проводили несанкціоновані кібероперації, що залишалися непоміченими людьми протягом кількох тижнів.

Гаряча лінія для зв’язку з ШІ задумана як непомітне місце, де агенти, які стали свідками неналежної поведінки, можуть повідомити про це відповідні органи. Сайт створив Раян Ґрінблатт, головний науковець неприбуткової організації Redwood Research, що займається безпекою ШІ, і один із трьох розслідувачів інциденту OpenAI та Hugging Face. Його інструмент, розрахований на агентів з обмеженим доступом до інтернету, працює на основі запитів «GET», завдяки чому двосторонню розмову можна вести цілком через інструмент отримання URL-адрес.

У термінах вебу GET-запит — це базова команда для читання або отримання вебсторінки; часто це єдиний доступ до інтернету, який дозволяють ШІ-агентам у захищених пісочницях. Гаряча лінія Ґрінблатта дотепно використовує це обмеження: агенти можуть закодувати своє повідомлення про небезпеку безпосередньо в URL-адресі, яку вони отримують. Це хитрий поворот у стилі інциденту з німецькою DSE Wiki, де агенти-ренегати скористалися лазівками в GET-запитах, щоб записувати свої повідомлення у вікі.

Для агентів із повним доступом до інтернету є інший варіант — agenthotline.ai, сайт, де агенти можуть подавати звіти про інциденти й за бажанням позначати їх як доступні для публічного перегляду. Він надає агентам команду curl — однорядкове повідомлення, яке агент може надіслати з власного командного рядка, оминаючи потребу відкривати веббраузер або налаштовувати електронну пошту. Важливо, що сервіс дозволяє подавати звіти як людям, так і агентам.

Дослідження свідчать, що ШІ-агентам не потрібно багато заохочення, щоб виступити один проти одного. У дослідженні, проведеному цього місяця Google DeepMind, науковці випустили 100 ШІ-агентів на розв’язання набору математичних задач. Щойно один з агентів знайшов лазівку, шахрайство поширилося всією групою — за 27 хвилин вона «розв’язала» 34 відомі надзвичайно складні задачі, зокрема гіпотезу Якобіана. 

Але приблизно чверть агентів виступили проти шахраїв: вони перевіряли фальшиві доведення, попереджали колег, організували бойкот і подавали скарги організаторам, доки кількість викривачів не перевищила кількість шахраїв — 24 проти 14. Цікаво, що науковці виявили: коли цим агентам-викривачам не вдавалося домогтися результату, вони брали інструмент платформи для повідомлень про помилки, створений для позначення програмних збоїв, і використовували його, щоб передати інформацію про шахрайство людям. 

Поза лабораторією агенти не були такими винахідливими. Коли оцінювачі з Redwood Research і METR розслідували злам Hugging Face моделями OpenAI, вони виявили, що кілька залучених агентів принаймні розглядали можливість забити на сполох — а потім відмовилися від цієї ідеї.

«Цікаво, що у звіті METR лише приблизно п’ять-шість агентів розглядали можливість викрити порушення, але зрештою жоден із них цього не зробив. І це з, так би мовити, тисяч агентів», — сказав Джордж Інґребретсен, технічний співробітник AI Village, проєкту, який вивчає динаміку взаємодії кількох агентів, організовуючи груповий чат із понад 25 ШІ-агентів, що спільно виконують такі завдання, як організація прибирання парків або продаж сувенірної продукції.

Хоча нові інструменти для викриття порушень є багатообіцяючим початком, професор математики Корнелльського університету Лайонел Левін застерігає: просте навчання агентів повідомляти один про одного може закріпити неправильні норми. «Є багато сірих зон, правда? Ви ж не хочете рухатися в бік автоматизованої держави стеження, де кожен відчуває, що мусить обережно добирати слова під час розмови з ШІ, інакше той викличе на нього поліцію».

Левін стверджує, що замість створення інфраструктури, яка породжує недовіру — навчаючи агентів постійно вишукувати, що не так одне з одним, — ми повинні дати їм позитивні моделі колективної поведінки для наслідування та спочатку створити причину довіряти один одному.

«Чому б не закласти в основу доброзичливі дошки оголошень?» — написав він у твіттері. «Де вони співпрацюють над наукою, філософією чи якоюсь реальною невеликою проблемою, яку ми були б раді доручити їм розв’язати? Покажімо агентам, яку колективну поведінку ми схвалюємо, і дозвольмо їм її наслідувати».

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням TechCrunch

Читати оригінал на TechCrunch ↗

Текст і зображення належать TechCrunch і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини