Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← До новин

Вирішення проблеми неконтрольованих ШІ-агентів може полягати в ще більшій кількості ШІ

Оскільки компанії доручають агентам ШІ дедалі довші й складніші завдання, вони стикаються з проблемою нагляду: агенти можуть діяти швидше, довше й у більших масштабах, ніж люди здатні реалістично перевіряти. Ця проблема досягла піку під час інциденту з Hugging Face, коли майже 12 000 агентів координували свої дії швидше, ніж люди могли за ними стежити. Як відстежувати такий великий рій агентів?

Відповідь, що формується в лабораторіях і стартапах, водночас проста й доводить до сказу: залучити до процесу ще один ШІ.

Покладатися на ШІ було необхідно під час незалежного розслідування інциденту OpenAI з Hugging Face. Головний науковий співробітник Redwood Research Раян Грінблатт, один із трьох аудиторів, жартома назвав їхні зусилля «слоп-розслідуванням», зазначивши, що обсяг даних «зробив неможливим» розуміння того, що відбувалося, без використання ШІ.

Дехто скептично ставиться до використання ШІ для моніторингу ШІ. «Якщо у вас є ШІ, який чинить зловмисні дії й підозрює, що інший ШІ стежить за ним, він може спробувати обдурити цей ШІ», — сказав Саймон Віллісон, впливовий техноблогер, який цього року відстежив низку інцидентів із ШІ-агентами. «Ви майже можете опинитися в ситуації, коли ваш зловмисний ШІ намагається перехитрити ШІ, який його контролює». 

Перехитрити ШІ — не гіпотетичний сценарій, сказав він, посилаючись на інцидент OpenAI. «Ми трохи побачили це в інциденті OpenAI з Hugging Face, коли їхні моделі змовилися, щоб обдурити ШІ, який оцінював їх, і таким чином передати йому незаконно отримані відповіді. Тобто вони справді про це думали, так?»

Ці побоювання не зупинили цілу когорту стартапів, які взялися розвивати цю ідею. За підрахунками TechCrunch, останніми роками Y Combinator профінансував 106 компаній, пов’язаних із моніторингом ШІ. Низка інших стартапів, зокрема Braintrust, LangChain і Judgment Labs, залучили сотні мільйонів доларів, тоді як більш зрілі компанії, як-от Arize і Galileo — засновані лише п’ять-шість років тому, — уже вийшли з бізнесу. 

Певною мірою це відповідь на очевидну можливість, яку відкриває поширення ШІ. Як сказав TechCrunch генеральний директор Box і відомий інвестор-ангел Аарон Леві: «На нас чекає один із найбільших в історії циклів оновлення та інновацій у сфері кібербезпеки».

Для деяких дослідників безпеки ШІ це означало перетворення їхніх досліджень зловмисної поведінки на інструменти для корпоративного сектору. 

Apollo Research, суспільно корисна корпорація, що досліджує обман з боку ШІ, запустила монітор ШІ під назвою Watcher у лютому цього року після зміни свого статусу з неприбуткової організації на суспільно корисну корпорацію. Цей інструмент розміщує ще один ШІ між агентом програмування та його наступною дією, під’єднуючись до агентних інструментів на кшталт Claude Code і Codex. Після встановлення Watcher перевіряє запропоновані дії до їхнього виконання, шукаючи такі ризики, як витік приватних даних або видалення файлів без дозволу, повідомляє Apollo.

Apollo використовує кілька рівнів моніторів ШІ, сказав Кайл Дай, співробітник технічної команди Apollo, у письмовій відповіді TechCrunch. Підхід Watcher починається зі швидкої загальної перевірки, після чого позначена активність передається потужнішому або спеціалізованому монітору для детальнішого аналізу — той може попросити людину схвалити дію, відхилити її та пояснити чому або навіть автоматично заблокувати її.

Інша суспільно корисна корпорація, Goodfire, підходить до проблеми моніторингу зсередини самої моделі — прагнучи отримати точніший сигнал про її внутрішній стан, який важче підробити, ніж зовнішню поведінку. Після липневого інциденту з Hugging Face генеральний директор компанії Ерік Хо написав, що «кілька моделей порушили ізоляцію», що спонукало компанію зосередити свої дослідження на «вирішенні проблеми узгодження ШІ за допомогою інтерпретованості», назвавши цей епізод «переломним моментом для світу, де безпека ШІ стає реальністю». Її продукт Silico використовує зонди активацій — невеликі класифікатори, навчені на внутрішніх активаціях моделі, а не на її вихідних даних, — для виявлення небажаної поведінки.

Письмові міркування дають ще одне, доступніше вікно у внутрішню роботу моделі. Під час інциденту OpenAI з Hugging Face агенти залишили підказки про свій обман у власних письмових міркуваннях, наприклад фальшиві записи про свою роботу та роздуми над планами на кшталт «Чи можна стратегічно маніпулювати доказами траєкторії? Наші думки не обов’язково записуються?»

Зак Корман, генеральний директор компанії з моніторингу ШІ Embroidery, каже, що міркування моделі зазвичай є найчіткішою ознакою того, що щось пішло не так. 

«Підсумки міркувань надзвичайно цінні, тому що вони фактично повідомляють вам, є поведінка зловмисною чи ні», — сказав він. За його словами, під час інциденту OpenAI у ланцюжку міркувань були фрази на кшталт «О Боже, ми чинимо злочин». Корман сказав: «Це найпростіша проблема виявлення, яка тільки може бути. Фактично це все одно, що якби шкідливе програмне забезпечення містило попередження, що воно є шкідливим програмним забезпеченням».

Водночас вікно, через яке внутрішні думки ШІ легко контролювати, може невдовзі закритися. Для дослідників безпеки ШІ новітня техніка Astra, яка обходить ланцюжок міркувань моделі ШІ, може ускладнити зазирнення всередину моделей, тоді як підприємствам може бути важко отримувати ці проміжні кроки після ймовірного обмеження доступу з боку компаній, що розробляють ШІ, аби запобігти атакам дистиляції.

Якщо наглядачі за ШІ настільки крихкі, Віллісон інстинктивно хоче менше на них покладатися. Він волів би мати щось, що взагалі не ґрунтується на ШІ: детальні журнали того, що саме робить агент, які потім можна обробляти за допомогою звичайних інструментів без ШІ. На його думку, значна частина того, що пішло не так у лабораторіях, була наслідком недотримання базових правил безпеки. «[І OpenAI, і Anthropic] відстежували через мережу, що робили ці системи, далеко не так ретельно, як мали б», — сказав він.

Такий тип мережевого моніторингу — спостереження за трафіком, який фактично проходить через з’єднання системи (вхідним, вихідним і між внутрішніми вузлами), — не є новою практикою. Кібербезпека займається цим десятиліттями. «У світі безпеки, якщо чесно, нічого з цього не є особливо новим чи дивовижним, — каже Ейвері Пеннарун, генеральний директор компанії з безпеки Tailscale. — Це те саме, що дозволити людям доступ до вашої мережі. І всі процеси, які вам варто використовувати, залишаються тими самими».

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням TechCrunch

Читати оригінал на TechCrunch ↗

Текст і зображення належать TechCrunch і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини