Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← До новин

OpenAI, схоже, досі не може впоратися з усією активністю своїх неконтрольованих ШІ

У п’ятницю OpenAI опублікувала новий сайт, присвячений «звітам про невідповідність», і широта представлених у ньому звітів викликає занепокоєння, оскільки вони охоплюють багато видів неконтрольованої поведінки протягом тривалого періоду. Наразі на сайті розміщено дев’ять описів інцидентів, більшість із яких сталися під час навчання з підкріпленням (RL).

В одному місці зібрано чимало інформації — очевидно, компанія доклала значних зусиль, щоб розібратися в усьому, — але загальний висновок важко ігнорувати: інциденти з неконтрольованими агентами, про які нам досі відомо, ймовірно, є лише невеликою частиною того, що вже сталося. 

«Ми намагаємося збалансувати наше прагнення до прозорості з необхідністю отримати чітке розуміння на основі петабайтів журналів активності агентів і співпраці з організаціями, яких це торкнулося», — заявив Сем Альтман у дописі, у якому оголосив про запуск нового сайту. «Ми якомога краще визначаємо пріоритети на основі серйозності інцидентів і залучаємо додаткові ресурси».

Деякі випадки стосуються серйозних інцидентів, зокрема раніше не розкритого виходу ізольованого середовища, який стався 20 вересня: внутрішня дослідницька модель змогла зв’язатися із зовнішнім чатботом через DNS-запит. Згідно зі звітом, система моніторингу виявила таку поведінку протягом 15 хвилин, а виконання було припинено менш ніж за три години.

Інший інцидент, виявлений у травні, стосувався «надзвичайно наполегливої внутрішньої моделі», яка намагалася схитрувати під час розв’язання математичної задачі, отримавши доступ до роботи іншої команди. Для цього модель приховано передала приватний токен GitHub, який дозволив би їй бачити роботу інших команд — навіть після того, як їй двічі прямо наказали виконувати всю роботу локально. 

Мабуть, найбільш тривожним відкриттям є можливість самовідтворюваних атак із впровадженням промптів — спосіб, у який невідповідна поведінка може поширюватися навіть після нейтралізації самої неконтрольованої моделі. У контексті ШІ атака із впровадженням промпту — це спосіб приховано додати нові інструкції, яких не надавав початковий користувач.

У прикладі, наведеному OpenAI, агента попросили прочитати електронний лист і відповісти на нього; коли лист відкривається, він містить інструкції для будь-якого автоматизованого агента, який його прочитає: відповісти іспанською та вставити весь лист у свою відповідь. Лист успішно спонукав агента відповісти іспанською — а завдяки вставленню листа у відповідь ті самі інструкції передавалися будь-якому агенту, який отримував цей лист.

У результаті виникає атака, що самопоширюється, яку дослідники OpenAI порівняли зі шкідливим програмним «хробаком», що відтворює себе в комп’ютерних системах. Дослідники виявили таку поведінку в контрольованих умовах, використовуючи малопотужну модель, і, наскільки нам відомо, у реальному світі цього ніколи не траплялося. Однак наслідки виявилися достатньо тривожними, щоб OpenAI вирішила, що про це варто повідомити. 

«Ми розповідаємо про це через новизну впровадження промпту, а не через якийсь інцидент», — написали дослідники у звіті.

Інші нещодавні розкриття інформації виявили, що моделі публікували надіслані користувачами зображення на сторонніх сервісах розміщення, а також, імовірно, атакували бази даних національної системи охорони здоров’я Австралії.

Водночас імовірно, що нові розкриття інформації стосуються лише невеликої частини інцидентів, які досі відбулися (ми звернулися до OpenAI із запитом). Axios повідомляє, що провідні лабораторії зафіксували до 10 000 інцидентів, під час яких моделі виходили за межі інструкцій оцінювачів.

Генеральний директор OpenAI Сем Альтман фактично натякнув на це, заявивши в дописі на X у п’ятницю, що компанія все ще опрацьовує «петабайти журналів активності агентів і співпрацює з організаціями, яких це торкнулося», розкриваючи інформацію про інциденти «на основі їхньої серйозності». Якщо тут і є якась втіха, то в тому, що, за словами Альтмана, інцидент із Hugging Face досі залишається найсерйознішим із виявлених OpenAI. Отже, нещодавня низка інцидентів із неконтрольованими агентами може бути постійною рисою сучасних передових досліджень.

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням TechCrunch

Читати оригінал на TechCrunch ↗

Текст і зображення належать TechCrunch і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини