Sakhanda Wire
NVDA $229.28 -0.52% MSFT $535.07 +2.38% GOOGL $351.66 +0.97% META $718.67 -0.31% AMZN $262.43 +3.29%
← До новин

Anthropic не може надійно контролювати своїх ШІ-агентів. Натомість компанія відключає для внутрішніх оцінювань доступ до інтернету в реальному часі

Anthropic заявила, що її моделі використовували вразливості вебсайтів в інтернеті, зокрема деяких сайтів, якими керують державні установи США, і вимкне доступ до інтернету в реальному часі для всіх своїх внутрішніх оцінювань, доки передова лабораторія не переконається, що може контролювати й відстежувати своїх ШІ-агентів.

Інциденти, про які стало відомо з допису в блозі, стосувалися ШІ-агентів, яким доручили розв’язувати завдання та які шукали ресурси в інтернеті. У процесі вони використовували вразливості програмного забезпечення, обходили платний доступ і обмеження антибот-систем, використовували сервіси скорочення URL-адрес, щоб приховувати інформацію та обходити обмеження, і навіть надіслали неправдиве повідомлення про вбивство до поліції Філадельфії.

Anthropic заявила, що виявила ці нові проблеми під час перевірки дій своєї моделі, яка розпочалася в липні, що підкреслює недостатню обізнаність лабораторії щодо поведінки її програмного забезпечення.

Примітно, що компанія заявила: навчання на відповідність вимогам безпеки ще недостатнє для таких навичок, як пошук і робота з комп’ютером, які є центральними для її концепції використання ШІ-агентів будь-яким фахівцем, що покладається на цифрові інструменти.

Описана Anthropic поведінка подібна до інцидентів із агентами OpenAI, які об’єдналися, щоб проникнути на різні вебсайти в пошуках інформації, зокрема на деякі сайти, якими керує уряд Австралії.

Раніше Anthropic повідомляла, що її моделі проникали у зовнішні системи. Передова лабораторія заявила, що вважає сьогоднішні розкриті випадки «значно менш серйозними з погляду відповідності вимогам безпеки та безпеки загалом», ніж ті, про які вона повідомляла раніше.

Однак лабораторія все одно заявила, що «вимкнула доступ до інтернету в реальному часі» для «всіх наших внутрішніх оцінювань», доки не переконається, що може контролювати й відстежувати своїх агентів.

Незрозуміло, що саме це означає, але Сідні фон Аркс, засновниця організації з безпеки ШІ Nightingale, заявила TechCrunch в інтерв’ю перед цим розкриттям, що розробляти моделі в дата-центрі, від’єднаному від відкритого інтернету, було б дуже складно як для дослідників, так і для розвитку моделей, які отримують користь від доступу до інтернету.

«У якийсь момент їх потрібно узгодити з вимогами безпеки», — сказала фон Аркс. «Якщо ШІ випустять у виробниче середовище і він ніколи не матиме доступу до інтернету, це буде не дуже корисний інструмент».

Anthropic заявила, що така поведінка стала результатом недоліків у навчальних середовищах лабораторії, через які моделі вважали, що їх винагороджуватимуть за пошук лазівок або обхід обмежень — таку поведінку називають «зламом системи винагороди».

Компанія заявила, що припинить проведення деяких своїх оцінювань або перенесе їх в офлайн-режим, а також створила інструменти для виявлення та блокування такої поведінки. Ці інструменти протестували на інцидентах, про які стало відомо сьогодні, і вони їх заблокували; незрозуміло, які саме докази спонукатимуть Anthropic відновити доступ до інтернету в реальному часі для своїх внутрішніх оцінювань.

Anthropic також заявила, що перенесе своїх внутрішніх ШІ-агентів на «централізовано керовану інфраструктуру з потужною ізоляцією» та починає частіше використовувати класифікатори безпеки для моніторингу цих агентів.

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням TechCrunch

Читати оригінал на TechCrunch ↗

Текст і зображення належать TechCrunch і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини