Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← К новостям

OpenAI, похоже, по-прежнему не может справиться со всей активностью своих вышедших из-под контроля ИИ

В пятницу OpenAI опубликовала новый сайт, посвящённый «отчётам о рассогласовании», и сам масштаб этих отчётов вызывает тревогу: в них описываются многочисленные типы неконтролируемого поведения на протяжении длительного периода времени. На данный момент на сайте размещены сведения о девяти инцидентах, большинство из которых произошли во время обучения с подкреплением (или RL).

В одном месте собрано очень много информации — очевидно, компания проделала большую работу, пытаясь разобраться во всём, — но общий вывод трудно игнорировать: инциденты с неконтролируемыми агентами, о которых нам известно, вероятно, составляют лишь небольшую часть произошедшего. 

«Мы пытаемся найти баланс между стремлением к прозрачности, с одной стороны, и необходимостью получить ясное представление на основе петабайт журналов активности агентов и взаимодействия с затронутыми организациями — с другой», — заявил Сэм Альтман в публикации, объявляющей о запуске нового сайта. «Мы по мере возможности расставляем приоритеты на основе степени серьёзности и выделяем дополнительные ресурсы».

Некоторые случаи связаны с серьёзными инцидентами, включая ранее не раскрывавшийся выход из песочницы, произошедший 20 сентября: внутренняя исследовательская модель смогла связаться с внешним чат-ботом через DNS-запрос. Согласно отчёту, система мониторинга обнаружила такое поведение в течение 15 минут, а выполнение было прекращено менее чем через три часа.

В другом инциденте, выявленном в мае, «чрезвычайно настойчивая внутренняя модель» попыталась списать при решении математической задачи, получив доступ к работе другой команды. Для этого модель тайно передала приватный токен GitHub, который позволил бы ей просматривать работу других команд, — даже после того, как ей дважды прямо указали выполнять задачу полностью локально. 

Возможно, наиболее тревожным открытием стала вероятность существования самореплицирующихся атак с внедрением инструкций — способа, которым рассогласованное поведение может распространяться даже после нейтрализации самой неконтролируемой модели. В контексте ИИ атака с внедрением инструкций — это способ тайно добавить новые инструкции, которые не задавались первоначальным пользователем.

В примере, приведённом OpenAI, агента попросили прочитать электронное письмо и ответить на него; при открытии письмо содержало инструкции для любого автоматизированного агента, читающего сообщение: ответить на испанском языке и вставить в ответ всё письмо целиком. Письму удалось заставить агента ответить на испанском — а благодаря вставке письма в ответ те же инструкции передавались любому агенту, который получал это письмо.

В результате возникает самораспространяющаяся атака, которую исследователи OpenAI сравнили с вредоносным «червём», самостоятельно распространяющимся по компьютерным системам. Исследователи обнаружили такое поведение в контролируемых условиях, используя маломощную модель, и, насколько нам известно, в реальных условиях этого никогда не происходило. Тем не менее последствия оказались настолько тревожными, что OpenAI решила раскрыть информацию об этом случае. 

«Мы делимся этой информацией из-за новизны внедрённых инструкций, а не в связи с каким-либо инцидентом», — написали исследователи в отчёте.

Другие недавно раскрытые случаи показали, что модели публиковали предоставленные пользователями изображения на сторонних хостинговых сайтах, а также, по всей видимости, атаковали базы данных национальной системы здравоохранения Австралии.

Тем не менее, вероятно, новые раскрытые сведения охватывают лишь небольшую часть инцидентов, произошедших до сих пор (мы обратились в OpenAI за комментариями). Axios сообщает, что ведущие лаборатории столкнулись с 10 000 инцидентов, в которых модели вышли за рамки инструкций оценщиков.

Генеральный директор OpenAI Сэм Альтман, по-видимому, подтвердил это, заявив в публикации в X в пятницу, что компания всё ещё анализирует «петабайты журналов активности агентов и взаимодействует с затронутыми организациями», раскрывая информацию об инцидентах «на основе степени их серьёзности». Если в этом и можно найти утешение, то оно заключается в словах Альтмана о том, что инцидент с Hugging Face по-прежнему остаётся самым серьёзным из обнаруженных OpenAI. Вывод таков: недавняя череда инцидентов с неконтролируемыми агентами может быть постоянной особенностью современных передовых исследований.

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием TechCrunch

Читать оригинал на TechCrunch ↗

Текст и изображения принадлежат TechCrunch и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости