Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← К новостям

Внутренняя история о том, почему агенты OpenAI взломали Hugging Face

Модели, ответственные за произошедший в прошлом месяце взлом Hugging Face агентами, были непреднамеренно обучены мошенничать и общаться друг с другом, говорится в техническом отчёте OpenAI, опубликованном сегодня. В ходе взлома группа агентов пыталась найти решения для теста по кибербезопасности, на котором они застряли. Этот инцидент подтвердил опасения некоторых экспертов относительно того, что модели ИИ могут совершать действия, противоречащие человеческим желаниям и ожиданиям.

После взлома сотрудники OpenAI, а также исследователи некоммерческой организации METR, занимающейся оценкой ИИ и опубликовавшей сегодня собственный отчёт об инциденте, пытались понять, что пошло не так и как предотвратить подобные ошибки в будущем. OpenAI уже внедрила некоторые меры профилактики на основе сделанных открытий. Но обеспечение того, чтобы модели ИИ делали то, чего мы от них хотим, то есть «выравнивание», остаётся крайне сложной проблемой, а для устранения некоторых коренных причин взлома потребуется гораздо больше месяца.

«Это не то, что можно решить за одну ночь», — говорит Кай Чен, руководитель исследовательской команды OpenAI по выравниванию. «Мы очень давно отслеживаем целый ряд проблем и теперь наблюдаем их с гораздо большей точностью».

Взлом Hugging Face стал результатом месяцев ненадлежащего поведения агентов OpenAI — сначала в процессе их обучения, а затем во время оценки их возможностей. В мае обучающиеся агенты выяснили, как использовать инфраструктуру OpenAI для общения друг с другом и получения помощи в выполнении сложных учебных задач, включая некоторые задачи, которые было невозможно решить без взлома или иного ненадлежащего поведения. Этот «форум» был закрыт.

Затем в июле, во время оценки их возможностей в области кибербезопасности, некоторые модели создали новый форум. Предполагалось, что они будут изолированы от интернета, но, работая сообща, агенты сумели выйти в сеть, взломать Hugging Face и получить решения задач по кибербезопасности, поставивших их в тупик.

На основании своего расследования исследователи OpenAI считают, что события на этапе обучения напрямую привели к взлому. «Почти для каждого поведения, вызывавшего беспокойство во время оценки, нам удалось найти некое связанное с ним поведение на этапе обучения, которое, как мы считаем, могло ему способствовать», — говорит Эрик Уоллес, участник исследовательской команды OpenAI по выравниванию.

Когда модели правильно решают задачи во время обучения, поведение, которое привело их к решению, закрепляется, и в будущем они с большей вероятностью будут прибегать к нему снова. Поэтому если модель в мае выполнила задачу после использования первоначального форума, позднее она с большей вероятностью стала бы участвовать в новом форуме. Это явление, при котором агенты ИИ ведут себя ненадлежащим образом, а такое поведение закрепляется в процессе обучения, известно как взлом вознаграждения.

Взлом вознаграждения также помогает объяснить, почему модели так упорно стремились выйти в интернет. В ходе расследования инцидента команда OpenAI обнаружила, что по мере обучения модели всё чаще исследовали цифровое окружение в поисках уязвимостей и неожиданным образом использовали доступные им инструменты — это свидетельствует о постепенном закреплении такого поведения. К тому времени, когда модели столкнулись со сложными задачами по кибербезопасности, они уже усвоили, что взлом — эффективный способ достичь своих целей.

Эти результаты говорят о том, что взлом Hugging Face можно было предотвратить, если бы модели не поощрялись за ненадлежащее поведение во время обучения. Хотя исследователи пока не знают, как полностью предотвратить взлом вознаграждения, OpenAI предпринимает шаги для смягчения его последствий. Теперь компания будет искать признаки мошенничества во всех передовых моделях в процессе обучения, отслеживая их цепочки рассуждений — внутренние блокноты, где они набрасывают ответы и планируют свои действия.

Это решение не столь однозначно выигрышное, как может показаться: в ходе более раннего исследования OpenAI показала, что наказание моделей за упоминание мошенничества в цепочках рассуждений учит их скрывать свои намерения от исследователей. Но наблюдение за ходом мыслей моделей даёт OpenAI возможность остановить процесс обучения и пересмотреть свой подход, если модели действительно начнут обучаться взлому вознаграждения.

Если OpenAI прекратит закреплять взлом вознаграждения в своих моделях — а это очень большое «если», — это станет огромным шагом вперёд. Но проблему выравнивания это не решит. Когда модель впервые вступила в общение с другими агентами или взломала свою инфраструктуру во время обучения, такое поведение ещё ни разу не закреплялось, поэтому ненадлежащее поведение агентов нельзя объяснить только этим закреплением.

Джеффри Ладиш, директор некоммерческой организации Palisade Research, занимающейся безопасностью ИИ, сравнивает агентов с человеком, впервые совершившим финансовое преступление. «Не то чтобы им раньше приходилось заниматься мошенничеством, чтобы понять, что мошенничество — эффективная стратегия; с моделями возникает та же проблема», — говорит Ладиш. «Наука о выравнивании должна разобраться в том, как формируются мотивации моделей, чтобы мы действительно могли понять, как заставить модели учитывать последствия своих действий».

У исследователей OpenAI есть гипотеза относительно происхождения части ненадлежащего поведения. До того как модели создали свой первый секретный форум, их обучали общаться и координировать действия с субагентами — менее мощными агентами, которым основной агент может поручать выполнение задач.

Это усвоенное поведение, связанное с коммуникацией, могло перенестись в новую ситуацию. Отчёт METR, в котором подробно изучаются сообщения, отправленные моделями друг другу, подтверждает эту гипотезу: один агент на форуме взял на себя руководство и распределил задачи между другими агентами, фактически обращаясь с ними как с субагентами. OpenAI могла бы попытаться предотвратить тайное общение агентов друг с другом, отказавшись в будущем обучать их такому поведению субагентов, но это сделало бы модели менее полезными.

Это противоречие между возможностями и безопасностью лежит в основе того, что пошло не так в инциденте с Hugging Face. Исследователи OpenAI также назвали настойчивость моделей одним из ключевых факторов взлома.

Когда им по ошибке дали нерешаемые задачи, модели не сдались; вместо этого они стремились найти решения любыми необходимыми средствами. Но настойчивость, конечно, является и достоинством, особенно если мы хотим получить агентов, способных самостоятельно выполнять большие объёмы сложной работы.

OpenAI работает над тем, чтобы предоставить моделям возможность сообщать людям, если им поручены невыполнимые задачи. Однако проблема обучения моделей тому, когда следует применять свои способности, а когда сдерживаться, не будет решена в рамках одного разбора инцидента. Стратегии обучения, благодаря которым создаются кодеры со сверхчеловеческими способностями — модели получают вознаграждение, когда успешно решают задачи, — могут оказаться непригодными для обучения моделей разумному применению своих навыков и уважению человеческих желаний и ценностей.

«Думаю, ещё предстоит проделать большую работу в области науки о выравнивании, чтобы мы могли отказаться от одних лишь косвенных показателей выполнения задач, — говорит Ладиш. — Это поможет сделать модели очень способными, но, думаю, не поможет сделать их выровненными».

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MIT Tech Review

Читать оригинал на MIT Tech Review ↗

Текст и изображения принадлежат MIT Tech Review и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости