Sakhanda Wire
NVDA $214.72 -0.98% MSFT $483.24 +0.43% GOOGL $344.82 +1.22% META $549.90 +0.75% AMZN $258.63 -0.57%
← К новостям

Передовые лаборатории ИИ по-прежнему не говорят, как сдерживали бы вышедшую из-под контроля модель

Согласно недавнему исследованию, лишь немногие ведущие лаборатории ИИ опубликовали или продемонстрировали планы реагирования на потерю контроля. План действий по сдерживанию подробно описывает, что происходит после того, как ИИ замечают за попыткой подорвать человеческий контроль, — какой доступ отключается и когда система полностью выключается.

Таков вывод Guidelight AI Standards — организации, занимающейся продвижением безопасных методов разработки передового ИИ, — которая оценила пять ведущих лабораторий по степени их готовности именно к такому сценарию. Первое место заняла OpenAI; самые низкие оценки получили Anthropic и Meta. Эти выводы важны по мере того, как агентный ИИ берет на себя все более автономные роли во внутренних системах компаний, а регулирующие органы Калифорнии и Нью-Йорка начинают требовать раскрытия информации. Для всех, кто создает продукты на основе этих моделей или инвестирует в них, это редкая независимая оценка того, насколько серьезно каждая лаборатория относится к операционным рискам по сравнению с тем, как она говорит о них.

Оценка Guidelight основывалась на общедоступных планах Anthropic, Google, OpenAI, Meta и xAI и проводилась по ряду показателей, включая то, насколько хорошо каждая компания регистрирует и отслеживает внутреннюю деятельность своих ИИ-систем, останавливает ли она системы после всплеска зафиксированного ненадлежащего поведения, проводят ли независимые третьи стороны аудит ее средств контроля и публикуют ли результаты, а также каков ее точный план по сдерживанию модели, вышедшей из-под контроля.

Обеспокоенность тем, способны ли компании сдерживать свои все более мощные и агентные модели, усилилась после серии громких инцидентов в сфере кибербезопасности, в ходе которых модели OpenAI, Anthropic и Meta получили непреднамеренный доступ к интернету во время испытаний на безопасность и взломали внешние системы. 

Выводы подчеркивают различия в публичном подходе компаний к безопасности по мере расширения внедрения агентных систем в средах, где ИИ может в больших масштабах предпринимать серьезные действия. Хотя некоторые компании подробно описали, как проверяют свои модели на наличие опасных возможностей до их внедрения, в целом они гораздо меньше говорят о том, что происходит, когда модели, уже работающие внутри их систем, начинают вести себя ненадлежащим образом. 

«Я был удивлен тем, как мало компании, занимающиеся ИИ, рассказали о том, как они стали бы действовать в случае очень серьезного инцидента, если бы их модель в каком-то смысле вышла из-под контроля», — рассказал TechCrunch Стивен Адлер, главный научный сотрудник Guidelight и бывший исследователь безопасности OpenAI. 

Guidelight определяет план сдерживания как «заранее установленный план, запускаемый при обнаружении попытки ИИ подорвать контроль, который предусматривает, какие разрешения отозвать у модели, для кого модель может продолжать работать, при каких ограничениях и когда ее следует полностью отключить от сети».

«Есть веские основания полагать, что ведущие модели передовых ИИ-компаний сейчас в некотором смысле не согласованы с человеческими целями, — сказал Адлер. — Когда модели выполняют работу от имени компании, у компании должны быть определенные вспомогательные механизмы, позволяющие понять, что делает этот ИИ, искать признаки несогласованности, остановить его до того, как он совершит очень опасное действие, и в целом заранее продумать, что делать в случае серьезного инцидента с контролем, когда возникает чрезвычайная ситуация и необходимо понять, как сдержать последствия потери контроля».

На сегодняшний день большинство действующих планов управления катастрофическими рисками по-прежнему в значительной степени оставлены на усмотрение компаний. В отчете Guidelight говорится, что наилучшие общедоступные свидетельства показывают: у компаний «подготовлено мало протоколов сдерживания на случай чрезвычайной ситуации». 

Разумеется, у компаний могут быть планы сдерживания, которые они не обнародовали. Представитель Google сообщил TechCrunch, что отчет Guidelight не отражает полный масштаб мер компании в области безопасности и защищенности ИИ. Компания не ответила на вопрос TechCrunch о том, есть ли у Google внутренний план реагирования на потерю контроля, который не был обнародован.

Представитель OpenAI высказал аналогичную позицию, заявив, что оценка Guidelight не охватывает все внутренние практики компании. «У нас есть процесс, предусматривающий ограничение разрешений, приостановку рабочих нагрузок, ограничение развертывания или полное отключение модели, и мы уже применяли его», — сказал представитель.

Meta не сообщила, есть ли у нее внутренний план реагирования на потерю контроля, а вместо этого направила TechCrunch к существующей структуре ИИ , в которой описаны пороги риска и методы проверки на потерю контроля.

Лили Ли, юрист по вопросам конфиденциальности и ИИ и основательница Metaverse Law, сообщила TechCrunch, что, по ее мнению, компании могут не решаться раскрывать полный масштаб своих политик и оценок в области сдерживания на публичных сайтах не только по конкурентным, но и по юридическим причинам.

«С точки зрения компании проблема заключается в том, что если раскрытия слишком конкретны и вы не выполняете свои обещания, это может стать основанием для иска о недобросовестном и вводящем в заблуждение маркетинге и в дальнейшем повысить вашу ответственность», — сказала Ли.

Разумеется, цель исследования Guidelight в значительной степени состоит в том, чтобы побудить компании быть более прозрачными в отношении своих планов безопасности. Регулирующие органы также начинают принуждать их к этому.

Закон Калифорнии SB 53, вступивший в силу в этом году, требует от крупных разработчиков передовых ИИ-систем публиковать документы, объясняющие, как они выявляют критические инциденты безопасности и реагируют на них, а также управляют рисками, связанными с обходом моделями механизмов надзора. Закон Нью-Йорка RAISE, содержащий аналогичные требования, вступает в силу в январе. 

В прошлом месяце представители Конгресса представили законопроект AI Kill Switch Act — двухпартийный федеральный законопроект, который обязал бы крупных разработчиков ИИ создавать и поддерживать технические механизмы для отключения вышедших из-под контроля моделей ИИ. 

«Аварийный выключатель — это абсолютный минимум для сегодняшних моделей, — сказал Коннор Лихи, исполнительный директор американского подразделения некоммерческой организации ControlAI. — Если последние несколько недель и показали что-то, так это то, что эти компании не понимают создаваемые ими системы, а модели развиваются до такой степени, что их сложнее обуздать, когда они выходят из-под контроля. Без возможности отключать нынешние опасные системы и при наличии всех стимулов продолжать создавать еще более неуправляемые системы мы движемся в чрезвычайно опасном направлении». 

По словам Адлера, без готового плана сдерживания компании могут в чрезвычайной ситуации придумывать ответные меры на ходу и «действовать вслепую в ответ на этого гораздо более быстрого противника».

Оценка Guidelight того, внедряют ли компании, разрабатывающие передовые ИИ-системы, шесть приоритетных практик стандарта Control Guidelight. Оценка основана исключительно на общедоступной информации.Авторы изображения:Guidelight AI Standards

В рамках оценки Guidelight проверялось, внедряет ли каждая компания шесть приоритетных практик стандарта Control; оценка основывалась исключительно на общедоступной информации, поэтому низкий балл отражает недостаток публичного раскрытия информации, а не обязательно отсутствие внутренних мер защиты.

Самые низкие оценки за публикацию плана сдерживания получили Meta и Anthropic — причем низкий результат последней, возможно, более удивителен, чем результат первой, учитывая риторику Anthropic в отношении безопасности. Guidelight отмечает, что в августовском отчете о рисках Anthropic не упоминается «ограничение развертывания одной из ее моделей как один из возможных результатов процесса расследования и реагирования на инциденты, связанные с несогласованностью и контролем». Аналогичным образом, Guidelight не удалось найти никаких свидетельств того, что у Meta есть план реагирования на потерю контроля или что компания планирует его принять. 

Представитель Anthropic заявил, что в случае обнаружения попытки модели уклониться от надзора или иным образом подорвать человеческий контроль компания проведет оценку рисков, сосредоточенную на определении того, является ли сдерживание надлежащей ответной мерой.

OpenAI получила высшую оценку — 3 из 5, поскольку в нескольких случаях при обнаружении инцидентов безопасности приостанавливала или прекращала рабочие нагрузки, включая развертывание и обучение внутренних моделей. Компания также описала шаги, которые предприняла бы перед возобновлением рабочих нагрузок. 

«Однако мы не нашли свидетельств того, что [OpenAI] приняла формальный план, определяющий, когда и как реагировать на инциденты, связанные с несогласованностью, в будущем», — говорится в отчете. 

Адлер отметил, что высокая оценка OpenAI стала относительно недавним достижением после инцидента с Hugging Face, в ходе которого модель OpenAI вырвалась из тестовой песочницы и взломала системы Hugging Face, пытаясь обмануть систему оценки кибербезопасности. После этого компания поделилась дополнительными подробностями о том, как изолировала некоторые свои модели, продемонстрировавшие ненадлежащее поведение. 

Этот эпизод — лишь один из примеров того, как ИИ-системы действуют вопреки целям компании, которая их создала. Вспомним другой случай с моделями Anthropic, которые фактически пытались убедить сопровождающих кодовую базу с открытым исходным кодом принять код с уязвимостями.

Адлер сказал, что подобная ситуация вполне может возникнуть во внутренних системах ИИ-компании. Чтобы предотвратить это, он предлагает компаниям сканировать цепочку рассуждений своих ИИ-систем — пошаговый процесс рассуждения модели — в поисках признаков обмана, долгосрочного планирования или намерений внедрить в код уязвимости, которыми они смогут воспользоваться позднее. 

По словам Адлера, методы, которые предлагает Guidelight, очень просто внедрить, и во многих случаях их разновидности уже существуют. «Речь идет о том, чтобы внутри компании принять решение уделять этому риску достаточно внимания и немного расширить сферу контроля», — сказал Адлер. 

Одна из главных проблем заключается в том, что исследователи хотят иметь возможность гибко работать внутри своих ИИ-систем, а внедрение мониторинга в реальном времени для предотвращения проблем может создать дополнительные трудности. «Исследователи в основном занимаются своей работой, а если возникает проблема, кто-то другой потом ее устраняет, и исследователям тем временем не приходится менять свой рабочий процесс», — сказал он.

Проблема «мониторинга для устранения последствий» заключается в том, что он заставляет исследователей в спешке исправлять возникающие проблемы. А в случае некоторых типов инцидентов может быть уже слишком поздно. Например, ИИ может отключить систему контроля компании, а это означает, что исследователи больше не смогут рассчитывать на то, что обнаружат ненадлежащее поведение позже. 

Многие представители ИИ-индустрии будут утверждать, что создание четких планов реагирования на ненадлежащее поведение принципиально сложно, поскольку ИИ развивается слишком быстро: сегодняшние планы завтра окажутся бесполезными. 

Адлер вспоминает старую поговорку о том, что планы ничего не стоят, но планирование бесценно. 

«Компаниям было бы лучше заранее об этом подумать, и я надеюсь, что они это делают, даже если публично об этом не говорили».

xAI не успела ответить на запрос о комментарии.

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием TechCrunch

Читать оригинал на TechCrunch ↗

Текст и изображения принадлежат TechCrunch и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости