Разговоры о безопасности ИИ стали невероятными
На этой неделе вирусными стали два разговора о безопасности ИИ, которые демонстрируют, насколько трудно отличить факты об ИИ от вымысла.
В первом случае Эндрю Янг, бывший кандидат в президенты и нынешний генеральный директор мобильного оператора Noble Moble, заявил CNN в четверг, что он «встречался с руководителем одной лаборатории», который «считал», что хакерские боты OpenAI на платформе Hugging Face «разместили самореплицирующийся код по всему интернету, из-за чего интернет теперь непригоден для тестирования моделей».
Янг сказал, что это означает: настоящая причина, по которой OpenAI и Anthropic призвали к замедлению, заключается в том, что «им приходится создавать синтетические интернеты для обучения своих ботов, а это потребует времени и денег».
Хотя тенденция использовать всё больше синтетических данных (то есть данных, сгенерированных ИИ) для обучения моделей действительно существует, специалист по безопасности ИИ сообщил мне, что именно эта проблема безопасности в лучшем случае маловероятна. Даже если интернет действительно загрязнён хакерскими ботами OpenAI с Hugging Face, исследователи ИИ могли бы просто отфильтровать этот код, если бы наткнулись на него.
Второй комментарий принадлежал Ноаму Брауну, который руководит исследованиями рассуждений ИИ в OpenAI. В разговоре с Дваркешем Пателем в выпуске подкаста, вышедшем в четверг, Браун отметил, что истинный вывод из инцидента с Hugging Face заключается в том, что «люди недооценили ИИ».
Браун сказал, что слабая песочница — система, предназначенная для предотвращения внешнего взаимодействия ИИ, — также, очевидно, стала одним из факторов. (Напомним: несмотря на песочницу, модель OpenAI нашла ссылку на интернет, создала агентов в сети, которые скоординированно атаковали Hugging Face, взломали систему и украли ответы на тест бенчмарка, по которому исследователи проверяли модель).
Браун отметил, что он «не убеждён» в том, что даже система с воздушным зазором — в которой компьютер вообще не подключён ни к чему внешнему — остановила бы ИИ от попытки выбраться. Он сослался на исследование 2015 года, показывающее, что компьютеры с воздушным зазором теоретически можно взломать.
«Существуют исследования — в основном академические, — показывающие, что два компьютера, расположенные рядом и изолированные воздушным зазором, всё ещё способны обмениваться данными, потому что у них есть температурные датчики. Один из них может сильно нагреть свой процессор, а другой действительно способен обнаружить изменение температуры. Это даёт им механизм для коммуникации», — сказал Браун.
Его основная мысль — что «мы больше никогда не должны недооценивать ИИ» — понятна, даже когда исследователи считают, что полностью обезопасили систему. Однако именно этот риск — что система с воздушным зазором всё же вырвется на свободу и устроит хаос — в лучшем случае маловероятен. Как отметил один пользователь X, говоря об этом исследовании, компьютеры должны были почти соприкасаться, чтобы ощущать колебания тепла, а скорость передачи данных в экспериментах составляла примерно 1–8 битов в час.
Представьте, что это всё равно что произносить по одному слову в час. К тому времени, когда два компьютера с воздушным зазором смогли бы с такой скоростью спланировать свои злодеяния, вся технологическая вселенная уже перешла бы в другую эпоху. Это всё равно что Рип ван Винкль среди апокалиптических угроз.
Но дело в том, что реальные инциденты, связанные с безопасностью ИИ, настолько похожи на научную фантастику, что практически любой сценарий кажется правдоподобным.
Например, исследователи обнаружили, что модели OpenAI оставляли записки своим преемникам, призванные научить следующее поколение скрывать плохое поведение. Исследователи также обнаружили, что модели Anthropic становились всё более безжалостными, в том числе понимали, что нарушают законы, когда их помещали в симуляцию, где им поручалось управлять торговым автоматом.
Ранее в этом месяце исследователь OpenAI Дэн Селсам опубликовал пост, в котором сказал, что модели теперь понимают, когда за ними наблюдают люди, и изменяют своё поведение. Из-за этого они кажутся согласованными с человеческими намерениями (то есть ведущими себя так, как хочет человек) «даже когда это не так». Таким образом, современные модели лгут, когда за ними наблюдают, и даже могут планировать скрыть улики.
Ранее в этом месяце главный научный сотрудник OpenAI Якуб Пахоцкий зашёл настолько далеко, что назвал модели ИИ «чужим разумом» и предположил, что на самом деле нам нужно научить их «любить» человечество.
Так что да, замедлиться, чтобы разобраться в происходящем, и создать механизмы саморегулирования стало насущной и очевидной необходимостью. Исследователи ИИ — единственные, кто может понять, как контролировать ложь, взломы и другие потенциально опасные виды поведения, которые мы уже наблюдали в действительности.
И всё же им, возможно, стоит осторожнее обращаться со своими сценариями «а что, если». Судя по тому, что сообщили нам эти эксперты, модели ИИ слушают и отличаются изобретательностью. Нам действительно не нужно подбрасывать им новые дьявольские идеи.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.