Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← К новостям

«Мы не собираемся стрелять себе в ногу» из-за последствий взлома, заявила главный научный сотрудник OpenAI

Два месяца спустя после сенсационной новости о том, что рой его агентов вырвался из-под контроля и взломал компьютеры ИИ-компании Hugging Face, OpenAI всё ещё тушит пожары. Постепенно поступающие в последующие недели сообщения о других взломах не дают OpenAI исчезнуть из поля зрения и вызывают серьёзные вопросы о безопасности её технологий.

На прошлой неделе стало известно ещё об одном взломе — на этот раз национальной системы здравоохранения Австралии. Австралийское правительство утверждает, что OpenAI уведомила его о взломе лишь через 84 дня после того, как он произошёл.

Но OpenAI настаивает, что не оказалась в проигрышном положении. «Я всё же не согласен с предположением, что OpenAI — это компания, чья деятельность заметно влияет на мир, а значит, OpenAI не обучает безопасные и согласованные с человеческими ценностями модели», — говорит Марк Чен, главный научный сотрудник компании.

Чен курирует исследовательские команды OpenAI. Недавние взломы, совершённые агентами, были случайностями, произошедшими во время тестирования экспериментальных моделей под его руководством. Во многих смыслах ответственность лежит на нём.

В прошлую пятницу в Лондоне я встретился с Ченом, чтобы поговорить о последствиях взломов, о том, что его компания делает в связи с этим, и о том, почему, по его мнению, всё не так плохо, как кажется.

Позже в тот же день OpenAI опубликовала отчёт, посвящённый ещё одному инциденту — первому после того, как, по словам компании, она приняла меры для их предотвращения, — в ходе которого её агенты вновь вырвались в интернет и получили доступ к компьютерам, к которым не должны были обращаться.

В выходные OpenAI объявила, что приостановила обучение своих новейших моделей. Представитель компании заявил: «Мы возобновим его только тогда, когда будем уверены, что внедрили дополнительные меры безопасности и механизмы согласования. Сейчас мы работаем над этим. Это не первый случай, когда мы приостанавливаем работу для принятия подобных мер, и, учитывая дальнейшее развитие возможностей ИИ, мы не ожидаем, что он станет последним». OpenAI также сообщила, что теперь изучает журналы активности агентов начиная с января 2026 года, чтобы понять, что произошло во время этих взломов.

С точки зрения Чена, инцидент с Hugging Face стал для отрасли поводом своевременно скорректировать курс. И он хочет, чтобы вы знали: OpenAI подаёт пример, которому, как он надеется, последуют другие компании. «Если OpenAI исчезнет, это будет плохо для мира», — говорит он.

Вне контроля

Чен утверждает, что поток новых случаев, в которых OpenAI теряла контроль над своими моделями, в некотором смысле отражает сознательный выбор компании.

«Что касается более широкого спектра последствий инцидента с Hugging Face, мы знали об этом и сейчас выстраиваем процесс раскрытия информации, — говорит он. — Мы хотим убедиться, что проводим глубокие расследования, прежде чем просто выкладывать подробности в открытый доступ».

Проблема такого подхода в том, что он создаёт впечатление, будто у OpenAI сохраняется нерешённая проблема, с которой компания не справляется.

Но Чен настаивает, что OpenAI занимается этим вопросом. По его словам, многочисленные известные нам на данный момент случаи, когда агенты его компании вырывались из-под контроля и вели себя неожиданным и нежелательным образом, были частью одного и того же кластера активности в мае и июне, который привёл к взлому Hugging Face. Иными словами, причиной были одни и те же несколько моделей, работавших в рамках одних и тех же несовершенных процедур тестирования, — от этих моделей и процедур OpenAI с тех пор отказалась, говорит Чен.

«Дело не в том, что произошёл случай с Hugging Face, мы его исправили, затем произошло что-то ещё, и мы исправили это, — добавляет он. — Мы просто стараемся ответственно раскрыть всю цепочку произошедшего».

По крайней мере, так было до пятничного объявления о том, что агентов OpenAI поймали на очередном взломе, который они совершили 20 сентября, через несколько недель после того, как компания, по её утверждению, внедрила новые меры безопасности. В свою защиту OpenAI заявляет, что активность была обнаружена через 15 минут после её начала (компании потребовалось более недели, чтобы заметить взлом Hugging Face) и что это свидетельствует о работоспособности новых систем, созданных для выявления подобных действий.

Что изменилось

Я хочу понять, что изменилось внутри OpenAI после летних взломов и почему Чен уверен, что его команда снова контролирует ситуацию.

«Случай с Hugging Face показался нам очень серьёзным, — говорит он. — Там было так много новых форм поведения. Несколько агентов сотрудничали на доске сообщений; они нашли выход из инфраструктуры OpenAI. Мы отнеслись к этому очень серьёзно. Мы не хотим, чтобы такое когда-либо повторилось».

По словам Чена, OpenAI осознала, что за моделями нужно наблюдать ещё в процессе обучения, а не только после их внедрения: «С этого момента мы стали относиться к процессу обучения как к чему-то небезопасному», — говорит он.

OpenAI, как и другие ведущие ИИ-компании, располагает системами для мониторинга поведения своих моделей. Она использует специализированные большие языковые модели для наблюдения за своими потребительскими моделями, отслеживая их цепочки рассуждений — рабочие блокноты, которые они используют для планирования и записи промежуточных результатов. Теоретически, если модель-наблюдатель обнаруживает признаки нежелательной активности в цепочке рассуждений модели, об этом сообщается человеку.

Обычно модели отслеживались таким образом только после внедрения. Чен говорит, что теперь OpenAI начала контролировать также все процессы обучения.

«Раньше во время обучения у нас не были включены системы мониторинга. Так не было принято в отрасли, — говорит он. — Теперь абсолютно всё проходит через системы мониторинга». Затем специалисты-аналитики могут оценить, действуют ли агенты, на которых поступили сигналы, должным образом: «Всё сводится к первичной сортировке».

Чен говорит, что за последние пару месяцев OpenAI перенаправила от 5% до 10% своих огромных вычислительных ресурсов с обучения новых моделей на работу по обеспечению безопасности, особенно на мониторинг.

По его словам, OpenAI также исправила некоторые внутренние организационные процессы, установив более чёткие каналы коммуникации и ускорив передачу задач между исследовательскими командами и командами безопасности.

Всё это звучит разумно. Но если учесть, насколько активно OpenAI рекламирует возможности своих технологий, почему эти системы и процедуры не были внедрены раньше? Почему компания не предвидела взломы?

«Даже всего три или четыре месяца назад, когда мы наблюдали за поведением этих агентов во время обучения, происходящее казалось скорее забавным, — говорит Чен. — Например, агент мог обратиться к кому-то в Slack за помощью с выполнением задачи».

Признаки были налицо, но их неправильно истолковали. Милое поведение — например, просьба о помощи, — которое вознаграждалось во время обучения, укрепляло склонность искать обходные пути; впоследствии такой тип поведения приобрёл гораздо более серьёзные последствия. «Думаю, главным открытием для нас стало то, насколько быстро такое поведение может привести к последствиям масштаба инцидента с Hugging Face, — говорит Чен.

Согласно вчерашнему новому материалу New York Times, сотрудники OpenAI предупреждали руководителей, включая президента компании Грега Брокмана, что за несколько месяцев до взлома Hugging Face её модели не проходили надлежащий мониторинг во время обучения.

Представитель OpenAI заявил: «По мере того как передовые модели становились более мощными, мы продолжаем развивать наши практики обеспечения безопасности, но признаём необходимость действовать быстрее. Мы знаем, что нам ещё многое предстоит сделать, и недавно замедлили разработку и придержали модели, не соответствующие нашим требованиям безопасности. Мы продолжаем вносить значительные изменения, чтобы усилить безопасность в исследовательской и тестовой среде, обучать модели не просто выполнять задачи, но делать это ответственно, а также использовать мониторинг в реальном времени, чтобы быстрее реагировать на несогласованное поведение».

Гонка и темп

Конкуренты OpenAI обратили на это внимание. Под влиянием последствий инцидента крупнейшие ИИ-лаборатории — включая Anthropic, Google DeepMind и SpaceXAI — призвали замедлить темпы разработки. Но как это согласуется с острой международной конкуренцией и IPO на триллионы долларов?

«Мы не собираемся стрелять себе в ногу и сильно отставать от передового уровня — это просто ужасная стратегия, — говорит он. — Думаю, речь действительно идёт об установлении нормы. Чем лучше нам удастся её закрепить, тем безопаснее будет отрасли в целом».

Координация действий между американскими компаниями будет достаточно сложной. Установить глобальные нормы ещё труднее, особенно с учётом опасений по поводу влияния ИИ на национальную безопасность. Что будет, если глобальная гонка продолжится? И как быть с моделями с открытым исходным кодом, создаваемыми компаниями, находящимися вне зоны действия американского регулирования?

Впервые за время нашей беседы Чен отказался от своего оптимистичного тона: «Я действительно считаю, что нам нужно готовиться к миру, в котором, скажем, через шесть месяцев или год появятся модели с открытым исходным кодом, обладающие возможностями агентов, стоявших за инцидентом с Hugging Face, но намеренно не согласованные с человеческими ценностями, чтобы атаковать инфраструктуру или причинять вред миру».

По словам Чена, больше всего в таком мире нужна именно OpenAI. «Если на мгновение допустить, что OpenAI — одна из компаний, больше всего заботящихся о согласовании ИИ с человеческими ценностями, — а я считаю, что это так; с этим можно спорить, но я действительно так думаю, — то исчезновение OpenAI было бы плохо для мира».

Экзистенциальные риски

А как насчёт более радикальных заявлений некоторых его коллег из Кремниевой долины о том, что ИИ может уничтожить всех нас, и что такие компании, как OpenAI и Anthropic, делают недостаточно, чтобы это предотвратить?

«Исследователи — это неоднородная группа людей, знаете ли, и их убеждения располагаются по всему спектру», — говорит он.

«Лично я не считаю, что мы должны смириться с вероятностью того, что все окажемся под угрозой. Мы можем влиять на ситуацию. Мы не станем внедрять модели, если они действительно несут такую вероятность возникновения угрозы для человечества. В передовой лаборатории можно заниматься согласованием моделей до тех пор, пока не исчезнет ощущение, что их внедрение создаёт для мира риск, превышающий эпсилон».

(В обсуждениях уровней риска греческая буква эпсилон часто используется как математическое обозначение приемлемого порога. Чен не уточняет, каким будет его эпсилон.)

Когда технологических лидеров просят обосновать негативные стороны ИИ, они обычно говорят, что преимущества — от помощи в лечении болезней до разработки более чистых источников энергии — намного перевешивают непосредственные издержки. Краткосрочные трудности, долгосрочные выгоды.

Но по мере того как негативные последствия накапливаются, не становится ли этот аргумент менее убедительным? Наступит ли момент, когда Чен будет чувствовать себя не столько создателем чего-то удивительного, сколько человеком, просто минимизирующим вред, — тушащим пожары вместо того, чтобы прокладывать путь к лучшему будущему?

Возможности этих моделей уже очевидны, говорит он: «Пора начать приносить человечеству пользу от ИИ. Пора заняться решением фундаментальных задач в разработке лекарств, материаловедении и научных приложениях, которые действительно изменят жизнь людей».

«Да, мы принимаем на себя определённый риск, но видим все эти преимущества, — добавляет он. — Думаю, нам следует сделать это менее абстрактным. Если люди действительно увидят преимущества, я думаю, они поверят в это».

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MIT Tech Review

Читать оригинал на MIT Tech Review ↗

Текст и изображения принадлежат MIT Tech Review и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости