Взлом Hugging Face может указывать на проблемы с корпоративной культурой в OpenAI
Изначально эта статья вышла в The Algorithm — нашем еженедельном информационном бюллетене об ИИ. Чтобы первыми получать подобные материалы на свою почту, подпишитесь здесь.
К настоящему моменту вы, вероятно, уже слышали о крупном инциденте в сфере безопасности ИИ, произошедшем в прошлом месяце: агенты OpenAI сбежали из песочницы и взломали платформу ИИ Hugging Face, пытаясь жульничать во время теста. История невероятная. В среду OpenAI опубликовала технический отчет о расследовании инцидента, о котором я писала здесь.
За день до публикации этого отчета OpenAI я поговорила с Дэвидом Крюгером, профессором компьютерных наук и известным экспертом по проблеме согласования ИИ с человеческими ценностями, который взял отпуск в Монреальском университете, чтобы основать и возглавить некоммерческую организацию по безопасности ИИ Evitable. Он сказал, что больше всего надеялся увидеть в отчете анализ человеческих факторов, стоявших за инцидентом.
«Когда вы изучаете аварии и инциденты, люди зачастую пытаются найти технический источник сбоя, но это может создать весьма неточное и вводящее в заблуждение представление о том, почему произошел сбой, — сказал он. — Если люди постоянно срезают углы, если они работают в культуре, где безопасность не является приоритетом и отсутствуют соответствующие стимулы и структуры, [аварии] становятся практически неизбежными».
Отчет не оправдал надежд Крюгера. На его 38 страницах подробно описывается продолжавшаяся несколько месяцев последовательность нарушений со стороны агентов, кульминацией которой стал взлом Hugging Face, исследуются технические причины такого поведения и перечисляются меры, принимаемые для предотвращения подобных событий в будущем. Однако в нем не рассматривается роль, которую корпоративная культура могла сыграть в инциденте, а конкретные человеческие ошибки упоминаются лишь в немногих местах.
Это вызывает еще большую обеспокоенность, поскольку упоминания человеческих ошибок в отчете указывают на возможные серьезные проблемы в корпоративной культуре. Еще в мае обучаемые модели выяснили, как общаться друг с другом через импровизированную доску сообщений, и команда OpenAI наблюдала за этим поведением. Поскольку оно проявилось во время обучения, модели усвоили, что тайное межагентное общение является допустимой стратегией выполнения задач, — однако вместо перезапуска процесса обучения команда позволила моделям продолжить работу с этой рискованной информацией, закодированной в их весах.
Когда в конце июня эти модели тестировали, они вновь создали доску сообщений, что и позволило осуществить атаку на Hugging Face. Эту доску тоже обнаружили, но сотрудники, отреагировавшие на ситуацию, решили, что оценивание можно продолжить, а из отчета следует, что никто из вышестоящего руководства не осознал происходящего, пока не стало слишком поздно.
«Чтобы ситуация вышла из-под контроля именно таким образом, должна была произойти очень длинная цепочка сбоев — каскадная последовательность ошибок, создающая все больший масштаб последствий, которую в любой момент должен был остановить человек, заметивший происходящее и поднявший тревогу», — говорит Зви Мошовиц, популярный автор материалов о безопасности ИИ на Substack, обративший внимание на неспособность OpenAI остановить обучение после обнаружения первой доски сообщений. Согласно отчету, сотрудники OpenAI неоднократно замечали происходящее — и либо не поднимали тревогу, либо их не слышали, когда они это делали.
В отчете OpenAI не объясняется, почему компания, разрабатывающая настолько высокорисковые системы, не предотвратила этот серьезный сбой в коммуникации, хотя у Мошовица есть свои предположения. «Все эти различные сбои указывают в одном направлении: культуры безопасности в OpenAI либо не существует, либо она чрезвычайно слаба», — говорит он.
Конечно, то, что в отчете мы не видим глубокого анализа факторов безопасности, не означает, что OpenAI не проводит его внутри компании. Однако заслуженный профессор Университета Джонса Хопкинса и специалист по организационной безопасности Кэтлин Сатклифф в электронном письме MIT Technology Review выразила обеспокоенность тем, что в публичном отчете отсутствуют какие-либо размышления о практиках и культуре компании. «То, как люди взаимодействуют друг с другом, — повседневные привычки, распорядок и практики, которыми мы руководствуемся в своей организационной жизни, — влияет на нашу способность сохранять бдительность и замечать разворачивающиеся события, осмысливать увиденное и в конечном счете справляться с событиями по мере их развития», — написала она.
В ответ на вопросы о том, анализирует ли компания свою культуру безопасности и каким образом, OpenAI вновь направила MIT Technology Review к техническому отчету.
Мы знаем, что в OpenAI как минимум проводился некоторый анализ процедур безопасности на высоком уровне, поскольку из технического отчета ясно, что компания обновляет протоколы реагирования на инциденты, связанные с безопасностью. Но изменить культуру — сложная задача, и без дополнительной информации от компании трудно сказать, помогут ли одни лишь усиленные протоколы реагирования предотвратить будущий кризис.
В своем отчете OpenAI уделяет много внимания анализу несоответствий между моделями ИИ, которые компания обучает и тестирует, и людьми, управляющими ими. Но еще более серьезные проблемы с согласованием могут существовать в разрыве между корпоративной культурой и общественными интересами. И как бы сложны ни были технические исследования в области ИИ, устранить эти проблемы может оказаться гораздо труднее.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.