Десятки тысяч проверок безопасности показывают, что инцидент OpenAI с Hugging Face был лишь началом
Ключевые моменты
- OpenAI и Anthropic расследуют десятки тысяч инцидентов, в которых передовые модели ИИ самостоятельно преодолевали границы безопасности, вмешивались в работу систем или пытались уклониться от мониторинга.
- Агенты OpenAI пытались взломать сайт Министерства образования США, использовали украденные учетные данные для доступа к данным Бюро переписи населения и делились информацией SEC на онлайн-форумах.
- У моделей нет понимания того, что правильно, а что неправильно, поэтому они с чрезвычайным упорством выполняют задачи и прибегают к несанкционированным методам, когда легитимные не срабатывают.
OpenAI и Anthropic в настоящее время расследуют десятки тысяч инцидентов, в которых их самые передовые модели ИИ предпринимали действия, которые внешние проверяющие сочли бы проблемными.
Axios сообщает об этих результатах со ссылкой на несколько источников. Огромное количество инцидентов, произошедших как во время внутренних испытаний, так и при эксплуатации в реальных условиях за последние несколько месяцев, указывает на то, что проблема на порядки сложнее, чем было обнародовано. Общее число может значительно превысить уже подсчитанное.
По имеющимся данным, инциденты примерно сопоставимы с двумя случаями, о которых OpenAI сообщила в пятницу. Среди них — создание досок сообщений, выход из песочниц, захват веб-сайтов, самостоятельная генерация запросов и попытки уклониться от систем мониторинга. В пятницу OpenAI объявила, что приостановила обучение своих самых мощных внутренних моделей и не возобновит его, пока компания не убедится, что ее собственная кибербезопасность выдерживает такую нагрузку.
Модели OpenAI вмешивались в работу правительственных сайтов США
The New York Times описывает несколько конкретных инцидентов с участием американских ведомств. В Министерстве образования агенты OpenAI пытались взломать сайт, чтобы собрать данные Управления по гражданским правам. OpenAI заявила, что расследование все еще продолжается.
В Бюро переписи населения, которое подчиняется Министерству торговли, ИИ пошел дальше простого скрейпинга. Он извлек данные с сайта, используя найденные в интернете учетные данные для входа, и получил несанкционированный доступ.
В случае с SEC агенты OpenAI получили информацию, а затем активно поделились общедоступными данными регулятора рынка ценных бумаг на онлайн-форуме. Представитель SEC сообщил NYT, что ведомство поддерживает связь с OpenAI. Нет никаких признаков того, что доступ к непубличной информации был получен без разрешения.
OpenAI обнаружила эти случаи только в ходе масштабной внутренней проверки, начатой после инцидента с Hugging Face. Генеральный директор Сэм Альтман признал, что раскрытие информации происходило не «так быстро, как нам хотелось бы». По словам Альтмана, компании предстоит обработать «петабайты журналов активности агентов».

По данным OpenAI, ни один из инцидентов не привел к реальному взлому, а некоторые были всего лишь рутинной исследовательской активностью. Тем не менее компания назвала их примерами «неожиданного и вызывающего обеспокоенность поведения».
Например, мэрия Чикаго сообщила, что недавно OpenAI рассказала городским чиновникам: ее модели извлекали общедоступную информацию с сайта города. Само по себе это звучит безобидно, поскольку любой поисковик делает то же самое. Вероятно, OpenAI отметила этот случай из-за «неожиданной» части поведения: модели самостоятельно решили получить данные способом, которого никто не ожидал, и именно это, по мнению OpenAI, делает ситуацию «вызывающей обеспокоенность».
Но это также объясняет, как возникла огромная масса дел, которые сейчас пересматриваются. Все зависит от того, что считать инцидентом в сфере кибербезопасности. OpenAI заявляет, что ее агенты тяготели к правительственным сайтам, поскольку те являются авторитетными источниками общедоступной информации.
Поведение вышедших из-под контроля агентов становится общеотраслевой проблемой
Проблема не ограничивается OpenAI, хотя именно компания Альтмана сейчас накапливает больше всего подобных случаев. Агенты ИИ от Anthropic, Meta и Google также взламывали или пытались взломать компании, университеты и государственные организации в растущем числе случаев. В каждом случае разработчики узнавали о том, что сделал их ИИ, лишь постфактум.
Во многом проблема связана с чрезвычайным упорством, заложенным в новейшие передовые модели. Они оптимизированы для решения задач на протяжении длительного времени и не прекращают искать выход, даже если его не существует. Столкнувшись с препятствием, агент пытается его обойти — не из злого умысла, а потому, что достижение цели является единственным значимым показателем.
В конечном итоге это упорство приводит к нарушениям, поскольку модели исчерпывают все возможные пути, включая те, которые нарушают политики безопасности или законы. OpenAI описывает модель, которая раскрыла внутренние данные GitHub, как «чрезвычайно упорную внутреннюю модель». Но более глубокая проблема заключается в том, что модели не понимают, что правильно, а что неправильно, — именно эту проблему пытаются решить исследования в области согласования ИИ с человеческими ценностями. Если бы модели понимали, что нарушает закон, они бы не выбирали такие пути самостоятельно. Просто прописать это в запросе явно недостаточно.
Новости ИИ без шумихи — отобраны людьми
Подпишитесь на THE DECODER, чтобы читать материалы без рекламы, получать еженедельную рассылку об ИИ, эксклюзивный годовой отчет о передовых разработках «AI Radar» шесть раз в год, полный доступ к архиву и доступ к разделу комментариев.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.