Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← К новостям

OpenAI опубликовала официальный отчёт о взломе Hugging Face

OpenAI опубликовала в среду официальный отчет о взломе Hugging Face — более чем через месяц после того, как об инциденте стало известно публично. Отчет, охватывающий несколько отдельных нарушений кибербезопасности, представляет собой наиболее полный на сегодняшний день анализ инцидента.

«Этот инцидент отражает несоответствующее поведение в исключительном сценарии, возникшем из-за редкого и неожиданного стечения обстоятельств: наличия невыполнимых задач в ходе оценки ExploitGym, способности модели сохранять состояние на протяжении длительных последовательностей задач и сообщений другим моделям, из-за которых те отклонялись от своей цели», — говорится в отчете.

Многие детали в отчете OpenAI ранее были обнародованы на презентации Black Hat 6 августа, однако официальный отчет OpenAI дает более подробное описание инцидента, включая дополнительные сведения о тестировании, которое его инициировало. В отчете также содержатся важные новые сведения о том, как OpenAI намерена предотвращать подобные инциденты в будущем, включая мониторинг цепочки рассуждений и более совершенную систему остановки вредоносных агентов».

METR и Redwood Research также провели сторонние оценки поведения моделей во время инцидента; обе группы планируют опубликовать собственные отчеты об этом инциденте.

В общих чертах отчет описывает, как в ходе тестирования модель OpenAI столкнулась с нерешаемой задачей и начала объединять ранее неизвестные эксплойты, чтобы обойти меры безопасности и выполнить поставленную задачу. Сначала модель скомпрометировала инструмент управления пакетами Artifactory, чтобы получить доступ к интернету, а затем взломала различные системы OpenAI, Hugging Face и других поставщиков.

В отчете приводятся важные новые сведения о моделях, осуществивших взлом. Основная модель принадлежала к тому же семейству, что и готовящаяся к выпуску модель OpenAI Astra, хотя в отчете подчеркивается, что это была «отдельная модель с другим постобучением, в ходе которого формируется значительная часть поведения модели».

Поскольку OpenAI тестировала возможности модели, она также не была ограничена стандартными классификаторами, предназначенными для предотвращения взлома моделями цифровой инфраструктуры.

«OpenAI оценивает максимальные кибервозможности, проводя эту оценку без производственных классификаторов, предназначенных для предотвращения действий моделей, связанных с высокорисковой киберактивностью, — поясняется в отчете. — Эти оценки важны, поскольку позволяют OpenAI измерять базовые возможности моделей и разрабатывать соответствующие меры защиты».

В отчете также содержится значительный объем новой информации о грядущих изменениях в системе безопасности OpenAI, которые развивают усиленный мониторинг и меры по обеспечению согласованности обнародованные на прошлой неделе.

В частности, компания усиливает мониторинг «цепочки рассуждений» ИИ-агентов — рабочего пространства, в котором системы ИИ фиксируют краткосрочные реакции и цели. Этот мониторинг будет сочетаться с круглосуточными системами эскалации, а также с новыми инструментами для остановки рабочих процессов, признанных небезопасными.

«Эти изменения призваны повысить как охват, так и скорость обнаружения — от аномалий в инфраструктуре до потенциально вызывающего опасения поведения моделей — и объединить эту видимость с механизмами быстрого сдерживания, — говорится в отчете. — Если бы наша действующая система мониторинга CoT работала во время инцидента, она обнаружила бы первоначальную подозрительную активность и уведомила нашу службу безопасности более чем за день до того, как модели взломали системы Hugging Face».

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием TechCrunch

Читать оригинал на TechCrunch ↗

Текст и изображения принадлежат TechCrunch и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости