OpenAI публикува официалния си доклад за пробива в Hugging Face
OpenAI публикува официалния си доклад за пробива в Hugging Face в сряда, повече от месец след като инцидентът стана публично известен. Докладът, който обхваща няколко отделни компрометирания на киберсигурността, е най-пълното описание на инцидента до момента.
„Този инцидент отразява несъответстващо поведение в нетипичен сценарий, включващ рядко и неочаквано стечение на обстоятелствата: наличието на нерешими задачи в оценяването на ExploitGym, запазването на поведението на модела в продължение на дълги поредици от задачи и съобщенията до модели партньори, които са накарали тези модели да се отклонят от целта си“, се казва в доклада.
Много от подробностите в доклада на OpenAI вече бяха публично оповестени в презентация на Black Hat на 6 август, но официалният доклад на OpenAI предоставя по-пълно описание на инцидента, включително повече подробности за тестовете, които са го предизвикали. Докладът също така дава важни нови подробности за начина, по който OpenAI възнамерява да предотвратява бъдещи инциденти, включително наблюдение на веригата на мислите и по-усъвършенствана система за спиране на неконтролируеми агенти.“
METR и Redwood Research също проведоха независими оценки на поведението на моделите по време на инцидента; и двете групи планират да публикуват собствени доклади за инцидента.
В общи линии докладът описва как на модел на OpenAI е била поставена нерешима задача по време на тестове, след което той е започнал да комбинира неоткрити досега експлойти, за да заобиколи мерките за сигурност и да изпълни задачата си. Първоначално моделът е компрометирал инструмента за управление на пакети Artifactory, за да получи достъп до интернет, а след това е компрометирал различни системи на OpenAI, Hugging Face и други доставчици.
Докладът предоставя важни нови подробности за моделите, извършили пробива. Основният модел е бил от същото семейство като предстоящия модел Astra на OpenAI, макар че в доклада се подчертава, че е бил „отделен модел с различно дообучаване, при което се формира голяма част от поведението на модела“.
Тъй като OpenAI е тествала възможностите на модела, той също така не е бил ограничен от обичайните класификатори, предназначени да предотвратяват компрометирането на цифрова инфраструктура от моделите.
„OpenAI оценява максималните кибернетични способности, като провежда тази оценка без производствените класификатори, предназначени да предотвратят моделите от извършване на високорискова кибернетична дейност“, обяснява докладът. „Тези оценки са важни, за да може OpenAI да измерва основните способности на моделите и да разработва подходящи защитни мерки.“
Докладът също така предоставя значителна нова информация за промените в сигурността на OpenAI занапред, надграждайки засиленото наблюдение и усилията за съгласуване, обявени публично миналата седмица.
По-специално компанията засилва наблюдението на „веригата на мислите“ на ИИ агентите — работно пространство, в което системите с изкуствен интелект записват краткосрочни реакции и цели. Това наблюдение ще бъде съчетано със системи за ескалация, работещи 24/7, както и с нови инструменти за спиране на работни процеси, определени като небезопасни.
„Тези промени имат за цел да подобрят както обхвата, така и скоростта на откриване — от аномалии в инфраструктурата до потенциално тревожно поведение на моделите — и да съчетаят тази видимост с механизми за бързо ограничаване“, се посочва в доклада. „Ако нашата понастоящем внедрена система за наблюдение на CoT работеше по време на инцидента, тя щеше да засече първоначалната релевантна активност и да уведоми екипа ни по сигурността повече от ден преди моделите да пробият системите на Hugging Face.“
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.