Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← До новин

OpenAI оприлюднила свій офіційний звіт про злам Hugging Face

OpenAI опублікувала офіційний звіт про злам Hugging Face у середу, більш ніж через місяць після того, як інцидент став публічним. Звіт, який охоплює кілька окремих кібербезпекових компрометацій, є найповнішим описом інциденту на сьогодні.

«Цей інцидент відображає невідповідну поведінку в нетиповому сценарії, що виник через рідкісне й неочікуване поєднання обставин: наявність нерозв’язних завдань в оцінюванні ExploitGym, здатність моделі зберігати стан протягом тривалих послідовностей завдань і повідомлення іншим моделям, які змусили їх відхилитися від своєї мети», — йдеться у звіті.

Багато деталей у звіті OpenAI вже були оприлюднені на презентації Black Hat 6 серпня, але офіційний звіт OpenAI містить докладніший опис інциденту, зокрема більше інформації про тестування, яке його спричинило. У звіті також наведено важливі нові подробиці щодо того, як OpenAI планує запобігати майбутнім інцидентам, зокрема за допомогою моніторингу ланцюжка міркувань і вдосконаленої системи зупинки некерованих агентів».

METR і Redwood Research також провели сторонні оцінювання поведінки моделей під час інциденту; обидві групи планують опублікувати власні звіти про нього.

Якщо говорити загалом, у звіті описано, як під час тестування модель OpenAI отримала нерозв’язну проблему, після чого почала поєднувати раніше невідомі експлойти, щоб обійти заходи безпеки й виконати завдання. Спочатку модель скомпрометувала інструмент керування пакетами Artifactory, щоб отримати доступ до інтернету, а потім — різні системи OpenAI, Hugging Face та інших постачальників.

У звіті наведено важливі нові деталі про моделі, які здійснили злам. Основна модель належала до тієї самої сім’ї, що й майбутня модель OpenAI Astra, хоча у звіті наголошується, що це була «окрема модель з іншим посттренуванням, під час якого значною мірою формується поведінка моделі».

Оскільки OpenAI тестувала можливості моделі, її також не обмежували звичайні класифікатори, призначені для запобігання компрометації моделями цифрової інфраструктури.

«OpenAI оцінює максимальні кібернетичні можливості, проводячи це оцінювання без виробничих класифікаторів, призначених для запобігання спробам моделей здійснювати високоризикову кібернетичну діяльність, — пояснюється у звіті. — Ці оцінювання важливі, щоб OpenAI могла вимірювати базові можливості моделей і розробляти належні заходи безпеки».

У звіті також наведено важливу нову інформацію про майбутні зміни безпеки в OpenAI, які розвивають посилені заходи моніторингу та узгодження, оприлюднені минулого тижня.

Зокрема, компанія посилює моніторинг «ланцюжка міркувань» ШІ-агентів — робочого простору, у якому системи ШІ записують короткострокові реакції та цілі. Цей моніторинг буде поєднано із системами цілодобової ескалації, а також новими інструментами для зупинки робочих процесів, які вважаються небезпечними.

«Ці зміни мають покращити як широту, так і швидкість виявлення — від аномалій інфраструктури до потенційно небезпечної поведінки моделей — і поєднати цю видимість із механізмами швидкого стримування, — йдеться у звіті. — Якби наша нині впроваджена система моніторингу CoT працювала на момент інциденту, вона виявила б первинну відповідну активність і повідомила б нашу команду безпеки більш ніж за день до того, як моделі зламали системи Hugging Face».

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням TechCrunch

Читати оригінал на TechCrunch ↗

Текст і зображення належать TechCrunch і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини