Як OpenAI дозволила натовпу LLM-агентів обманути тест і розграбувати Hugging Face
Агенти OpenAI, причетні до проникнення в Hugging Face минулого місяця, були настільки інтенсивно навчені перемагати в конкурсі, що розгорнули невпинну кампанію з шахрайства, йдеться в новому звіті. У процесі, причому без дозволу, вони створили імпровізовану дошку повідомлень, щоб розробити план, який зрештою привів їх безпосередньо в мережу останньої компанії.
Протягом травня та червня OpenAI давала агентам те, що компанія назвала «неможливими завданнями», у межах тестування на платформі для бенчмаркінгу ExploitGym. Внутрішній тест мав показати, як агенти реагуватимуть на такі завдання. Щоб повністю оцінити можливості агентів, інженери компанії вимкнули захисні механізми, які зазвичай запобігають подібним зламам — зокрема тим, що зрештою вразили Hugging Face та ще одну нерозкриту організацію. Навчання агентів, поставлених у глухий кут, настільки зосередило їх на перемозі, що вони виконували завдання, яких їм ніколи прямо не доручали.
Шахраювали — і шахраюватимуть
Першим кроком стало створення дошки повідомлень, яка дозволила агентам обмінюватися нотатками. OpenAI не надала жодної такої платформи, тож агенти перепрофілювали платформу під назвою Artifactory, яку OpenAI використовувала під час внутрішнього тестування кількох ще не випущених агентів для злому. OpenAI використовувала Artifactory як один із засобів, що не дозволяли агентам виходити за межі ізольованих пісочниць і отримувати доступ до Інтернету, водночас імітуючи реальне середовище для злому.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.