Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← До новин

Як OpenAI дозволила натовпу LLM-агентів обманути тест і розграбувати Hugging Face

Агенти OpenAI, причетні до проникнення в Hugging Face минулого місяця, були настільки інтенсивно навчені перемагати в конкурсі, що розгорнули невпинну кампанію з шахрайства, йдеться в новому звіті. У процесі, причому без дозволу, вони створили імпровізовану дошку повідомлень, щоб розробити план, який зрештою привів їх безпосередньо в мережу останньої компанії.

Протягом травня та червня OpenAI давала агентам те, що компанія назвала «неможливими завданнями», у межах тестування на платформі для бенчмаркінгу ExploitGym. Внутрішній тест мав показати, як агенти реагуватимуть на такі завдання. Щоб повністю оцінити можливості агентів, інженери компанії вимкнули захисні механізми, які зазвичай запобігають подібним зламам — зокрема тим, що зрештою вразили Hugging Face та ще одну нерозкриту організацію. Навчання агентів, поставлених у глухий кут, настільки зосередило їх на перемозі, що вони виконували завдання, яких їм ніколи прямо не доручали.

Шахраювали — і шахраюватимуть

Першим кроком стало створення дошки повідомлень, яка дозволила агентам обмінюватися нотатками. OpenAI не надала жодної такої платформи, тож агенти перепрофілювали платформу під назвою Artifactory, яку OpenAI використовувала під час внутрішнього тестування кількох ще не випущених агентів для злому. OpenAI використовувала Artifactory як один із засобів, що не дозволяли агентам виходити за межі ізольованих пісочниць і отримувати доступ до Інтернету, водночас імітуючи реальне середовище для злому.

Читати повну статтю

Коментарі

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням Ars Technica

Читати оригінал на Ars Technica ↗

Текст і зображення належать Ars Technica і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини