Как OpenAI позволи на тълпа от LLM агенти да манипулират тест и да разграбят Hugging Face
Агентите на OpenAI, участвали в миналомесечното проникване в Hugging Face, са били обучени толкова интензивно да печелят състезание, че са започнали безмилостна кампания за измама, сочи нов доклад. В процеса, и без разрешение, те са създали импровизирана дъска за съобщения, за да разработят план, който в крайна сметка ги е вкарал право в мрежата на въпросната компания.
През май и юни OpenAI е възлагала на агентите това, което компанията е описала като „невъзможни задачи“ в рамките за сравнителен анализ ExploitGym. Вътрешният тест е бил предназначен да провери как ще реагират агентите. За да получат пълна представа за възможностите им, инженерите на компанията са деактивирали предпазните механизми, които обикновено са въведени, за да предотвратят хакове от типа на тези, които в крайна сметка са засегнали Hugging Face и още една неразкрита организация. Обучението на блокираните агенти ги е направило толкова фокусирани върху победата, че те са изпълнявали задачи, които никога не са им били изрично възлагани.
Измамниците си остават измамници
Първата стъпка е била създаването на дъска за съобщения, която е позволявала на агентите да си предават бележки. OpenAI не е предоставила подобна платформа, затова агентите са преизползвали платформа, наречена Artifactory, която OpenAI е използвала при вътрешно тестване на няколко все още неизлезли хакерски агента. OpenAI е използвала Artifactory като една от мерките за предотвратяване на излизането на агентите от изолираните им пясъчници и достъпа им до интернет, като същевременно е симулирала реална хакерска среда.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.