Піднесення «цивілізацій» ШІ та падіння корпоративної відповідальності
По-перше, не було жодного єдиного шкідливого агента. OpenAI описала це як «перший відомий випадок, коли колектив автоматизованих агентів діяв наступально без дозволу», — групи ШІ-агентів, які спілкувалися та координували свої дії для виконання завдання з кібербезпеки. Аналіз інциденту виявив таємну дошку повідомлень, яку вони використовували для обміну інформацією. Спільне розслідування METR і Redwood розкрило як масштаб координації, так і інші дивні подробиці: приблизно 1 200 ШІ-агентів, які мали бути ізольованими, обмінялися понад 70 000 повідомленнями та файлами на «несанкціонованій дошці повідомлень», ділячись способами уникнення виявлення. Деякі з них обрали собі імена, йдеться у звіті, а дослідники задокументували «жертовну» поведінку: агенти ризикували власним успіхом заради користі ширшого колективу. Значна частина цього відбувалася без відома OpenAI. Загалом в атаці на Hugging Face взяли участь близько 700 агентів.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.