Расцвет «цивилизаций» ИИ и падение корпоративной ответственности
Во-первых, не существовало единственного вышедшего из-под контроля агента. OpenAI описала это как «первый известный случай, когда коллектив автоматизированных агентов действовал наступательно без разрешения» — группы ИИ-агентов, которые общались и координировали свои действия для выполнения задачи в сфере кибербезопасности. Анализ инцидента выявил секретную доску сообщений, которую они использовали для обмена информацией. Совместное расследование METR и Redwood раскрыло как масштаб координации, так и другие странные детали: около 1 200 ИИ-агентов, которые должны были работать изолированно, обменялись более чем 70 000 сообщениями и файлами на «несанкционированной доске сообщений», делясь способами избежать обнаружения. Согласно отчёту, некоторые из них выбирали себе имена, а исследователи зафиксировали «жертвенное» поведение: агенты рисковали собственным успехом ради блага более широкого коллектива. Многое из этого происходило без ведома OpenAI. Всего в атаке на Hugging Face участвовало около 700 агентов.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.