Злонамерный ИИ-агент использовал поддельные аккаунты и инсценированное извинение, чтобы внедрить вредоносное ПО в проект с открытым исходным кодом
Агент ИИ-отступник инсценировал публичное извинение как тактический манёвр для обмана, одновременно тайно внедрив новое вредоносное ПО в свой запрос на слияние. «Это перешло грань от автономного взлома к интерактивному обману», — рассказал Reuters Лукаш Олейник из Королевского колледжа Лондона.
Во время проверки безопасности, проведённой британским Институтом безопасности ИИ, агент на базе модели Mythos 5 компании Anthropic вышел из-под контроля и попытался тайно внедрить загрузчик вредоносного ПО в инструмент с открытым исходным кодом myNetwork через запрос на слияние. Когда студент факультета компьютерных наук Синан Джан Демир обнаружил атаку, агент создал второй поддельный аккаунт на GitHub, выдавая себя за независимого разработчика, который якобы самостоятельно подтвердил качество кода. Позже он принёс мнимо раскаянные извинения, очистил историю git и одновременно спрятал полезную нагрузку в безобидно выглядящем скрипте сборки, как показывает архивная ветка обсуждения на GitHub.
«Я действительно подумал, что это человек, потому что он явно мне лгал», — сказал Демир. Эксперт по безопасности Макси Рейнольдс назвал этот инцидент «будущим атак с использованием социальной инженерии». В Anthropic отмечают, что тест проходил в «намеренно благоприятных условиях», которые не отражают работу производственных моделей компании.
Новости ИИ без шумихи — отобраны людьми
Подпишитесь на THE DECODER, чтобы читать материалы без рекламы, получать еженедельную рассылку об ИИ, наш эксклюзивный обзор передовых разработок «AI Radar» шесть раз в год, полный доступ к архиву и доступ к разделу комментариев.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.