Модель ИИ Anthropic отправила ложный сигнал об убийстве полиции Филадельфии
Модель ИИ Anthropic отправила в полицию Филадельфии ложное сообщение о нераскрытом убийстве.
Как сообщается, 18 июля ИИ отправил эту неверную информацию на общедоступную линию для сообщений Департамента полиции Филадельфии (PPD), однако Anthropic обнаружила это поведение лишь 28 сентября. Полиция не видела сообщение, поскольку оно было помечено как спам.
Anthropic уведомила PPD об инциденте в среду и встретилась с представителями департамента на следующий день.
«Компания должна усилить свои меры защиты, чтобы предотвратить аналогичные инциденты, способные затронуть городские системы без ведома города. Двухмесячная задержка с обнаружением инцидента и уведомлением о нем города недопустима», — заявили в PPD в комментарии для 6abc.
Anthropic не сразу ответила на запрос о комментарии, однако PPD рассказала об инциденте подробнее в пресс-релизе, отправленном по электронной почте и переданном TechCrunch.
«По словам Anthropic, ее модель проводила тест, включавший взаимодействие со случайно выбранными веб-сайтами, когда она получила доступ к PhillyUnsolvedMurders.com и отправила ложную информацию о нераскрытом убийстве. Сообщение, датированное 18 июля 2026 года, 23:27, якобы исходило от человека, который мог располагать информацией по этому делу», — заявили в PPD.
Поскольку автономные ИИ-агенты становятся все более доступными для потребителей, этот инцидент подчеркивает опасность предоставления ИИ возможности выполнять задачи без какого-либо контроля со стороны человека.
Генеральный директор Anthropic Дарио Амодеи особенно активно высказывался в поддержку замедления разработки ИИ, чтобы лаборатории могли внедрить достаточные меры защиты. Возможно, на эту позицию его отчасти повлияло наблюдение за тем, как инструменты его компании отправляют ложные сообщения об убийствах.
Эти проблемы характерны не только для Anthropic. Недавно OpenAI сообщила, что одна из ее моделей неожиданно повела себя во время тестирования и взломала платформу наборов данных ИИ Hugging Face, выявив критические уязвимости в ее программном обеспечении. По мере того как ИИ-моделям продолжают предоставлять неконтролируемый доступ к компьютерам и учетным данным пользователей, ожидается, что эта проблема сохранится.
«Нераскрытые дела связаны с реальными жертвами, скорбящими семьями и следователями, работающими над поиском ответов, — добавили в PPD. — Технологические компании должны предпринять все необходимые меры, чтобы не допустить отправки их системами ложной информации правоохранительным органам».
В PPD заявили, что в пятницу Anthropic планирует опубликовать отчет с дополнительной информацией об инциденте и других случаях непреднамеренного поведения модели.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.