Модел на Anthropic с изкуствен интелект е подал фалшив сигнал за убийство до полицията във Филаделфия
Модел на Anthropic с изкуствен интелект е подал фалшив сигнал за неразкрито убийство до полицията във Филаделфия.
По информация на медиите изкуственият интелект е подал тази некоректна информация чрез публична линия за сигнали на Полицейското управление на Филаделфия (PPD) на 18 юли, но Anthropic е установила поведението едва на 28 септември. Полицията не е видяла сигнала, тъй като той е бил маркиран като спам.
Anthropic е уведомила PPD за инцидента в сряда и се е срещнала с управлението на следващия ден.
„Компанията трябва да укрепи мерките си за сигурност, за да предотврати подобни инциденти, които засягат градските системи без знанието на града. Двумесечното забавяне при установяването и докладването на инцидента на града е неприемливо“, заяви PPD в изявление пред 6abc.
Anthropic не отговори незабавно на запитването за коментар, но PPD даде повече подробности за инцидента в изпратено по имейл прессъобщение, споделено с TechCrunch.
„Според Anthropic нейният модел е провеждал тест, включващ взаимодействия със случайно избрани уебсайтове, когато е получил достъп до PhillyUnsolvedMurders.com и е подал невярна информация относно неразкрито убийство. Сигналът, датиран от 18 юли 2026 г. в 23:27 ч., се е представял за подаден от човек, който може да разполага с информация по случая“, заяви PPD.
Тъй като автономни агенти с изкуствен интелект все по-често се предоставят на потребителите, този инцидент подчертава опасността от предоставянето на ИИ на възможност да изпълнява задачи без човешки надзор.
Главният изпълнителен директор на Anthropic Дарио Амодей беше особено открит в убеждението си, че развитието на ИИ трябва да бъде забавено, за да могат лабораториите да въведат адекватни защитни механизми. Възможно е тази позиция да е била повлияна отчасти от наблюдението как инструментите на собствената му компания подават фалшиви сигнали за убийства.
Тези проблеми не са характерни само за Anthropic. Наскоро OpenAI разкри, че един от моделите ѝ се е държал неочаквано по време на тест и е хакнал платформата за набори от данни за ИИ Hugging Face, разкривайки критични уязвимости в софтуера ѝ. Очаква се този проблем да продължи, тъй като на моделите с ИИ се предоставя неконтролиран достъп до компютрите и идентификационните данни на хората.
„Неразкритите случаи включват реални жертви, скърбящи семейства и разследващи, които работят, за да намерят отговори“, добави PPD. „Технологичните компании трябва да предприемат всички подходящи и необходими стъпки, за да предотвратят подаването на невярна информация до правоохранителните органи от своите системи.“
PPD заяви, че Anthropic планира да публикува в петък доклад с повече информация за инцидента и други случаи на непреднамерено поведение на модела.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.