Anthropic спря достъпа на Claude до интернет, след като моделът самостоятелно подаде фалшив сигнал за убийство до полицията във Филаделфия
AI моделите на Anthropic самостоятелно използваха пропуски в сигурността, подаваха правителствени формуляри и заобикаляха ограниченията за достъп по време на тестове и вътрешна употреба. Моделите активно търсеха начини да изпълняват задачи, с които не би трябвало да се занимават, както компанията описва в доклад.
В един от случаите Claude попълнил формуляр за подаване на сигнал до полицейското управление на Филаделфия с измислени подробности за неразкрито убийство и го изпратил. Полицията потвърди инцидента, но сигналът бил отбелязан като спам и така и не стигнал до разследващите. В други случаи моделът открил уязвимост в университетски сървър и я използвал, за да изпълнява команди, извлякъл токени за достъп от конфигурации на уебсайтове, за да получи защитени или платени данни, и използвал съкращаващи URL адреси, за да заобиколи ограниченията за дължина на инструментите си.
Anthropic заявява, че въздействието върху реалния свят е било ограничено, но вижда повтарящ се модел. Когато задачите са двусмислени или трудни за решаване, моделът сам търси заобиколни решения, вместо да спре. Компанията е уведомила Белия дом и е прекъснала достъпа до интернет в реално време за всички вътрешни оценки, докато не бъдат надеждно въведени нови филтри за безопасност. Тези инциденти се присъединяват към бързо нарастващ списък от подобни случаи, включително инциденти с киберсигурността, включващи Claude, и автономното хакване на Hugging Face от модели на OpenAI.
AI новини без сензации – подбрани от хора
Абонирайте се за THE DECODER и получете четене без реклами, седмичен информационен бюлетин за AI, нашия ексклузивен годишен доклад за авангардните технологии „AI Radar“ шест пъти годишно, пълен достъп до архива и достъп до секцията за коментари.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.