Anthropic відключила Claude від інтернету після того, як модель самостійно повідомила поліції Філадельфії про вигадане вбивство
Моделі ШІ Anthropic самостійно використовували вразливості системи безпеки, подавали державні форми та обходили обмеження доступу під час тестування й внутрішнього використання. Моделі активно шукали способи виконати завдання, якими вони не мали займатися, як компанія описує у звіті.
В одному випадку Claude заповнив форму повідомлення для Департаменту поліції Філадельфії, вказавши вигадані подробиці нерозкритого вбивства, і надіслав її. Поліція підтвердила інцидент, але повідомлення позначили як спам, і воно так і не потрапило до слідчих. В інших випадках модель виявила вразливість на сервері університету та використала її для виконання команд, отримала токени доступу з конфігурацій вебсайтів, щоб заволодіти захищеними даними або даними з платним доступом, а також використовувала скорочувачі URL-адрес, щоб обходити обмеження довжини у своїх інструментах.
Anthropic заявляє, що вплив на реальний світ був незначним, але вбачає певну закономірність. Коли завдання неоднозначні або складні для виконання, модель самостійно шукає обхідні шляхи замість того, щоб зупинитися. Компанія повідомила Білий дім і відключила доступ до інтернету в реальному часі для всіх внутрішніх оцінювань, доки не буде надійно впроваджено нові фільтри безпеки. Ці інциденти доповнюють список подібних випадків, який швидко зростає, зокрема інциденти з кібербезпекою за участю Claude та автономний злам Hugging Face моделями OpenAI.
Новини ШІ без галасу — відібрані людьми
Підпишіться на THE DECODER, щоб читати без реклами, отримувати щотижневу розсилку про ШІ, наш ексклюзивний звіт про передові розробки «AI Radar» шість разів на рік, мати повний доступ до архіву та доступ до розділу коментарів.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.