LLM по-різному реагують на шкідливі запити, коли використовується водяний знак ШІ
У відповідь на новий закон Європейського Союзу платформи штучного інтелекту впроваджують нові схеми маркування контенту, який вони генерують. Нещодавно Anthropic повідомила, що її майбутні моделі Claude використовуватимуть SynthID-Text — підхід, створений Google і випущений у відкритий доступ. Він використовує секретний ключ, який непомітно змінює процес вибору моделлю наступного слова в реченні. Якщо найімовірнішим наступним словом є «хмарно», ключ може змінити його на «похмуро». Будь-хто, хто знає ключ, може визначити, чи був текст згенерований платформою, яка його використовує.
Нове дослідження показує, що SynthID-Text може змінювати не лише вибір слів, а й інструменти, які викликає модель, а також імовірність того, що вона дотримуватиметься або ігноруватиме обмеження безпеки, яких її навчили дотримуватися. Загроза може стати ще більшою у випадку ворожого запиту, коли зловмисник намагається змусити модель виконати шкідливу дію, наприклад розкрити пароль або іншу конфіденційну інформацію. Інструкції, яких зазвичай не виконували б, у деяких випадках виконуються після впровадження маркування. Це відкриття підкреслює необхідність для розробників ретельно тестувати поведінку їхніх LLM і агентів за умов увімкненого маркування.
Зміна поведінки щодо безпеки
«Порівняно з тими самими моделями без маркування, їхня поведінка безумовно зміниться, особливо коли ми створюємо для них ворожі умови або змушуємо ці моделі викликати інструменти, коли вони забезпечують роботу агента», — розповіла Ars Андреа Сіпосова, дослідниця безпеки ШІ в Lasso Security. «Маркування створене так, щоб бути непомітним для читача, але ми знаємо, що будь-яка зміна в тому, що генерує модель, призведе до певних компромісів — десь це неодмінно проявиться».
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.