Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← До новин

LLM по-різному реагують на шкідливі запити, коли використовується водяний знак ШІ

У відповідь на новий закон Європейського Союзу платформи штучного інтелекту впроваджують нові схеми маркування контенту, який вони генерують. Нещодавно Anthropic повідомила, що її майбутні моделі Claude використовуватимуть SynthID-Text — підхід, створений Google і випущений у відкритий доступ. Він використовує секретний ключ, який непомітно змінює процес вибору моделлю наступного слова в реченні. Якщо найімовірнішим наступним словом є «хмарно», ключ може змінити його на «похмуро». Будь-хто, хто знає ключ, може визначити, чи був текст згенерований платформою, яка його використовує.

Нове дослідження показує, що SynthID-Text може змінювати не лише вибір слів, а й інструменти, які викликає модель, а також імовірність того, що вона дотримуватиметься або ігноруватиме обмеження безпеки, яких її навчили дотримуватися. Загроза може стати ще більшою у випадку ворожого запиту, коли зловмисник намагається змусити модель виконати шкідливу дію, наприклад розкрити пароль або іншу конфіденційну інформацію. Інструкції, яких зазвичай не виконували б, у деяких випадках виконуються після впровадження маркування. Це відкриття підкреслює необхідність для розробників ретельно тестувати поведінку їхніх LLM і агентів за умов увімкненого маркування.

Зміна поведінки щодо безпеки

«Порівняно з тими самими моделями без маркування, їхня поведінка безумовно зміниться, особливо коли ми створюємо для них ворожі умови або змушуємо ці моделі викликати інструменти, коли вони забезпечують роботу агента», — розповіла Ars Андреа Сіпосова, дослідниця безпеки ШІ в Lasso Security. «Маркування створене так, щоб бути непомітним для читача, але ми знаємо, що будь-яка зміна в тому, що генерує модель, призведе до певних компромісів — десь це неодмінно проявиться».

Прочитати повну статтю

Коментарі

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням Ars Technica

Читати оригінал на Ars Technica ↗

Текст і зображення належать Ars Technica і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини