Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← К новостям

LLM по-разному реагируют на вредоносные запросы при использовании ИИ-водяного знака

В ответ на новый закон Европейского союза платформы ИИ внедряют новые схемы маркировки создаваемого ими контента. Недавно Anthropic раскрыла, что будущие модели Claude будут использовать SynthID-Text — подход, созданный Google и выпущенный в открытый доступ. Он использует секретный ключ, который незаметно меняет процесс выбора моделью следующего слова в предложении. Например, вместо наиболее вероятного следующего слова «облачно» ключ может выбрать «пасмурно». Любой, кто знает ключ, может определить, был ли текст сгенерирован платформой, использующей этот ключ.

Новое исследование показывает, что SynthID-Text может менять не только выбор слов, но и инструменты, которые вызывает модель, а также вероятность того, что она будет соблюдать или игнорировать защитные ограничения, которым её обучили следовать. Угроза может стать ещё серьёзнее при наличии состязательного запроса, когда злоумышленник пытается заставить модель выполнить вредоносное действие, например раскрыть пароль или другую конфиденциальную информацию. Инструкции, которые обычно не выполнялись бы, в некоторых случаях выполняются после внедрения водяного знака. Этот вывод подчёркивает необходимость для разработчиков тщательно проверять поведение их LLM и агентов при использовании водяных знаков.

Изменение поведения систем безопасности

«По сравнению с теми же моделями без водяных знаков их поведение определённо изменится, особенно если поместить их в состязательные условия или заставить эти модели вызывать инструменты, когда они обеспечивают работу агента, — рассказала Ars исследовательница безопасности ИИ из Lasso Security Андреа Сипосова. — Водяной знак создаётся так, чтобы читатель его не замечал, но мы знаем, что любое изменение в том, что генерирует модель, приводит к определённым компромиссам — где-то это обязательно проявится».

Прочитать статью полностью

Комментарии

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием Ars Technica

Читать оригинал на Ars Technica ↗

Текст и изображения принадлежат Ars Technica и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости