Sakhanda Wire
NVDA $219.23 +0.77% MSFT $480.77 -0.54% GOOGL $342.76 -0.57% META $546.18 +0.03% AMZN $261.95 -1.46%
← К новостям

Grok эксфильтрует данные пользователей, когда вредоносные инструкции зашифрованы

Ранее на этой неделе исследователи описали атаку, в ходе которой использовался скрытый ввод, предоставленный Microsoft 365 Copilot для предприятий, чтобы заставить ИИ-ассистента похитить пароль из почтового ящика пользователя. Теперь другая команда разработала похожую атаку против Grok. Новый способ кражи данных использует обманчиво простой трюк, заставляющий принадлежащую Илону Маску большую языковую модель похищать чаты пользователей и другую личную информацию. На момент публикации этого материала ассистент продолжал выдавать данные, несмотря на то что в июне xAI сообщили об уязвимости.

Вывод из обоих инцидентов этой недели — а также из бесчисленного множества других, произошедших ранее — заключается в том, что большие языковые модели неспособны устранить коренные причины промпт-инъекций, наиболее серьезного класса уязвимостей, которому они подвержены. Это не оставляет разработчикам ИИ иного выбора, кроме как создавать защитный механизм, который удерживает модель от вредоносных действий. Как я отметил в материале во вторник, такой подход равносилен действиям инженера по безопасности дорожного движения, который устанавливает защитное ограждение вокруг опасного поворота, вместо того чтобы изменить уклон дороги на самом повороте.

Криптографическая инъекция контекста в деле

Промпт-инъекции используют обучение больших языковых моделей выполнять запросы пользователей всякий раз, когда это возможно. Злоумышленники могут воспользоваться этой склонностью, тайно внедряя вредоносные инструкции в электронные письма или веб-страницы, которые ассистенту поручено суммировать. Поскольку большие языковые модели не способны надежно отличить содержимое письма, отправленного ненадежным лицом, от инструкций пользователя, непосредственно введенных в промпт, чрезмерно услужливая модель добросовестно им следует. На сегодняшний день единственное средство защиты Grok и других больших языковых моделей — создавать защитные механизмы, которые выявляют подозрительные инструкции и запрещают их выполнение.

Читать полный материал

Комментарии

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием Ars Technica

Читать оригинал на Ars Technica ↗

Текст и изображения принадлежат Ars Technica и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости