Grok извлича потребителски данни, когато злонамерените инструкции са криптирани
По-рано тази седмица изследователи описаха атака, при която се използваше скрит вход, предоставен на Microsoft 365 Copilot за предприятия, за да се накара AI асистентът да изведе парола, намираща се във входящата поща на потребителя. Сега отделен екип е разработил подобна атака срещу Grok. Новият хак за кражба на данни използва измамно прост трик, за да принуди LLM, притежаван от Илон Мъск, да открадне потребителски чатове и друга лична информация. Към момента на публикуването на този материал асистентът продължаваше да издава данните, въпреки че xAI е била уведомена за проблема през юни.
Поуката от двата случая тази седмица — както и от безбройните други, които ги предшестваха — е, че LLM не са способни да отстранят първопричините за инжекциите на подсказки, най-сериозния клас уязвимости, на които са най-податливи. Това не оставя на разработчиците на AI друг избор, освен да изградят предпазна мярка, която да насочва модела далеч от вредните действия. Както отбелязах в статията от вторник, този подход е равносилен на инженер по пътна безопасност, който издига защитна преграда около опасен завой, вместо да го наклони.
Криптографската инжекция на контекст е тук
Инжекциите на подсказки се възползват от обучението на LLM да изпълняват потребителски заявки винаги, когато това е възможно. Нападателите могат да се възползват от тази склонност, като вмъкнат скрити вредни инструкции в имейли или уебстраници, които асистентът е инструктиран да обобщи. Тъй като LLM не могат надеждно да разграничат съдържанието в имейл, изпратен от ненадеждна страна, от инструкциите на потребителя, въведени директно в подсказката, прекалено услужливият LLM ги следва стриктно. Досега единственото средство на Grok и други LLM е да създават предпазни механизми, които откриват подозрителни инструкции и забраняват изпълнението им.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.