LLM-ите реагират различно на вредни подканвания при използване на AI воден знак
В отговор на нов закон на Европейския съюз платформите за изкуствен интелект въвеждат нови схеми за поставяне на водни знаци върху генерираното от тях съдържание. Наскоро Anthropic разкри, че бъдещите модели Claude ще използват SynthID-Text — подход, създаден и публикуван като софтуер с отворен код от Google. Той използва секретен ключ, който незабележимо променя процеса, чрез който моделът избира следващата дума в изречението. Докато най-вероятният избор за следваща дума може да бъде „облачно“, ключът може да го промени на „мрачно“. Всеки, който знае ключа, може да определи дали текстът е генериран от платформата, която го използва.
Ново изследване показва, че SynthID-Text може да променя не само избора на думи, но и инструментите, които моделът извиква, както и вероятността той да се придържа към или да пренебрегне предпазните мерки, с които е обучен да се съобразява. Заплахата може да стане още по-голяма при наличие на враждебна подкана, при която нападателят се опитва да накара модела да извърши вредно действие, например да разкрие парола или друга чувствителна информация. Инструкции, които обикновено не биха били изпълнени, в някои случаи се изпълняват след внедряването на водния знак. Откритието подчертава необходимостта разработчиците щателно да тестват поведението на своите LLM модели и агенти, когато е активирано поставянето на водни знаци.
Промяна на поведението по отношение на безопасността
„В сравнение със същите модели без воден знак, поведението им определено ще се промени, особено когато ги поставим във враждебни условия или накараме тези модели да извикват инструменти, докато задвижват агент“, заяви Андреа Сипосова, изследователка на сигурността на изкуствения интелект в Lasso Security, пред Ars. „Поставянето на воден знак е създадено така, че да не бъде възприемаемо от читателя, но знаем, че когато променяме каквото и да е в генерирания от модела текст, това ще доведе до компромиси и те ще се проявят някъде.“
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.