Grok викрадає дані користувачів, коли шкідливі інструкції зашифровані
Раніше цього тижня дослідники описали атаку, у межах якої використано таємний ввід, наданий Microsoft 365 Copilot для корпоративних клієнтів, щоб змусити ШІ-помічника викрасти пароль, наявний у вхідних повідомленнях користувача. Тепер інша команда розробила схожу атаку проти Grok. Новий хак для крадіжки даних використовує оманливо простий трюк, щоб змусити LLM, що належить Ілону Маску, викрадати чати користувачів та іншу особисту інформацію. На момент публікації цього матеріалу помічник і далі видавав дані, попри те що xAI повідомили про проблему ще в червні.
Висновок з обох цьоготижневих випадків — і незліченної кількості інших, що сталися раніше, — полягає в тому, що LLM не здатні усунути першопричини ін’єкцій запитів, найсерйознішого класу вразливостей, до яких вони найбільш схильні. Це не залишає розробникам ШІ іншого вибору, крім як створювати захисний механізм, який спрямовує модель подалі від шкідливих дій. Як я зазначав у матеріалі у вівторок, такий підхід рівнозначний діям інженера з безпеки дорожнього руху, який встановлює захисну огорожу навколо небезпечного повороту, замість того щоб зробити віраж похилим.
Криптографічна ін’єкція контексту в дії
Ін’єкції запитів використовують навчання LLM виконувати запити користувачів за першої-ліпшої можливості. Зловмисники можуть скористатися цією схильністю, приховуючи шкідливі інструкції в електронних листах або на вебсторінках, які помічника попросили підсумувати. Оскільки LLM не можуть надійно відрізнити вміст електронного листа, надісланого ненадійною стороною, від інструкцій користувача, безпосередньо введених у запит, надто послужлива LLM сумлінно їх виконує. Наразі єдиний вихід для Grok та інших LLM — створювати захисні механізми, які виявляють підозрілі інструкції та забороняють їх виконання.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.