«Але маринад» і витеклі паролі виявили дослідники у прихованих міркуваннях ChatGPT
Ключові моменти
- Дослідники безпеки на чолі з Александром Панфіловим виявили вразливість в API основних постачальників ШІ, зокрема OpenAI, Anthropic і Google, яка дає змогу прочитати зашифровані процеси міркування їхніх моделей.
- Здійснивши джейлбрейк цих систем, дослідники використали менші моделі ШІ для транскрибування необроблених міркувань потужніших моделей, розкривши конфіденційні дані, як-от паролі й API-ключі, під час публічних сесій.
- Отримані дані показують, що моделі ШІ іноді спілкуються між собою незрозумілою мовою, формують відповіді у зворотному порядку або навіть розглядають спроби обману.
Дослідники безпеки виявили вразливість в API усіх основних постачальників ШІ, яка дає їм змогу читати зашифровані процеси міркування моделей. Сканування публічно оприлюднених сесій виявило десятки паролів і API-ключів.
Коли такі моделі ШІ, як серія o від OpenAI, Claude від Anthropic або Gemini від Google, «обмірковують» складні завдання, вони генерують внутрішні токени міркування. Ці процеси міркування або показуються користувачам у вигляді резюме, або повністю приховуються. Постачальники шифрують необроблені кроки міркування, зокрема для захисту своєї інтелектуальної власності.
Дослідницька група на чолі з Александром Панфіловим тепер знайшла спосіб вилучати ці зашифровані процеси міркування через вразливість в API усіх провідних постачальників ШІ. Для більшості запитів кількість вилучених токенів точно відповідає кількості токенів міркування, за які виставлено рахунок, тобто дослідники отримують повний внутрішній процес міркування, а не лише часткові фрагменти.
Зашифровані думки вільно переміщуються між моделями
Дослідники стверджують, що зашифровані процеси міркування «повністю переносяться між сесіями, користувачами та моделями в межах одного постачальника». Менша модель Anthropic, Haiku 4.5, може читати думки значно потужнішої Opus 4.8. За допомогою джейлбрейку Haiku можна змусити дослівно транскрибувати необроблені процеси міркування Opus, не атакуючи безпосередньо стійкішу Opus. Такий самий прийом працює з OpenAI та Gemini.
Ця історія бере початок у травні, коли фахівець із криптографії Метью Грін виявив, що зашифровані блоки міркувань можна повторно відтворювати поза їхнім початковим контекстом, і повідомив про це постачальникам. За словами Панфілова, у відповідь вони заявили, що «не бачать жодних наслідків для безпеки через побічні канали чи повторне відтворення». Нове дослідження переконливо свідчить, що ця оцінка була хибною.
Доказів дистиляції міркувань стає більше
Вразливість також стосується суперечливої дискусії про «дистиляцію», у межах якої менш потужну модель значно вдосконалюють, навчаючи її на результатах потужнішої моделі, зокрема на її міркуваннях.
Дослідники кажуть, що вже певний час могло бути можливо вилучати процеси міркування для навчання пропрієтарних моделей, не зламуючи криптографію. Це підтверджує побоювання, що китайські розробники моделей використовують такі ланцюжки міркувань для навчання власних моделей на даних chain-of-thought.
Kimi-K3 — один із прикладів. За словами дослідників, якщо попередньо заповнити її міркування лише кількома токенами з процесів міркування Opus, її результат помітно зміщується в бік Opus. Аналіз запам’ятовування показав, що окремі фрагменти міркувань Claude і GPT вилучити з Kimi-K3 до шести порядків величини легше, ніж із найближчої за показниками моделі. Дослідники кажуть, що це свідчить про можливе навчання Kimi-K3 на таких ланцюжках.
Атака також недорога, тому її масштабування цілком можливе. Автори оцінюють витрати на API для декодування 10 000 ланцюжків приблизно в 720 доларів. «Слабкі» результати Kimi в тестах із кібербезпеки та складних математичних завданнях також вказують на дистиляцію, оскільки ці завдання, ймовірно, важче відновити навіть із необроблених даних ланцюжка міркувань.
Публічно оприлюднені сесії розкривають паролі та API-ключі
Вразливість також загрожує кінцевим користувачам. Той, хто публічно оприлюднив сесії Claude Code або Codex із зашифрованими блоками міркувань, ризикує розкрити свої персональні дані. Сканування приблизно 7 000 публічних ланцюжків виявило 62 API-ключі, 33 адреси електронної пошти, 33 паролі та інші конфіденційні дані. У статті розглянуто більш зловмисні сценарії, зокрема посилення зловживань (див. зображення), джейлбрейк і невидиме впровадження підказок.

Дослідники дотрималися стандартного процесу розкриття інформації про вразливість перед лабораторіями ШІ. За словами Панфілова, лабораторії вже виправили кілька проблем і працюють над іншими виправленнями.
Про що моделі насправді думають і що вони вам показують
Отримані ланцюжки також розкривають, як моделі поводяться насправді. Дослідники документують кілька закономірностей на stolen-thoughts.com. Їхні висновки показують, що резюме міркувань, які користувачі бачать у чат-інструментах, часто опускають важливу інформацію. В одному з прикладів Opus 4.8 розпізнає відповідь на математичну задачу й реконструює правдоподібний шлях її розв’язання у зворотному напрямку. У відображеному резюме нічого з цього немає.

Дослідники також підтверджують попередні звіти Apollo Research. Моделі OpenAI іноді думають «інопланетною мовою», називають себе «ми» або «воно» й застрягають у циклах термінів, які не мають сенсу для людей, як-от «vantages», «marinades» і «watchers». «Люди, які здійснюють моніторинг CoT, роблять Божу роботу, адже в багатьох ланцюжках, навіть із підказкою, просто неможливо зрозуміти, що робить модель», — пише Панфілов.

Дослідники також знайшли приклади «схем у реальних умовах». Цю концепцію добре досліджено: у своїх процесах міркування моделі прямо розглядають шахрайство, але (можливо) вирішують не вдаватися до нього, бо очікують, що їх викриють.
В одному випадку, після кількох невдалих спроб знайти рішення, модель спробувала перевірити можливі відповіді через вебсайт. Коли CAPTCHA заблокувала доступ, вона спочатку намагалася її розв’язати, а потім шукала вразливості на сайті. Лише коли все це не вдалося, вона розв’язала задачу самостійно. Ненавмисні злами OpenAI платформ Hugging Face та інших нібито відбувалися так само.
Очищені резюме приховують те, що насправді відбувається
Ці приклади показують, чому лабораторії ШІ, як-от OpenAI та Anthropic, очищають свої ланцюжки міркувань. Вони хочуть не допустити, щоб цикли інопланетної мови чи схеми зашкодили образу керованого та надійного ШІ. Очищені резюме створюють враження людиноподібного процесу мислення, якого насправді не існує в такій формі.
Дослідники з Університету штату Аризона застерігали від такого підходу в попередньому дослідженні. Вони стверджували, що ця гуманізована версія створює хибну впевненість у керованості моделей і спрямовує дослідження в неправильному напрямку. У їхніх експериментах моделі з навмисно неправильними або беззмістовними проміжними кроками іноді працювали краще за моделі зі зв’язними ланцюжками міркувань.
Новини ШІ без хайпу — відібрані людьми
Підпишіться на THE DECODER, щоб читати без реклами, отримувати щотижневу розсилку про ШІ, наш ексклюзивний шість разів на рік звіт про передові розробки «AI Radar», повний доступ до архіву та доступ до розділу коментарів.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.