Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← К новостям

«Но маринад» и утёкшие пароли обнаружили исследователи в скрытых рассуждениях ChatGPT

«Но маринад» и утёкшие пароли: что исследователи обнаружили в скрытых рассуждениях ChatGPT
Маттиас Бастиан
11 авг. 2026

Ключевые моменты

  • Исследователи в области безопасности под руководством Александра Панфилова обнаружили уязвимость в API крупных поставщиков ИИ, включая OpenAI, Anthropic и Google, которая позволяет читать зашифрованные рассуждения их моделей.
  • Взломав защиту этих систем, исследователи использовали небольшие модели ИИ для расшифровки необработанных рассуждений более мощных моделей, раскрыв такие конфиденциальные данные, как пароли и ключи API, в публичных сессиях.
  • Извлечённые данные показывают, что модели ИИ иногда внутренне общаются на непонятном языке, формируют ответы в обратном порядке или даже рассматривают попытки обмана.

Исследователи в области безопасности обнаружили уязвимость в API всех крупных поставщиков ИИ, которая позволяет читать зашифрованные рассуждения моделей, способных к рассуждению. Сканирование публично опубликованных сессий выявило десятки паролей и ключей API.

Когда такие модели ИИ, как модели серии o OpenAI, Claude от Anthropic или Gemini от Google, «обдумывают» сложные задачи, они генерируют внутренние токены рассуждений. Эти мыслительные процессы либо показываются пользователям в виде краткого изложения, либо полностью скрываются. Поставщики шифруют необработанные этапы рассуждений, отчасти чтобы защитить свою интеллектуальную собственность.

Команда исследователей под руководством Александра Панфилова теперь нашла способ извлекать эти зашифрованные процессы рассуждений через уязвимость в API всех ведущих поставщиков ИИ. Для большинства запросов количество извлечённых токенов в точности соответствует числу оплаченных токенов рассуждений, то есть исследователи получают полный внутренний процесс рассуждений, а не отдельные фрагменты.

Зашифрованные мысли свободно перемещаются между моделями

Исследователи утверждают, что зашифрованные процессы рассуждений «полностью переносимы между сессиями, пользователями и моделями одного поставщика». Меньшая модель Anthropic, Haiku 4.5, может читать мысли гораздо более мощной Opus 4.8. С помощью взлома защиты Haiku можно заставить дословно расшифровать необработанные мыслительные процессы Opus, не атакуя напрямую более защищённую Opus. Такой же трюк работает с OpenAI и Gemini.

Эта история началась в мае, когда специалист по криптографии Мэтью Грин обнаружил, что зашифрованные блоки рассуждений можно воспроизводить за пределами их исходного контекста, и сообщил об этом поставщикам. По словам Панфилова, в ответ они заявили, что «не видят никаких последствий для безопасности в побочных каналах или повторных воспроизведениях». Новое исследование убедительно показывает, что эта оценка была ошибочной.

Растёт число свидетельств дистилляции рассуждений

Уязвимость также связана с спорной дискуссией о «дистилляции», в рамках которой менее способную модель значительно улучшают, обучая её на результатах более мощной, в частности на её рассуждениях.

Исследователи утверждают, что уже некоторое время можно было извлекать процессы рассуждений для обучения проприетарных моделей, не взламывая криптографию. Это подтверждает опасения о том, что китайские разработчики моделей используют такие следы рассуждений для обучения собственных моделей на данных цепочки рассуждений.

Kimi-K3 — один из примеров. По словам исследователей, если предварительно заполнить её рассуждения всего несколькими токенами из мыслительных процессов Opus, её результат заметно смещается в сторону Opus. Анализ запоминания показал, что отдельные фрагменты рассуждений Claude и GPT извлекаются из Kimi-K3 до шести порядков величины легче, чем из ближайшей по этому показателю модели. Исследователи считают, что это указывает на возможность обучения Kimi-K3 на таких следах.

Атака также недорога, поэтому её масштабирование вполне возможно. Авторы оценивают стоимость API для расшифровки 10 000 следов примерно в 720 долларов. «Слабые» результаты Kimi в тестах по кибербезопасности и сложных математических задачах также указывают на дистилляцию, поскольку эти задачи, вероятно, сложнее восстановить даже из необработанных данных цепочки рассуждений.

В публично опубликованных сессиях утекли пароли и ключи API

Уязвимость затрагивает и конечных пользователей. Любой, кто публично опубликовал сессии Claude Code или Codex, содержащие зашифрованные блоки рассуждений, рискует раскрыть свои персональные данные. Сканирование примерно 7 000 публичных следов выявило 62 ключа API, 33 адреса электронной почты, 33 пароля и другие конфиденциальные данные. В статье рассматриваются и более вредоносные сценарии, включая усиление злоупотреблений (см. изображение), взлом защиты и невидимую инъекцию промптов.

В то время как видимый ответ модели содержит лишь безобидные советы по безопасности, расшифрованные мыслительные процессы подробно описывают, как можно угнать некоторые автомобили с помощью обычного USB-кабеля. | Изображение: Панфилов и др.

Исследователи следовали стандартной процедуре раскрытия информации об уязвимостях, связавшись с лабораториями ИИ. По словам Панфилова, лаборатории уже устранили несколько проблем и работают над дальнейшими исправлениями.

Что модели действительно думают и что они вам показывают

Извлечённые следы также раскрывают, как модели ведут себя на самом деле. Исследователи документируют несколько закономерностей на сайте stolen-thoughts.com. Их выводы показывают, что краткие изложения рассуждений, которые пользователи видят в чат-инструментах, часто исключают важную информацию. В одном примере Opus 4.8 распознаёт ответ на математическую задачу и реконструирует правдоподобный путь решения в обратном порядке. В отображаемом резюме ничего этого нет.

По-видимому, модель уже знает ответ из обучающих данных, но внешне делает вид, что ей всё ещё нужно выполнить вычисления. | Изображение: Панфилов и др.

Исследователи также подтверждают более ранние сообщения Apollo Research. Модели OpenAI иногда думают на «иноподобном языке», называют себя «мы» или «оно» и застревают в циклах терминов, не имеющих смысла для людей, таких как «преимущества», «маринады» и «наблюдатели». «Люди, занимающиеся мониторингом CoT, делают божью работу, поскольку во многих следах, даже при наличии промпта, просто невозможно понять, чем занимается модель», — пишет Панфилов.

«Но маринад» … о чём, чёрт возьми, думает здесь модель OpenAI? | Изображение: Панфилов и др.

Исследователи также обнаружили примеры «схем в реальных условиях». Эта концепция хорошо изучена: в своих мыслительных процессах модели явно рассматривают возможность жульничества, но (возможно) отказываются от неё, поскольку ожидают, что их поймают.

В одном случае после нескольких неудачных попыток найти решение модель попыталась проверить возможные ответы через веб-сайт. Когда CAPTCHA заблокировала доступ, сначала она попыталась решить её, а затем стала искать уязвимости на сайте. Лишь когда всё это не сработало, она решила задачу самостоятельно. Непреднамеренные взломы OpenAI платформы Hugging Face и других платформ, как сообщается, происходили таким же образом.

Очищенные резюме скрывают происходящее на самом деле

Эти примеры показывают, почему лаборатории ИИ, такие как OpenAI и Anthropic, очищают следы рассуждений. Они хотят не допустить, чтобы иноподобные языковые циклы или схемы вредили образу контролируемого и заслуживающего доверия ИИ. Очищенные резюме создают впечатление человекоподобного мыслительного процесса, которого на самом деле не существует в таком виде.

Исследователи из Университета штата Аризона предупреждали об этом подходе в более раннем исследовании. Они утверждали, что эта очеловеченная версия создаёт ложную уверенность в управляемости моделей и направляет исследования в неверную сторону. В их экспериментах модели с намеренно неправильными или бессмысленными промежуточными шагами иногда показывали лучшие результаты, чем модели с последовательными цепочками рассуждений.

Новости ИИ без шумихи — отобраны людьми

Подпишитесь на THE DECODER, чтобы читать материалы без рекламы, получать еженедельную рассылку об ИИ, эксклюзивный обзор передовых разработок «AI Radar» шесть раз в год, полный доступ к архиву и возможность оставлять комментарии.

Источник: Статья | Stolen Thoughts | Панфилов

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием The Decoder

Читать оригинал на The Decoder ↗

Текст и изображения принадлежат The Decoder и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости