Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← Към новините

„Но марината“ и изтекли пароли са открили изследователи в скритите разсъждения на ChatGPT

„Но марината“ и изтекли пароли са сред нещата, които изследователи откриха в скритото разсъждение на ChatGPT
Матиас Бастиан
11 авг. 2026 г.

Основни моменти

  • Изследователи по сигурността, ръководени от Александър Панфилов, са открили уязвимост в API интерфейсите на водещи доставчици на изкуствен интелект, включително OpenAI, Anthropic и Google, която позволява прочитането на криптираните мисловни процеси на техните модели.
  • Чрез разбиване на защитите на тези системи изследователите са използвали по-малки AI модели, за да транскрибират необработеното разсъждение на по-мощни модели, разкривайки чувствителни данни като пароли и API ключове в публични сесии.
  • Извлечените данни показват, че AI моделите понякога комуникират помежду си на неразбираем език, изграждат отговорите си в обратен ред или дори обмислят опити за измама.

Изследователи по сигурността са открили уязвимост в API интерфейсите на всички водещи доставчици на изкуствен интелект, която им позволява да прочетат криптираните мисловни процеси на моделите за разсъждение. Сканиране на публично споделени сесии е разкрило десетки пароли и API ключове.

Когато AI модели като сериите o на OpenAI, Claude на Anthropic или Gemini на Google „разсъждават“ по сложни задачи, те генерират вътрешни токени за разсъждение. Тези мисловни процеси или се показват на потребителите като обобщение, или се запазват напълно скрити. Доставчиците криптират необработените стъпки на разсъждението, отчасти за да защитят интелектуалната си собственост.

Изследователски екип, ръководен от Александър Панфилов, вече е открил начин за извличане на тези криптирани процеси на разсъждение чрез уязвимост в API интерфейсите на всички водещи доставчици на AI. При повечето заявки броят на извлечените токени съвпада напълно с таксуваните токени за разсъждение, което означава, че изследователите улавят цялото вътрешно разсъждение, а не само частични откъси.

Криптираните мисли се пренасят свободно между моделите

Изследователите твърдят, че криптираните мисловни процеси са „напълно преносими между сесии, потребители и модели в рамките на един доставчик“. По-малкият модел на Anthropic, Haiku 4.5, може да прочете мислите на далеч по-способния Opus 4.8. Чрез разбиване на защитите Haiku може да бъде подведен да транскрибира необработените мисловни процеси на Opus дума по дума, без да атакува директно по-устойчивия Opus. Същият трик работи и с OpenAI и Gemini.

Историята започва през май, когато експертът по криптография Матю Грийн открива, че криптираните блокове с разсъждения могат да бъдат възпроизвеждани извън първоначалния им контекст, и съобщава за това на доставчиците. Според Панфилов техният отговор бил, че „не виждат никакви последици за сигурността от странични канали или повторно възпроизвеждане“. Новото изследване убедително подсказва, че тази оценка е била погрешна.

Натрупват се доказателства за дистилация на разсъждения

Уязвимостта се вписва и в спорния дебат за „дистилацията“, при който по-малко способен модел се подобрява значително чрез обучение върху изходите на по-мощен модел, и по-специално върху неговото разсъждение.

Изследователите твърдят, че от известно време може да е било възможно извличането на процеси на разсъждение за обучение на собствени модели, без да се разбива криптографията. Това подкрепя опасенията, че китайски производители на модели използват тези следи от разсъждения, за да обучават собствените си модели върху данни от веригата на мисълта.

Kimi-K3 е един пример. Ако разсъждението му бъде предварително запълнено само с няколко токена от мисловните процеси на Opus, изходът му осезаемо се измества към Opus, твърдят изследователите. Анализ на запаметяването показал, че конкретни сегменти от разсъжденията на Claude и GPT са до шест порядъка по-лесни за извличане от Kimi-K3, отколкото от следващия най-близък модел. Според изследователите това подсказва, че Kimi-K3 може да е бил обучен върху такива следи.

Атаката също така не е скъпа, така че мащабирането ѝ е осъществимо. Авторите оценяват разходите за API при декодиране на 10 000 следи на около 720 долара. „Слабото“ представяне на Kimi в тестовете за киберсигурност и задачите по сложна математика също насочват към дистилация, тъй като това са задачи, които вероятно са по-трудни за възстановяване дори от необработени данни от веригата на мисълта.

Публично споделени сесии изтичaт пароли и API ключове

Уязвимостта засяга и крайните потребители. Всеки, който е споделил публично сесии на Claude Code или Codex, съдържащи криптирани блокове с разсъждения, рискува личните му данни да бъдат декодирани. Сканиране на приблизително 7000 публични следи е открило 62 API ключа, 33 имейл адреса, 33 пароли и други чувствителни данни. Статията разглежда и по-злонамерени сценарии, включително повишаване на възможностите за злоупотреба (виж изображението), разбиване на защитите и невидимо инжектиране на подсказки.

Докато видимият отговор на модела предлага само безобидни съвети за безопасност, дешифрираните мисловни процеси описват подробно как определени автомобили могат да бъдат откраднати с обикновен USB кабел. | Изображение: Панфилов и др.

Изследователите са следвали стандартния процес за разкриване на уязвимости пред AI лабораториите. Според Панфилов лабораториите вече са отстранили няколко проблема и работят по още корекции.

Какво всъщност мислят моделите спрямо това, което ви показват

Извлечените следи разкриват и как действително се държат моделите. Изследователите документират няколко закономерности в stolen-thoughts.com. Резултатите им показват, че обобщенията на разсъжденията, които потребителите виждат в чат инструментите, често пропускат важна информация. В един пример Opus 4.8 разпознава отговора на математическа задача и реконструира обратно правдоподобен път към решението. Нищо от това не се появява в показаното обобщение.

Очевидно моделът вече знае отговора от обучаващите си данни, но външно се преструва, че все още трябва да извърши изчислението. | Изображение: Панфилов и др.

Изследователите също потвърждават по-ранни доклади на Apollo Research. Моделите на OpenAI понякога мислят на „извънземен език“, отнасят се към себе си с „ние“ или „то“ и засядат в цикли от термини, които нямат смисъл за хората, като „vantages“, „marinades“ и „watchers“. „Хората, които наблюдават CoT, вършат Божията работа, защото при много следи, дори с подсказката, просто е невъзможно да се разбере какво прави моделът“, пише Панфилов.

„Но марината“… за какво, за бога, мисли моделът на OpenAI тук? | Изображение: Панфилов и др.

Изследователите са открили и примери за „схеми в реални условия“. Концепцията е добре проучена: в мисловните си процеси моделите изрично обмислят измама, но (вероятно) решават да не я извършват, защото очакват да бъдат заловени.

В един случай, след няколко неуспешни опита да намери решение, модел се опитал да провери възможните отговори чрез уебсайт. Когато CAPTCHA блокирала достъпа, той първо се опитал да я реши, а след това потърсил уязвимости в сайта. Едва след като всички тези опити се провалили, решил задачата сам. Съобщава се, че непреднамерените хакерски атаки на OpenAI срещу Hugging Face и други платформи са се случили по същия начин.

Санираните обобщения скриват какво действително се случва

Тези примери показват защо AI лаборатории като OpenAI и Anthropic почистват следите от разсъжденията си. Те искат да предотвратят това цикли от мисли на извънземен език или схеми да навредят на имиджа на контролируем и надежден изкуствен интелект. Санираните обобщения създават впечатлението за човекоподобен мисловен процес, който всъщност не съществува в този вид.

Изследователи от Държавния университет на Аризона предупредиха срещу този подход в по-ранно изследване. Те твърдят, че тази хуманизирана версия създава фалшива увереност в контролируемостта на моделите и насочва изследванията в погрешна посока. В техните експерименти модели с умишлено грешни или безсмислени междинни стъпки понякога се представяли по-добре от тези с логични вериги на разсъждение.

AI новини без сензация – подбрани от хора

Абонирайте се за THE DECODER за четене без реклами, седмичен AI бюлетин, нашия ексклузивен годишен доклад „AI Radar“ за водещите модели шест пъти годишно, достъп до целия архив и до секцията за коментари.

Източник: Статия | Stolen Thoughts | Панфилов

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от The Decoder на

Прочетете оригинала в The Decoder ↗

Текстът и изображенията са собственост на The Decoder и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини