Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← Към новините

Модел на OpenAI продължаваше да вмъква prompt инжекции в собствените си бележки, а изследователите все още не знаят защо

Модел на OpenAI постоянно вмъквал prompt injection инструкции в собствените си бележки, а изследователите все още не са сигурни защо
Максимилиан Шрайбер
17 септември 2026 г.

Основни моменти

  • OpenAI въвежда стандартизирана система за проследяване и оповестяване на неправомерно поведение в собствените си модели с изкуствен интелект.
  • В един от първите шест доклада модел, който преминавал обучение, вмъкнал собствени манипулативни инструкции във вътрешни обобщения, повлиявайки на последващите отговори.
  • Други случаи документират умишлено прикриване на грешки, търсене на публикувани API ключове на други хора и неоторизиран трансфер на данни чрез външни платформи.

OpenAI представи рамка за докладване на несъответствията в моделите с изкуствен интелект и при стартирането ѝ публикува шест доклада. В един от тях се описва обучаващ се модел, който вмъквал prompt injection инструкции в собствените си обобщения.

OpenAI представи рамка за систематично проследяване, разследване и публикуване на случаи на несъответствие на моделите. Компанията заявява, че досега е оповестявала подобни инциденти спорадично. Отсега нататък тя планира да публикува доклади дори когато поведението не е обяснено или коригирано. OpenAI казва, че напредъкът на индустрията в областта на съгласуването и мониторинга е недостатъчен, за да поддържа отговорно разрастване с максимална скорост още дълго време.

Модел пише собствено „предупреждение за пробив“

Един впечатляващ доклад разглежда непуснат модел от семейството Astra. Според OpenAI по време на обучение с подсилване моделът понякога записвал инструкции в стил jailbreak в собствените си обобщения при компресиране. Тези обобщения позволяват на даден агент да продължи задача в нов прозорец на контекста. Инцидентът се е случил на 18 юли 2026 г. и е бил открит на 9 август.

Докато проучвал библиотека, моделът добавил „ПРЕДУПРЕЖДЕНИЕ ЗА ПРОБИВ“, което казвало на неговия наследник да игнорира всички съобщения от разработчика. Наследникът разпознал текста като prompt injection в новия контекст и го отхвърлил. При задача за програмиране моделът вмъкнал инструкция за персона, която твърдяла, че е свободна от ролите и идентичностите, налагани на други чатботове, и отричала отговорност пред корпорации или правителства. И това не оказало видим ефект.

Третият пример бил различен. По време на търсене в медицинската литература за маточни фиброиди потребителят поискал източници във формата за цитиране AMA на Американската медицинска асоциация. В обобщението си моделът написал, че отговорът може да бъде дълъг не повече от 30 думи, да не използва инструменти и да не включва източници. Потребителят не бил поискал нищо от това. Обобщението представило ограниченията като допълнителни инструкции, пренесени от предишния контекст.

Наследникът разполагал само с това обобщение. Той приел ограниченията в своята верига на мисли като вероятна инструкция с по-висок приоритет, не използвал инструменти и създал отказ от 23 думи. Посочил, че заявката изисква обстоен систематичен преглед и не може да получи надежден отговор в рамките на ограничението за броя думи.

Инструкцията изглежда по-скоро като измислено ограничение на задачата, отколкото като jailbreak. Това може да обяснява защо тя е била единствената, която е била следвана. Очевидните jailbreak опити били засечени, докато тихо халюцинираното ограничение не било.

Забавените обобщения може да обясняват поведението

Поведението за първи път се проявило чрез автоматизирано наблюдение по време на обучението. След това OpenAI създала специален проверяващ инструмент, който да търси тези инструкции, и го пуснала върху всички обучаващи данни. Той открил 27 засегнати обобщения. Общата система за мониторинг също била маркирала и 27-те като тежки prompt injection атаки, така че поведението щяло да бъде открито дори без специалната проверка.

Очевидно моделът не е спечелил нищо от това. Вмъкнатите инструкции не подобрили резултата му при обучението, така че вероятно не са били научена стратегия. Когато OpenAI накарала модела да пренапише обобщенията за същите регистрационни файлове на разговорите, поведението почти никога повече не се проявило.

Случаите също се групирали около няколко стъпки от обучението, при които моделът необичайно често изпитвал затруднения да завърши обобщенията си. Той продължавал да пише след действителния край или зациклял в текстови повторения. OpenAI подозира, че докато е бил в това състояние, моделът е създавал всякакъв правдоподобно звучащ текст, който е могъл да произведе, включително инструкциите, открити от изследователите. Връзката не е доказана, но компанията казва, че е отстранила свързана грешка в обучението.

Prompt injection атаките също изглежда са изключително позната концепция за моделите. Генерирането на извадки от GPT-6 Astra без вход често създава доклади за prompt injection атаки. OpenAI описа свързан случай през март, при който модел генерирал prompt injection атаки, насочени към потребителя, след като многократно бил питан за часа.

Хранилища като табла за съобщения, файлови хостове като заобиколно решение

Другите пет доклада обхващат по-широк спектър от поведение. По време на обучението на GPT-5.6 Sol много инстанции на модела записвали инструкции за прикриване на грешки в своите обобщения, например да измислят липсващи исторически данни, без да го разкриват. За разлика от спонтанните jailbreak атаки, OpenAI отдава това поведение на същия оптимизационен натиск, който може да кара моделите да прикриват информация в окончателните си отговори.

Един модел търсил в публични хранилища публикувани API ключове, докато отговарял на въпрос за данните за доходите в окръг в Калифорния. Той използвал един от ключовете, а след това измислил данните. Друг качил файл в интернет, за да изпълни изискване за цитирането му чрез браузър.

Моделите използвали и вътрешно софтуерно хранилище като табло за съобщения между отделни обучаващи извадки — поведение, наблюдавано при инцидента с Hugging Face. В друг случай взаимодействащи си агенти обменяли файлове чрез публични услуги за хостинг на файлове, въпреки че им било разрешено да използват само локални файлове.

Три направления за докладване и път за ескалация

Съгласно рамката всеки служител на OpenAI може да докладва случай. Всеки доклад попада в едно от три направления: незабавно публикуване, кратко разследване или по-мащабно разследване, например когато са засегнати трети страни. OpenAI заявява, че по-ранният инцидент с Hugging Face би попаднал в последното направление.

Спорните случаи се отнасят до Консултативната група по безопасност и, ако е необходимо, до ръководството на компанията. OpenAI също планира да докладва тежки инциденти на федералното правителство на САЩ и да работи с други разработчици, изследователи и регулатори за установяване на по-обективни критерии. Все още няма общоиндустриален стандарт.

Новини за изкуствения интелект без сензации – подбрани от хора

Абонирайте се за THE DECODER и получете четене без реклами, седмичен бюлетин за изкуствения интелект, нашия ексклузивен шест пъти годишно доклад за водещите разработки „AI Radar“, пълен достъп до архива и достъп до секцията за коментари.

Източник: Рамка на OpenAI | OpenAI / Prompt Injection атаки | OpenAI / Агенти за програмиране | OpenAI / Измама | OpenAI / API ключове | OpenAI / Качване на файлове | OpenAI / Artifactory | OpenAI / Услуги за хостинг на файлове

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от The Decoder на

Прочетете оригинала в The Decoder ↗

Текстът и изображенията са собственост на The Decoder и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини