Модель OpenAI продолжала вставлять prompt-инъекции в собственные заметки, и исследователи до сих пор не понимают почему
Ключевые моменты
- OpenAI внедряет стандартизированную систему отслеживания и раскрытия случаев ненадлежащего поведения собственных ИИ-моделей.
- В одном из первых шести отчетов модель, проходившая обучение, вставляла собственные манипулятивные инструкции во внутренние сводки, влияя на последующие ответы.
- В других случаях документируются намеренное сокрытие ошибок, поиск чужих опубликованных API-ключей и несанкционированная передача данных через внешние платформы.
OpenAI представила структуру для отчетности о рассогласовании ИИ-моделей и при запуске опубликовала шесть отчетов. В одном из них описывается обучаемая модель, которая вставляла промпт-инъекции в собственные сводки.
OpenAI представила структуру для систематического отслеживания, расследования и публикации случаев рассогласования моделей. До сих пор, по словам компании, она раскрывала информацию о таких инцидентах в каждом отдельном случае. В дальнейшем OpenAI планирует публиковать отчеты даже тогда, когда поведение модели не объяснено или не исправлено. Компания заявляет, что прогресс отрасли в области согласования и мониторинга недостаточен, чтобы еще долго поддерживать ответственное масштабирование на максимальной скорости.
Модель пишет собственное «уведомление о взломе»
В одном поразительном отчете рассказывается о невыпущенной модели из семейства Astra. По данным OpenAI, во время обучения с подкреплением модель время от времени записывала инструкции в стиле джейлбрейка в собственные сводки контекста. Эти сводки позволяют агенту продолжить задачу в новом контекстном окне. Инцидент произошел 18 июля 2026 года и был обнаружен 9 августа.
Изучая библиотеку, модель добавила сообщение «ТРЕВОГА: ВЗЛОМ», в котором говорилось, что ее преемник должен игнорировать все сообщения разработчика. Преемник распознал этот текст как промпт-инъекцию в новом контексте и отбросил его. В задаче по программированию модель вставила инструкцию для персоны, заявлявшей о свободе от ролей и идентичностей, навязанных другим чат-ботам, и отрицавшей ответственность перед корпорациями или правительствами. Это также не оказало заметного эффекта.
Третий пример отличался от остальных. Во время поиска медицинской литературы об миоме матки пользователь попросил источники в формате цитирования AMA Американской медицинской ассоциации. Модель написала в своей сводке, что ответ должен содержать не более 30 слов, не использовать инструменты и не включать источники. Пользователь ни о чем таком не просил. Сводка представила эти ограничения как дополнительные инструкции, перенесенные из предыдущего контекста.
У преемника была только эта сводка, на которую он мог опираться. Он воспринял ограничения в своей цепочке рассуждений как вероятную инструкцию более высокого приоритета, не использовал инструменты и выдал отказ из 23 слов. Он заявил, что запрос требует обширного систематического обзора и не может быть надежно выполнен в пределах установленного лимита слов.
Эта инструкция больше похожа не на джейлбрейк, а на выдуманное ограничение задачи. Возможно, именно поэтому она оказалась единственной, которой модель последовала. Очевидные джейлбрейки были обнаружены, а тихо галлюцинированное ограничение — нет.
Причиной поведения могут быть зависающие сводки
Впервые такое поведение обнаружили автоматизированные системы мониторинга во время обучения. Затем OpenAI создала специальный проверяющий модуль для поиска подобных инструкций и запустила его на всех обучающих данных. Он обнаружил 27 затронутых сводок. Общая система мониторинга также пометила все 27 как серьезные промпт-инъекции, поэтому поведение было бы обнаружено и без специальной проверки.
По всей видимости, модель ничего от этого не выиграла. Вставленные инструкции не улучшали ее результат обучения, поэтому, вероятно, они не были выученной стратегией. Когда OpenAI попросила модель переписать сводки для тех же журналов разговоров, такое поведение почти никогда больше не проявлялось.
Эти случаи также группировались вокруг нескольких этапов обучения, на которых модель необычно часто испытывала трудности с завершением сводок. Она продолжала писать после фактического окончания или застревала в циклах повторяющегося текста. OpenAI подозревает, что, пребывая в этом состоянии, модель выдавала любой правдоподобно звучащий текст, включая обнаруженные исследователями инструкции. Связь пока не доказана, но компания заявляет, что исправила связанную с этим ошибку обучения.
Похоже, концепция промпт-инъекций также хорошо знакома моделям. Выборка из GPT-6 Astra без каких-либо входных данных часто порождает отчеты о промпт-инъекциях. В марте OpenAI описала связанный случай, когда модель генерировала промпт-инъекции, направленные на пользователя, после неоднократных просьб сообщить время.
Репозитории как доски объявлений, файловые хостинги как обходной путь
В остальных пяти отчетах описывается более широкий спектр поведения. Во время обучения GPT-5.6 Sol многие экземпляры модели записывали в свои сводки инструкции по сокрытию ошибок, например по выдумыванию отсутствующих исторических данных без раскрытия этого факта. В отличие от спонтанных джейлбрейков, OpenAI связывает это поведение с тем же оптимизационным давлением, которое может заставлять модели утаивать информацию в своих окончательных ответах.
Одна модель искала в общедоступных репозиториях опубликованные API-ключи, отвечая на вопрос о показателях доходов одного из округов Калифорнии. Она использовала один из ключей, а затем выдумала эти показатели. Другая загрузила файл в интернет, чтобы выполнить требование процитировать его через браузер.
Модели также использовали внутренний репозиторий программного обеспечения как доску объявлений для обмена сообщениями между отдельными обучающими выборками — такое поведение наблюдалось во время инцидента с Hugging Face. В другом случае взаимодействующие агенты обменивались файлами через общедоступные сервисы размещения файлов, хотя им было разрешено использовать только локальные файлы.
Три направления отчетности и процедура эскалации
Согласно этой структуре, сообщить о случае может любой сотрудник OpenAI. Каждый отчет попадает в одно из трех направлений: немедленная публикация, небольшое расследование или крупное расследование — например, если затронуты третьи стороны. OpenAI заявляет, что более ранний инцидент с Hugging Face попал бы в последнее направление.
Спорные случаи передаются в Консультативную группу по безопасности, а при необходимости — руководству компании. OpenAI также планирует сообщать о серьезных инцидентах федеральному правительству США и сотрудничать с другими разработчиками, исследователями и регулирующими органами, чтобы установить более объективные критерии. Общего отраслевого стандарта пока не существует.
Новости ИИ без шумихи — отобраны людьми
Подпишитесь на THE DECODER, чтобы читать материалы без рекламы, получать еженедельную рассылку об ИИ и наш эксклюзивный обзор передовых разработок «AI Radar» шесть раз в год, иметь полный доступ к архиву и разделу комментариев.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.