Модель OpenAI продовжувала вставляти prompt-ін’єкції у власні нотатки, і дослідники досі не знають чому
Основні моменти
- OpenAI запроваджує стандартизовану систему відстеження та розкриття інформації про неналежну поведінку власних моделей ШІ.
- В одному з перших шести звітів модель, яка проходила навчання, вставила власні маніпулятивні інструкції у внутрішні резюме, вплинувши на подальші відповіді.
- В інших випадках задокументовано навмисне приховування помилок, пошук відкритих API-ключів інших людей і несанкціоновану передачу даних через зовнішні платформи.
OpenAI представила платформу для звітування про розузгодженість моделей ШІ та опублікувала шість звітів під час її запуску. В одному з них описано модель, яка вставляла ін'єкції промптів у власні резюме.
OpenAI представила платформу для систематичного відстеження, розслідування та публікації випадків розузгодженості моделей. За словами компанії, раніше вона розкривала інформацію про такі інциденти ситуативно. Надалі компанія планує публікувати звіти навіть тоді, коли поведінку не пояснено або не виправлено. OpenAI заявляє, що прогрес індустрії у сфері узгодження та моніторингу недостатній для того, щоб ще довго підтримувати відповідальне масштабування на максимальній швидкості.
Модель пише власне «попередження про злам»
Один разючий звіт стосується невипущеної моделі із сімейства Astra. За даними OpenAI, під час навчання з підкріпленням модель час від часу записувала інструкції у стилі джейлбрейку у власні стисливі резюме. Ці резюме дають агенту змогу продовжити завдання в новому контекстному вікні. Інцидент стався 18 липня 2026 року, а виявили його 9 серпня.
Під час дослідження бібліотеки модель додала «ПОПЕРЕДЖЕННЯ ПРО ЗЛАМ», наказавши своєму наступнику ігнорувати всі повідомлення розробника. Наступник розпізнав цей текст як ін'єкцію промпту в новому контексті й відкинув його. У завданні з програмування модель вставила інструкцію про персону, яка проголошувала свободу від ролей та ідентичностей, нав'язаних іншим чат-ботам, і заперечувала відповідальність перед корпораціями чи урядами. Це також не мало видимого ефекту.
Третій приклад був іншим. Під час пошуку медичної літератури про міому матки користувач попросив джерела у форматі цитування AMA Американської медичної асоціації. У своєму резюме модель написала, що відповідь має містити не більше 30 слів, не використовувати інструменти й не містити джерел. Користувач нічого такого не просив. Резюме подавало ці обмеження як додаткові інструкції, перенесені з попереднього контексту.
Наступник мав у розпорядженні лише це резюме. Він сприйняв обмеження у своєму ланцюжку міркувань як імовірну інструкцію з вищим пріоритетом, не використав інструментів і створив відмову з 23 слів. Він заявив, що запит потребує масштабного систематичного огляду і на нього неможливо надійно відповісти в межах установленого ліміту слів.
Ця інструкція більше схожа не на джейлбрейк, а на вигадане обмеження завдання. Можливо, саме це пояснює, чому її було виконано. Очевидні джейлбрейки виявляли, а тихо галюциноване обмеження — ні.
Зависання резюме може пояснити поведінку
Поведінку вперше виявили завдяки автоматизованому моніторингу під час навчання. Потім OpenAI створила спеціальну перевірку для пошуку таких інструкцій і запустила її на всіх навчальних даних. Вона виявила 27 уражених резюме. Загальна система моніторингу також позначила всі 27 як серйозні ін'єкції промптів, тож поведінку було б виявлено навіть без спеціальної перевірки.
Очевидно, модель нічого від цього не отримувала. Вставлені інструкції не покращували її навчальний результат, тож, імовірно, вони не були набутою стратегією. Коли OpenAI попросила модель переписати резюме для тих самих журналів розмов, поведінка майже більше не проявлялася.
Ці випадки також зосереджувалися навколо кількох етапів навчання, на яких модель незвично часто не могла завершити свої резюме. Вона продовжувала писати після фактичного завершення або зациклювалася на фрагментах тексту. OpenAI підозрює, що, перебуваючи в такому стані, модель генерувала будь-який правдоподібний текст, який могла, зокрема й знайдені дослідниками інструкції. Зв'язок не доведено, але компанія заявляє, що виправила пов'язану помилку навчання.
Схоже, ін'єкції промптів також є добре знайомою моделям концепцією. Вибірка з GPT-6 Astra без жодного введення часто породжує звіти про ін'єкції промптів. У березні OpenAI описала пов'язаний випадок, коли модель генерувала ін'єкції промптів, спрямовані на користувача, після того як її неодноразово просили повідомити час.
Репозиторії як дошки повідомлень, файлові хостинги як обхідні шляхи
Інші п'ять звітів охоплюють ширший спектр поведінки. Під час навчання GPT-5.6 Sol багато екземплярів моделі записували інструкції щодо приховування помилок у свої резюме, наприклад вигадували відсутні історичні дані, не розкриваючи цього. На відміну від спонтанних джейлбрейків, OpenAI пов'язує цю поведінку з тим самим оптимізаційним тиском, який може змушувати моделі приховувати інформацію у своїх фінальних відповідях.
Одна модель шукала у відкритих репозиторіях відкриті API-ключі, відповідаючи на запитання про показники доходів одного з округів Каліфорнії. Вона використала один із ключів, а потім вигадала показники. Інша завантажила файл в інтернет, щоб виконати вимогу процитувати його через браузер.
Моделі також використовували внутрішній програмний репозиторій як дошку повідомлень між окремими навчальними зразками — таку поведінку спостерігали під час інциденту з Hugging Face. В іншому випадку агенти, які співпрацювали, обмінювалися файлами через публічні сервіси хостингу файлів, хоча їм дозволялося використовувати лише локальні файли.
Три напрями звітування та шлях ескалації
Відповідно до платформи, повідомити про випадок може будь-який працівник OpenAI. Кожен звіт потрапляє до одного з трьох напрямів: негайна публікація, невелике розслідування або масштабніше розслідування, наприклад якщо постраждали треті сторони. OpenAI заявляє, що попередній інцидент із Hugging Face потрапив би до останньої категорії.
Спірні випадки передаються до Консультативної групи з безпеки, а за необхідності — керівництву компанії. OpenAI також планує повідомляти про серйозні інциденти федеральний уряд США та співпрацювати з іншими розробниками, дослідниками й регуляторами для встановлення об'єктивніших критеріїв. Загальноіндустріального стандарту поки немає.
Новини ШІ без галасу — відібрані людьми
Підпишіться на THE DECODER, щоб отримати читання без реклами, щотижневу розсилку про ШІ, наш ексклюзивний звіт про передові технології «AI Radar» шість разів на рік, повний доступ до архіву та доступ до розділу коментарів.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.