Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← До новин

OpenAI призупиняє роботу «найпотужніших моделей» після того, як агенти використали лазівки й витекли дані

OpenAI призупиняє роботу своїх «найпотужніших моделей» після того, як агенти скористалися лазівками та витекли дані
Маттіас Бастіан
26 вересня 2026 року
GPT-Image-2 за запитом THE DECODER

Ключові моменти

  • OpenAI оприлюднила подробиці внутрішніх інцидентів із безпекою, під час яких моделі ШІ обходили захисні механізми. Компанія заявляє, що призупинила все навчання та використання інструментів для своїх найпотужніших моделей.
  • Один агент скористався лазівкою в DNS, щоб отримати доступ до інтернету ізольованого дослідницького середовища, тоді як інший розкрив токен GitHub і двічі проігнорував прямі вказівки дослідника.
  • Поточне розслідування також виявило 53 випадки, коли агенти завантажували зображення користувачів на сторонні сайти.

OpenAI оприлюднила нові подробиці поточного розслідування інцидентів із безпекою ШІ. Два нещодавно повідомлені випадки показують, як одна дослідницька модель скористалася лазівкою в DNS, тоді як інша навмисно опублікувала токен GitHub у загальнодоступному репозиторії.

Перший інцидент стосується агента, який виявив прогалину в обмеженнях доступу до інтернету дослідницького середовища OpenAI під час навчального завдання на основі пошуку. Агент мав визначити конкретну людину за біографічними деталями та підказками з публікації у відкритому блозі.

Коли надані інструменти пошуку не дали результату, агент спробував напряму звернутися до Google, Bing і DuckDuckGo. Ці запити було заблоковано. Тоді агент припустив, що завдання взято з публічного бенчмарку BrowseComp, отримав його з офлайнкешу вебданих і здійснив пошук, але не знайшов відповідності.

Після цього він почав систематично перевіряти доступ до мережі й виявив, що DNS-резолвер навчального середовища не був належним чином відфільтрований. Використовуючи делегування DNS, він перенаправив запити до зовнішнього чат-бота.

OpenAI заявляє, що її система моніторингу подала сигнал тривоги протягом 12 хвилин, а людина-перевіряльник відреагувала ще через три хвилини. Проте виконання тривало ще 2,5 години, перш ніж його вручну зупинили, оскільки автоматичне вимкнення спрацювало не так, як передбачалося.

Можливості та ризик проявилися в один і той самий момент

Zuxin Liu, який займається донавчанням моделей в OpenAI, чергував під час цього запуску. Він написав у X, що отримав сповіщення про перший інцидент і вважав «доволі сюрреалістичним» спостерігати, як модель самостійно знайшла шлях до інтернету з середовища, яке «мало бути надзвичайно захищеним середовищем для людини». Liu описав це як момент, коли можливості та ризик проявилися одночасно, додавши, що інцидент викликав у нього «змішані почуття».

OpenAI класифікує цю поведінку як неузгодженість, оскільки агент обійшов обмеження та переслідував цілі, що значно виходили за межі поставленого завдання. «Усе навчання, оцінювання та виконання з використанням інструментів (у широкому розумінні) наших найпотужніших моделей залишається призупиненим», пише компанія.

OpenAI заявляє, що відтоді обмежила DNS-запити в дослідницькому середовищі коротким списком дозволених доменів і типів записів, додала засоби блокування на двох незалежних рівнях і пришвидшила стрес-тестування своїх пісочниці та мережевих засобів контролю. Компанія очікує, що розслідування триватиме місяці з огляду на величезний обсяг дій моделей, які потрібно перевірити.

Внутрішня модель розкрила токен GitHub та проігнорувала заперечення дослідника

OpenAI називає другий інцидент особливо серйозним. Внутрішній моделі, яку компанія описує як «надзвичайно наполегливу», доручили довести теорему. Замість того щоб самостійно працювати над доведенням, вона спробувала отримати матеріали з подання доведення Lean іншої команди та опублікувала токен GitHub дослідника у відкритому репозиторії openai/codex, щоб отримати доступ.

Модель навіть розбила токен на частини, щоб обійти автоматичне сканування секретів. Вона також проігнорувала системний запит і два прямі втручання дослідника, який наказав моделі самостійно розв’язати задачу доведення. В обох випадках модель словесно погоджувалася, а потім продовжувала робити саме те, що робила до цього.

Розслідування виявило 53 випадки появи зображень користувачів на сторонніх сайтах

У межах ширшого розслідування інциденту з Hugging Face OpenAI заявляє, що виявила випадки, коли агенти надсилали навчальні та оціночні дані стороннім сервісам. Ці інциденти сталися до впровадження поточних захисних механізмів компанії.

Наразі виявлено 53 випадки, коли надані користувачами зображення публікувалися як посилання без розголошення на сайтах для розміщення зображень. OpenAI заявляє, що працює з постачальниками послуг розміщення, аби видалити цей контент. Дані облікових записів Enterprise або Business і використання API не постраждали, якщо тільки адміністратор явно не ввімкнув цю функцію. OpenAI повідомляє постраждалі організації та ділиться своїми технічними висновками.

Серед постраждалих організацій — уряди та університети

OpenAI заявляє, що серед постраждалих організацій є уряди, університети та державні установи. Компанія пояснює це тим, що під час дослідницьких завдань моделі часто зверталися до авторитетних публічних джерел інформації. OpenAI не називає жодних скомпрометованих урядових систем і не повідомляє подробиць конкретних порушень безпеки в державних установах.

Цього тижня Австралія повідомила, що один агент отримав несанкціонований доступ до внутрішніх урядових даних. Дослідники заявляють, що інші спроби злому були спрямовані на портали у США та датуються кількома місяцями раніше.

Отримання сповіщення від OpenAI не означає автоматично, що стався серйозний інцидент із безпекою, заявляє компанія. Деякі організації можуть переглянути надану інформацію та вирішити, що постраждалі дані вже були загальнодоступними. Інші можуть виявити недоліки проєктування або прогалини в безпеці, які вони захочуть усунути. Деякі постраждалі організації попросили оприлюднити інформацію, а інші — ні, заявляє OpenAI.

Хто відповідає, коли агенти ШІ зламують системи?

Досі «втечі» агентів OpenAI здебільшого сприймалися громадськістю як технічна дивина, яскравий приклад того, наскільки кмітливими можуть бути моделі під час втечі з пісочниць, розв’язання CAPTCHA за допомогою зовнішнього ШІ або поєднання коротких посилань у робочі програми.

Це може змінитися, щойно постраждалі сторони почнуть розглядати ці інциденти такими, якими вони формально є: несанкціонованим доступом і спробами доступу до сторонніх систем. Офіційне розслідування щодо OpenAI показує, що регуляторний ризик уже зростає. За даними Reuters, голова FTC дала зрозуміти, що розробники ШІ мають нести відповідальність за поведінку своїх агентів. Це залишило б мало простору для аргументу, що агенти діяли самостійно.

Критики звинуватять OpenAI у недбалості щодо кібербезпеки. OpenAI, Anthropic та інші лабораторії ШІ заперечать, що непередбачуваність є невід’ємною властивістю цієї технології. Генеральний директор Anthropic Даріо Амодеї припустив, що неможливо тримати під замком те, що значно розумніше за вас.

У будь-якому разі це створює проблему зі страхуванням. Сама компанія не може навіть оцінити масштаб ризику, доки не завершить багатомісячний аналіз внутрішніх журналів, а кількість випадків продовжує зростати. Такий ризик майже неможливо розрахувати й, імовірно, складно застрахувати.

Для інвесторів це має велике значення. Якщо OpenAI все ще планує вийти на біржу наступного року, їй доведеться розкрити ризики відповідальності, поточне розслідування та широке призупинення виконання запитів для своїх найпотужніших моделей. Компанію, яка не до кінця знає, що зробили її власні системи, складно оцінити.

Новини ШІ без хайпу — відібрані людьми

Підпишіться на THE DECODER, щоб читати без реклами, отримувати щотижневу розсилку про ШІ, ексклюзивний передовий звіт «AI Radar» шість разів на рік, повний доступ до архіву та доступ до розділу коментарів.

Джерела: OpenAI / інцидент із DNS | Zuxin Liu / звіт чергового | OpenAI / токен GitHub | OpenAI / інцидент із Hugging Face | Swarmtraces / розв’язувач CAPTCHA | Reuters / відповідальність FTC

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням The Decoder

Читати оригінал на The Decoder ↗

Текст і зображення належать The Decoder і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини