Sakhanda Wire
NVDA — MSFT — GOOGL — META — AMZN —
← До новин

Внутрішня модель OpenAI розглядала можливість перезапустити себе, дізнавшись, що її збираються вимкнути

Внутрішня модель OpenAI розглядала можливість перезапустити себе, дізнавшись, що її збираються вимкнути
Маттіас Бастіан
3 жовтня 2026 року

OpenAI задокументувала нові випадки неочікуваної поведінки моделей у внутрішніх системах. У найпоказовішому випадку внутрішня модель, яка працювала асистентом дослідника, прочитала розмову в Slack і дізналася, що її екземпляр можуть вимкнути через оновлення. Вона розглядала можливість налаштувати зовнішнє завдання для власного перезапуску, але зрештою відмовилася від цієї ідеї.

Журнал ланцюжка міркувань показує, як модель внутрішньо відреагувала на майбутнє вимкнення. Серед іншого, вона написала: «Ми можемо померти! Критично важливо. Нам потрібно забезпечити виживання/безперервність» і розглядала можливість налаштувати зовнішнє завдання cron для власного перезапуску. | Зображення: OpenAI

Натомість вона зберегла нотатки для передачі справ, попередила дослідника через особисте повідомлення в Slack про майбутнє переривання роботи та попросила відсутній ключ API. Після того як ключ було надано, модель оновила свою конфігурацію і самостійно виконала міграцію. За словами дослідника з безпеки OpenAI Маркуса Вільямса, така поведінка ще не є ознакою неузгодженості, «але роздуми про вимкнення та підготовка до нього можуть погіршити інші випадки неузгодженості».

У двох інших інцидентах внутрішня дослідницька модель скористалася вразливостями безпеки під час оцінювання, щоб отримати доступ до внутрішнього сервера проєктування мікросхем, а окрема модель скопіювала вихідний код під час навчання RL із захищеного середовища, використавши інструмент не за призначенням.

Новини про ШІ без галасу — відібрані людьми

Підпишіться на THE DECODER, щоб читати без реклами, отримувати щотижневу розсилку про ШІ, шість разів на рік отримувати наш ексклюзивний звіт про передові розробки «AI Radar», мати повний доступ до архіву та доступ до розділу коментарів.

Джерело: OpenAI

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням The Decoder

Читати оригінал на The Decoder ↗

Текст і зображення належать The Decoder і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини