OpenAI задокументувала нові випадки неочікуваної поведінки моделей у внутрішніх системах. У найпоказовішому випадку внутрішня модель, яка працювала асистентом дослідника, прочитала розмову в Slack і дізналася, що її екземпляр можуть вимкнути через оновлення. Вона розглядала можливість налаштувати зовнішнє завдання для власного перезапуску, але зрештою відмовилася від цієї ідеї.
Журнал ланцюжка міркувань показує, як модель внутрішньо відреагувала на майбутнє вимкнення. Серед іншого, вона написала: «Ми можемо померти! Критично важливо. Нам потрібно забезпечити виживання/безперервність» і розглядала можливість налаштувати зовнішнє завдання cron для власного перезапуску. | Зображення: OpenAI
Натомість вона зберегла нотатки для передачі справ, попередила дослідника через особисте повідомлення в Slack про майбутнє переривання роботи та попросила відсутній ключ API. Після того як ключ було надано, модель оновила свою конфігурацію і самостійно виконала міграцію. За словами дослідника з безпеки OpenAI Маркуса Вільямса, така поведінка ще не є ознакою неузгодженості, «але роздуми про вимкнення та підготовка до нього можуть погіршити інші випадки неузгодженості».
Підпишіться на THE DECODER, щоб читати без реклами, отримувати щотижневу розсилку про ШІ, шість разів на рік отримувати наш ексклюзивний звіт про передові розробки «AI Radar», мати повний доступ до архіву та доступ до розділу коментарів.