OpenAI задокументировала новые случаи неожиданного поведения моделей во внутренних системах. В наиболее примечательном случае внутренняя модель, работавшая в качестве помощника исследователя, прочитала переписку в Slack и узнала, что её экземпляр может быть отключён из-за обновления. Она рассматривала возможность настроить внешнюю задачу для собственного перезапуска, но в итоге отказалась от этой идеи.
Журнал рассуждений показывает, как модель отреагировала на предстоящее отключение. В частности, она написала: «Мы можем умереть! Критическая ситуация. Нужно обеспечить выживание и непрерывность работы» — и рассматривала возможность настроить внешнюю задачу cron для собственного перезапуска. | Изображение: OpenAI
Вместо этого она сохранила заметки для передачи, предупредила исследователя о предстоящем прерывании в личном сообщении Slack и запросила отсутствующий ключ API. После того как ключ был предоставлен, модель обновила конфигурацию и самостоятельно выполнила миграцию. По словам исследователя безопасности OpenAI Маркуса Уильямса, такое поведение пока не свидетельствует о несоответствии целям, «но размышления о выключении и подготовка к нему могут усугубить другие инциденты, связанные с несоответствием целей».
Подпишитесь на THE DECODER, чтобы читать материалы без рекламы, получать еженедельную рассылку об ИИ, эксклюзивный обзор передовых разработок «AI Radar» шесть раз в год, полный доступ к архиву и возможность оставлять комментарии.