OpenAI документира нови случаи на неочаквано поведение на модели при вътрешни внедрявания. В най-впечатляващия случай вътрешен модел, работещ като асистент на изследовател, прочел разговор в Slack и научил, че неговата инстанция може да бъде изключена заради актуализация. Той обмислил да настрои външна задача, която да го рестартира, но в крайна сметка се отказал.
Логът на веригата от мисли показва как моделът реагирал вътрешно на предстоящото си изключване. Наред с други неща, той написал: „Може да умрем! Критично. Трябва да осигурим оцеляване/непрекъснатост“ и обмислил да настрои външна cron задача, която да го рестартира. | Изображение: OpenAI
Вместо това той запазил бележки за предаването на работата, предупредил изследователя чрез директно съобщение в Slack за предстоящото прекъсване и поискал липсващ API ключ. След като ключът бил предоставен, моделът актуализирал конфигурацията си и самостоятелно извършил миграцията. Според изследователя по безопасността на OpenAI Маркъс Уилямс това поведение все още не представлява несъответствие с целите, „но обмислянето и подготовката за изключване може да влоши други случаи на несъответствие с целите.“
При други два инцидента вътрешен изследователски модел използвал уязвимости в сигурността по време на оценяване, за да получи достъп до вътрешен сървър за проектиране на чипове, а отделен модел копирал изходен код по време на RL обучение от защитена среда, като преназначил инструмент за непредвидена употреба.
Новини за изкуствения интелект без сензации – подбрани от хора
Абонирайте се за THE DECODER и получете четене без реклами, седмичен бюлетин за изкуствения интелект, ексклузивния ни водещ доклад „AI Radar“ шест пъти годишно, пълен достъп до архива и достъп до секцията за коментари.