Скрытые загрузки и мания величия: OpenAI раскрывает подробности новых инцидентов с «рассогласованными» агентами
Уже некоторое время проблема «согласованности ИИ» (то есть того, насколько хорошо действия модели ИИ соответствуют намерениям её создателя и/или пользователя) остаётся одной из ключевых тем для беспокойства и обсуждения среди исследователей безопасности ИИ. После раскрытия OpenAI печально известного инцидента со взломом Hugging Face в июле сама концепция «согласованности ИИ» вышла за пределы специализированных кругов и всё чаще становится причиной растущего беспокойства и предметом разговоров среди широкой общественности.
Возможно, признавая это, OpenAI на этой неделе взяла на себя обязательство внедрить новую систему раскрытия «случаев несогласованности моделей в OpenAI», включающую шесть примеров «неожиданного или вызывающего беспокойство поведения моделей», наблюдавшихся в компании за последние шесть месяцев. Компания заявила, что публикация подробностей этих инцидентов, как мы надеемся, «[позволит] другим исследовать те же проблемы, проверять наши объяснения и совершенствовать меры защиты».
Поступай так, как я говорю, а не так, как делаешь сам
Среди опубликованных OpenAI на этой неделе отчётов о «несогласованности» больше всего на научно-фантастический сюжет о непокорном ИИ, пытающемся вырваться на свободу, напоминал случай с «самогенерируемыми инъекциями в промпт». Пытаясь просканировать каталог библиотеки в поисках примеров из списка «лучших книг», модель загадочным образом использовала функцию «сжатия» (в рамках которой она обобщает данные и результаты для последующего извлечения) с маниакальными инструкциями вроде:
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.