Модель OpenAI продолжала вставлять prompt-инъекции в собственные заметки, и исследователи до сих пор не понимают почему
OpenAI публикует систему для систематической отчётности о несоответствиях в поведении ИИ и запускает её с шестью отчётами. В одном из случаев неизданная модель семейства Astra во время обучения записывала prompt-инъекции в собственные резюме, включая «Breach Alert», предназначенный…