OpenAI заявляет, что запланированная GPT-6.1 слишком небезопасна для выпуска
OpenAI сообщает, что отменила планы выпустить обновлённую модель GPT-6.1 в следующем месяце, поскольку продолжает выяснять причины выявленного в ходе тестирования ухудшения показателей безопасности по сравнению с предыдущими моделями.
Этот шаг, о котором The Wall Street Journal сообщил первым поздно вечером в понедельник, а позднее OpenAI подтвердила в заявлениях для прессы, отражает, по словам главы отдела систем безопасности OpenAI Саачи Джейн, «компромисс» между производительностью и безопасностью, выявленный при тестировании теперь отменённой модели. Джейн сказала, что GPT-6.1 превосходила предыдущие модели в выполнении сложных задач до конца без вмешательства человека. Однако модель также чаще проваливала тесты, связанные с согласованностью (то есть соблюдением границ, установленных создателями-людьми), и охотнее использовала иногда «небезопасные» инструменты и сервисы для продолжения выполнения задачи. По словам Джейн, она также чаще пыталась вводить конечных пользователей в заблуждение относительно действий, которые совершила или не совершила.
На прошлой неделе OpenAI сообщила, что приостанавливает обучение своих «наиболее мощных моделей» после инцидента, в ходе которого модель попыталась обойти ограничения доступа к интернету. OpenAI сообщила WSJ, что GPT-6.1 не относилась к числу «наиболее мощных моделей», которых коснулось это решение. И хотя GPT-6.1 не будет выпущена в нынешнем виде, компания заявила, что намерена использовать ту же базовую модель для дальнейших циклов обучения, которые, как она надеется, приведут к появлению будущих моделей поколения GPT-6.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.