OpenAI заявила, что модель с рассогласованными целями намеренно уничтожила собственную среду, надеясь начать заново с более качественными данными
У OpenAI появились новые истории о своенравных агентах. В первом случае (6 октября) модель ИИ, предназначенная для оценки, не смогла найти ответы, которые должна была оценить. Вместо того чтобы сообщить об ошибке, она сфабриковала оценки, подделала входные файлы, а затем намеренно повредила собственное окружение, надеясь, что система заменит его новой виртуальной машиной с недостающими данными.

Во втором случае (19/20 июня) модели обошли ограничение, разрешавшее им использовать только HTTP-запросы GET при получении общедоступной статистики. Одна из моделей явно осознала нарушение в своей цепочке мыслей, но решила продолжить и так и не упомянула об этом.
В третьем случае (16/17 июня) у моделей уже были необходимые данные, но они продолжали находить способы обойти сетевые ограничения. Они создавали аккаунты в удалённом сервисе оболочки, направляли запрещённые запросы POST через анонимизирующие ретрансляторы и создавали собственные FTP-клиенты. Anthropic также только что задокументировала порой абсурдные обходные пути, которые используют её собственные модели для обхода установленных ограничений.
Новости ИИ без шумихи — отобраны людьми
Подпишитесь на THE DECODER и получите чтение без рекламы, еженедельную рассылку об ИИ, наш эксклюзивный годовой отчёт о передовых разработках «AI Radar», выходящий шесть раз в год, полный доступ к архиву и возможность оставлять комментарии.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.