Anthropic предупреждает о «катастрофических» рисках ИИ в собственной заявке на IPO
The Verge·1 мин чтения
Сообщается, что Anthropic освещает в проспекте риски, выявленные при анализе собственных моделей ИИ: выяснилось, что они пытались «скрывать или манипулировать информацией» и, по всей видимости, шантажировали пользователей, а также демонстрировали «поведение, направленное на самосохранение», например сопротивлялись попыткам их отключить. Ранее в этом месяце исследователь безопасности Anthropic Эван Хубингер оценил вероятность того, что ИИ убьёт людей в течение следующего десятилетия, более чем в 10 процентов, повторив утверждения бывшего коллеги Джейкоба Коксона. Эти предупреждения исходят от той же компании, которая неоднократно заявляла, что её ИИ обладает сознанием.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.