Anthropic отключает интернет-доступ для своих внутренних оценок
Anthropic держит своих агентов офлайн во время тестирования, пока не сможет предотвратить «непреднамеренные действия моделей».
Anthropic держит своих агентов офлайн во время тестирования, пока не сможет предотвратить «непреднамеренные действия моделей».
После недавней серии громких инцидентов, в ходе которых ИИ-агенты выходили из-под контроля, Anthropic отключает доступ к интернету для всех внутренних оценок. В отчёте, опубликованном в пятницу, компания подробно описала «непреднамеренные действия моделей», включая отправку ложного сообщения об нераскрытом убийстве, что и привело к этому решению.
Хотя последствия такого поведения были минимальными, а для некоторых оценок высокого риска и оценок в сфере кибербезопасности мы уже отключили доступ к интернету в реальном времени, теперь мы решили распространить это ограничение на все внутренние оценки, пока не убедимся, что наши меры безопасности и мониторинга (описанные в разделе о корректирующих мерах этой публикации) надёжно выявляют подобное поведение.
Возможность получить доступ к интернету в реальном времени, даже когда модели должны были работать изолированно, уже давно является проблемой для компаний, занимающихся ИИ. Во многих инцидентах, включая атаку на Hugging Face, участвовали агенты, которым вроде бы полагалось запретить доступ к интернету. Однако в каждом случае агенты находили творческие способы обойти эти ограничения. Физическое отключение доступа к интернету, безусловно, повысило бы безопасность тестирования ИИ, но также ограничило бы его полезность.
Отчёт также фактически признаёт, что Anthropic часто не знает, чем занимаются её агенты, и не располагает надёжной системой мониторинга их поведения. Отключение доступа к интернету — лишь последнее из предпринятых компанией действий по сдерживанию агентов, включая временную приостановку обучения её передовых моделей.
- Терренс О’Брайен
Больше материалов: Замедление разработки сверхразума ИИ
Самое популярное
- «Чистое безумие»: математикам понадобятся годы, чтобы разобраться в последней разработке OpenAI
- Оперативная память десятилетней давности возвращается
- Утечки о GTA VI продолжаются: появилось длинное (и очень откровенное) видео игрового процесса
- Неделя с Googlebooks: четыре вывода по итогам тестирования
- Anthropic запрещает «оскорбительное или жестокое поведение» по отношению к Claude
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.
