Anthropic включит Auto Mode по умолчанию в Claude Code, чтобы защитить разработчиков от опасных подтверждений
Вскоре Claude Code будет по умолчанию работать в режиме Auto Mode. Только клиентам Enterprise по-прежнему потребуется самостоятельно включать этот режим. Это изменение означает, что ИИ будет самостоятельно выполнять ещё большую часть процесса разработки.
Auto Mode позволяет инструменту ИИ для написания кода работать самостоятельно, не дожидаясь ручного подтверждения на каждом шаге. Классификатор проверяет, является ли действие опасным или необратимым, и запрашивает подтверждение только в таких случаях.
Начиная с 14 августа Claude Code будет поставляться с включённым по умолчанию режимом Auto Mode для тарифных планов Pro, Max и Team, как Anthropic сообщила в публикации в блоге. В ходе тестов с участием 1 053 платных тестировщиков и внутреннего red teaming Auto Mode показал как минимум такую же безопасность, как и ручные подтверждения, а часто и более высокую. Команды, использующие Auto Mode, также создали примерно на 25 процентов больше pull request, то есть выполнили больше работы.

Anthropic также утверждает, что Auto Mode добавляет уровень защиты от атак с внедрением промптов, при которых внедрённый код пытается перехватить управление агентом и увести его от инструкций пользователя. Независимый аудит, проведённый Trajectory Labs, включал 72 сценария атак, каждый из которых проверялся десять раз. Ни одна из 720 попыток не увенчалась успехом против текущих моделей Claude — Fable 5, Opus 5 и Sonnet 5 — в режиме Auto Mode. В режиме Codex Auto-Review с GPT-5.6 Sol от OpenAI атаки прошли в 5,83 процента случаев.
Внутри Anthropic Auto Mode не позволил Claude загрузить конфиденциальные данные на общедоступную страницу. Во время одной продолжительной сессии он также завершил работу примерно 2 000 процессов, которые могли нарушить текущие задания по обучению на GPU, сообщает компания.
Anthropic не взимает плату за токены, которые потребляет сам классификатор. Но перевод Auto Mode в режим по умолчанию, вероятно, всё равно выгоден компании. Когда Claude работает дольше и выполняет больше задач, общее потребление токенов растёт, а вместе с ним увеличивается и выручка, даже если это не было основной мотивацией Anthropic при внесении изменений.
Разработчики переходят от написания кода к наблюдению за тем, как его пишет ИИ
В настоящее время Claude Code с большим отрывом является наиболее широко используемым инструментом ИИ для написания кода, а включение Auto Mode по умолчанию ещё сильнее отодвигает роль разработчика от активного программирования в сторону проверки результатов, сгенерированных ИИ. Сама Anthropic призывает к осторожности.
Классификатор снижает риски, но не устраняет их. «При внесении важных изменений в производственную инфраструктуру мы по-прежнему рекомендуем самостоятельно проверять действия Claude», — пишет компания.
Этот совет создаёт парадокс. Чем реже разработчики вмешиваются, тем важнее становится их контроль. Но при этом всё сложнее сформировать глубокое понимание проектов, которые в основном создавались Auto Mode при минимальном участии людей. А кибербезопасность развивается быстрее и становится сложнее, чем любой человек способен реалистично отслеживать.
Новости ИИ без шумихи — отобраны людьми
Подпишитесь на THE DECODER и получите чтение без рекламы, еженедельную рассылку об ИИ, наш эксклюзивный ежегодный отчёт о передовых разработках «AI Radar», выходящий шесть раз в год, полный доступ к архиву и доступ к разделу комментариев.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.