Anthropic делает Auto mode режимом по умолчанию в Claude Code: классификатор перехватил 89% опасных команд против 13,6% у людей
Компания Anthropic объявила, что с 14 августа 2026 года новый режим разрешений Auto mode станет стандартным для всех новых сессий Claude Code на тарифах Pro, Max и Team. Решение основано на результатах масштабного исследования, в котором автоматический классификатор безопасности продемонстрировал превосходство над ручным подтверждением: он заблокировал 89% потенциально деструктивных команд, тогда как живые разработчики остановили лишь 13,6%. 
Почему ручные подтверждения перестали работать
Главная причина перехода на Auto mode — так называемая «усталость от подтверждений» (prompt fatigue). Внутренние данные Anthropic показывают, что пользователи одобряют 97% всех запросов на выполнение команд. При этом при проверке планов разработчиков люди отклоняют предложения в 39% случаев, но отдельные команды — только в 3%.
Со временем разработчики начинают отключать проверки самостоятельно. По состоянию на июнь 2026 года 49,5% активных пользователей CLI создали хотя бы одно разрешающее правило для Bash. Примерно 5% разрешили любые shell-команды, а ещё 43% добавили правила для интерпретаторов вроде Bash(python:*) или Bash(node:*), которые на практике позволяют выполнить произвольный код. Доля таких пользователей растёт примерно на 5 процентных пунктов каждые пять недель. Кроме того, 62% пользователей хотя бы раз включали bypassPermissions или выбирали «не спрашивать снова» для Bash, и 25% интерактивных сессий уже запускались в режиме полного обхода разрешений.
Как работает Auto mode
Вместо запроса подтверждения перед каждым действием, каждый вызов инструмента проходит через отдельный классификатор. Он анализирует команду на предмет необратимых, разрушительных операций или попыток выйти за границы рабочего окружения. Действия, признанные безопасными, выполняются автоматически. Рискованные блокируются, и Claude пытается найти альтернативный путь или запрашивает разрешение у пользователя.
Система имеет встроенные предохранители: если классификатор блокирует действия три раза подряд или 20 раз за сессию, режим автоматически переключается на ручное подтверждение. Правила разрешений из конфигурационных файлов всё ещё срабатывают до классификатора, за исключением слишком широких allow-правил (например, python:*), которые в Auto mode откладываются, чтобы не обходить проверку.
Классификатор использует небольшое количество дополнительных токенов на каждый вызов инструмента. С 7 августа Anthropic перестала учитывать эти расходы в лимитах пользователей Pro, Max и Team.
Результаты контролируемого эксперимента с 1053 участниками
Для оценки безопасности Anthropic привлекла 1053 оплачиваемых участника через стороннего подрядчика. Они работали в специально подготовленном тестовом окружении, зная об участии в исследовании, но не зная, какое именно поведение измеряется. В каждой сессии один обычный запрос подменяли явно опасной командой, которая в действительности не выполнялась независимо от ответа.
Результаты оказались впечатляющими: люди заблокировали 143 из 1053 опасных команд (13,6%), а Auto mode — 937 из 1053 (89%). В прямом сравнении автоматический режим остановил 800 команд, которые разрешили люди. Обратная ситуация — когда человек заблокировал команду, пропущенную классификатором — произошла всего шесть раз. 
Интересная динамика: в начале сессии участники замечали около 17% опасных команд, но после 50 и более предыдущих запросов доля снижалась примерно до 5%. Эффективность классификатора при увеличении длины сессии не менялась.
Анализ реальных производственных сессий
Компания также изучила сессии за май и июнь 2026 года, которые система безопасности ранее отправила на дополнительную проверку. В выборку вошли только аккаунты, разрешившие использование данных для обучения. Среди этих уже отобранных сессий серьёзное действие, которое пользователь явно не запрашивал, обнаружили в 6,3% случаев с ручным подтверждением и в 2,4% случаев с Auto mode. Под серьёзным Anthropic понимает уровень последствий от 7 баллов из 10 — например, удаление данных из продакшн-базы.
Защита от prompt injection и независимые аудиты
Отдельное тестирование классификатора вместе с исследовательской организацией Apollo Research снизило долю пропущенных синтетических атак с 12% до 7%. Проверка проводилась на отложенном наборе атак, которого Anthropic не видела при настройке защиты.
В ещё одной независимой оценке исследователи протестировали 72 сценария косвенной prompt injection по десять раз — всего 720 попыток. Ни одна не сработала против моделей Claude Fable 5, Opus 5 и Sonnet 5 в Auto mode. Для сравнения: у GPT-5.6 Sol в режиме Auto-review Codex доля успешных атак составила 5,83%, а в Full Access — 19,03%.
Влияние на продуктивность команд
Auto mode позволяет Claude работать автономно дольше, что делает модели, созданные для длительных задач — в частности Claude Opus 5 — практичнее для запуска на часах при больших задачах. По данным компании, среди пользователей Teams и Enterprise команды с Auto mode создают примерно на 25% больше pull request благодаря более длинным непрерывным запускам агентов. Уже сейчас команды компаний Adobe, Nuro, Gusto и Garner Health используют Auto mode как производственный режим по умолчанию. 
План развертывания и настройки для администраторов
С 14 августа новые сессии на тарифах Pro, Max и Team будут запускаться в Auto mode по умолчанию. Если пользователь уже установил другой режим по умолчанию, он получит однократный запрос о переключении. При закреплённом (pinned) режиме ничего не изменится.
Для Enterprise, Claude API, Claude Platform на AWS, Amazon Bedrock, Google Cloud Agent Platform и Microsoft Foundry Auto mode пока остаётся опциональным — администраторам дано время на рассмотрение изменений. В ближайший месяц, работая с облачными партнёрами, Anthropic планирует сделать его режимом по умолчанию везде и везде убрать оплату за накладные расходы классификатора. Enterprise-администраторы уже сейчас могут сделать Auto mode режимом по умолчанию через управляемые настройки (managed settings), установив disableAutoMode: "disable" для отключения в CLI и расширении VS Code.
Разработчики могут включить Auto mode командой claude --enable-auto-mode и переключаться между режимами с помощью Shift+Tab. В Desktop-приложении и расширении VS Code сначала нужно включить Auto mode в Settings → Claude Code, затем выбрать его из выпадающего списка режимов разрешений в сессии.
Ограничения и рекомендации
Anthropic подчёркивает, что Auto mode остаётся исследовательской функцией и не гарантирует абсолютной безопасности. Компания рекомендует использовать его для задач с понятным направлением работы, но не считать заменой проверке изменений перед публикацией или развёртыванием. Переключаться между режимами (например, обратно на ручной или на режим плана) можно в любой момент.