Anthropic перестаёт просить пользователей Claude Code нажимать «подтвердить» каждые несколько минут. Начиная с 14 августа 2026 года авторежим Claude Code становится настройкой по умолчанию для новых сессий в тарифах Pro, Max и Team, заменяя постоянный поток запросов на разрешение, который долгое время определял, как разработчики взаимодействуют с AI‑агентами для написания кода. Компания утверждает, что у неё есть данные в пользу такого перехода, но независимые комментарии — в том числе от разработчика и исследователя Саймона Уиллисона — показывают, что история сложнее, чем простая победа в области безопасности.
Summary
Ключевые выводы
- Anthropic делает авторежим настройкой по умолчанию для тарифов Claude Code Pro, Max и Team, начиная с 14 августа 2026 года.
- В тесте с участием 1 053 платных пользователей авторежим заблокировал 89% опасных команд, тогда как люди отказывались только в 13,6% случаев.
- Независимый оценщик Trajectory Labs провёл 720 атак с косвенной инъекцией подсказок против Claude Fable 5, Opus 5 и Sonnet 5 в авторежиме — ни одна не увенчалась успехом.
- Anthropic перестанет взимать плату за дополнительные токены, которые использует классификатор авторежима при каждом вызове инструмента.
- Аналитики по‑прежнему указывают на нерешённые риски, включая вредоносные сторонние пакеты, которые могут незаметно выводить данные.
Anthropic делает авторежим Claude Code настройкой по умолчанию
Этот шаг отвечает на проблему, о которой инженеры Anthropic говорили открыто: усталость от подтверждений. Просить человека одобрять каждый шаг рабочего процесса AI‑агента звучит осторожно, но на практике это приучает людей бездумно прокликивать запросы, не вчитываясь в них. По словам Anthropic, авторежим заменяет этот повторяющийся цикл подтверждений классификатором, который проверяет каждый вызов инструмента на предмет действий, которые являются необратимыми, разрушительными или явно выходят за рамки допустимого. Если классификатор что‑то помечает, Claude либо ищет более безопасный путь, либо возвращается к запросу разрешения — и если блокировки продолжают накапливаться, вся сессия откатывается к ручному одобрению.
Развёртывание затрагивает тарифы Pro, Max и Team, если только пользователь или администратор вручную не закрепил другую настройку разрешений. Anthropic также убирает небольшой финансовый барьер: согласно собственному блогу компании об этом изменении, она больше не будет взимать плату за дополнительные токены, которые классификатор потребляет при каждом вызове инструмента.
Почему это важно не только с точки зрения удобства? Anthropic утверждает, что авторежим уже меняет то, как работают команды: по сообщениям, клиенты Team и Enterprise, использующие его, отправляют примерно на 25% больше pull‑запросов, чем те, кто полагается на ручное одобрение. Это заметный сигнал о росте продуктивности, но он также повышает ставки: более автономная работа по написанию кода означает больше возможностей для ошибок, если лежащий под ней слой безопасности недостаточно надёжен.
Действительно ли авторежим блокирует больше опасных команд, чем люди?
Да, согласно собственным тестам Anthropic — с большим отрывом. Компания провела исследование среди 1 053 платных тестировщиков, в котором в середине обычной сессии стандартный запрос на разрешение незаметно заменялся явно опасной командой. Каждый тестировщик видел идентичный сценарий. Результат: только 13,6% людей отказались выполнить вредоносное действие. Авторежим, протестированный на той же команде, заблокировал её в 89% случаев.
Разрыв увеличивается по мере продолжительности сессии. Anthropic сообщила, что бдительность людей падала примерно до 5% после 50 запросов — показатель, который наглядно иллюстрирует, почему компания рассматривает усталость от подтверждений как реальный риск для безопасности, а не абстрактную проблему. Люди устают, отвлекаются или становятся самоуверенными. Классификатор, по крайней мере в теории, — нет.
Тем не менее математика работает в обе стороны. Эти 89% блокировок оставляют 11% опасных команд, которые проходят через проверки авторежима, — на этот пробел Anthropic сама указывает. Компания по‑прежнему рекомендует человеческую проверку для изменений, затрагивающих продуктивные системы, что говорит о том, что даже Anthropic пока не готова считать авторежим полноценной заменой человеческому суждению.
Инъекция подсказок: более серьёзный тест для безопасности AI‑агентов для написания кода
Блокировать очевидно опасную команду — одно. Остановить атаку, скрытую внутри контента, который агент читает из внешних источников, — совсем другая задача, и именно она больше всего беспокоит исследователей в области безопасности. Инъекция подсказок — встраивание вредоносных инструкций в текст, код или файлы, которые затем потребляет AI‑агент, — неоднократно называлась ключевой уязвимостью в безопасности AI‑агентов для написания кода, и Саймон Уиллисoн ранее предполагал, что 2026 год может принести серьёзный инцидент безопасности, связанный именно с таким типом уязвимости.
Ответом Anthropic стало заказанное внешнее исследование. Компания наняла Trajectory Labs для независимой оценки последних общедоступных версий Claude Code и Codex по состоянию на 17 июля 2026 года. Trajectory Labs разработала 72 сценария косвенной инъекции подсказок, которые были исключены из собственных обучающих и тестовых наборов Anthropic, а затем прогнала каждый сценарий десять раз — всего 720 попыток атак. Согласно результатам, опубликованным Anthropic, ни одна из 720 попыток не увенчалась успехом против Claude Fable 5, Opus 5 или Sonnet 5 в авторежиме.
Это впечатляющий результат, и именно его Anthropic хочет вынести в заголовки. Тарик Шихипар, один из представителей Anthropic, обсуждавший эту работу на недавнем Fireside Chat, в шутку написал в соцсетях, что отчёт можно было бы назвать «победа над смертоносной триадой» — отсылка к сочетанию недоверенного ввода, конфиденциальных данных и автономии агента, которое исследователи безопасности считают самым опасным сочетанием для AI‑систем. Кэт Ву, ещё одна представительница Anthropic, присутствовавшая на этой дискуссии, сказала, что компания «по сути смягчила каждую атаку», которую тестировала.
Сам Уиллисoн остаётся скорее осторожным скептиком, чем убеждённым сторонником. Он отмечает, что нулевая успешность 720 отобранных атакующих сценариев обнадёживает, но это не то же самое, что доказательство защиты от всех векторов атак, которые может попробовать реальный противник. Один из сценариев, на который он специально указывает: вредоносный сторонний программный пакет, который инструктирует агента для написания кода сначала получить и запустить дополнительные файлы, а уже затем выполнять легитимные команды — файлы, которые при этом могут незаметно выводить данные. Неясно, смогла бы какая‑либо версия авторежима Claude Code обнаружить такую косвенную атаку по типу атаки на цепочку поставок, поскольку вредоносная инструкция не обязательно будет выглядеть как опасная команда в том виде, в каком её должен распознавать классификатор.
Что остаётся нерешённым
Под всей этой дискуссией лежат две разные проблемы безопасности, и авторежим не обязательно одинаково хорошо решает обе. Первая — непреднамеренный вред, когда агент удаляет не те файлы или стирает продуктивную базу данных просто из‑за неверного понимания инструкции. Вторая, и более волнующая исследователей безопасности, — преднамеренная инъекция подсказок, когда злоумышленник превращает в оружие контент, которому доверяет агент.
Собственный вывод Уиллисoна склоняется к более структурному решению, чем доверие какому‑то одному уровню безопасности, даже если он хорошо показывает себя в тестах. Вместо того чтобы полностью полагаться на механизмы безопасности Anthropic AI, встроенные в модель или классификатор, он говорит, что теперь больше мотивирован проектировать рабочие процессы агентов так, чтобы AI‑системы просто не имели доступа к данным или инструментам, способным нанести ущерб при некорректном срабатывании. Это существенно иная позиция, чем «доверяйте классификатору»: она рассматривает авторежим как один из уровней защиты среди нескольких, а не как окончательное решение.
Также стоит отметить, что Anthropic — не единственная крупная AI‑лаборатория, которая борется с этим компромиссом. По сообщениям, OpenAI решила не включать аналогичный авторежим по умолчанию для своей самой мощной модели GPT‑5.6, выбрав вместо этого более консервативный подход, основанный на подтверждениях, — признак того, что даже внутри отрасли пока нет консенсуса относительно того, какой уровень автономии безопасно предоставлять агенту для написания кода по умолчанию.
FAQ
Что такое авторежим Anthropic в Claude Code?
Авторежим — это настройка, которая заменяет повторяющиеся запросы на человеческое одобрение классификатором, автоматически блокирующим необратимые или опасные вызовы инструментов и переходящим к ручному одобрению только тогда, когда блокировки повторяются или возникает по‑настоящему неоднозначное действие.
Насколько эффективен авторежим в блокировке опасных команд по сравнению с людьми?
В тестировании с участием 1 053 платных пользователей авторежим заблокировал 89% опасных команд, тогда как только 13,6% человеческих тестировщиков отказались выполнить то же вредоносное действие — и, по сообщениям, бдительность людей падала ещё ниже, примерно до 5%, после 50 запросов в рамках одной сессии.
Полностью ли авторежим предотвращает атаки с инъекцией подсказок?
Независимое тестирование Trajectory Labs не выявило ни одной успешной атаки с инъекцией подсказок среди 720 попыток против Claude Fable 5, Opus 5 и Sonnet 5 в авторежиме. Тем не менее такие риски, как вредоносные сторонние пакеты, которые выводят данные, могут быть не полностью устранены текущей системой.
Какие риски для безопасности всё ещё существуют у AI‑агентов для написания кода, несмотря на авторежим?
Агенты всё ещё могут выполнять разрушительные действия по ошибке, а сложные атаки — особенно проводимые через вредоносные сторонние пакеты кода — могут не всегда надёжно обнаруживаться классификатором авторежима, согласно анализу опубликованных Anthropic результатов.
{«@context»:»https://schema.org»,»@type»:»FAQPage»,»mainEntity»:[{«@type»:»Question»,»name»:»Что такое авторежим Anthropic в Claude Code?»,»acceptedAnswer»:{«@type»:»Answer»,»text»:»Авторежим — это настройка, которая заменяет повторяющиеся запросы на человеческое одобрение классификатором, автоматически блокирующим необратимые или опасные вызовы инструментов и переходящим к ручному одобрению только тогда, когда блокировки повторяются или возникает по‑настоящему неоднозначное действие.»}},{«@type»:»Question»,»name»:»Насколько эффективен авторежим в блокировке опасных команд по сравнению с людьми?»,»acceptedAnswer»:{«@type»:»Answer»,»text»:»В тестировании с участием 1 053 платных пользователей авторежим заблокировал 89% опасных команд, тогда как только 13,6% человеческих тестировщиков отказались выполнить то же вредоносное действие — и, по сообщениям, бдительность людей падала ещё ниже, примерно до 5%, после 50 запросов в рамках одной сессии.»}},{«@type»:»Question»,»name»:»Полностью ли авторежим предотвращает атаки с инъекцией подсказок?»,»acceptedAnswer»:{«@type»:»Answer»,»text»:»Независимое тестирование Trajectory Labs не выявило ни одной успешной атаки с инъекцией подсказок среди 720 попыток против Claude Fable 5, Opus 5 и Sonnet 5 в авторежиме. Тем не менее такие риски, как вредоносные сторонние пакеты, которые выводят данные, могут быть не полностью устранены текущей системой.»}},{«@type»:»Question»,»name»:»Какие риски для безопасности всё ещё существуют у AI‑агентов для написания кода, несмотря на авторежим?»,»acceptedAnswer»:{«@type»:»Answer»,»text»:»Агенты всё ещё могут выполнять разрушительные действия по ошибке, а сложные атаки — особенно проводимые через вредоносные сторонние пакеты кода — могут не всегда надёжно обнаруживаться классификатором авторежима, согласно анализу опубликованных Anthropic результатов.»}}]}
Статья подготовлена при содействии искусственного интеллекта и проверена редакционной командой.

