Anthropic променя начина, по който Claude Code обработва рискови команди, преминавайки от постоянни подкани за одобрение от потребителя към автоматизиран класификатор за сигурност, наречен автоматичен режим (auto mode).
Началото на тази промяна е 14 август 2026 г., когато автоматичният режим ще стане настройка по подразбиране за нови сесии в плановете Pro, Max и Team на Claude Code, което отбелязва голяма промяна в начина, по който ИИ агентите за програмиране балансират автономността със сигурността.
Решението идва след месеци на вътрешни и външни тестове, сравняващи ръчните подкани за разрешение с автоматизирания преглед. От Anthropic са установили, че проверяващите потребители са станали опасно самодоволни, одобрявайки 97% от всички заявки за разрешение в Claude Code, често рефлекторно, а не чрез реален контрол.
Това „изтощение от одобрения“ оставя голяма пролука в сигурността: в контролирано проучване с участието на 1053 платени професионални тестери, хората са открили едва 13,6% от опасните команди, вмъкнати в техния работен процес, докато класификаторът на автоматичния режим е открил 89% от същите заплахи.
Автоматичният режим е блокирал 800 команди, които хората са одобрили, докато хората са блокирали само 6, които автоматичният режим е пропуснал. Бдителността на хората е намалявала допълнително с удължаването на сесиите, спадайки от 17% степен на засичане в началото до едва 5% след 50 или повече предходни подкани, докато степента на откриване на автоматичния режим е останала стабилна през цялото време.Вместо да прекъсва потребителите с повтарящи се подкани, автоматичният режим насочва всяко извикване на инструмент през класификатор, предназначен да блокира действия, които са необратими, деструктивни или насочени извън собствената среда на потребителя.
Когато класификаторът маркира нещо като рисково, Claude обикновено намира по-безопасна алтернатива или изисква директно потвърждение от потребителя. Ако се достигнат три последователни блокирания или общо двадесет в рамките на една сесия, Claude Code автоматично се връща към ръчно одобрение.
Съществуващите правила за разрешения все още имат приоритет в повечето случаи, с изключение на прекалено широки правила за разрешение като неограничено изпълнение на Python или Node. Те се пренебрегват при автоматичен режим, тъй като биха позволили на командите да заобиколят класификатора изцяло.
Освен рутинния преглед на команди, автоматичният режим е демонстрирал устойчивост и срещу сложни атаки. В двуседмичен проект за симулация на червен екип (red-teaming) съвместно с Apollo Research, процентът на пропуските на класификатора срещу злонамерени атаки е спаднал от 12% на 7% след укрепване на защитата.
При тестове за инжектиране на подкани (prompt-injection), проведени от Trajectory Labs, нито един от 720 опита за атака не е успеел срещу моделите на Claude, работещи в автоматичен режим, в сравнение с 5,83% степен на успех срещу GPT-5.6 Sol на OpenAI, работещ в сходния режим за автоматичен преглед на Codex.
Вътрешно в Anthropic автоматичният режим вече е предотвратил реални инциденти, включително блокиране на опит за изтичане на данни към публичен сайт за споделяне на код, спиране на масово изтриване на контейнери (pod-kill), което би унищожило текущи задачи за обучение, и засичане на заявка за достъп в облака с твърде големи привилегии, която би предоставила пълен административен контрол вместо достъп само за четене на данни за плащане.
Отвъд сигурността, автоматичният режим е проектиран да позволи на Claude да работи автономно за по-дълги периоди без прекъсване – функция, особено подходяща за дълго работещи модели като Claude Opus 5.
Anthropic съобщава, че екипите и компаниите, внедрили автоматичния режим, изпращат с около 25% повече заявки за сливане (pull requests). Компании като Adobe, Nuro, Gusto и Garner Health вече са внедрили автоматичния режим като стандартна настройка в производствената си среда, използвайки го за захранване на нощни изследователски агенти, автоматизиране на проверката на уеб страници в няколко държави и стандартизиране на работните процеси за разработка на стотици служители.
Засега автоматичният режим остава опционален за Claude Enterprise, Claude API и облачните платформи, включително AWS, Google Cloud и Microsoft Foundry, давайки време на администраторите да оценят промяната, преди Anthropic да я направи по подразбиране там през следващия месец.
Anthropic също така вече не таксува потребителите на Pro, Max и Team за допълнителните токени, необходими за класификатора на автоматичния режим. За екипите по сигурност тази промяна сигнализира за по-широка тенденция в индустрията: с поемането на все по-автономни и дългосрочни задачи от ИИ агентите за програмиране, автоматизираното класифициране на рискове може да се окаже по-надеждно от човешкия надзор, изтощен от постоянни, повтарящи се искания за одобрение.