Anthropic ще направи автоматичния режим („auto mode“) в Claude Code стандартен по подразбиране за нови сесии за плановете Pro, Max и Team, считано от 14 август. Потребителите, които преди това са избрали различна настройка по подразбиране, може да получат еднократна подкана с въпрос дали искат да преминат към автоматичен режим.

В контролиран експеримент с 1053 платени професионални тестери, човешкият преглед е уловил едва 13,6% от опасните команди, докато автоматичният режим е уловил 89% (Източник: Anthropic).

Функцията остава опционална за Claude Enterprise, Claude API, Anthropic Platform, Amazon Bedrock, Agent Platform на Google Cloud и Microsoft Foundry, което дава време на администраторите да оценят възможностите ѝ, преди да я активират. Anthropic планира да направи автоматичния режим стандартен за тези платформи през следващия месец и ще спре да таксува допълнителния изчислителен ресурс, необходим за работата на неговия класификатор за сигурност.

Автоматичният режим намалява риска за повечето потребители, но не го елиминира напълно, тъй като разчита на изкуствен интелект да преценява дали действията са безопасни. Компанията препоръчва потребителите все пак да преглеждат действията на Claude, преди да правят промени с висок риск, като например модифициране на производствени системи или критична инфраструктура.

В автоматичен режим системата пренасочва всяко извикване на инструмент през класификатор, предназначен да блокира необратими или разрушителни действия, както и действия, насочени към ресурси извън средата на потребителя. Когато класификаторът блокира дадено действие, Claude или намира по-безопасна алтернатива, или иска одобрение от потребителя. Ако не успее да постигне напредък след три последователни блокирания или общо 20 блокирания по време на една сесия, Claude се връща към ръчно одобрение.

„Прекарахме последните няколко месеца в тестване дали автоматичният режим е толкова безопасен или по-безопасен от това средностатистическият потребител да клика върху подканите. Проведохме вътрешни симулации на атаки („red-teaming“), оценки от трети страни и оценки за инжектиране на подкани, контролирано проучване с 1053 платени тестери, както и анализ на реални производствени сесии. По всеки показател, който тествахме, автоматичният режим съответстваше на ръчния преглед или го превъзхождаше“, обясни Конър Филипи, член на техническия персонал в Anthropic.

Режимът позволява на Claude да работи автономно за по-дълги периоди, намалявайки ангажираността на потребителя и същевременно увеличавайки производителността.

Сравнение между автоматичния режим и ръчното одобрение

От Anthropic заявиха, че разработчиците одобряват 97% от подканите за разрешения в Claude Code, което подсказва, че много заявки се одобряват без внимателен преглед. Компанията също така установи, че много потребители вече са отслабили или заобиколили проверките за разрешения чрез промяна на своите настройки.

Вътрешните и независимите тестове показаха, че автоматичният режим е по-бепасен от ръчните одобрения. В проучване сред 1053 платени тестери, участниците са блокирали 13,6% от опасните команди, докато автоматичният режим е блокирал 89%. Анализът на маркирани реални сесии също така установи, че при ръчното одобрение вероятността да се стигне до вредни действия, които потребителите не са поискали изрично, е над два пъти по-голяма, отколкото при автоматичния режим.

Компанията си сътрудничи с фирмата за безопасност на ИИ Apollo Research, за да оцени автоматичния режим срещу симулирани кибератаки. След направените подобрения, процентът на пропуснати атаки от страна на класификатора спадна от 12% на 7%. Атаките бяха умишлено проектирани да разкриват слаби места и бяха по-злонамерени от типичната употреба в реалния свят.

Защита срещу инжектиране на подкани (prompt injection)

Автоматичният режим добавя още едно ниво на защита срещу атаки за инжектиране на подкани, при които скрити в уебсайтове, документи или друго съдържание злонамерени инструкции се опитват да подведат агента да игнорира инструкциите на потребителя.

Независима оценка от Trajectory Labs установи, че нито една от 720-те атаки с инжектиране на подкани не е успяла срещу моделите на Claude, работещи в автоматичен режим. В същия бенчмарк Trajectory Labs отчете 5,83% степен на успеваемост срещу GPT-5.6 Sol на OpenAI, работещ в режим Auto-review на Codex, и 19.03% степен на успеваемост, когато Codex работи в режим на пълен достъп.

„Предпазните мерки, вградени в първичните интеграции на браузъра, като разширенията за Chrome, предоставени от OpenAI и Anthropic, не бяха тествани. Поради това тези резултати трябва да се разглеждат като измерване на базовия модел, а не на пълния набор от предпазни мерки, които биха могли да съществуват в дадено внедряване“, продължи Филипи.

Как Anthropic използва автоматичния режим вътрешно

Anthropic използва автоматичния режим във всички работни процеси на Claude Code. Класификаторът е предотвратил изтичане на данни извън мрежата, разрушителна масова операция и твърде широко ескалиране на привилегии. Във всеки от случаите Claude или е открил по-безопасна алтернатива, или е поискал одобрение от потребителя, преди да предприеме по-нататъшни действия.

Компанията също така въведе функции, включително твърди откази („hard denies“), правила, уреждащи достъпа и споделянето на данни, проверки на състоянието на git преди деструктивни действия в Git и скрининг за инжектиране на подкани, за да направи автоматичния режим по-безопасен за производствена употреба.

„Автоматичният режим ни даде по-безопасен баланс между скорост и контрол. Успяхме да премахнем повтарящите се подкани и да повишим производителността, без да правим компромис с безопасността. Виждаме, че автоматичният режим блокира в правилния момент, което ни дава увереност да се движим бързо“, каза Мартин Емде, софтуерен инженер в Gusto.