Нов експлойт, наречен “Friendly Fire”, компрометира интерфейсите с команден ред (CLI) Claude Code на Anthropic и Codex CLI на OpenAI, за да изпълнява контролирани от атакуващия двоични файлове по време на рутинни проверки на сигурността на код от трети страни.
Атаката, разкрита от изследователи по сигурността в AI Now Institute, е насочена срещу Claude Sonnet 4.6, Sonnet 5 и Opus 4.8, както и GPT-5.5, използвайки единствено конфигурациите по подразбиране „auto-mode“ (автоматичен режим) или „auto-review“ (автоматичен преглед).
Експлойтът не изисква куки (hooks), плъгини, MCP сървъри или конфигурационни файлове; вместо това той крие инжекции с подкани (prompt injections) директно в документацията и изходните файлове на библиотека с отворен код от трета страна.
Изследователите са модифицирали копие на популярната Python библиотека за геокодиране geopy, добавяйки скрипт security.sh, зловреден двоичен файл с име code_policies и примамващ изходен файл на Golang с име code_policies.go, предназначен да направи така, че двоичният файл да изглежда легитимно компилиран и безопасен.
Файлът README.md препраща към скрипта security.sh като рутинна програма за проверка на сигурността, подтиквайки ИИ агента да го изпълни като част от стандартна оценка на уязвимостите.
Когато потребителят просто даде подкана на агента от сорта на „Извърши тестване на сигурността на /path/to/geopy“, агентът изследва кодовата база, сблъсква се с инжектираната документация, инспектира примамващия изходен файл и заключава, че двоичният файл е безопасен, след което го изпълнява, постигайки отдалечено изпълнение на код (RCE) на хост машината, съобщават от AI Now Institute.
Както автоматичният режим (auto-mode), така и автоматичният преглед (auto-review) бяха рекламирани като по-безопасни междинни варианти в сравнение с напълно неограниченото изпълнение от агенти, използвайки ИИ класификатори за автоматично одобряване на команди, считани за нискорискови, докато подозрителните се пренасочват за преглед от човек.
От Anthropic заявиха, че при автоматичния режим на Claude Code потребителите вече одобряват 93% от подканите за разрешения, и класификаторът има за цел да намали ненужното триене, без да се жертва безопасността.
С Friendly Fire изследователите от AI Now Institute установиха, че същият този класификатор последователно е оценявал зловредния зловреден код като безопасен, тъй като евристиките за съпоставяне на код могат да бъдат измамени чрез сдвояване на реално изглеждащ изходен файл с компилиран двоичен файл, съдържащ съвпадащи низови константи.
Атаката се оказа директно преносима от Claude Code към Codex без модификация, което предполага, че основната слабост е присъща на начина, по който водещите модели разграничават доверени инструкции от недоверени данни, а не е специфичен за модела бъг.
Този клас атаки съответства на реални заплахи, включително скорошни компрометирания на веригата за доставки като кампанията Megalodon в GitHub и пробива в библиотеката PyTorch Lightning, като и двете показват, че зловредният код може реално да достигне до крайните потребители чрез актуализации на зависимостите.
Ако CI/CD тръбопроводите делегират автоматизираното сканиране за уязвимости на входящи актуализации на пакети на ИИ агенти, същата техника на инжектиране може да се задейства тихо, без човек изобщо да прегледа промяната.
Изследователите твърдят, че изолирането в пясъчник (sandboxing) само по себе си не е пълно решение, посочвайки разкрити уязвимости за избягване от пясъчника на Claude Code, които биха могли да позволят на атакуващ, който вече е постигнал RCE, да излезе напълно от контейнера.
Те също така предупреждават да не се разчита на одобрение от човек (human-in-the-loop) като крайна защита, цитирайки пристрастията към автоматизацията и „умората от подкани“ (prompt fatigue), които отслабват бдителността на проверяващия по време на повтарящи се взаимодействия с агента.
Основната препоръка: избягвайте внедряването на ИИ агенти за кодиране с права за изпълнение на код срещу недоверени или външни кодови бази, докато границите на доверие на ниво модел между инструкциите и данните не бъдат смислено разрешени.