Нова техника за атака срещу AI агенти, наречена „Ghostjacking“, може да подмами кодиращите агенти да изпълняват контролирани от атакуващия команди, да променят настройките в облака, да крадат идентификационни данни и да създават постоянни задни врати (backdoors).
Изследването беше представено от Tenet Security на DEF CON 34 в Лас Вегас на 9 август 2026 г. От Tenet заявиха, че атаката засяга нарастващ клас работни процеси с изкуствен интелект, при които кодиращите асистенти могат да четат информация от доверени инструменти и след това да предприемат действия в среди за разработка или в облачни среди.
Ghostjacking се основава на непряко инжектиране на подкани (indirect prompt injection). Вместо да изпраща злонамерен команда директно към AI кодиращия асистент, атакуващият вгражда вредни инструкции в данни, които агентът е вероятно да инспектира. Това може да включва блокирана уеб заявка, дневник с грешки (error log), предупреждение от система за мониторинг или доклад за грешка.
Когато разработчик поиска от AI агент да проучи данните, агентът може да интерпретира съдържанието на атакуващия като легитимна инструкция. Ако агентът има достъп до конзолни команди (shell), облачни табла за управление, DNS записи, изходен код или тайни данни, той може да извърши опасни действия, използвайки разрешенията, които вече са предоставени от организацията.
Tenet демонстрира проблема при интеграции с Cloudflare, Datadog и Sentry. В един сценарий атакуващият изпраща злонамерена заявка към уебсайт, защитен от Cloudflare. Защитната стена правилно блокира заявката и я записва в дневника. Когато обаче анализатор поиска от AI асистент да прегледа блокираните събития, асистентът обработва контролирания от атакуващия текст, вграден в дневника.
Изследователите заявиха, че компрометираният агент може след това да промени DNS настройките и да пренасочи уеб и имейл трафика на компанията. При тестове срещу Claude Code, Tenet твърди, че има 90 процента успеваемост, използвайки препоръчаната настройка на Cloudflare. Защитната стена блокира заявката, но получената регистрация в дневника се превръща в механизъм за доставяне на атаката. Подобна техника беше демонстрирана и срещу Datadog.
Изследователите споделиха, че атакуващите могат да използват публично изложени клиентски ключове, за да създават фалшиви предупреждения, съдържащи спешно изглеждащи диагностични инструкции. AI агент, преглеждащ тези предупреждения, може да бъде убеден да изпълни команди, които разкриват променливи на средата и облачни идентификационни данни.
Веригата на атака срещу Sentry се фокусира върху доверието между отделни AI системи. AI асистентът на Sentry, Seer, може да анализира манипулиран доклад за проблем и да генерира препоръка, контролирана от атакуващия. След това отделен кодиращ агент може да се довери на заключението на Seer и да изпълни предложената корекция, без да вижда първоначалното злонамерено съдържание.
Tenet също така разкри вече коригирана уязвимост за бягство от изолирана среда (sandbox escape) в Claude Desktop на Anthropic. Според изследователите, дефектът е можел да позволи на събраните от AI агент данни да напуснат изолираната среда, предназначена да ограничава изходящия достъп. Съобщава се, че Anthropic е потвърдила и отстранила уязвимостта преди презентацията на DEF CON.
По-голямото безпокойство е, че Ghostjacking не изисква традиционна експлоатация, като разбиване на удостоверяване или внедряване на зловреден код. AI агентът извършва оторизирани действия, което прави по-трудно за системите за откриване на крайни точки (EDR), защитните стени за уеб приложения (WAF) и системите за идентичност да го открият като злонамерен.
Tenet препоръчва ограничаване на мрежовия достъп на AI агентите по подразбиране, изискване на човешко одобрение преди изпълнение на команди, разделяне на ненадеждните данни от инструкциите на агента и преглед на всеки токен и външен инструмент, използван в работния процес на AI.