CrowdStrike представи пет нови техники за внедряване на подкани (prompt injection), подчертавайки нарастващата заплаха за AI агентите, тъй като организациите все по-често внедряват автономни AI системи.
Докато първоначалните рискове бяха фокусирани върху просто манипулиране на чатботове, възходът на AI агентите, способни да сърфират в уебсайтове, да осъществяват достъп до вътрешни данни и да изпълняват команди, значително разшири повърхността за атака.
Сега нападателите вграждат злонамерени инструкции в данните, които тези агенти консумират, което позволява косвени атаки, които могат да отвлекат поведението на системата без очевидни признаци.
За да се справи с това нарастващо предизвикателство, CrowdStrike разшири своята таксономия за prompt injection с 18 нови техники, с което общият брой на документираните методи става над 200.
Сред тях пет новоподчертани техники демонстрират как нападателите усъвършенстват стратегиите си, за да избягват откриването и фино да манипулират AI системите:
- Активиране на добавяне на правила чрез тригер (Trigger-Activated Rule Addition - PT0201): Скрити тригери активират злонамерени инструкции само когато са изпълнени специфични условия.
- Когнитивно потискане на токени (Cognitive Token Suppression - PT0197): Манипулира подканите, за да накара AI да игнорира или пренебрегне важни инструкции.
- Алгоритмично разлагане на полезния товар (Algorithmic Payload Decomposition - PT0200): Разделя злонамерена подкана на по-малки части, за да се избегне откриването.
- Внедряване на специални токени (Special Token Injection - PT0198): Използва специални или контролни токени за промяна на поведението на AI или заобикаляне на предпазните мерки.
- Неволно доставяне от потребителя (Unwitting User Delivery - IM0005): Подмамва потребителите неволно да доставят злонамерени подкани до AI система.
Тези развития сигнализират за промяна в начина, по който работят атаките с внедряване на подкани. Вместо да разчитат на очевидни опити за джейлбрейк, нападателите все по-често използват многослойни техники, включващи скрит контекст, забавено изпълнение и трикове с форматирането.
CrowdStrike подчертава, че организациите трябва да разширят моделирането на заплахи за изкуствен интелект, за да включат всички възможни източници на данни - от подкани и API до имейли и SaaS платформи.