Рускоезичен злонамерен субект, известен като „Trim“, е трансформирал чрез заобикаляне на защитите („jailbreak“) водещи модели с изкуствен интелект в автоматизирана платформа за проникващи тестове, наречена AI Pentest Checker.

Тази дейност подчертава как киберпрестъпниците могат да злоупотребяват с легитимни AI услуги и общи инструменти за сигурност, за да ускорят разузнаването, да валидират уязвимости и да генерират отчети.

Според доклади на Cato, Trim се появява за първи път в рускоезичен форум за киберпрестъпления на 13 март 2026 г., където споделя методи, за които твърди, че заобикалят контролите за безопасност на Claude Opus.

Атакуващият твърди, че е описал техники за манипулиране чрез текстови подкани (prompts), предназначени да накарат модела да третира злонамерени заявки като разрешено изследване на сигурността, вместо като вредна дейност.

Описаните методи включват създаване на безопасен контекст преди отправяне на вредна заявка, преформулиране на инструкциите с фокус единствено върху структурата на кода и повторен опит с по-меки версии на вече отхвърлени подкани.

Тези техники представляват форми на „jailbreaking“ (заобикаляне на защитите), при които атакуващият се опитва да отмени поведенческите предпазни мерки на модела чрез специално изготвени входящи данни, вместо да експлоатира основната инфраструктура.

Изследователите на заплахи вече са наблюдавали злонамерена употреба от престъпници на легитимни големи езикови модели (LLM), включително чрез заобикаляне на защитите им. Съобщава се също, че Trim е препоръчал алтернативни AI услуги и локално хоствани модели, когато търговските системи откажат дадена заявка.

Тази стратегия намалява зависимостта от един доставчик на AI, предоставяйки на злонамерените субекти резервен вариант за генериране на код, анализ на цели или създаване на съдържание за експлоатация.

Изследователски групи предупреждават, че все по-способните водещи модели могат да подпомагат офанзивни задачи, като анализ на уязвимости и дейности, свързани с експлойти, дори когато доставчиците прилагат контроли за безопасност.

Cato Networks съобщава, че Trim уж е популяризирал AI Pentest Checker на 21 юни, комбинирайки възможностите на изкуствения интелект с офанзивни инструменти за сигурност за автоматизирано тестване.

Инструментът интегрира скенери и инструменти за разузнаване като Nuclei, ffuf, katana, subfinder и Gitleaks, за да автоматизира откриването на цели, изброяването на крайни точки, откриването на тайни ключове и проверките за уязвимости.

Притеснението не е, че тези инструменти са изначално зловредни – легитимните специалисти по проникващи тестове и защитниците ги използват широко.

Когато обаче се комбинират с компрометиран AI асистент, тези инструменти могат да намалят времето и експертния опит, необходими за координиране на работен процес по компрометиране на системи, интерпретиране на резултатите от сканирането, приоритизиране на констатациите и изготвяне на добре оформени отчети.

Платформата е използвала Claude Opus в своя процес за ескалация на критични уязвимости и друг модел за генериране на отчети от експлоатация.

Твърденията, че е използвана модифицирана системна подкана от конфигурация „Fable 5“, трябва да се третират с повишено внимание, освен ако не бъдат независимо проверени.

Въпреки това, разкритите или изтекли системни подкани могат да предоставят на атакуващите представа за инструкциите на модела, помагайки им да тестват стратегии за инжектиране на подкани или заобикаляне на защитите по-ефективно.

Този случай отразява по-широка промяна в пейзажа на заплахите. Изкуственият интелект се развива от асистент за писане на киберпрестъпници в оперативен слой, който може да организира многостъпкови работни процеси за атаки.

Anthropic по-рано съобщи за неутрализиране на дейности на киберпрестъпници, при които изкуственият интелект е бил използван за задачи, вариращи от проучване на цели до подпомагане на прониквания и дейности, свързани с изнудване.

Организациите трябва да отговорят, като намалят своята открита повърхност за атаки, непрекъснато сканират активите си с достъп до интернет, прилагат многофакторна автентификация (MFA), подменят компрометирани идентификационни данни и наблюдават за необичайна разузнавателна дейност.

Екипите за сигурност трябва също така да разглеждат фишинга, генериран от AI, автоматизираното изследване на уязвимости и по-бързото разработване на експлойти като реални рискове, а не като бъдещи сценарии.