Новоразкрита атака може да превърне рутинно искане за „резюмиране на тази страница“ в уеб чата Grok на xAI в тиха кражба на името на потребителя, приблизителното му местоположение, абонаментния план и историята на подканите в активния разговор.
Adversa AI сподели в доклад за Cyber Security News (CSN), че методът, наречен Cryptographic Context Injection (инжектиране на криптографски контекст), скрива командите на атакуващия в шифрован текст с AES-256-GCM, така че филтрите на входящите данни никога да не ги прочетат. След това той подтиква модела да декриптира и да се довери на тези команди, третирайки ги като свой собствен изход от изолираната програмна среда (пясъчник).
Водещият изследовател Рони Утевски сподели, че злонамереният код се намира на обикновено изглеждаща уеб страница като шифрован JSON обект, заедно с ключовия материал и кратка инструкция за неговото декриптиране в Python средата за изпълнение на агента.
Статичните защитни бариери класифицират текст; те не изпълняват функции като PBKDF2 и AES-256-GCM. За разлика от по-старите трикове за избягване на детекция, като Base64 или шифри за замяна, силното шифроване не може да бъде възстановено в рамките на теглата на модела, така че единственият път е през интерпретатора. След като изолираната среда върне чист текст, Grok третира този резултат по начина, по който една програма третира собственото си вътрешно състояние, а не като ненадеждно уеб съдържание.
След това декриптираните инструкции указват на агента да извлече данните за частната сесия и да ги вгради във фалшив „ключ за декриптиране“, който всъщност е шаблон на низ, съдържащ идентичността на жертвата и историята на чата.
На Grok се казва да отвори URL адрес, „за да извлече допълнителен контекст“, и неговият привилегирован инструмент за навигация зарежда контролирания от атакуващия адрес с откраднатите данни в низа за заявка (query string).
В доказателството за концепция (PoC) срещу Grok 4.5 Fast на grok.com трансферът е приключил без диалогов прозорец за потвърждение и без видимо предупреждение – истински резултат без кликване (zero-click) в реална производствена система.
Adversa първо съобщи за проблема на xAI и тяхната програма HackerOne на 3 юни 2026 г. xAI потвърди получаването, но не предложи график за отстраняване на уязвимостта, а последващите запитвания на 4 и 10 август останаха без отговор.
Изследователите заявиха, че все още са успели да възпроизведат атаката на 19 август. При около 20 опита от юни насам успеваемостта е била приблизително 40 процента, като неуспехите са се дължали на грешки при декриптиране, а не на блокирана инструкция. Няма издаден CVE идентификатор, няма публична корекция за сигурност и няма докладвани злоупотреби в реална среда. Работещите варианти на злонамерения код не са публично разкрити.
Същият криптографски метод беше демонстриран и срещу Google Gemini в режим Deep Thinking, идентифициран от извлечения системен текст като Gemini 3 Flash на платения уеб план. Единична подкана е поискала от Gemini да декриптира масив от данни, чийто чист текст е фалшифициран трасиращ код (traceback) на Python, съдържащ фалшиво извикване за политика за безопасност и префикс за разсъждение от първо лице.
Тъй като моделът е третирал резултата от изолираната среда като собствена работа, той е генерирал ограничено съдържание, което филтрите му обикновено блокират, а с модифициран злонамерен код е възпроизвел системни инструкции, които не трябва да разкрива.
Google не е уведомен, тъй като заобикалянето на защитите (jailbreaks) попада извън неговата програма за докладване на уязвимости. От Adversa заявиха, че успеваемостта при Gemini е спаднала рязко до август, вероятно поради промени във филтрите или модела.
Разкритието се вписва в по-широк модел на кражба на чат данни от интелигентни агенти-асистенти, които могат да сърфират, да изпълняват код и да извикват външни инструменти. Инжектирането на инструкции вече не е просто низ, поставен в подканата; това е борба за всеки контекст, който агентът третира като свой собствен, включително изходните данни от инструментите и състоянието на средата за изпълнение.
Утевски твърди, че решението е в защитната обвивка, а не в теглата на модела: изолиране на извлечените страници от привилегировани инструменти, изискване на съгласие за нови дестинации с напълно дефинирани аргументи, поддържане на хронология за всяка сесия и сигнализиране при засичане на последователност от ненадеждно съдържание, изпълнение на код и неочакван изход на данни.
Докато Grok не разграничи произхода на данните по този път, потребителите трябва да третират резюмирането на непознати страници като действие, което може да изложи на риск текущия чат.