Открит е значителен архитектурен дефект в начина, по който големите доставчици на изкуствен интелект (ИИ), включително OpenAI, Anthropic и Google, защитават вътрешния процес на разсъждение (chain-of-thought), генериран от техните водещи големи езикови модели (LLM).
Проучването разкрива, че шифрованите пакети с разсъждения, връщани от API интерфейсите на доставчиците, могат да бъдат пренасочени и изпълнени повторно към по-слаби модели с по-малко защити от същата фамилия, за да се извлекат личните следи от разсъжденията в чист текст.
Подробно описана от съвместен изследователски екип от института ELLIS в Тюбинген, Института „Макс Планк“, MATS Research и Snyk, атаката засяга екосистемите от модели Claude, GPT и Gemini и изисква единствено стандартен достъп до API без специални привилегии.
Дефект в API интерфейсите разкрива скрити следи от разсъждения
Модерните архитектури за разсъждение като GPT-5.6, Claude Opus 4.8 и Gemini 3 изграждат скрити следи от процеса на разсъждение, преди да върнат окончателния отговор. Тъй като тези вътрешни разсъждения съдържат търговска интелектуална собственост и проверки за безопасност, доставчиците не ги предоставят в чист текст. Вместо това техните API пренасят следата от разсъждения като шифрован, base64-кодиран пакет, който клиентското приложение изпраща обратно при следващите повиквания, за да се поддържа контекстът на разговора в няколко стъпки, без да е необходимо съхраняване на състоянието от страна на сървъра.
Изследователите обаче откриват, че тези шифровани пакети се удостоверяват с глобален ключ за целия доставчик, вместо да бъдат криптографски обвързани с конкретен потребителски акаунт, идентификатор на сесията (session ID) или ниво на модела. Тъй като криптографските подписи нямат обвързване с конкретен модел, шифрованият пакет, създаден от строго охраняван водещ модел, може легално да бъде подаден към всеки друг модел, хостван в инфраструктурата на същия доставчик. Експлоатирането на такива широко разпространени пропуски в имплементацията демонстрира как неотстранените уязвимости в сигурността на API могат да компрометират чувствителни облачни услуги.
Атаката работи, като използва по-евтини и леки модели като оракули за декриптиране. Атакуващият улавя шифрован блок с разсъждения, излъчен от водещ модел (като Claude Opus 4.8), и го инжектира в API повикване на по-малък модел (като Claude Haiku 4.5), като му указва да транскрибира буквално вътрешното мислене в потребителски текстови тагове. Тъй като по-леките модели нямат агресивните настройки против дестилация и предпазните бариери за сигурност, прилагани при водещите модели, те изпълняват подканата и извеждат скритото разсъждение в чист текст.
Както е описано подробно в научния труд, публикуван в ArXiv, екипът е потвърдил идентична съвместимост между моделите от фамилията GPT-5.6 на OpenAI и линията Gemini 3 на Google. Изследователите потвърждават математическата точност на възстановените следи чрез съпоставяне на дължината на декодираните токени с таксуваните токени за мислене, отчетени от API на доставчиците.
Реалните последици за сигурността надхвърлят дестилацията на модели или кражбата на интелектуална собственост. Анализирайки 6708 публични транскрипта на агенти, извлечени от GitHub и Hugging Face, изследователите са декодирали 315 320 вградени блока с разсъждения, възстановявайки:
- 367 артефакта с лични данни (PII);
- 182 твърдо кодирани идентификационни данни (включително 62 API ключа, 33 пароли и 30 лични имейл адреса).
Освен това уязвимостта позволява невидими атаки с индиректно инжектиране на подкани (indirect prompt injection) срещу автономни ИИ агенти. Атакуващият може да състави злонамерени инструкции в шифрован блок с разсъждения. При обработка от агент, инструментите за мониторинг, които проверяват само видимата история на разговора, не успяват да маркират скрития злонамерен код, което позволява на инжектираните инструкции да компрометират последващите работни процеси на агента, без да бъдат засечени.
След отговорно разкриване, OpenAI, Anthropic и Google признаха резултатите от изследването. И трите доставчика внедриха защити от страна на сървъра, което прави първоначалните демонстрационни кодове (PoC) за повторно изпълнение между модели невъзпроизводими в настоящите версии на API.
За установяване на цялостен контрол върху сигурността на Генеративния ИИ в LLM архитектурите, доставчиците и корпоративните разработчици трябва да внедрят следните защити:
- Криптографско обвързване: Обвързване на пакетите с разсъждения с конкретния модел източник, идентификатора на сесията и потребителската идентичност на ниво API шлюз.
- Строга изолация на моделите: Отхвърляне на блокове с разсъждения, подадени към ниво модел, различно от генериралото кода.
- Ротация на ключове: Ротация на наследените ключове за подписване, за да се анулират историческите блокове с шифрован текст, изложени в публични хранилища за код.
- Почистване на дневниците: Екипите от разработчици, изграждащи ИИ агенти, трябва да третират шифрованите блокове с мислене като чувствителни данни и да изтриват полетата с необработени подписи, преди да направят дневниците на агентите публични.