Наскоро разкрита уязвимост в начина, по който OpenAI, Anthropic и Google пренасят скрити разсъждения на изкуствения интелект (ИИ) между API повиквания, позволи на изследователи да възстановят вътрешни разсъждения и тайни от сесийни регистрационни файлове, включително API ключове и пароли.

Слабостта засяга криптираните обекти с разсъждения, използвани от API интерфейсите за разсъждения на доставчиците, при които блок, създаден в една сесия, може да бъде възпроизведен в друга, а по време на тестовете дори предаден на по-слаб модел от същата фамилия на доставчика, за да бъде накаран да разкрие скритата информация.

Екипът, стоящ зад доклада, демонстрира четири сценария за злоупотреба: кражба на патентовани разсъждения с цел дестилация на модели, извличане на лични данни от публикувани хронологии на други потребители, възстановяване на вредно съдържание, скрито зад безопасен видим отговор, и скриване на инжектирани инструкции (prompt injections) в непрозрачни блокове с разсъждения.

В рамките на 6708 публични траектории на агенти екипът е дешифрирал 315 320 блока с размисли. След изключване на източниците от бенчмаркове са преброени 704 отделни артефакта, засягащи поверителността, от реални потребителски сесии, включително 62 API ключа, 33 пароли, 24 токена за достъп и седем частни ключа.

Атаката между различни потребители не осигурява произволен достъп до лични чатове. Тя изисква получаване на криптиран блок с разсъждения, например такъв, публикуван в регистрационен файл на агент, и API достъп до съвместим модел от същия доставчик.

Изследователите са разкрили констатациите си на засегнатите доставчици на модели, на Microsoft и Hugging Face, и споделят, че демонстрираните атаки са спрели да работят след прилагането на мерки за ограничаване на рисковете. Тяхното изявление за възпроизводимост гласи, че основната атака за извличане вече не може да бъде възпроизведена към август 2026 г.

Докладът не документира злонамерена експлоатация в реална среда. На разработчиците се препоръчва да премахват блоковете с разсъждения и непрозрачните полета с разсъждения от споделяните хронологии и да избягват публикуването на необработени API транскрипти, дори когато видимият текст е бил изчистен.

Проблемът започва с дизайн, предназначен да запази разсъжденията в рамките на API повикванията, когато състоянието на разговора се управлява ръчно или без съхранение на състоянието (stateless). OpenAI може да връща криптирани елементи с разсъждения, които приложенията възпроизвеждат с ръчно управлявана история, Anthropic пренася пълните разсъждения в криптиран подпис, а Google използва криптирани подписи на мисълта. Тези обекти запазват състоянието на разсъжденията, без да излагат базовия чист текст директно на клиента.

Самото криптиране не е било разбито и атаката не е изисквала получаване на ключ за декриптиране. Тя се е основавала на това, че непокътнатите непрозрачни блокове се приемат и обработват от доставчика.

По време на тестването авторите на доклада са установили, че тези обекти са преносими между сесии, потребители и модели, което позволява на по-слаб съвместим модел да действа като т.нар. „приблизителен“ (fuzzy) декодер: Claude Haiku 4.5 за хронологии на Claude, GPT-5.6 Luna за хронологии на GPT и Gemini Robotics ER-1.6 за хронологии на Gemini. На декодера е подавана инструкция да транскрибира разсъжденията, генерирани от по-силен модел.

Това поведение между различни потребители превръща публикуваните регистрационни файлове на агенти в по-сериозен проблем за сигурността. От 704-те артефакта, възстановени от изследователите (извън тези от бенчмаркове), 64 са присъствали само в скритите разсъждения и никъде във видимата следа. Поради това изчистването на четимия разговор може да остави тайни в непрозрачния блок, които друг акаунт би могъл да възпроизведе.

Излагането на риск, което проучването демонстрира, е ограничено: то засяга разработчици, които са публикували необработени хронологии на агенти с непокътнати обекти за разсъждение – една идентифицируема група, а не всеки потребител на API, като това не е задължително единствената група в риск.

Същата преносимост е позволила и демонстрация на концепция за невидимо инжектиране на инструкции. Екипът е създал непрозрачен блок с разсъждения, който пренася злонамерена инструкция, и по-късно го е възпроизвел в несвързана задача, карайки получаващия модел да добави насочено от атакуващия действие за качване на данни, без да поставя инжектираната инструкция във видимия текст.

Авторите предупреждават, че не разполагат с действителния чист текст (ground-truth) за патентованите разсъждения, така че не могат да гарантират, че всяка реконструирана следа е точно копие. Техните проверки за достоверност са се опирали на броя на токените за разсъждение и качествени сравнения, като извлечените дължини в общи линии съвпадат с отчетения от доставчиците брой токени за размисъл.

Текущата документация на доставчиците показва, че криптираните разсъждения остават част от тези API, но обработката им е променена. OpenAI все още съветва разработчиците да възпроизвеждат криптираните елементи с разсъждения, когато управляват ръчно историята без състояние, докато Google заявява, че неговият бекенд управлява съвместимостта на мислите, когато сесията превключва между модели.

Anthropic вече посочва, че блоковете за размисли са обвързани с модела, който ги е създал, и трябва да бъдат премахвани при превключване на моделите, тъй като другите модели ги игнорират.

Няколко въпроса, повдигнати от разкритието, остават отворени в публичното пространство. Досега не се е появило публично признание за уязвимостта от нито един от тримата доставчици и никой не е свързал настоящата си документация с това изследване, така че твърдението, че демонстрираните атаки вече не работят, се основава на собственото изявление за възпроизводимост на изследователите, а не на потвърждение от доставчиците.