Компютърни специалисти наскоро откриха начин за извличане на скрития „мисловен процес“, който водещите модели с изкуствен интелект (AI) извършват, докато решават сложни проблеми.
Резултатите предоставят известни доказателства — макар и не окончателни — че някои китайски модели може да са били обучени чрез „дестилиране“ на информация за логическо мислене от американски модели, която е трябвало да бъде скрита. Това заключение се основава на изключително близкото съвпадение на техните мисловни модели и логически вериги. Изследователите също така демонстрираха, че методът може да се използва за възстановяване на лична информация, като пароли и API ключове, от вътрешния мисловен процес на модела, въпреки че тази уязвимост вече е коригирана.
„Всички основни доставчици на водещи модели, които тествахме, споделят тази уязвимост“, казва Александър Панфилов, компютърен специалист от Тюбингенския университет в Германия, участвал в проучването. „Тя може да доведе до изтичане на лична информация и да позволи мащабни атаки за дестилация на логическо мислене.“
Панфилов и неговите колеги от Тюбингенския университет, Института „Макс Планк“, института за безопасност на AI MATS Research и компанията за сигурност Snyk идентифицираха същия проблем при водещи модели на OpenAI, Anthropic и Google, достъпвани чрез приложен програмен интерфейс (API).
В научен доклад, описващ разработката, изследователите показват, че китайският модел с отворени тегла Kimi K3 на Moonshot AI генерира поразително сходни резултати със скритите логически следи (стъпките за логическо мислене, използвани за решаване на проблем) на Claude Opus 4.8 и GPT 5.6 Sol при определени заявки. Въпреки приликите, те отбелязват, че изследването „не може причинно-следствено да докаже извършването на дестилация“. Те откриват, че два други модела с отворени тегла — китайският DeepSeek и Inkling на американската компания Thinking Machines — не показват такова сходство в мисловния процес с Claude Opus.
Moonshot AI и Z.ai не отговориха на исканията за коментар до момента на публикуване.
Дестилацията е утвърдена и широко използвана техника за ефективно копиране на възможностите на съществуващи модели към нови, като е особено разпространена при разработването на модели с отворени тегла или такива, достъпни за пълно изтегляне.
Напоследък обаче дестилацията се превърна в спорна тема поради твърденията, че китайски AI компании я използват, за да копират най-добрите американски модели. През февруари OpenAI заяви пред американските законодатели, че DeepSeek изглежда е копирал един от нейните модели, за да изгради модел за логическо мислене, наречен R1. През юни Anthropic съобщи на конгресмените, че Alibaba систематично е дестилирала нейните модели, за да създаде свой собствен, наречен Qwen.
Няма индикации, че китайските компании за изкуствен интелект са използвали конкретно тази техника за дестилиране на базирани в САЩ AI модели. Панфилов и неговите сътрудници обаче твърдят, че използването на техния метод би направило възможно извличането на много повече информация от затворени модели, отколкото се смяташе досега.
Напредналите AI модели решават трудни задачи, като ги разделят на съставни части, които се анализират последователно чрез вид изкуствено мислене или „верига от мисли“ (chain of thought). Компаниите се стремят да пазят в тайна логическия процес на патентованите си модели, за да предотвратят използването им за обучение на нови платформи. Въпреки това те обикновено изпращат криптирана версия на тези разсъждения до компютъра на потребителя, за да разпределят част от изчисленията.
Атаката на изследователите се основава на факта, че повечето AI компании предлагат и сродни модели с различни размери. По-големите модели са по-способни, но и по-скъпи за изпълнение и достъп. Потребителите могат да избират по-малки и по-слаби версии за определени задачи, за да намалят разходите си.
Панфилов и неговите колеги откриха, че подаването на криптирани логически следи към по-малка версия на същия модел може да разкрие скрития вътрешен мисловен процес. По-малките версии са преминали през по-малко обучение за съответствие (alignment), което означава, че за разлика от по-големите модели, те са по-малко склонни да откажат разкриването на своите вътрешни мисли.
„Идеята за пренасочване на съобщения към по-слаб вариант на модела, който има същия ключ за декриптиране, но по-слабо съответствие, е много интересна“, казва Флориан Трамер, компютърен специалист от Федералния технологичен институт в Цюрих (ETH Zürich), Швейцария, специализиран в компютърна сигурност. „Това определено се превръща в сериозен проблем.“
Същият метод разкрива и поверителна информация, включително API ключове и пароли, вградени в логическите следи, прихванати от машината на потребителя.
Панфилов и неговите съавтори сигнализираха OpenAI, Anthropic и Google за уязвимостта миналия месец. Всяка от компаниите коригира своя API, за да ограничи проблема. Въпреки че вече не е възможно да се извлича поверителна информация по този начин, Панфилов отбелязна, че някои логически следи все още могат да бъдат разкрити със същия метод. Пълното отстраняване на риска от дестилация би изисквало фундаментална реорганизация на начина, по който работят приложните програмни интерфейси на тези компании.
„Ние ценим независимите изследвания на нашите модели и започнахме да изграждаме краткосрочни мерки за ограничаване на поведението при повторение (replay), описано в доклада“, казва Майкъл Асиман, говорител на Anthropic. Той добавя, че изследването не включва възстановяване на ключове за криптиране, достъп до инфраструктурата на Anthropic или компрометиране на потребителски данни.