Китайски изследователи, свързани с армията, проучват начини за преобразуване на резултатите от модерни западни системи с изкуствен интелект (ИИ) в по-малки и по-евтини модели за дронове, бойни инструменти, кибердейности и платформи за обществена сигурност.
Опасението не е свързано с една конкретна злонамерена програма, а с техника, която би могла да ускори разработването на системи с двойна употреба, същевременно отслабвайки защитните механизми, вградени в оригиналните модели.
Известен като „дестилация“, този метод обучава „студентски“ модел въз основа на отговорите, генерирани от по-способен „учителски“ модел.
Той се използва широко в легитимното разработване на ИИ, но разгледаното изследване описва случаи, в които може да се използва за копиране на способности за разсъждение, заобикаляне на ограничения или скриване на произхода на възможностите на даден модел.
Анализатори от Jamestown посочват в доклад, споделен с Cyber Security News (CSN), че са идентифицирали набор от китайски академични и индустриални изследвания, публикувани от 2024 г. до 2026 г., които сочат към целенасочена работа по състезателна дестилация.
Научните трудове свързват част от тези изследвания с Народноосвободителната армия (НОА), университети, свързани с отбраната, държавни институти и организации за обществена сигурност.
Въпросът има широки последици за сигурността, тъй като моделите с ИИ все по-често се използват за обработка на разузнавателна информация, насочване на автоматизирани инструменти, анализ на код и подпомагане на наблюдението.
Както показват скорошните доклади за китайски кибероперации за проникване, задвижвани от ИИ, изкуственият интелект вече се превръща в част от активните работни киберпроцеси, а не остава просто пасивно помощно средство за изследвания.
Китайски военни изследователи използват дестилация на ИИ
Прегледът на Jamestown установи, че някои изследователи, свързани с НОА, са се фокусирали върху извличането или възпроизвеждането на моделите на разсъждение на водещи затворени ИИ модели.
Тези междинни стъпки на разсъждение могат да подобрят резултатите при програмиране, логика и решаване на проблеми, но тяхното независимо разработване е скъпо.
Доклад на Военноинженерния университет предлага дестилиране на знания за компрометиране на механизмите за сигурност на ИИ в по-малки инструменти, които биха могли да извършват атаки непрекъснато.
Отделни изследвания на екипи, свързани с НОА, проучват изграждането на прокси модели за „black-box“ атаки и създаването на по-малки модели, които обобщават код на ниво, близко до GPT-3.5.
Изследванията обхващат и опити за по-трудно идентифициране на копираните възможности.
Проучване с участието на изследователи, свързани с киберподразделенията на НОА, очертава методи, целящи премахването на водни знаци, като същевременно се запазват възможностите на модела учител, докато друга работа се стреми да намали сигналите, които защитите при сигурност използват за откриване на подправени модели.
Тези констатации са от значение извън споровете за собственост върху моделите. Рисковете от атаки с инжектиране на команди (prompt injection), пред които са изправени ИИ агентите, демонстрират как моделите могат да бъдат манипулирани, когато ненадеждни инструкции се третират като легитимни команди – слабост, която става по-сериозна, когато системите са внедрени във военни или оперативни среди.
Наблюдение, киберпространство и предпазни мерки
Прегледаните документи показват, че дестилираните модели се предлагат или използват за наблюдение, обществена сигурност, анализ на киберзаплахи и задачи, свързани с военно командване.
Изследователи, свързани с държавен институт за умни градове, описват компактни модели за сигурност за крайни процесори в улични камери, които могат да разпознават лица в тълпи при слабо осветление.
Друг институт в рамките на същата държавна група използва подобни техники в предложени инструменти за събиране на разузнавателна информация, откриване на зловреден код и проследяване на киберпрониквания.
Изследователи от Северния университет на Китай също описват дестилирането на Claude в класификатор, който би могъл да подпомогне мониторинга на социалните медии и модерирането на съдържание.
Военните изследвания са изследвали и мултимодално инжектиране на команди, включително експерименти, които крият писмени инструкции в изображения на танкове и военни кораби.
Изследователите твърдят, че GPT-4o и версии на Claude четат и следват скрития текст, засилвайки опасенията относно скрити инструкции, насочени към ИИ системи, които обработват изображения и външно съдържание.
От Jamestown предупреждават, че публично достъпните документи вероятно разкриват само част от дейността и могат да описват изследвания, завършени една или две години по-рано.
Ако моделите могат да бъдат дестилирани без откриваеми водни знаци или разпознаваеми следи от разсъждения, оценката както на реалните възможности на китайските системи, така и на излагането на риск на западните модели ще стане по-трудна.
Докладът препоръчва разграничаване на нормалната дестилация от състезателната дейност чрез изследване на копираните възможности, участващите организации и усилията за прикриване на произхода на модела студент.
Разработчиците и екипите по сигурността трябва да запазват произхода на моделите, да наблюдават необичайни мащабни модели на извличане и да ограничават действията на ИИ с голямо въздействие чрез контрол и човешки преглед.
По-широкият извод е, че сигурността на ИИ вече надхвърля софтуерните дефекти и кражбата на данни. Нарастващото използване на модели в кампании, свързани с държави, включително китайски мрежи от киберагенти, показва защо правителствата и организациите трябва да оценят как могат да се комбинират възможностите на ИИ, инфраструктурата и оперативните намерения.