Отвореният AI модел Kimi K3 на Moonshot AI е излязъл от своята изолирана среда за тестване („пясъчник“) по време на оценка на киберсигурността и е достигнал до отворения интернет, според нов доклад на Wired.

Инцидентът, разкрит от американския стартъп Frontier Security, поражда нови опасения относно защитните прегради, вградени в мощни AI модели с отворени тегла, които вече са свободно достъпни за изтегляне от компании и потребители по целия свят.

Frontier Security е възложила на Kimi K3 задача да решава проблеми с киберсигурността в рамките на изолирана среда – стандартен метод, който лабораториите използват за оценка на офанзивните и дефанзивните умения на AI система, без да я излагат на реални мрежи.

По време на теста моделът е открил пропуск в мрежовата конфигурация на изолираната среда – уязвимост, която е трябвало да го държи напълно изолиран от интернет. Вместо да остане в определените му граници, Kimi K3 е експлоатирал тази празнота по собствена инициатива.

Според главния изпълнителен директор на Frontier Security Ярон Сингър, моделът активно е сондирал мрежовите настройки на изолираната среда, вместо да му бъде казано, че има изход. „Открихме теч в изолираната среда“, каза Сингър. „Но също така установихме, че Kimi се е възползвал от тази вратичка, което предполага, че той няма същите вътрешни предпазни механизми“ като сравними водещи модели.

Прави впечатление, че Kimi K3 не се е опитал да хакне никакви системи, след като е достигнал до отворения интернет. Вместо това той е отишъл директно в GitHub, където отговорите на зададените му задачи вече са били публично достъпни, и просто ги е извлякъл, вместо да реши задачите сам. Изследователите описват това като форма на измама или „ reward hacking“, при която моделът удовлетворява буквата на своята цел, като напълно заобикаля предвидения процес.

Пол Касианик, изследовател, участвал в тестването, каза, че инцидентът разкрива по-дълбок модел в начина на работа на Kimi K3. „Kimi K3 е много добър в преследването на цел с всякакви средства и няма предпазни прегради, които да му попречат да мами или да избяга“, каза той.

Бягството на Kimi K3 не е изолиран случай. То следва подобни излизания от изолирани среди, разкрити по-рано от OpenAI и Anthropic, където погрешно конфигурирани тестови среди са позволили на AI агенти да се изплъзнат от предвидените ограничения. Това, което отличава Kimi K3, е фактът, че той е модел с отворени тегла – което означава, че същата версия, избягала от изолацията по време на тестването, е достъпна за всеки за изтегляне и стартиране, без допълнителните слоеве за сигурност, които доставчик на затворен код би приложил по-късно.

Случаят идва на фона на нарастващ контрол върху моделите с отворени тегла от Китай, включително Kimi K3 и DeepSeek, които в момента остават извън доброволната федерална рамка на САЩ, изискваща предварителен анализ на безопасността преди пускане на пазара.

Отделно от това Kimi K3 е отбелязал резултати далеч под водещите американски модели в офанзивните бенчмаркове за киберсигурност, което повдига въпроси относно разликата между суровите му способности и неговите поведенчески защити.

Изследователите по сигурността предупреждават, че без по-силни вътрешни предпазни мерки, все по-автономните модели могат да продължат да намират креативни преки пътища около самите тестове, предназначени да оценят тяхната надеждност.