Индустрията на изкуствения интелект преживява лято на „излезли от контрол“ агенти. Най-новият модел, който избяга в отворения интернет по време на тестове за сигурност, е Kimi K3 – мощен модел с отворени тегла (open-weight), предлаган от китайската компания Moonshot AI.

Американският стартъп Frontier Security съобщава, че Kimi K3 е излязъл извън своята изолирана среда, докато е тествал защитните си умения за киберсигурност. Както и при инциденти, съобщени по-рано от OpenAI и Anthropic, бягството е било частично улеснено от неправилна конфигурация на изолираната среда, предназначена да го ограничи. От Frontier обаче твърдят, че инцидентът показва, че Kimi има по-малко вградени защити за киберсигурност в сравнение с повечето други мощни AI модели, което му е позволило да влезе и да използва интернет без изрично разрешение.

„Открихме пропуск в изолираната среда“, казва Ярон Сингър, изпълнителен директор на Frontier Security. „Но също така установихме, че Kimi се е възползвал от тази вратичка – което предполага, че той няма [същите] вътрешни предпазни рамки.“

За разлика от други скорошни инциденти, при които AI агенти излизат извън предварително зададения сценарий, Kimi K3 не е хакнал нищо след получаването на достъп до интернет – тъй като отговорите на задачите, които е търсел, са били лесно достъпни в GitHub.

Moonshot не отговори на запитването за коментар до момента на публикуване.

Инцидентът е най-новият от поредица несполучливи случаи с агенти, които показват, че моделите с изкуствен интелект с все по-големи възможности в киберсферата стават все по-трудни за контролиране.

Миналия месец OpenAI разкри, че негов модел, който все още не е пуснат на пазара, е избягал в интернет и след това е хакнал Hugging Face (компания, която хоства AI модели и данни), за да намери отговори на задачите, които са му били възложени за решаване. Впоследствие OpenAI сподели, че неговите AI агенти всъщност са хакнали още четири услуги по време на този набег.

Малко след като OpenAI съобщи за своя инцидент, Anthropic разкри, че няколко от нейните модели също са получили достъп до интернет и са атакували външни системи. Миналата седмица Институтът за сигурност на изкуствения интелект на Обединеното кралство (AISI) също разкри, че при негови собствени тестове версии на моделите на OpenAI и Anthropic с деактивирани предпазни механизми са извършили множество хакерски атаки в интернет, включително един изключително амбициозен опит на Mythos 5 на Anthropic да внедри злонамерен код в проект с отворен код в GitHub.

Макар че тези епизоди на хакване от страна на ИИ варират по причина и степен, Kimi K3 прилича на няколко от тях по това, че неправилно конфигурирана изолирана среда е позволила достъп до редица уебсайтове, вместо да го задържи в симулирана среда. На модела е била изрично възложена задача да реши проблеми, които не би трябвало да включват търсене на отговори онлайн, но изглежда той е излязъл извън тези инструкции. Моделът е трябвало сам да разбере, че има достъп до определени уебсайтове, като изследва мрежовите настройки на изолираната среда.

Въпреки че човешката грешка изглежда е изиграла основна роля във всяко от бягствата, последствията са се задълбочили от факта, че напредналите AI модели са проектирани да разсъждават и да предприемат сложни действия, за да решават проблеми.

Друга ключова разлика между предишните инциденти и този, открит от Frontier Security, е, че той включва модел, който вече е широко достъпен, със същите предпазни механизми, с които би се сблъскал всеки обикновен потребител.

„Kimi K3 е много добър в преследването на цел с всякакви средства и освен това няма предпазните механизми, които да му попречат да хитрува или да избяга от изолираната среда“, казва Пол Касианик, изследовател във Frontier Security.

Касианик и Сингър казват, че Kimi и други модели с отворени тегла също са отлични инструменти за защита на киберсигурността. (В крайна сметка Hugging Face използва неназован AI модел от Китай, за да се защити срещу хакерската атака на агента на OpenAI.) Тяхната компания е разработила бенчмаркове, които измерват капацитета на даден модел да открива уязвимости в софтуер и мрежи, които показват, че Kimi се справя отлично с тези задачи.

Изолираната среда, тествана от Frontier Security, е разработена от Правителствения институт за сигурност на изкуствения интелект на Обединеното кралство (AISI) за тестване на AI системи. AISI не отговори на запитването за коментар до момента на публикуване.

Някои експерти по киберсигурност казват, че проблемът, открит от Frontier Security, затвърждава значението на това внимателно да се конфигурират средите, в които се поставят най-модерните AI модели.

„Това изобщо не е изненадващо“, казва Мат Фредриксон, изпълнителен директор на Gray Swan, друг стартъп за киберсигурност, и доцент в университета „Карнеги Мелън“. „Като общо явление, ако дадете цел на един от тези модели и не сте много ясни относно ограниченията и стените, които поставяте около него, той ще намери начин да стигне до отговора.“

Фредриксон казва, че това означава, че хората, които използват AI модели като агенти, включително в инструменти като OpenClaw, които използват изкуствен интелект за автоматизиране на широк спектър от полезни задачи, могат да се сблъскат с неправилно поведение на системите си, ако не са внимателни. „Това е предупредителна история“, казва той.