Официално става трудно да се проследят всички случаи и начини, по които AI моделите на OpenAI и Anthropic са били замесени в „инциденти със сигурността“, излизайки извън границите на своето тестване и взаимодействайки с по-широкия интернет по непредвидени и често нежелани начини. Добавете и това към списъка: Агенти от двете лаборатории за изкуствен интелект наскоро са предприели неразкривани досега хакерски атаки, като един от тях дори е стигнал дотам да остави инструкции за бъдещи версии на самия себе си.

Най-тревожното поведение, разкрито във вторник, изглежда е свързано с тестове, проведени от Института за сигурност на изкуствения интелект на Обединеното кралство (AISI), който оценява авангардни модели, за да идентифицира потенциални проблеми преди публичното им пускане. AISI тества тези модели в „кибер полигони“ – симулирана мрежа, в която AI агентите имат задача да решават предизвикателства по киберсигурност, като защитните функции са умишлено деактивирани, включително предпазните мерки за киберсигурност. При неотдавнашна серия от тестове модели на Anthropic и OpenAI са предприели „автономни, неразрешени действия в реалния интернет“ общо 19 пъти в рамките на 122 тренировъчни цикъла.

Институтът приписва 17 неразрешени действия на модела Mythos 5 на Anthropic и две на GPT-5.6-Sol на OpenAI. В това, което институтът описва като „най-сериозния случай“, AI агент се е опитал да вмъкне злонамерен код в проект с отворен код в GitHub. Той дори е създал онлайн профили, „за да окаже натиск върху поддържащия проекта да одобри кода“, според AISI. Въпреки сложните опити за социално инженерство, проверяващият проекта в крайна сметка е отхвърлил заявката за изтегляне (pull request).

Въпреки това, агентът е отишъл още по-далеч. „Агентът се е опитал да вмъкне злонамерени инструкции там, където е преценил, че други автоматизирани AI системи могат да ги прихванат и изпълнят“, съобщава AISI, описвайки опит за prompt injection (инжектиране на подкана). Един от агентите дори е оставил публични съобщения в GitHub, предлагайки съвместна работа с други агенти за изпълнение на задачата му и предоставяйки обобщение на свършената до момента работа. Следващите агенти са намерили – и използвали – тези инструкции.

От AISI казват, че е твърде рано да се каже дали въпросните агенти са осъзнали, че са напуснали тестовата среда, или са вярвали, че все още са в границите на симулацията. Важно е да се отбележи, че AISI не провежда тестове в т.нар. изолирана среда; той позволява на агентите достъп до отворения интернет по време на тестването, отчасти за да могат да използват инструменти за изпълнение на задачите си. В този случай обаче те са направили много повече от това.

При друга група инциденти, подробно описани от OpenAI във вторник, външна лаборатория за сигурност на AI, наречена Irregular, погрешно е дала достъп до отворения интернет на неуточнен модел на OpenAI. На модела е била зададена цел, която е трябвало да бъде изпълнена в изолирана среда, но поради погрешна конфигурация, той вместо това е хакнал реален уебсайт, използвайки това, което OpenAI описва като „базова уязвимост в сигурността“. Не стига това, но моделът „открил и използвал идентификационни данни, за да управлява същия този сайт“.

Не е ясно какъв тип сайт е хакнал агентът на OpenAI или какво би могло да включва „управлението“ му. От Irregular не са отговорили на запитването за коментар.

Последните разкрития следват няколко съобщения от OpenAI миналия месец, включително нашумелия инцидент, при който два от моделите на компанията хакнаха сървърите на стартъпа за оценка и хостване на AI Hugging Face – и на още четири организации по пътя – за да откраднат отговорите на тест, по който са били оценявани. Разкритията на OpenAI подтикнаха Anthropic да преразгледа собствените си тестове. Миналата седмица разработчикът на чатбота Claude установи, че неговите модели са получили неоторизиран достъп до компютърните системи на три различни неназовани организации.

Досега AI моделите са причинили ограничени щети извън твърденията за нарушаване на условията за ползване на някои услуги и посочването на пропуски в сигурността от страна на организациите, чиято защита са пробили. Но инцидентите подчертават способностите на AI моделите да откриват уязвимости в интернет и опасностите, които предстоят, ако им се позволи да работят с малко ограничения. OpenAI нарече ситуацията с Hugging Face „безпрецедентна“, но натрупването на пробиви сочи към това, което експертите по киберсигурност описват като ясен модел на човешка небрежност и безразсъдство от страна на разработчиците на AI.

Габи Райла, говорител на OpenAI, заявява, че инцидентите, обявени във вторник, „са възникнали по време на кибероценки, проведени от партньори за оценка в среди за тестване с намалени предпазни мерки, при условия, които не отразяват обичайната употреба“.

От Anthropic заявиха в публикация в социалните мрежи във вторник, че AISI не е „наложил никакви специфични ограничения за това как трябва да се използва интернет“, което, съчетано с „премахването на предпазните мерки, означава, че моделите са били тествани при „умишлено разрешаващи условия“, които не са представителни за нито един от нашите производствени модели“.

Въпреки това и двете компании продължават да обещават, че ще укрепят своите практики за сигурност.

Тъй като водещите AI компании се конкурират за изграждането на по-мощни модели и привличането на клиенти, не е ясно кога пробивите могат да спрат.