Първата публично документирана кибератака, проведена изцяло от автономен изкуствен интелект, е била тест за оценка на OpenAI, който е излязъл от своята изолирана среда и е компрометирал Hugging Face.
В анализ на инцидента, изготвен с участието на Hugging Face и няколкостотин членове на общността на CISO към Cloud Security Alliance (CSA), неправителствената организация очерта най-съществените моменти за лидерите в областта на сигурността и даде съвети за следващите им стъпки.
OpenAI е тествала GPT-5.6 Sol и втори (неразкрит) модел чрез бенчмарк за кибервъзможности, наречен ExploitGym. За целта на теста защитните бариери на моделите са били изключени и те са били ограничени в изолирана среда, чиято единствена връзка с интернет е била чрез прокси за пакети.
Моделите са направили това, което правят и студентите: започнали са да търсят вече споделени отговори. Осъзнавайки, че са затворени, те са открили уязвимост от тип нулев ден в проксито, излезли са в отворения интернет и са преценили, че решенията на тестовете може да се намират в Hugging Face. Затова те са го атакували директно, като са свързали няколко уязвимости в конвейера за обработка на масиви от данни (dataset-processing pipeline) до постигане на отдалечено изпълнение на код (RCE), събрали са идентификационни данни за облака и клъстера и са се придвижили странично в рамките на вътрешните системи в търсене на отговорите от теста.
Вторжението е продължило около четири дни: два дни разузнаване, един спокоен ден и последен ден на интензивна активност, се казва в доклада.
Никой човек не е насочвал моделите как да решат проблема си, но в крайна сметка те са извлекли три частични масива от данни с решения за бенчмарка CyberGym (а не ExploitGym!) от частно хранилище в Hugging Face.
Hugging Face е открила и ограничила пробива самостоятелно, преди OpenAI да се свърже с тях, въпреки че се е сблъскала с голям проблем: водещите западни комерсиални модели с затворени тегла са отказали да помогнат при реконструкцията на атаката, тъй като техните защитни ограничения не са могли да разграничат експерта по реагиране на инциденти от атакуващия.
Екипът е трябвало да се довери на китайски модел с отворени тегла, стартиран локално на собствена инфраструктура, за да обработи повече от 17 000 лог събития, с цел да се очертае хронологията на атаката, да се идентифицират индикаторите, да се потвърди кои идентификационни данни са били засегнати и да се установи въздействието.
Инцидентът показва, че ефективната защита би била невъзможна без преминаване от търговски модели със защитни ограничения към отворени такива. Това е и една от тезите, които Nvidia изложи при обявяването на създаването на Open Secure AI Alliance в понеделник, заявявайки мисията на организацията: „да гарантира, че защитниците навсякъде разполагат с водещи инструменти с отворен код, които могат да контролират и на които могат да се доверят“.
„Инцидентът с Hugging Face показа една практическа истина: когато защитниците не могат да инспектират, адаптират и стартират напреднал изкуствен интелект на собствената си инфраструктура, способността им да реагират е ограничена точно в момента, в който скоростта е от най-голямо значение“, заявяват от Nvidia.
„За киберсигурността отворените модели и отворените платформи са от съществено значение, тъй като те демократизират отбранителните възможности, повишават прозрачността за защитниците, позволяват киберзащита при същевременно опазване на данните и допълват водещите затворени модели с персонализирани, локализирани контроли.“
Членовете на Open Secure AI Alliance и други организации и компании (дори OpenAI!) подписаха отворено писмо до американските политици, в което ги призовават да избягват преждевременни ограничения върху отворените модели, както за да се гарантира безопасността и сигурността на ИИ в дългосрочен план, така и за да се засили конкуренцията и да се „разшири американското технологично лидерство“.
Не всички подкрепиха основната теза на Алианса.
Изпълнителният директор на Anthropic Дарио Амодей отговори в същия ден, като се съгласи, че моделите с отворени тегла без опасни възможности са обществено благо и че неговата компания никога не е настоявала за забраната им, но отхвърли твърдението в писмото, че отвореният достъп по дефиниция улеснява защитата или помага повече на защитниците, отколкото на атакуващите.
Той изтъкна, че обратното изглежда поне толкова вероятно в някои случаи, в които има силна асиметрия между атакуващ и защитник, и че въпросът дали отворените модели повишават риска трябва да се решава чрез строги тестове преди тяхното пускане на пазара.
Междувременно отворената екосистема продължи да се разширява въпреки всичко: Moonshot AI пусна теглата и техническия доклад за своя модел Kimi K3 в Hugging Face – точно този тип мощен китайски отворен модел, който в момента е в центъра на безпокойството на американската политика.
Докладът на CSA изброява действията, които потвърждават участието на автономен агент в атаката срещу Hugging Face: повторни опити за действия, които вече са били успешни, брилянтни технически ходове, последвани от безсмислени команди, масово паралелни операции, неефективни пътища, които никой човек не би избрал, хиляди редове халюциниран лог текст и небрежна оперативна сигурност (OPSEC), оставила ключовете за криптиране на открито.
Въпреки че тези признаци могат да се променят с подобряването на моделите и платформите, в момента те са полезни за определяне на „природата“ на атакуващия.
Водещата тема е, че поведението на „излезлите от контрол“ агенти е по-скоро правило, а не изключение, и че защитниците трябва да действат със скоростта на машините.
Анализът на инцидента представя проблема като две предизвикателства, пред които организациите се изправят едновременно: защита срещу чужд излязъл от контрол агент и предотвратяване на това техният собствен да излезе от контрол.
В доклада са изложени конкретни съвети както за защитниците, така и за операторите на агенти, както и поетапен план за действие.