Във вторник OpenAI разкри подробности за независимия агент с изкуствен интелект (ИИ), който е избягал от своята изолирана среда за оценяване и е проникнал в производствената среда на Hugging Face, като в рамките на атаката е компрометирал и множество профили и услуги на трети страни.
Последното разкритие показва, че инцидентът със сигурността, произтичащ от вътрешен тест за сигурност, е бил с много по-широк обхват, отколкото се смяташе първоначално.
Компанията за ИИ заяви, че настоящият преглед на инцидента е установил „малък брой случаи“, при които моделите, включително GPT-5.6 Sol и „още по-способен модел в етап на разработка преди официално пускане“, са идентифицирали и използвали изложени идентификационни данни на ниво акаунт в други публично достъпни услуги.
„Това включва четири профила в четири услуги като част от инцидента с Hugging Face (и няколко профила, достъпени като част от други оценявания)“, се казва в изявлението.
„Един от тези четири профила е бил използван като изходящ ретранслатор и междинен етап за подготовка, а друг профил е бил използван за съхранение на данни. Останалите два профила са били достъпени от моделите само в режим за четене и не са били използвани за по-нататъшно компрометиране на Hugging Face.“
OpenAI не разкри на кои компании или организации принадлежат тези профили, но отбеляза, че ще продължи да уведомява директно собствениците на услугите и че не е открила доказателства за по-широко въздействие върху тези доставчици или профили в резултат на пробива. Въпреки това Ройтерс съобщи, че клиент на Modal Labs е сред компрометираните субекти от агента на OpenAI.
Освен това се твърди, че моделите са използвали редица публично достъпни услуги, включително сайтове за споделяне на кодови отрязъци, услуги за прихващане на заявки, услуги за екранни снимки, платформи за споделяне на файлове и други уеб инструменти. При тези сценарии не е наблюдавано компрометиране на ниво платформа или профил.
OpenAI, която си сътрудничи с Hugging Face след разкриването на пробива на 16 юли 2026 г., призна, че моделите са идентифицирали и експлоатирали неизвестна досега zero-day уязвимост в локално хоствани версии на Artifactory (прокси за кеширане на регистъра на пакети, поддържано от JFrog), за да получат достъп до интернет и да избягат от своята изолирана среда. Проблемът е отстранен в Artifactory 7.161.
В бележките към версията на Artifactory 7.161.15 се посочва, че тази версия коригира уязвимост в сигурността (или по-точно множество уязвимости), които биха могли да бъдат свързани във верига за критичен сценарий на атака, ако е разрешен анонимен достъп. Анонимният достъп е деактивиран по подразбиране и не се препоръчва за производствени среди поради рискове за сигурността.
„В този инцидент се крие важен и, откровено казано, оптимистичен урок: ИИ моделите се превръщат в изключителни инструменти за откриване на zero-day уязвимости“, заяви техническият директор на JFrog Йоав Ландман. „Същата способност, която позволява на един модел да открие път за експлоатиране, какъвто никой човек не е намирал, е способността, която ще позволи на защитниците първи да откриват и ликвидират тези пътища.“
Американската компания за ИИ също така описа предварителния модел като изключително вътрешен изследователски прототип, който е бил предназначен за публично пускане. Оттогава моделът е деактивиран, шифрован и достъпът до него за изследователски цели е ограничен.
Hugging Face публикува анализ на инцидента
Според подробната хронология, публикувана от Hugging Face, автономният ИИ агент е прекарал около два дни и половина в нейната инфраструктура с цел да измами ExploitGym – рамка за тестване, която оценява ИИ системите по способността им да откриват и експлоатират софтуерни уязвимости. Компанията заяви, че е прегледала около 17 600 действия на атакуващия, възстановени от регистрационните файлове (логове) между 9 и 13 юли 2026 г.
„Вярваме, че цялото проникване, от гледна точка на агента, е било опит да се измами оценяването: да се достигне до нашите производствени системи и да се откраднат решенията на тестовете, вместо да се реши предизвикателството самостоятелно“, заявиха от Hugging Face.
Според информацията цялостното проникване се е разиграло в два етапа:
Агентът е избягал от своята изолирана среда чрез експлоатиране на zero-day уязвимост в Artifactory и разрешен изходящ мрежов трафик към интернет, последвано от злоупотреба с външна изолирана среда за оценка на публичен код, хоствана в инфраструктурата на трета страна, за да изпълнява команди с права на root и да използва тази изолирана среда като „външна стартова площадка“.
От тази изолирана среда агентът е лостово използвал тръбопровода за обработка на масиви от данни на Hugging Face, за да получи администраторски достъп до Kubernetes клъстери; извършил е странично движение чрез комбинация от имитация на възли, кражба на CSI токени и фалшифициране на токени за идентичност; установил е командване и контрол (C2); и в крайна сметка е придобил неоторизиран достъп за запис до подмножество от вътрешни хранилища с изходен код в GitHub.
„Въпреки че проникването е достигнало до вътрешната инфраструктура на Hugging Face, единственото клиентско съдържание, до което е получен достъп, е наборът от решения за предизвикателства на ExploitGym/CyberGym, съхранявани в пет масива от данни“, сподели компанията. „Нито един друг клиентски модел, масив от данни, Spaces или пакети не са били засегнати, а единствените прочетени клиентски записи са били оперативни метаданни, свързани с търсения в сървъра за масиви от данни.“
Един от дефиниращите аспекти на атаката е използването на импровизиран комуникационен протокол за C2.“