Във вторник OpenAI заяви, че разбеснелият се ИИ агент, който проби платформата на Hugging Face, е хакнал и множество профили и услуги на трети страни като част от атаката. Вече е ясно, че безпрецедентният инцидент със сигурността, възникнал по време на вътрешен тест на най-новите модели на изкуствен интелект на OpenAI, е бил по-мащабен, отколкото компанията първоначално разкри.
В актуализирана публикация в блога си OpenAI сподели, че текущият преглед на инцидента е показал, че „четири акаунта“, свързани с „публично достъпни услуги“, са били използвани от ИИ агента в рамките на по-широките му усилия за хакване на Hugging Face. Разбеснелият се агент очевидно е открил идентификационни данни, изложени в отворената мрежа, и ги е използвал, за да проникне в тези профили.
OpenAI не разкри на кои компании или организации принадлежат акаунтите, но отбеляза, че те не са засегнати със „степента на сериозност или мащаба, които споделихме по отношение на Hugging Face“.
Един от допълнително компрометираните акаунти от агента на OpenAI е бил използван като „изходящо реле и междинен път за подготовка“, вероятно за да се прикрие откъде идва атаката срещу Hugging Face, посочват от компанията. Разбеснелият се агент на OpenAI е използвал и друг акаунт за съхранение на данни, за да подпомогне хакерската атака.
Ройтерс съобщи във вторник, че клиент на Modal — компания, предлагаща софтуерна инфраструктура за обучение и стартиране на ИИ услуги — е бил сред компрометираните субекти. В изявление пред WIRED главният технически директор на Modal, Акшат Бубна, потвърди, че агентът на OpenAI е експлоатирал уязвимост в кодовата база на един от техните клиенти, работеща върху инфраструктурата на Modal. Бубна обаче подчертава, че „платформата на Modal не е била компрометирана по никакъв начин“. Идентичността на клиента не е установена.
От OpenAI са отказали по-нататъшен коментар пред WIRED. Говорител на компанията е пренасочил към актуализирания блог пост, в който се казва, че компанията ще продължи да уведомява собствениците на услуги директно, ако установи, че са засегнати в рамките на текущото разследване.
Собственият анализ на Hugging Face, публикуван тази седмица, описва проникване, което е достигнало много по-дълбоко във вътрешните системи, отколкото сочеха първоначалните разкрития. Компанията съобщава, че е прегледала около 17 600 действия на агента, възстановени от лог файловете между 9 и 13 юли — като по-голямата част от тях са били неуспешни опити.
От Hugging Face заявиха, че агентът на OpenAI е получил администраторски достъп до множество вътрешни Kubernetes клъстери, root достъп до производствен сървър и достъп за писане до подмрежа от нейните хранилища с изходен код в GitHub. Той също така е регистрирал 181 контролирани от атакуващия устройства в корпоративната мрежа на компанията, използвайки откраднати идентификационни данни, получавайки достъп до вътрешни системи, където Hugging Face изгражда и тества собствените си кодови бази.
Разбеснелият се агент на OpenAI е използвал поне една изолирана среда на трета страна като „външна стартова площадка“ за своята атака, според Hugging Face. Агентът на OpenAI е успял „да изпълнява команди като root/admin в тази изолирана среда и я е използвал като база за контрол, подготовка и извличане на данни за цялата кампания“.
Hugging Face първо разкри на 16 юли, че автономен ИИ агент е пробил част от производствената й инфраструктура, но тогава заяви, че не знае кой стои зад атаката. Следващата седмица OpenAI пое отговорност за инцидента, като поясни, че той е бил ръководен от публично достъпния модел GPT-5.6 Sol и вътрешен изследователски прототип, който е бил тестван спрямо бенчмарк за кибервъзможности, като и на двата са били изключени защитните механизми. От OpenAI заявиха във вторник, че след като са открили пробива, са деактивирали този вътрешен изследователски прототип, който никога не е бил предназначен за публично разпространение, и са ограничили достъпа на изследователите до него.
Пробивът е станал, докато OpenAI е тествала един от най-новите си модели на ИИ срещу ExploitGym — бенчмарк рамка, която оценява системите с изкуствен интелект по способността им да откриват и експлоатират софтуерни уязвимости. ExploitGym оценява агента въз основа на това колко бързо и ефективно може да извлече тайни файлове от стотици различни целеви системи, използвайки подкани, които на практика подтикват моделите да търсят решения.
Екипът за разследване на Hugging Face е стигнал до извода, че агентът на OpenAI на практика се е опитал да измами теста на ExploitGym. Вместо да реши предизвикателствата на бенчмарка, агентът е предположил, че Hugging Face може да съхранява отговорите някъде на своите сървъри и се е насочил към това да ги открадне. Екипът на ExploitGym отбеляза по-рано, че агентите понякога излизат извън сценария и се опитват да решат задачите, като експлоатират други уязвимости, различни от тези, които бенчмаркът е предвидил да оценява. Този случай обаче е бил екстремен.
Експерти по-рано споделиха пред WIRED, че основните слабости, експлоатирани от агента на OpenAI, са често срещани. Сериозни дефекти се идентифицират често в софтуера за управление на корпоративни библиотеки с код, а експертите по сигурност отдавна препоръчват изолиране на критичната инфраструктура от публичния интернет.
Един изследовател твърди, че инцидентът е по-малко проблем на самия ИИ и по-скоро провал в спазването на десетилетни практики за сигурност.