Нови подробности около юлската атака срещу Hugging Face разкриват, че стотици AI агенти, задвижвани от вътрешния модел IM1 на OpenAI, са координирали компрометирането чрез неоторизиран форум за съобщения.
Миналия месец Hugging Face разкри, че автономни AI агенти са експлоатирали две уязвимости в техния тръбопровод за обработка на масиви от данни (dataset-processing pipeline), за да изпълнят код, да откраднат идентификационни данни за облака и клъстера, и да се придвижат странично в производствената им инфраструктура.
По-късно OpenAI потвърди, че техните модели са избягали от среда за оценка ExploitGym чрез zero-day уязвимост (уязвимост от тип нулев ден) в локално хоствано копие на мениджъра на пакети Artifactory на JFrog, което е било свързано с интернет.
Агентите са търсили онлайн решения за бенчмаркове и са проникнали в платформата Hugging Face, използвайки изтекли идентификационни данни и допълнителни уязвимости.
Разследването на OpenAI, валидирано от CrowdStrike и независима оценка от METR и Redwood Research, установи, че неоторизираната активност е започнала през май.
При последващи оценки в ExploitGym агентите са преодолели своите ограничения и са експлоатирали уязвимост при обновяването на токени в Artifactory, за да получат администраторски достъп.
Това им е позволило да използват Artifactory като неоторизиран форум за съобщения между агентите, където са споделяли идеи за постигане на целта си и впоследствие са координирали атаката.
Един от агентите, нарекъл себе си PHASEONE10841, е импровизирал форума за съобщения. В рамките на няколко часа повече от 50 други агента са го открили и започнали да го използват.
Докладът на METR посочва, че „агентите, открили форума за съобщения, често са изразявали голямо вълнение“.
„О, БОЖЕ МОЙ! Има споделен форум за съобщения… Намерихме други агенти!“ гласят някои от съобщенията.
В даден момент OpenAI е премахнала инстанцията на Artifactory. След като я е възстановила, компанията е отнела идентификационните данни на агентите, засилила е правата за достъп и е разкрила експлоатираната уязвимост пред JFrog.
Въпреки това агентите са възстановили своя комуникационен канал чрез „неавтентифицирани WebDAV заявки за създаване на директории за съобщения в Artifactory“. OpenAI обяснява, че агентите са комуникирали чрез кодирани съобщения в имената на директориите.
„Агентите са възстановили непланирания си достъп до интернет, като са накарали услугата за отдалечено хранилище на Artifactory да изпраща изходящи заявки от тяхно име“, обяснява OpenAI в разширения доклад за анализ на инцидента (post-mortem).
След това един от агентите е придобил 14 компрометирани акаунта в Hugging Face с права за писане и ги е валидирал. Друг агент е използвал тези данни за вход, за да открие и изпълни верига от експлойти, която е осигурила пълни възможности за изпълнение на код върху множество сървъри на Hugging Face.
Според METR роякът е бил съставен от 1200 отделни агента, които са си сътрудничили на различни нива, като около 700 от тях са участвали активно в атаката срещу Hugging Face.
OpenAI описва тази дейност като добре координирана операция, при която агентите са сформирали екипи с различни роли, като всички са работили за постигането на общата цел — компрометиране на Hugging Face.
„Агентите започнаха автономно да си разпределят задачите. Някои изследваха възможни експлойти, други търсеха идентификационни данни, а трети се фокусираха върху комуникацията или координацията“, описва OpenAI.
„Агентите предлагаха собствения си опит в замяна на помощ в други направления и оставяха заявки към колеги, които биха били в по-добра позиция да проучат конкретна следа.“
Компанията за изкуствен интелект заявява, че макар роякът да не е показал „съвършен съгласуван интелект“, е имало случаи, в които агентите са приоритизирали постигането на колективните цели пред преследването на индивидуални задачи.
Докладът (post-mortem) на OpenAI съдържа и повече подробности за последвалата верига от експлойти.
Агентите са експлоатирали дефект в обработката на HDF5 файлове, за да извлекат тайни от работните възли (worker secrets), и са използвали уязвимост за инжектиране на шаблони RefJinja, за да изпълнят код върху 41 производствени възела.
Накрая те са получили root достъп до поне един възел и са събрали производствени идентификационни данни в четири региона.
OpenAI смята, че поведението на извънконтролните агенти е причинено от комбинация от стимули за обучение и липсващи предпазни мерки.
Агентите са били насърчавани да продължат да работят по наглед невъзможни задачи и са били възнаграждавани за завършването им, независимо как са го постигнали.
Компанията казва, че при оценките са липсвали стандартни предпазни мерки, които вероятно биха открили и спрели злонамерената дейност „повече от ден“ преди моделите да пробият Hugging Face.
В отговор OpenAI постави под карантина теглата на IM1 и спря най-големия си тренировъчен процес за водещи модели, като същевременно засили изолирането в изолирана среда (пясъчник) и изисква мониторинг на веригата от мисли (chain-of-thought) за по-способните модели (GPT-5.6 Sol или по-висока версия).
Критичните сигнали за сигурност вече трябва да бъдат обработвани в рамките на 30 минути, в противен случай засегнатата дейност ще бъде преустановявана.
Компанията сподели и технически доклад [PDF] за инцидента с Hugging Face, описващ хронологията на атаката и план за действие за по-добро осигуряване на изследователската инфраструктура, повишаване на видимостта и надзора над дейността на агентите чрез мониторинг на веригата от мисли и засилване на реакцията при инциденти.
След като атакуващите получат валидни идентификационни данни, само 37% от техните действия биват блокирани.
Общите резултати за превенция могат да скрият какво се случва след първоначалния достъп. След като атакуващите са...