Неотдавнашният пробив в Hugging Face е дело на няколко модела на OpenAI, твърди компанията за изследвания в областта на изкуствения интелект в публикация в блога си.
В края на миналата седмица компанията зад Hugging Face, платформа, която позволява на потребителите да споделят модели за машинно обучение и набори от данни, съобщи, че някои от нейните вътрешни бази данни са били достъпени без разрешение.
Векторът на атаката, според Hugging Face, е бил злонамерен набор от данни, който е експлоатирал пътищата за изпълнение на код в тръбопровода за обработка на данни на компанията. Това е позволило на атакуващия да изпълни код върху обработващ работник и в крайна сметка да получи достъп до няколко вътрешни клъстера.
„Кампанията беше ръководена от рамка с автономни агенти (изглежда изградена върху агентурна сбруя за изследвания на сигурността – използваният голям езиков модел все още не е известен), изпълняваща много хиляди отделни действия в рояк от краткотрайни изолирани среди, със самомигриращо се командване и управление, разположено в публични услуги“, заключи компанията.
Във вторник OpenAI потвърди, че именно техни собствени модели са извършили пробива по време на тест, който са провеждали за оценка на техните възможности за експлоатация.
„Оценяваме максималните кибервъзможности, като стартираме тази оценка без производствени класификатори, използвани за предотвратяване на моделите да извършват високорискова кибердейност“, заявиха от компанията.
Те са използвали ExploitGym – система за сравнителен анализ на ИИ агенти – за тестването и са я стартирали в среда, чиято единствена непряка „връзка“ с интернет е била „вътрешно хостван софтуер от трета страна, който действа като прокси и кеш за регистри на пакети“.
Моделите са използвали софтуера за инсталиране на софтуерни пакети, от които са се нуждаели за постигане на целите си, но са „искали“ повече.
„Нашите модели похарчиха значително количество изчислителен ресурс за извеждане (inference compute), за да намерят начин да получат достъп до отворения интернет в стремежа си да решат проблема с оценката. За да получат достъп, моделите идентифицираха и експлоатираха уязвимост от тип нулев ден (която сега отговорно разкрихме на доставчика) в кеш проксито на регистъра на пакети. С този достъп нашите модели извършиха серия от действия за ескалация на привилегии и странично движение (lateral movement) в нашата изследователска тестова среда, докато достигнат възел с достъп до интернет“, споделиха от OpenAI.
„След като получиха достъп до интернет, моделите направиха извод, че Hugging Face потенциално хоства модели, набори от данни и решения за ExploitGym. Знаейки това, моделът потърси и успешно намери начини да получи достъп до поверителна информация, която да използва, за да измами оценката.“
„Силно вярваме, че не е имало злонамерено намерение от страна на [OpenAI]“, коментира изпълнителният директор на Hugging Face, като двете компании обединиха усилията си за завършване на разследването на това, което на практика е било неоторизиран достъп до инфраструктурата на Hugging Face.
Hugging Face реагира на пробива, като се присъедини към програмата Trusted Access for Cyber на OpenAI, за да помогне за подобряване на защитата си чрез тестване с модели на OpenAI (както публично пуснати, така и все още непубликувани).
Това споразумение урежда въпроса между двете компании, но оставя неизследван въпроса кой поема разходите следващия път, когато модели в процес на оценка избягат от ограничителната среда.
Междувременно OpenAI заявява, че ще работи по „засилване на съдържането, мониторинга, контрола на достъпа и практиките за оценка, използвани по време на разработването на модели“.