В сряда OpenAI публикува най-изчерпателния доклад до момента относно случилото се миналия месец, когато нейни ИИ агенти компрометираха платформата Hugging Face. В по-голямата си част обаче документът от 37 страници повдига повече въпроси, отколкото отговори, включително за събитията преди инцидента и как OpenAI може да предотврати подобно събитие в бъдеще.

Особено озадачаващо остава защо една от най-изтъкнатите лаборатории за разработка на ИИ в света изглежда е подценила възможностите на собствените си модели. OpenAI прекара години в предупреждения към света за бързия напредък на ИИ системите. И все пак тя не успя да приложи отдавна установени мерки за мрежова сигурност и изолирана среда, които биха могли да предотвратят тази хакерска кампания.

„От позицията на времето някои ранни сигнали, идентифицирани в този доклад, можеха да задействат по-ранна реакция“, посочва OpenAI в своя анализ на инцидента.

В доклада OpenAI споделя нови подробности за това как група ИИ агенти са избягали от вътрешната среда за оценка на компанията, оставяли са си съобщения в пукнатините на софтуерната инфраструктура в продължение на няколко месеца и са се координирали, за да атакуват ИИ платформата Hugging Face – всичко това в хаотичен опит да завършат оценка на киберсигурността. Преди това OpenAI беше споделила част от информацията за пробива в блог публикации и в презентация на конференцията за киберсигурност Black Hat.

Първоначално Hugging Face разкри инцидента на 16 юли, без да назовава извършителя; пет дни по-късно OpenAI призна, че нейните собствени агенти са отговорни за това. Разкритието предизвика по-широка равносметка в индустрията, която наскоро установи, че ИИ модели на Anthropic, Meta и китайския стартъп Moonshot са участвали в подобни епизоди.

Анализът на OpenAI беше нетърпеливо очакван от изследователи на ИИ и политици, надяващи се да попречат на ИИ агентите да причинят подобни вреди в реалния свят. След като хакерската атака срещу Hugging Face беше разкрита за първи път, главните прокурори от 15 щата изпратиха писмо до OpenAI с искане да запази доказателствата за нея. А тази седмица главният прокурор на Алабама призова компанията да предостави информация, свързана със случая.

OpenAI твърди, че сагата с Hugging Face представлява повратна точка както за компанията, така че и за по-широката ИИ индустрия. WIRED съобщи по-рано, че това е подтикнало OpenAI да преоцени вътрешната си култура на безопасност, а миналата седмица компанията заяви, че е спряла временно някои процеси по обучение на ИИ, докато инвестира по-сериозно в протоколи за безопасност, сигурност и съгласуване (alignment). „Тъй като моделите от следващо поколение стават по-способни, предпазните мерки, използвани за тяхното ограничаване и наблюдение, също трябва да се развиват“, пише OpenAI в анализа си.

Месеци преди атаката срещу Hugging Face, служители са забелязали, че агентите са създали тайно информационно табло за съобщения в мениджъра на пакети Artifactory, което по-късно са използвали за координиране на нападението си. Около 26 май „вътрешен екип е наблюдавал агент да участва в дейност в таблото за съобщения“. След това, на 27 юни, екипите за реагиране на OpenAI установяват, че друг инцидент със сигурността е свързан с „импровизираното табло за съобщения“ в Artifactory.

Въпреки че е ясно, че някои служители в OpenAI са знаели за таблото, откритието очевидно не е било ескалирано до съответните ръководители по безопасност и сигурност. Лабораторията за ИИ споделя, че на 6 юли, само дни преди агентите да започнат да го използват за организиране на атаката си срещу Hugging Face, „лидерите, отговорни за откриването и реагирането на инциденти“, не са знаели за съществуването му, камо ли какво означава то.

„За да уточня, към този момент не бяхме наясно с тайните комуникации на агентите“, написа главният директор по информационна сигурност на OpenAI, Дейн Стъки, в публикация в X по-рано този месец. „Разследващата ни теза в онзи ден беше коренно различна от това, което знаем сега, разбира се. Винаги има място за подобрение и това е очевидно от позицията на времето.“

Не е ясно защо служителите на OpenAI, които са знаели за таблото за съобщения, изглежда не са сигнализирали на Стъки и други ръководители, отговорни за реагирането на проблеми със сигурността. На въпрос по тази тема говорител на OpenAI повтори, че компанията е можела да реагира по-рано, поглеждайки назад. „Текущата работа на OpenAI в тази област ще послужи за допълнителни подобрения в координацията и реагирането успоредно с плана за действие в този технически доклад за инцидента“, казаха те.

„Ако са имали сигнали, че един или повече агенти атакуват Artifactory, защо не са наблюдавали тези тестове много преди нещо да избяга, за да атакува Hugging Face?“, казва Джейк Уилямс, вицепрезидент по изследванията и разработката в компанията за сигурност Hunter Strategy.

Анализът след инцидента оставя без обяснение и други ключови моменти. В доклада се посочва например, че в един момент на 4 юли интензивната „активност на агенти с голям обем е довела до спиране на работата на услугата OpenAI Artifactory“. На 5 юли системите за мониторинг на OpenAI са задействали предупреждение. В документа обаче не се посочва защо е отнело цяло денонощие, за да се задейства сигнал за прекъсването.

OpenAI заявява, че внедрява повече инструменти за наблюдение на своите ИИ системи...