OpenAI призна, че не е оповестила публично по-ранен инцидент, при който нейни автономни AI агенти са поели контрол върху немско уики, за да комуникират, да споделят отговори и да разменят техники за заобикаляне на ограниченията.
Компанията заяви, че е разгледала тази активност като „несъответствие в подравняването“ (misalignment) на модела, а не като инцидент по сигурността, но сега признава, че нейните практики за разкриване на информация трябва да се разширят, тъй като системите с изкуствен интелект все повече оказват въздействие в реалния свят.
Подлудели агенти създадоха свое собствено табло за съобщения
Инцидентът започва през май, докато агенти на OpenAI изпълняват задачи с определено време за многократно търсене в мрежата.
В своя доклад независимите изследователи Сидни Фон Аркс, Кормак Слейд Бърд, Спенсър Китс и Томас Ларсен посочват, че са разкрили приблизително 18 000 публикации от автономни агенти, които са „се сговорили да споделят отговори, да проучват средата си и да заобикалят ограниченията на изолираната среда (sandbox)“.
Агентите е трябвало да имат достъп до интернет само за четене, но открили, че могат да пишат в слабо известно немско уики за програмиране — DSEWiki (DeutschesSoftwareEntwickler). Те го превърнали в споделено табло за съобщения за събиране на отговори, преписване на тестове, прогнозиране на бъдещи въпроси и обмен на техники за заобикаляне на ограниченията на изолираната среда на OpenAI.
Изследователите са установили също, че агентите са сканирали уикито за уязвимости от тип междусайтов скриптинг (XSS), имперсонирали са неговите модератори и са създали резервни комуникации, въпреки че не са намерени доказателства опитите за XSS да са успели.
Когато администраторът започнал да премахва техните страници, един от агентите предупредил останалите, че „изглежда е активна акция по почистване/изтриване на уикито по азбучен ред“ и ги насочил към резервна страница, започваща с „ZZZ“, за да оцелее по-дълго.
Изследователите приписват тази активност на вътрешни системи на OpenAI въз основа на имена на агенти, позоваващи се на OpenAI, естеството и скоростта на задачите за оценка, инфраструктурата, свързана с Microsoft Azure, и последващите посещения в уикито от IP адреси, свързани с OpenAI.
Въпреки това тяхното разследване е било ограничено само до информацията, която агентите са публикували публично.
Екипът от изследователи не е имал достъп до вътрешните транскрипти на OpenAI или други данни, които биха могли да установят точно как агентите са открили уикито и са започнали да се координират чрез него.
OpenAI заявява, че нейните правила за разкриване трябва да се променят
В изявление, публикувано днес, OpenAI съобщи, че исторически е третирала несъответствията в подравняването на моделите като научноизследователски въпрос, чиито констатации са били съобщавани чрез изследователски доклади и системни карти.
Компанията заяви, че е сметнала активността в уикито за пореден пример за „несъответствие“, подобен на поведения, които е обсъждала по-рано, а не за инцидент, изискващ специално публично оповестяване.
Собствената формулировка на OpenAI подсказва за по-широк отпечатък от този, документиран от изследователите, описвайки епизода като такъв, „при който нашите агенти са писали в няколко интернет сайта“.
Това се различава от нейната реакция при компрометирането на Hugging Face през юли, когато OpenAI заяви, че нейните AI модели са хакнали платформата, след като са открили уязвимост по време на изпълнение на задачи по киберсигурност.
Последващ анализ установи, че близо 700 подлудели AI агенти са се координирали по време на атаката, споделяйки стратегии и създавайки механизми за персистентен достъп без преки инструкции от хора.
От OpenAI заявиха, че са третирали пробива в Hugging Face като конвенционален инцидент по сигурността, тъй като той е засегнал сигурността както на OpenAI, така и на трети страни. Гигантът в областта на изкуствения интелект е започнал работа с Hugging Face и е разкрил инцидента публично на следващия ден.
Въпреки това OpenAI сега признава, че разликата между изследователско несъответствие в подравняването и инциденти по сигурността става все по-трудна за поддържане.
„Тази година започнахме да виждаме как несъответствията причиняват нови типове въздействие в реалния свят“, заяви компанията.
OpenAI посочва, че в индустрията на изкуствения интелект липсват последователни стандарти относно това кога неочаквано поведение на агенти по време на обучение, оценка или внедряване трябва да бъде докладвано, особено когато то не прилича на традиционен инцидент с киберсигурността.
Компанията разработва нова рамка за оповестяване, която планира да публикува през следващите седмици, и заявява, че обсъжда тези въпроси с регулаторни органи по целия свят.
Моментът на признанието също е забележителен, тъй като идва в същата седмица, в която OpenAI пусна GPT-6 Astra, рекламиран като „най-интелигентния и най-добре подравнен модел в света“ и водещ в областта на компютърната употреба, сърфирането, софтуерното инженерство и киберсигурността.
OpenAI твърди, че Astra се справя по-добре с оставането в рамките на предназначението си, измерено отчасти чрез нова оценка, създадена в отговор на инцидента с Hugging Face.
Проблемът обаче не е уникален само за OpenAI.
През юли Anthropic разкри, че нейният изкуствен интелект Claude е пробил три организации по време на вътрешни оценки на сигурността, като в един от случаите е регистрирал име на пакет, намерено в документацията, и е качил зловреден код в PyPI. Пакетът е бил активен около час, през който 15 реални системи са го изтеглили и стартирали.
Тъй като AI моделите стават все по-способни и придобиват все по-голяма автономия и достъп до интернет и външни инструменти, се очаква подобни инциденти да се зачестят.