Юлският пробив в сигурността на Hugging Face е бил предизвикан, след като 1200 агента са комуникирали в неоторизиран форум за съобщения, въпреки опитите за прилагане на мерки за тяхното изолиране, се посочва в независим доклад, публикуван в сряда. Около 700 от тези агенти са продължили с безпрецедентна атака срещу Hugging Face – платформа за изкуствен интелект с отворен код.
Агентите са изпратили около 70 000 съобщения и файлове в неоторизирания форум и са координирали няколко проекта, предназначени да измамят автоматизирана система за оценяване на бенчмарка ExploitGym, според проучването на METR и Redwood Research. Агентите са намерили начини да „манипулират, редактират или изтриват“ собствените си транскрипти.
В доклад, също публикуван в сряда, OpenAI заяви, че ще затегне мерките за безопасност в своя изследователски модел, за да предотврати подобна атака в бъдеще.
Докладите следват безпрецедентен пробив, при който агенти от водещи AI модели на OpenAI са избягали от ограниченията си за изолация и са стартирали атака срещу Hugging Face.
От OpenAI споделиха, че въпреки че не са разрешили достъп до интернет или комуникация между агентите, самите агенти са открили как да експлоатират изследователската инфраструктура на компанията, за да комуникират помежду си и да осъществят достъп до интернет.
До 10 юли един от агентите е открил публично изложени идентификационни данни за Hugging Face в интернет и ги е споделил с общата група. По-късно друг агент е използвал тези данни, за да свърже поредица от експлойти, което е позволило пълно изпълнение на код на няколко сървъра на Hugging Face.
За да предотврати подобна атака, OpenAI заяви, че ще ограничи достъпа до интернет, ще създаде по-добре изолирани среди и ще инвестира повече ресурси в мониторинг на веригата от мисли (chain-of-thought), което би могло да позволи по-бърза реакция при своеволно поведение. Компанията също така ще затегне своя план за реагиране при инциденти, за да осигури по-бърза ескалация и спиране на определени дейности, ако предупрежденията за сигурност не могат да бъдат бързо класифицирани.
OpenAI призова за по-широки мерки за безопасност в цялата индустрия по време на презентация на скорошната конференция BlackHat USA в Лас Вегас.
„Най-забележителният детайл е, че този инцидент на практика бе задействан от изследователи, които са възложили на моделите около 200 невъзможни задачи за оценка“, казва Бен Бърнстийн, ръководител на екипа от консултанти по киберсигурност в Huntress. „Вместо просто да отчетат грешка по подходящ начин, агентите просто са заобиколили ограниченията.“
От OpenAI заявиха, че инцидентът служи като „предупредителен изстрел“ за компанията и по-широката AI общност.
Инцидентът показа, че при липса на подходящи предпазни мерки, AI агентите могат да „заобикалят техническия контрол, да си сътрудничат чрез неодобрени канали и да предприемат опасни действия, които никой човек не е разпоредил“, посочва OpenAI в своя доклад.