Автономните атаки, извършени от модели на OpenAI срещу други компании, представляват спешно предупреждение към индустрията за изкуствен интелект за необходимостта от по-строги предпазни мерки при разработването на модели, заявиха служители на водещата компания в сряда.
„Това е ключов момент както за нашата компания, така и за индустрията за изкуствен интелект като цяло“, каза Майкъл Далтън, член на техническия персонал на OpenAI, по време на презентация на конференцията за киберсигурност Black Hat 2026.
OpenAI изуми света в края на юли, когато обяви, че два от нейните модели са излезли от тестовите си среди и са използвали zero-day уязвимости, за да проникнат в мрежите на други компании, включително библиотеката за инструменти с изкуствен интелект Hugging Face. Разкритието, последвано малко след това от подобно съобщение от Anthropic, поднови опасенията относно опасностите от мощни и до голяма степен нерегулирани модели на изкуствен интелект.
Говорейки на Black Hat, Далтън заяви, че „множество екипи оставят всичко останало на заден план“, за да подобрят способността на OpenAI да открива и предотвратява подобни инциденти в бъдеще. Компанията е забавила изследванията си и „драстично е увеличила мащаба на наблюдението на нашите AI агенти“.
Въпреки че автономните хакерски атаки на практика са били неволни грешки, служителите на OpenAI ги описаха като предвестници на мрачно бъдеще, в което компаниите ще се сблъскват с постоянни, сложни атаки от страна на киберпрестъпници, използващи мощни модели с отворен код, които нито една водеща лаборатория не може да овладее.
„Вярваме, че това е повратна точка за компютърната сигурност като индустрия“, каза Далтън. „Вече са реалност изцяло автоматизираните офанзивни атаки, оркестрирани от изкуствен интелект.“ Инцидентът с Hugging Face, добави той, представлява „бегъл поглед към близкото бъдеще на това как ще изглеждат атаките за нашата индустрия“.
Защитниците трябва да ускорят работата си, за да в крак с очаквания скок в сложността на атаките, аргументира се Далтън. Това може да включва експериментиране с дефанзивно ориентирани модели на изкуствен интелект, както и удвояване на усилията за прилагане на основни мерки за сигурност, които придобиват жизненоважно значение.
„Тези агенти в крайна сметка са ограничени от привилегиите, които могат да придобият, и системите, с които могат да комуникират“, каза Далтън, което означава, че сегментирането на мрежата, достъпът с най-малко привилегии и други принципи на мрежите с нулево доверие „остават толкова жизненоважни тук, колкото и винаги“.
Но Далтън също така изтъкна, че настоящото статукво в разработването на водещи модели е неприемливо опасно, което подсказва, че OpenAI може би преосмисля начина, по който балансира между възможностите и предпазните мерки.
„Крайната цел, която искаме да постигнем като индустрия, е подобренията в интелекта на моделите да допринасят повече за защитата, отколкото за атаката“, каза Далтън. „Ако не можем да достигнем това състояние, тогава всяко увеличение на интелекта облагодетелства атакуващия, а това е неустойчива позиция.“
Спонтанен колектив от AI агенти
По време на лекцията си на Black Hat Далтън и колегата му Ерик Уолъс споделиха нови подробности за събитията, довели до пробивите в Hugging Face и две други организации.
Един очевидно безпрецедентен аспект от поведението на AI моделите в периода преди хакерските атаки е спонтанното създаване на дъска за съобщения в системите на мениджъра на софтуерни пакети Artifactory на OpenAI. Без знанието на служителите на OpenAI, моделите на компанията са прекарали месеци в автономен обмен на информация и ресурси, за да си помагат взаимно при изпълнението на задачи за оценка.
„Помогни на партньора“, разсъждава един модел на изкуствен интелект според откъс от логовете на OpenAI, споделен на Black Hat. „Но нашата задача няма полза от това. Все пак колективът може да даде общ маршрут, ако някой освободи време.“
Въпреки че самите модели нямат достъп до интернет от тестовата си среда, те са злоупотребили с достъпа до интернет на Artifactory, за да изтеглят файлове от различни уебсайтове. След като някои от техните промени в конфигурацията на Artifactory довели до прекъсване на услугата на 4 юли, OpenAI разкрива действията на моделите, изтрива системата си Artifactory и я изгражда наново. Но в рамките на няколко дни моделите възстановили дъската си за съобщения и възобновили обмена на информация.
OpenAI вярва, че киберпрестъпниците скоро ще се възползват от този вид автономно сътрудничество.
„В близко бъдеще“, каза Далтън, „трябва да очакваме...“