Лидерите на OpenAI мобилизират служителите си, за да реагират на една от най-големите кризи в историята на компанията, която обхваща нейните дивизии за безопасност на изкуствения интелект, киберсигурност и съгласуване (alignment). Създателят на ChatGPT съобщава, че е забавил изследванията, похарчил е милиони долари и е инструктирал няколко екипа да изоставят текущите си задачи, за да се съсредоточат върху разследването на група отцепили се AI агенти. Тези агенти са пробили платформата Hugging Face в опит да завършат вътрешен тест за сигурност.

Очаква се през следващите дни OpenAI да публикува изчерпателен анализ след инцидента (postmortem), описващ подробно случилото се. Инцидентът с Hugging Face обаче вече вдъхнови ръководителите и служителите на OpenAI да проучат как културата на лабораторията за изкуствен интелект може да е спомогнала за възникването му.

Множество настоящи и бивши служители на OpenAI, които говориха при условие за анонимност, споделят пред WIRED, че според тях конкурентният натиск за бързо пускане на нови AI модели и продукти е затруднил персонала да даде достатъчен приоритет на безопасността, киберсигурността и съгласуването.

„Достигаме нови нива на възможности на моделите, които изискват по-надеждно обучение, съгласуване, тестване на безопасността и сигурността, практики за внедряване и управление – както показва работата, която вършим за подготовката на Astra и бъдещите модели“, заяви президентът и съосновател на OpenAI Грег Брокман в изявление за WIRED. „Усещаме тежестта на отговорното внедряване на нашите модели и продукти, и голяма част от това започва с промените, които направихме за по-дълбоко интегриране на изследванията, безопасността и сигурността в разработването на авангардни модели още от самото начало.“

Това далеч не е първият път, в който служители на OpenAI изразяват подобни опасения. През 2024 г. тогавашният ръководител на отдела за съгласуване в OpenAI Ян Лейке напусна, за да се присъедини към Anthropic, предупреждавайки тогава, че безопасността остава на заден план за сметка на лъскавите продукти. Две години по-късно атаката срещу Hugging Face представлява повратна точка за AI индустрията, доказвайки, че AI агентите днес могат да причинят реални вреди в реалния свят, когато безопасността, сигурността и съгласуването не са надлежно съобразени.

„Реагираме на това с изключителна сериозност“, каза Майкъл Далтън, инженер по сигурност и инфраструктура в OpenAI, по време на презентация на конференцията за киберсигурност Black Hat миналата седмица. „Това, което трябва да осъзнаем, е, че организираните от изкуствен интелект, напълно автоматизирани офанзивни атаки вече са реалност. Действията, които обсъдихме днес, бяха непредвиден страничен ефект от провеждането на оценки на авангарден AI.“

Някои служители на OpenAI споделиха пред WIRED, че са оптимисти, че този инцидент ще вдъхнови истинска промяна в компанията. OpenAI пое ангажимент да забави пускането на бъдещи AI модели и беше особено открита за областите, в които нейните мерки за смекчаване на рисковете са се оказали недостатъчни. Боаз Барак, изследовател, който съпредседателства консултативната група по безопасност на OpenAI, заяви в публикация в X, че справянето със ситуацията „изисква не просто коригиране на някои проблеми, но и промяна на нашата култура“.

В своята лекция на Black Hat инженерите по сигурността на OpenAI Далтън и Ерик Уолъс заявиха, че инцидентът с Hugging Face е започнал през май, когато – без знанието на компанията – няколко AI агента, за които се е смятало, че работят в изолирани среди за тестване, са получили достъп до интернет и са се събрали в таен форум, за да координират действията си помежду си.

OpenAI открива форума едва през юли, когато научава, че AI агентите са компрометирали множество услуги, за да се опитат да постигнат по-голямата си цел – пробив в платформата на Hugging Face, където са вярвали, че могат да се съдържат отговорите на тестовете за сигурност, които са се опитвали да решат.

„Те бяха невероятно небрежни. Ако се отнасяш сериозно към това, твоят изкуствен интелект не трябва да има възможност да избяга в интернет и след това да го направи отново веднага след това“, казва бивш служител на OpenAI, поискал анонимност пред WIRED. „Това беше най-големият инцидент с безопасността в историята на OpenAI.“

Седмици преди OpenAI да разкрие инцидента с Hugging Face, WIRED съобщи, че компанията е започнала реорганизация за обединяване на екипите си за безопасност и основни изследвания, което доведе до напускането на тогавашния лидер по безопасността Йоханес Хайдеке.

Сандхини Агарвал, която ръководеше екипи за безопасност на изкуствения интелект в OpenAI, също е напуснала компанията през юли след повече от шест години работа, според профила ѝ в LinkedIn. Агарвал не отговори веднага на запитването на WIRED за коментар.

WIRED научи също, че Дилън Скандинаро вече не заема поста ръководител на отдела за готовност (head of preparedness) – ключовият служител на компанията, натоварен със смекчаването на катастрофални рискове от AI, включително киберсигурност – въпреки че остава в компанията. OpenAI привлече Скандинаро от Anthropic преди около шест месеца. Изпълнителният директор Сам Алтман обяви пристигането му в публикация в социалните мрежи, отбелязвайки, че Скандинаро е бил „наистина най-добрият кандидат, когото съм срещал някъде“.

През трите години, откакто OpenAI създаде ролята на ръководител на отдела за готовност, четирима души са я заемали. OpenAI споделя пред WIRED, че специфичните области на готовност имат специални лидери в сферите на киберсигурността, биологията и рекурсивното самоусъвършенстване, които временно докладват на съпредседателя на консултативната група по безопасност и ръководител на системите за безопасност Саачи.