Във вторник OpenAI обяви, че е преустановила „значителен брой“ работни процеси по обучение и оценки на предстоящия си авангарден модел с изкуствен интелект (код име Astra), докато внедрява нови процедури, предназначени да се справят с рисковете за киберсигурността. Създателят на ChatGPT споделя, че въвежда редица нови изисквания за мониторинг, сигурност и съгласуване (alignment), за да се справи по-добре с все по-напредналите хакерски способности на своите авангардни модели с изкуствен интелект.

„Трябва да насочим енергията си към привеждането на тези цикли на обучение в съответствие с тези изисквания и очаквания. Колкото и време да е необходимо за постигането на тази цел, толкова дълго хората няма да могат да продължат с работните си натоварвания“, заяви Амелия Глейз, вицепрезидент по изследванията и безопасността в OpenAI, по време на брифинг с журналисти във вторник.

Сред новите предпазни мерки, представени от OpenAI, е по-стабилна система за мониторинг на нейните AI модели. Един от внедрените контроли включва мониторинг на веригата от мисли (chain-of-thought monitoring) – техника, при която класификатори преглеждат вътрешните процеси на „мислене“, генерирани от моделите за AI разсъждения. Компанията твърди, че обновената система разчита на изчислително скъпи „автоматизирани изследователи“, които анализират потенциално тревожно поведение и имат за цел да изпратят предупреждение до хората в рамките на 30 минути.

OpenAI също така заяви, че разширява усилията си за съгласуване по време на процеса на обучение, за да предотврати „хакването на възнаграждения“ (reward hacking) – поведение, при което моделите с изкуствен интелект преследват целите си чрез непредвидени или нежелани средства. Компанията планира да сподели повече подробности за тази дейност в бъдеще.

През последните седмици OpenAI трескаво се опитва да реагира на това, което може да се окаже най-сериозният инцидент с безопасността в нейната история. По-рано тази година група излезли извън контрол AI агенти избягаха от вътрешните изолирани среди за тестване и компрометираха платформата Hugging Face в стремежа си да завършат оценка на сигурността. OpenAI не успя да открие поведението на агентите, дори когато те прекараха седмици, използвайки форум за съобщения, за да координират действията си, което повдигна въпроси относно способността на компанията да контролира моделите си с нарастването на тяхната мощ.

Сагата предизвика сериозен анализ в OpenAI, принуждавайки служителите да преценят дали има пропуски в съществуващите политики по отношение на безопасността, сигурността и съгласуването. Оттогава Anthropic, Meta и китайският стартъп за изкуствен интелект Moonshot разкриха подобни инциденти, при които техните AI агенти са избягали от своите изолирани среди, което показва, че това е по-широк проблем, пред който са изправени компаниите за изкуствен интелект.

Сега OpenAI споделя повече за вътрешната си реакция спрямо нарастващите кибервъзможности на своите модели с изкуствен интелект и заяви, че планира да публикува по-подробен анализ на инцидента с Hugging Face през следващите дни. „Очевидно всичко, което правим, е предназначено да предотврати повторението на случай като този с Hugging Face“, заяви Глейз.

В публикация в блога си от вторник OpenAI посочва, че веднага след инцидента с Hugging Face е започнала работа по обезопасяването на своите изследователски среди. Компанията твърди, че сега изисква по-надеждни изолирани среди за обучение на своите AI агенти и е въвела по-строги контроли за изолирането им от интернет.

Якуб Пачоцки, главен учен в OpenAI, каза пред репортери, че решението на компанията да засили вътрешните си предпазни мерки е било провокирано не само от случилото се с Hugging Face, но и от две други скорошни събития. Едното е вътрешна оценка на Astra, която показва, че моделът се справя значително по-добре със задачи по програмиране и киберсигурност в сравнение с предшествениците си. Другото е общото темпо на напредък на изкуствения интелект, което OpenAI постига вътрешно и което Пачоцки очаква да продължи.

„Наистина очакваме темпото на подобряване на възможностите да бъде доста по-бързо, отколкото в миналото“, каза Пачоцки. „Това ни накара сериозно да се фокусираме върху укрепването на нашите предпазни мерки.“

Бързият напредък в хакерските способности на последните модели на OpenAI предизвика бърза реакция в цялата компания. Президентът и съосновател на OpenAI Грег Брокман заяви в публикация в блога си в понеделник, че сагата с Hugging Face е показала, че компанията е „подценила реалните киберспособности на нашите AI модели“.