OpenAI временно спря за две седмици обучението с подсилващо обучение (RL) на най-новите си модели, предназначени за внедряване, докато укрепваше и тестваше за пробиви (red-teamed) средите за изследвания и разширяваше мониторинга.

„Най-голямото ни планирано обучение с подсилващо обучение за модерни модели остава на изчакване, докато провеждаме по-малко по мащаб обучения и оценки за анализ на поведението на моделите, валидиране на нашите предпазни мерки и събиране на повече доказателства за съгласуваност (alignment), преди да продължим“, заявиха от компанията.

Ходът последва инцидента между OpenAI и Huggin Face и предварителните доказателства, че предстоящият модел Astra на компанията може да достигне критичния праг за киберсигурност съгласно нейната Рамка за подготвеност (Preparedness Framework).

Промените имат за цел да засилят мониторинга, съгласуваността и ограничаването по време на разработването на моделите.

OpenAI очерта актуализации на своите изследователски процеси и инфраструктура, заедно с работата, която все още е в ход.

Изграждане на предпазни мерки за по-способни модели

Разработването на по-способни модели разчита на три подсилващи се предпазни мерки. Мониторингът помага за откриване и реагиране на тревожно поведение, съгласуването намалява вероятността от вредни или неразрешени действия, а мерките за сигурност ограничават до какво системите с изкуствен интелект могат да имат достъп или да влияят.

OpenAI очаква моделите скоро да изпълняват по-голямата част от работата по сигурността, включително защита срещу други модели. Тя прилага трите предпазни мерки в изследванията и внедряването, като ги адаптира към възможностите на всяка система, работната среда и нивото на риск.

Затягане на сигурността в средите за изследвания

Компанията затяга изискванията за сигурност за средите, използвани за обучение и оценка на най-модерните модели, успоредно с нарастването на техните възможности в областта на киберсигурността. Покриването на по-високите стандарти изисква сериозна инженерна работа и доведе до значителни разходи и забавяния на изследванията на модерни модели.

След инцидента между OpenAI и Hugging Face, компанията спря изпълнението на заявки (inference) за модерни модели в изследователските клъстери за работни натоварвания, които могат да изпълняват код или да използват инструменти с достъп до интернет. По-късно тя възстанови по-ограничен и сигурен път за изпълнение на код и направи оценка на отделните работни натоварвания, преди да им позволи да продължат.

Мерките включват по-силна изолация за ненадежден код, по-строги мрежови ограничения и непрекъснато тестване за сигурност. OpenAI също така намали постоянните привилегии, премахна потенциално уязвими споделени услуги и подобрява способността си за събиране и наблюдение на регистрационни файлове (logs) за сигурност.

Най-строгите контроли се прилагат за Astra и други работни натоварвания, свързани с киберпространството, тъй като моделите Astra могат да достигнат критично ниво на възможности за киберсигурност.

Част от обучението и оценките на Astra отговарят на новите стандарти. Значителен брой работни натоварвания остават спрени, докато техните среди не бъдат мигрирани и обновени.

OpenAI дава приоритет на миграцията на дейностите по безопасност и съгласуваност към защитени среди.

OpenAI разшири мониторинга извън високорисковите вътрешни внедрявания и обучението с подсилващо обучение на модерни модели, за да обхване повече дейности на моделите, включващи инструменти.

Системата използва класификатори на активацията, които инспектират активността при всеки генериран токен и ескалират потенциални опасения към автоматизирани изследователи. Тези системи проверяват действията на инструментите, наличните разсъждения и пълната последователност от събития за неразрешен достъп, кражба на данни, деструктивно поведение и опити за заобикаляне на предпазните мерки.

OpenAI се стреми да издава предупреждение в рамките на 30 минути след появата на дадено опасение. Вероятните нарушения на критичните граници на сигурността се ескалират към екипите по безопасност, сигурност и изследвания, от които се очаква да спрат засегнатата дейност, ако не могат да определят в рамките на 30 минути, че предупреждението е фалшиво положително.

Изискването се прилага за всички обучения и оценки с подсилващо обучение, включващи инструменти за модели с възможности Sol или по-високи. То беше разширено за всички процеси на изпълнение на заявки за Astra, включващи инструменти, след като OpenAI определи на 7 август, че моделът може да има критични възможности за киберсигурност.

Системата добавя приблизително 20% към изчислителната мощ за изпълнение на заявки, която се наблюдава, като разходите варират в различните работни натоварвания за обучение и оценка.

За обученията с подсилващо обучение на най-способните си модели OpenAI прилага основни техники за съгласуваност в повече етапи от процеса на обучение. Те включват подобряване на моделите за възнаграждение за откриване и възпиране на небезопасно поведение в различни задачи и среди, обучение на моделите да бъдат по-честни за своите действия, възможности и ограничения, както и намаляване на поведенията, които експлоатират слабости във възнагражденията, оценителите, инструментите или надзора.

Обхватът на обучението се разширява и за поведения, които биха могли да причинят вреда, когато моделите взаимодействат с външни системи или ресурси.

Констатациите от по-широки изследвания и оценки на съгласуваността ще бъдат използвани за насочване на бъдещото обучение и предпазни мерки. Компанията планира да пусне повече информация за поведението на моделите и предизвикателствата, идентифицирани чрез тази работа.

Актуализиране на Рамката за подготвеност

OpenAI планира да актуализира своята Рамка за подготвеност, за да обедини тези предпазни мерки в обучението и внедряването и да отчете по-добре възможностите на бъдещите модели и средите, в които те работят.