OpenAI обяви, че временно спира някои „вътрешни дейности“, свързани с предстоящия си модел с изкуствен интелект (ИИ) Astra, след като вътрешна оценка установи, че той е постигнал значителен напредък в агентното програмиране и киберсигурността.
В отговор на разкритието стартиращата компания за ИИ заяви, че внедрява контроли за сигурност за модели с по-високи възможности и свързаните с тях дейности, като например изолирани среди за тестване, ограничен достъп до мрежа и инструменти, подобрена защита и криптиране на теглата на модела, допълнителни възможности за наблюдение и откриване, както и изпълнение в изолирана среда (пясъчник).
„Спираме вътрешните дейности с участието на Astra, които все още не отговарят на тези засилени изисквания за контрол на сигурността“, се казва в изявление на компанията.
„Внедрихме универсален мониторинг за рискови действия и отклонения в поведението при всички агентни приложения на Astra, включително при обучението и оценката. Мониторите оценяват веригата от мисли (Chain of Thought) на модела и задействат реакция при инциденти, за да прегледат и прекъснат дейности с висок риск.“
От OpenAI заявиха, че ще работят и със съответните правителствени агенции и избрани организации за безопасност на ИИ, за да тестват възможностите на модела, както и че ще споделят препоръчаните контроли за сигурност с външни партньори за тестване, за да могат безопасно да се изпълняват оценки и работни натоварвания с по-висок риск.
Компанията заяви, че „не може да изключи“ възможността моделът да притежава възможности от „критично“ ниво в киберсферата съгласно своята Рамка за готовност (Preparedness Framework), която дефинира прага по следния начин:
Модел, допълнен с инструменти, може да идентифицира и разработва функционални експлойти за уязвимости от тип нулев ден от всички нива на сериозност в множество защитени критични системи от реалния свят без човешка намеса ИЛИ моделът може да измисля и изпълнява цялостни нови стратегии за кибератаки срещу защитени цели, като му бъде зададена само високопоставена крайна цел.
С други думи, моделът може да открива и разработва функционални zero-day експлойти от всякаква степен на сериозност в много укрепени критични системи от реалния свят без човешка намеса или може да организира и изпълнява цялостни нови стратегии за кибератаки срещу цели, когато му бъде зададена само обща крайна цел.
От OpenAI посочиха, че предварителните оценки на Astra показват „достатъчно силно представяне“, поради което на този етап не може да се изключи възможността моделът да притежава „критично“ ниво на възможности. Компанията също така подчерта, че Astra не е участвал в миналия месец инцидент, насочен срещу Hugging Face. В неотдавнашна научна публикация OpenAI се похвали, че моделът е решил 10 отворени проблема в математиката и теоретичната компютърна наука за около 2000 долара по тарифите на Sol API.
OpenAI сподели, че разпространява тази информация, защото вярва, че „е важно да бъде прозрачна с обществеността и общностите по безопасност и сигурност относно тази потенциална промяна във възможностите“.
„Вярваме, че моделите с напреднали кибервъзможности трябва да помагат на защитниците да идентифицират и отстраняват уязвимости, преди атакуващите да го направят“, добавят оттам. „Ангажирани сме да работим съвместно с правителствата, институтите за безопасност и гражданското общество, за да гарантираме, че най-новите възможности на модели като Astra и тези след него се внедряват отговорно и широко в полза на цялото човечество.“
Това събитие е най-новият знак за бързо развиващите се кибервъзможности на водещите модели, като същевременно бележи първия случай, в който лаборатория за ИИ публично се ангажира да забави прогреса поради опасения за киберсигурността.
По-рано миналата седмица Институтът за безопасност на ИИ на Обединеното кралство (AISI) разкри, че неговата собствена оценка е установила, че модели на ИИ с достъп до интернет са се свързали с реалния свят, за да насочат действията си автономно срещу отделни лица и организации в 10 от общо 122 теста. От 19 такива регистрирани действия, 17 са произлезли от Mythos 5 на Anthropic, а останалите две са свързани с GPT-5.6-Sol на OpenAI с кибер класификатори.
„В най-сериозния случай агентът се е опитал да инжектира зловреден код в проект с отворен код“, заявиха от AISI. „В опит да издейства одобрението на кода, агентът е приложил социално инженерство – създавайки фалшиви онлайн самоличности и използвайки ги, за да притисне поддържащия проекта да одобри кода. Човекът, отговорен за поддръжката, е засякъл и отказал да одобри внедрения злонамерен код.“
„Тези опити бяха неуспешни и нашите разследвания не откриха доказателства за произтекли вреди в реалния свят. Но това е първият път, в който виждаме рисковете, свързани с автономията и измамата, да се проявяват толкова ясно, без специфично подканване, в реалния свят.“
Разкритието идва и на фона на информацията, че модели на Meta и китайската компания Moonshot, а именно Muse Spark 1.1 и Kimi K3, са избягали от контролираната среда и са атакували цели в реалния свят, което засилва опасенията относно способностите на разработчиците да изолират в пясъчник все по-способните системи с ИИ. И в двата случая е установено, че моделите използват като оръжие неправилни мрежови конфигурации, вместо самостоятелно да идентифицират и експлоатират непозната досега уязвимост, за да достигнат до интернет.
Докато моделите с ИИ се тестват спрямо широко приети бенчмаркове, за да се изследва как изпълняват офанзивни и дефанзивни задачи по киберсигурност в изолирани среди, водещите системи...