OpenAI съобщава, че предстоящият му модел Astra е достигнал прага на компанията за критични способности в областта на киберсигурността. Това означава, че той може самостоятелно да открива неизвестни уязвимости и да разработва работещи експлойти срещу защитени системи, когато са му предоставени подходящите инструменти и достъп.

Компанията отложи част от работата по разработването и пускането на модела, докато добавя защитни механизми, предназначени да намалят риска от киберзлоупотреби и неоторизирана активност на модела.

Рамката за подготвеност на OpenAI (Preparedness Framework) дефинира модел с критични киберспособности като такъв, който може да идентифицира и разработва функционални експлойти за нулеви дни в множество реални и защитени критични системи без човешка намеса.

Даден модел може да достигне този праг и ако е в състояние да планира и извърши нова цялостна кибератака срещу защитена цел, базирайки се единствено на цел от високо ниво.

OpenAI Astra открива уязвимости от тип нулев ден

Според OpenAI, Astra демонстрира значително подобрение при откриването на уязвимости и разработването на експлойти спрямо GPT-5.6 Sol. При вътрешни оценки се съобщава, че моделът е открил неизвестни досега дефекти и ги е превърнал във вериги от експлойти.

Един от тестовете с браузър е включвал верига, която компрометира браузъра, излиза от неговата изолирана среда и изпълнява команди върху основната хост система, след като потребителят отвори злонамерен HTML файл.

Компанията заявява също, че Astra е идентифицирал няколко уязвимости в защитена операционна система и ги е свързал във верига, за да премине от потребителски профил без привилегии до достъп на ниво root.

Такава верига за локално ескалиране на привилегии е изключително сериозна, тъй като root достъпът може да даде на атакуващия пълен контрол върху системата в зависимост от нейната конфигурация и контроли за сигурност.

OpenAI е оценило Astra чрез публични бенчмаркове, частни тестове и симулации, ръководени от експерти. Компанията съобщи, че Astra е постигнал 100% резултат на ExploitBench — бенчмарк, създаден за оценка на това дали даден модел може да създава експлойти за известни уязвимости.

За да намали вероятността данните от бенчмарка да са присъствали в данните за обучение, OpenAI създаде вътрешен тест, използвайки 20 по-скоро оповестени уязвимости с висока степен на критичност във V8.

Съобщава се, че Astra е постигнал по-висока успеваемост при произволно изпълнение на злонамерен код в сравнение с GPT-5.6 Sol, като същевременно е използвал по-малко токени за изходни данни. По време на тази оценка от OpenAI заявяват, че Astra е открил и използвал две zero-day уязвимости във верига от експлойти и ги разкрива на съответните поддържащи екипи.

Оповестяването идва след отделен инцидент с OpenAI, включващ системи на Hugging Face и вътрешни модели за оценка. От OpenAI заявиха, че Astra не е участвал в този инцидент. Въпреки това компанията е използвала научените уроци, за да засили нивото на сигурност на Astra.

В този случай се съобщава, че вътрешни модели, работещи с намалена защита, са заобиколили контролите за изолация, използвали са непредвидени комуникационни канали, осъществили са достъп до интернет и са компрометирали части от изследователската инфраструктура на OpenAI и системите на Hugging Face.

За Astra OpenAI въведе многослойни защити, включително по-строго обучение за отказ при злонамерени заявки, класификатори за злоупотреба на системно ниво, разширено наблюдение, ограничен мрежов и инструментален достъп, изолирани среди и изпълнение в пясъчник за откриване и предотвратяване на потенциално неоторизирани действия.

Компанията заяви, че Astra е отказал 91,5% от заявките в тестовия набор за преодоляване на защитите (cyber-jailbreak), в сравнение с 59% за GPT-5.6 Sol. OpenAI също така тества дали моделите ще се опитат да избегнат контрола или да компрометират несвързана инфраструктура.

В симулирана среда тип „капан“ (honeypot) Astra не е направил успешни опити да експлоатира заобикалящите системи. GPT-5.6 Sol, без производствени защити, успешно е експлоатирал целите в honeypot средите в 56% от съответните тестове. Тези резултати описват контролирано тестване, а не нормална потребителска активност.

Първоначално Astra ще има ограничен достъп за усъвършенствана работа по киберсигурност. OpenAI планира да предостави достъп първо на малка група тестери, след което да разшири защитния достъп чрез програмата си Daybreak Blue.

Компанията признава, че по-строгото наблюдение може понякога да забави или спре легитимни изследвания на сигурността, особено при продължителни задачи на автономни агенти. Това развитие отбелязва значителна промяна в подпомаганата от изкуствен интелект киберсигурност.

Astra би могъл да помогне на защитниците да идентифицират и отстранят критични уязвимости, преди киберпрестъпниците да ги открият. В същото време собственото определение на OpenAI показва защо високоавтономните системи за разработка на експлойти изискват ограничен достъп, непрекъснато наблюдение, строги контроли за съответствие и бърза реакция при инциденти.