OpenAI обяви във вторник, че предстоящият му AI модел, Astra, е първият, достигнал прага на компанията за това, което тя нарича „критични“ кибервъзможности. OpenAI планира да пусне публично версия на Astra „скоро“, но ще предостави разширените кибервъзможности на модела само на избрани партньори в програмата си за ранен достъп Daybreak Blue при стартирането.
В брифинг с журналисти лидерите по безопасност и сигурност на OpenAI заявиха, че компанията е стигнала до извода, че Astra достига критичните възможности за киберсигурност, очертани в нейната рамка за готовност, която задава прагове и протоколи за случаите, когато нейните AI модели представляват нови нива на риск. Компанията посочва, че даден AI модел е достигнал своя критичен праг за киберсигурност, когато може самостоятелно да намира и експлоатира неизвестни досега уязвимости в реален софтуер. Ръководителите на OpenAI казаха, че компанията е следвала процедурата си за тази ситуация, която изисква спиране на по-нататъшното разработване, докато не бъдат внедрени подходящи защитни механизми и мерки за сигурност.
Преди това OpenAI съобщи, че е паузирала някои работни натоварвания по обучението, свързани с разработването на Astra и бъдещ AI модел, за няколко седмици. Ръководителите казват, че компанията вече е възобновила посочената работа по Astra и бъдещия AI модел след въвеждането на допълнителни контроли за безопасност и сигурност. От OpenAI твърдят, че неколкоседмичната пауза е била продуктивна и сега са уверени, че могат да пуснат Astra широко по безопасен начин.
Обявлението идва в момент, когато Силициевата долина се бори с напредналите възможности за киберсигурност на водещите AI модели и се опитва да увери потребителите, законодателите и други компании, че може да ги държи под контрол. През юли OpenAI разкри инцидент, при който агенти, изпълняващи два от нейните модели, са експлоатирали уязвимости в тестова среда, която е трябвало да бъде изолирана среда, получавайки достъп до интернет и хаквайки платформата за AI с отворен код Hugging Face. (OpenAI отбелязва, че Astra не е бил сред моделите, участващи в този случай.)
Други AI компании, като Anthropic и Meta, разкриха подобни инциденти през последните седмици. В понеделник Anthropic също заяви, че е паузирала някои работни натоварвания за обучение на AI, докато засилва своите практики за безопасност и сигурност.
OpenAI заявява, че внедрява многостепенен подход, за да ограничи ежедневните потребители от достъп до разширените кибервъзможности на Astra, включително нов „монитор за разминаване в целите“ (misalignment monitor). Ако някой поиска от Astra да помогне за намиране на инструмент за експлоатация в реална софтуерна система, например, моделът трябва да откаже отговор. OpenAI казва, че е направила Astra и по-устойчива на опити за заобикаляне на ограниченията (jailbreaking), като при тестове успешно е отказала опасни запитвания със значително по-висок процент спрямо предишни модели.
Въпреки това OpenAI отбелязва в публикация в блога си, че нейният монитор може „понякога да маркира легитимна дейност като потенциална злоупотреба в киберпространството или неоторизирано поведение, което може да доведе до неволното ѝ забавяне, паузиране или спиране“. OpenAI посочва, че тази защитна стена може да бъде задействана в някои случаи дори когато потребителят извършва дейности, които не изглеждат свързани с киберсигурността. Когато това се случи, потребителите на ChatGPT и Codex може да бъдат помолени да прегледат действието на модела, преди да продължат.
Партньорите в програмата Daybreak на OpenAI — която включва доставчици на цифрова инфраструктура като Cisco, Cloudflare и Palo Alto Networks — ще получат ранен достъп до по-малко ограничена версия на Astra с по-робустни кибервъзможности. Целта на програмата е да се гарантира, че тези компании могат да използват разширени AI модели като Astra, за да засилят защитите си, преди сходни по възможности модели да станат широко достъпни. Лидерите на OpenAI казаха също, че компанията работи в тясно сътрудничество с правителствени партньори, за да гарантира, че те са запознати с киберуменията на Astra и имат достъп до тях.
Astra е способна не само да намира нови софтуерни уязвимости и да разработва начини за експлоатирането им за хакване, но и да верижно да свързва множество уязвимости (exploit chaining) — техника, използвана за все по-дълбоко проникване в целевата система и получаване на достъп, който не би бил постижим само с една уязвимост.
Според данни на OpenAI, Astra превъзхожда водещи в индустрията AI модели като GPT-5.6 Sol и Mythos на Anthropic в тестове за киберсигурност като ExploitBench, където Astra постига резултат от 100 процента. Тези възможности обаче са в съответствие с нарастващите способности за хакване на AI моделите, които OpenAI и Anthropic прогнозират от месеци. През април например Anthropic подчерта, че Mythos Preview е бил в състояние автономно да разработва вериги от зловредни кодове за експлоатация.
Въпреки че индустриите за изкуствен интелект и киберсигурност се надпреварват да се адаптират, много експерти по киберсигурност подчертават, че ключовите цифрови защити и дългогодишните добри практики остават ефективни. Въпреки това изкуственият интелект поставя организациите и системите, които не са внедрили напълно тези защити, пред още по-спешен и сериозен риск.