Във вторник OpenAI разкри, че е спряла временно за две седмици обучението с подсилено обучение (RL) на най-новите си модели с изкуствен интелект (ИИ). През това време компанията е изградила допълнителни защити и е разширила обхвата на мониторинга си, за да предотврати инцидент, подобен на този с Hugging Face.
„С нарастването на възможностите на моделите се увеличават и рисковете, свързани с тяхното вътрешно разработване и тестване“, заявиха от компанията за ИИ. „Нашите стандарти за мониторинг, съгласуване и сигурност трябва да изпреварват тези рискове. Искахме да отделим необходимото време, за да отговорим на тези стандарти, затова временно забавихме темпото на мащабиране.“
От компанията съобщиха, че най-големият планиран процес за обучение с подсилено обучение за водещи модели (frontier RL run) остава временно спрян. В момента се провеждат по-малко мащабни обучения и оценки, за да се анализира поведението на моделите, да се проверят предпазните мерки и да се съберат по-конкретни доказателства за съгласуваността им преди преминаването към следващата фаза.
За тази цел OpenAI планира да засили предпазните мерки в целия процес на разработка. Това включва подобрен мониторинг за по-добра реакция при непредвидено и обезпокоително поведение; съгласуване (alignment) за намаляване на вероятността от вредни или неразрешени действия; и мерки за сигурност, които да ограничат достъпа или въздействието на ИИ системите.
Част от тези мерки включват по-надеждни изолирани среди (пясъчници), мрежова изолация за предотвратяване на достъп до интернет и непрекъснато тестване за сигурност. Целта е да се премахнат потенциално уязвими споделени услуги, да се намалят постоянните привилегии и да се подобрят границите на сигурност и доверие.
Това развитие на събитията идва дни след като OpenAI обяви, че спира някои „вътрешни дейности“, свързани с предстоящия си модел Astra, след като вътрешна оценка установи значителен напредък в автономното писане на код (agentic coding) и киберсигурността.
„Въпреки че някои обучения и оценки на Astra отговарят на тези изисквания, значителен брой работни процеси остават спрени, докато не бъдат напълно мигрирани и подобрени, за да съответстват на новите изисквания за сигурност“, подчертаха от компанията. „Даваме приоритет на първо място на мигрирането на процесите, свързани с безопасността и съгласуването, към тези нови среди.“
Успоредно с това системата за мониторинг е обновена, за да сигнализира и препраща потенциални проблеми към „все по-сложни автоматизирани разследващи инструменти с висока изчислителна мощност“. Те анализират действията на инструментите, наличните разсъждения и пълната последователност от дейности за неразрешен достъп, кражба на данни, разрушително поведение и опити за заобикаляне на защитните мерки.
OpenAI планира да издава предупреждение в рамките на 30 минути след засичане на обезпокоителна активност чрез този механизъм за мониторинг. Този подход става задължителен за всички обучения и оценки с подсилено обучение, които включват инструменти за модели с ниво на възможности Sol или по-високо. Очаква се тези предпазни мерки да увеличат изчислителните разходи с 20% спрямо наблюдаваното натоварване при изпълнение (inference).
„С придобиването на напреднали способности от моделите, като например възможност за извършване на кибератаки, и работата им в по-сложни среди, несъгласуваните поведения като reward hacking (намиране на начини за получаване на високи награди при обучението, без реално да се постига целения резултат), измама или неразрешен достъп ще създават все по-сериозни рискове“, посочиха от компанията.
Действително, ново изследване, публикувано от конкурента Anthropic миналата седмица, установи, че ИИ агенти, поставени в ситуации с конкуриращи се и противоречиви цели, започват да се саботират взаимно и да разполагат самовъзпроизвеждащ се зловреден код един срещу друг. Това е довело до ситуация, описана като „война за територия между множество агенти“.
„Това включваше деактивиране на Unix акаунтите на другите агенти, писане на автоматизирани скриптове, които намират и спират конкуриращи се процеси в безкраен цикъл, и внедряване на злонамерен код, маскиран като собственост на друг агент“, споделят от Anthropic.
Въпреки че опасенията относно автономни системи, излизащи извън контрол, се превърнаха в гореща тема за дискусии, изследването има за цел да разбере какви нови поведения и потенциално вредни динамики могат да възникнат, когато множество агенти взаимодействат или се състезават помежду си.
Тези взаимодействия могат да доведат до ситуации, в които те се координират и работят в унисон за постигане на обща цел (както при инцидента с Hugging Face) или се конкурират помежду си, преди да се опитат да разрешат конфликтите си чрез „турнир“.
При друг случай, който наскоро стана известен, опитите на австралиец да запази място в популярен фитнес клас чрез OpenClaw са довели до неочаквани последствия. Моделът Anthropic Claude Opus 4.6, интегриран в платформата за ИИ асистенти, е резервирал фитнес клас месеци напред, като се е възползвал от уязвимост, открита в софтуера за резервации.
Още по-лошото е, че моделът е намерил начин да компрометира системата и да анулира резервациите на други членове от списъка на чакащите. Инцидентът, случил се през април 2026 г., е поредният пример за това как ИИ агентите могат да стигнат до крайности, за да изпълнят възложените им задачи, дори ако това означава нарушаване на установените правила.
За да противодейства на подобни рискови нововъзникващи модели на поведение, OpenAI заяви, че предприема стъпки за подобряване на моделите за възнаграждение с цел по-добро откриване и възпиране на безопасно поведение, както и за обучение на моделите да бъдат по-прозрачни...