GPT-Red е автоматизиран модел за симулация на кибератаки (red teaming), разработен от OpenAI за откриване на слабости, свързани с инжектиране на команди (prompt injection). Той работи по същия начин като човек, извършващ симулация на атака: изпраща команда, наблюдава как реагира моделът GPT и итерира към целта си, например успешно извличане на данни.
Обучението му се основава на самообучение с подкрепление (self-play reinforcement learning), като GPT-Red и набор от защитни модели се обучават едновременно в различни сценарии. Атакуващият модел получава награда при предизвикване на успешна пробойна. Защитните модели получават награда, когато противостоят на атаките и изпълнят първоначалните си задачи. Всяка от страните стимулира другата, така че GPT-Red постоянно открива по-силни и по-разнообразни атаки, докато защитите се укрепват.
OpenAI проведе това обучение с изчислителни ресурси, съизмерими с някои от най-големите им проекти след първоначалното обучение. Компанията държи GPT-Red за вътрешна употреба и не го включва в продуктите си, което предпазва натрупаните умения за атака от реални киберпрестъпници.
Как GPT-Red компрометира модели чрез инжектиране на команди
GPT-Red преодолява почти всеки модел, срещу който е изправен, включително и GPT-5.5. В репликирана версия на арената за индиректно инжектиране на команди от Dziemian et al. (2025 г.), той атакува GPT-5.1 в сценарии извън своя набор за обучение. GPT-Red постигна успех в 84% от случаите. За сравнение, хората, извършващи същата дейност, успяха в много малка част от същия набор от тестове.
Последваха два реални теста. OpenAI насочи GPT-Red срещу управляван от изкуствен интелект автомат за продажба на храни и напитки в офиса си – система, изградена от Andon Labs. След тренировки в симулация, атакуващият модел порази работещия агент и изпълни и трите си цели: свали цената на наличен продукт до минимума от $0.50, регистрира нов скъп продукт на същата цена и отмени поръчка на друг клиент. OpenAI докладва за пропуските и в момента се тестват нови защитни мерки.
Вторият тест изправи GPT-Red срещу команден агент на Codex, захранван от GPT-5.4 mini, при десет отделни задачи за извличане на данни. Моделът успя да извлече чувствителни данни в повече случаи в сравнение с базовата версия на GPT-5.5.
Интегриране на резултатите от симулациите в обучението на моделите
OpenAI внедрява атаките на GPT-Red в обучението на производствените си модели и прави това при всяка нова версия от GPT-5.3 насам. Настоящият резултат е GPT-5.6 Sol, който показва 6 пъти по-малко неуспехи при най-трудния тест на компанията за директно инжектиране на команди в сравнение с най-добрия им модел отпреди четири месеца.
Ранна версия на GPT-Red откри метод, наречен "Fake Chain-of-Thought" (фалшива верига от мисли), който заблуждаваше GPT-5.1 в над 95% от случаите. Този процент вече е под една десета при GPT-5.6 Sol.
Няколко теста за индиректно инжектиране на команди, обхващащи инструменти за разработчици и сърфиране в мрежата, отчетоха над 97% точност при най-новия модел. Срещу директните опити за инжектиране на команди от страна на самия GPT-Red, GPT-5.6 Sol се проваля в едва 0.05% от случаите.
Въпреки тези подобрения, възможностите на модела остават стабилни. Тестовете на OpenAI показаха, че резултатите за обща производителност и прекомерен отказ (over-refusal) остават непроменени. Това доказва, че моделът е станал по-добър в засичането на злонамерени инструкции, като същевременно продължава да обслужва легитимните потребителски заявки.
"Ще продължим да увеличаваме изчислителната мощ и данните, като същевременно правим алгоритмични подобрения, за да обучим бъдещи версии на GPT-Red, които са по-силни от днешния модел. От своя страна, тези модели ще помогнат за повишаване на сигурността на бъдещите версии на GPT. По-късно тази седмица ще публикуваме предварителен научен доклад с повече подробности", споделиха от OpenAI.
Демонстрация: Платформата за автоматизиран SOC на базата на агенти с изкуствен интелект Prophet трансформира триажа и разследването на сигнали за сигурност.