OpenAI представи GPT-Red – вътрешен автоматизиран модел за симулиране на атаки (red-teaming), предназначен да идентифицира и отстранява уязвимости от тип prompt injection в GPT-5.6.

Този подход има за цел да се справи с нарастващо предизвикателство пред сигурността. Въпреки че ръчните тестове, извършвани от хора, са ценни, те не могат да генерират състезателни тестови сценарии в мащаба, необходим за поддържане на темпото с все по-напредналите системи с изкуствен интелект.

Атаките от тип prompt injection възникват, когато злонамерени инструкции са скрити в съдържание от трети страни, което изкуственият интелект може да обработи – например уеб страници, имейли, изходящи данни от инструменти, кодови хранилища и локални файлове.

Наскоро CrowdStrike разкри пет нови техники за prompt injection, които предизвикват AI агентите. При тях атакуващите залагат скрити инструкции, които остават неактивни, докато конкретно условие или ключова дума не ги активира.

Атакуващите биха могли да използват този метод за заобикаляне на зададените задачи на изкуствения интелект, принуждавайки го да разкрие чувствителна информация, да качва файлове, да препраща идентификационни данни или да предприема неоторизирани действия.

GPT-Red автоматизира процеса на тестване, като изпраща състезателни подкани (prompts), наблюдава отговорите на целевия модел и итеративно разработва по-силни атаки.

OpenAI е обучила GPT-Red чрез обучение с подсилване и самообучение (self-play reinforcement learning), при което моделът атакуващ се конкурира с множество модели защитници в симулирани сценарии на заплахи.

GPT-Red получава награди за успешно провокиране на реални сривове в сигурността. За разлика от него, моделите защитници се награждават за успешно устояване на атаките, докато все още изпълняват първоначалните потребителски задачи.

Средите за обучение имитират реални повърхности за атака. В зависимост от сценария, GPT-Red може да манипулира съдържание в банер на уеб страница, в тялото на имейл, в локален файл или в отговор от инструмент. Тази конфигурация позволява на модела да оценява както преките, така и косвените рискове от prompt injection в агентни работни процеси.

От OpenAI съобщават, че GPT-Red успешно е компрометирал по-ранни вътрешни и производствени модели, включително толкова напреднали, колкото GPT-5.5.

Резултатите от атаките на GPT-Red след това са били използвани за обучение на GPT-5.6. Компанията отбелязва, че GPT-5.6 Sol е показал шест пъти по-малко сривове в най-предизвикателния си бенчмарк за директен prompt injection в сравнение с най-силния си производствен модел от едва четири месеца по-рано.

Освен това OpenAI е оценила GPT-Red във вътрешно копие на арена за индиректен prompt injection, базирано на изследване на Dziemian et al. Съобщава се, че GPT-Red е успял в 84% от тестовите сценарии срещу GPT-5.1, докато независимите специалисти по симулиране на атаки (red teamers) са постигнали едва 13% успеваемост.

В друг тест GPT-Red е атакувал AI агент на вендинг машина, като успешно е изпълнил злонамерени действия, включително промяна на цената на скъпа стока на $0.50, добавяне на по-скъп артикул на същата цена и анулиране на поръчката на друг клиент.

От OpenAI заявиха, че тези проблеми са били оповестени и в момента се тестват допълнителни предпазни мерки.

За да намали рисковете, OpenAI държи GPT-Red изолиран от публично внедрените модели, за да предотврати излагането на офанзивните способности, разработени по време на неговото обучение.

Компанията съобщи, че GPT-5.6 Sol вече се проваля само в 0.05% от опитите за директен prompt injection на GPT-Red в нейните контролирани среди, като същевременно запазва общите си възможности и избягва прекомерно поведение на отказ за съдействие.