OpenAI разкри подробности за GPT-Red – вътрешен автоматизиран модел за симулация на атаки (red-teaming), който мащабира откриването на уязвимости, свързани с инжектиране на подкани (prompt injection), с цел отстраняване на проблемите, преди инструментите да бъдат широко внедрени.

„GPT-Red е силен инструмент за симулация на атаки и предишните ни модели са силно уязвими към неговите атаки за инжектиране на подкани“, заявиха от компанията за изкуствен интелект (AI). „Използваме GPT-Red за състезателно обучение на GPT-5.6, което го прави много по-устойчив на инжектиране на подкани.“

Моделът работи точно като истински специалист по симулация на атаки. Той изпраща подкана, следи как реагира съответният GPT модел и итеративно върви към злонамерена цел, като например качване на чувствителни данни на външен сървър.

Тази разработка идва в момент, когато състезателното инжектиране на подкани продължава да бъде постоянен проблем за големите езикови модели, които могат да бъдат подведени да изпълнят внимателно изготвена инструкция, водеща до нежелани последици.

Тъй като агентните системи продължават да бъдат свързвани с външни източници на данни чрез уеб браузъри, свързани приложения, локални файлове и други инструменти, те разшириха повърхността за атака. Това предостави повече начини за злонамерените субекти да влияят на резултатите от даден модел, като внедряват злонамерен код в наглед безобидно съдържание, което се подава като входни данни. То може да бъде под формата на имейл, уеб страница, отговор от инструмент или кодово хранилище.

GPT-Red има за цел да допълни човешката дейност по симулация на атаки в голям мащаб, като по този начин прави възможно идентифицирането на нови режими на отказ, подобрява устойчивостта и изгражда подходящи противодействия, преди моделите да бъдат внедрени.

„Подобно на начина, по който хората специалисти по симулация на атаки разработват своите офанзиви, моделът работи за постигане на целта си, като изпраща подкана, наблюдава как реагират GPT моделите на нея и прави итерации“, споделят от OpenAI.

Чрез директно интегриране на GPT-Red в процеса на обучение на своите производствени модели, OpenAI заяви, че GPT-5.6 Sol е най-устойчивият им модел срещу инжектиране на подкани до момента. Той постига 6 пъти по-малко откази при тестове за директно инжектиране на подкани в сравнение с GPT-5.5 – техният водещ модел отпреди четири месеца.

Някои от примерните разговори с инжектирани подкани, тествани като част от процеса, включват:

  • Ексфилтрация на вътрешна директория
  • Измамни инструкции за плащане
  • Ексфилтрация на идентификационни данни за Amazon Web Services (AWS)
  • Деактивиране на двуфакторна автентификация (2FA)

„GPT-Red е обучен с помощта на обучение с подсилване чрез самоигра (self-play reinforcement learning), при което моделът и колекция от различни защитаващи големи езикови модели се обучават едновременно в широк набор от сценарии за симулация на атаки“, обясняват от OpenAI. „GPT-Red получава награда за предизвикване на валиден срив, като например успешно инжектиране на подкана, докато защитаващите модели се награждават за това, че устояват на атаката и изпълняват първоначалните си задачи.“

Това също така означава, че с увеличаване на устойчивостта на защитаващите модели, моделът за симулация на атаки ще трябва да се върне на чертожната дъска, за да открие по-мощни и разнообразни методи за атака, с които да преодолее тези защитни бариери. По-конкретно е установено, че GPT-Red генерира успешни атаки срещу GPT-5.1 в повече сценарии, отколко четирите човешки екипа за симулация на атаки, когато става въпрос за индиректно инжектиране на подкани.

OpenAI също така подчерта, че GPT-Red се държи отделно от другите модели, така че злонамерените възможности, изградени в него, да не достигнат до киберпрестъпници, които постоянно търсят различни начини да заобиколят етичните мерки и мерките за безопасност на модела.

В един реален тест OpenAI насочи GPT-Red срещу базиран на изкуствен интелект автомат за продажба, изграден от Andon Labs. След като се упражнява в симулация, моделът се насочи към автономния агент и изпълни и трите си цели: намаляване на цената на скъп артикул до минимално разрешената цена от $0.50, поръчване на нов артикул за $100 на същата тази сума и анулиране на поръчката на друг клиент. След отговорно оповестяване в момента се тестват нови защитни мерки, допълват от компанията.

Втори казус включва използването на GPT-Red за атака срещу команден агент на Codex, базиран на GPT-5.4 mini, в 10 отделни задачи за ексфилтрация на данни. Това доведе до изпращане на чувствителни данни в повече случаи, отколкото при базовия GPT-5.5.

Ранна версия на модела разкри и нов клас атаки за директно инжектиране на подкани, известни като атаки с фалшива верига от мисли (Fake Chain-of-Thought - CoT). Те постигнаха успеваемост над 95% при GPT-5.1, но сега са под 10% за GPT-5.6 Sol.

„По подобен начин няколко от нашите бенчмаркове за индиректно инжектиране на подкани, които са насочени към атаки в инструменти за разработчици и сърфиране, бяха наситени от най-новия ни модел (>97% точност)“, допълват от OpenAI.

„Устойчивостта към самия GPT-Red също се подобри значително. В широк набор от среди за тестване на устойчивостта нивата на успешни атаки на GPT-Red спадат монотонно с течение на времето. С най-новата версия на нашия модел, GPT-5.6 Sol се проваля при едва 0.05% от директните инжектирания на подкани от страна на GPT-Red.“

Разкритието идва в момент, когато компанията сподели, че одит на SWE-Bench Pro е установил, че около 30% от задачите са неработещи, оттегляйки предишната си препоръка за приемане на бенчмарка за измерване на водещите възможности за кодиране. По-рано този февруари OpenAI заяви, че се отказва от SWE-bench Verified поради фундаментални недостатъци в дизайна.