Claude Opus 5 на Anthropic регистрира най-ниския процент на успешна атака с индиректно инжектиране на подкана в последния бенчмарк на Gray Swan, според резултатите, предоставени в неговата системна карта (system card).
Моделът намали шанса на атакуващия за успех в рамките на 15 опита до 2,0%. Този резултат поставя Opus 5 пред всеки друг тестван модел, включително по-ранни версии на Claude и конкурентни водещи системи.
Разкритието подчертава нарастващото внимание към индиректното инжектиране на подкана – проблем със сигурността, който може да засегне AI агенти, свързани с документи, уебсайтове, имейл и бизнес инструменти.
Индиректно инжектиране на подкана възниква, когато злонамерени инструкции са скрити в ненадеждно съдържание, което система с изкуствен интелект впоследствие чете. Отровна уеб страница, документ или съобщение може да се опита да пренебрегне задачата на потребителя, да разкрие чувствителна информация или да задейства опасни действия.
Опасността нараства, когато моделите могат да използват инструменти, да извличат данни или да действат в корпоративни среди. Само по себе си доброто поведение на модела не премахва риска. То обаче може да намали вероятността враждебните инструкции успешно да променят решенията на даден агент.
В бенчмарка за индиректно инжектиране на подкана Opus 5 постигна значително подобрение спрямо Claude Opus 4.8. Процентът му на успешна атака при 15 опита спадна от 5,5% на 2,0%. При сценарий с единичен опит процентът падна от 0,5% на 0,2%.
Резултатите надминаха и тези на Claude Sonnet 5, който отчете 5,9% при 15 опита, и Claude Mythos 5, който достигна 2,6%. Anthropic заяви, че Opus 5 е най-устойчивият модел, оценяван при тестовите условия на бенчмарка.
Разликата с системи, които не са разработени от Claude, беше още по-голяма. Muse Spark, най-силният модел извън фамилията на Claude в теста, имаше 16,5% успеваемост в рамките на 15 опита.
Това е над осем пъти повече от процента, отчетен за Opus 5. GPT 5.6 Sol, описан като най-способния вариант, достигна 20,0%, което е близо до 20,8% на GPT 5.5.
Системната карта на Claude Opus 5 съобщава, че вероятността Sol да бъде успешно атакуван е била десет пъти по-висока в сравнение с Opus 5. GPT-5.6 Terra и Luna показаха по-висок процент на успешни атаки – съответно 30,4% и 43,9%.
Сравнението при единичен опит също е забележително. Единичен опит за атака срещу GPT 5.6 Sol е бил успешен в 3,1% от случаите. Този брой надхвърля успеваемостта от 2,0% срещу Opus 5, която е достигната едва след 15 опита.
Сравнението предполага, че защитите на Opus 5 могат да се противопоставят по-ефективно на многократни състезателни подкани. Въпреки това резултатите от бенчмарковете не трябва да се разглеждат като цялостна мярка за реална сигурност.
За екипите по сигурността резултатите затвърждават необходимостта от многослойна защита около внедряването на ИИ. Организациите трябва да продължат да разделят доверените инструкции от ненадеждните данни, да ограничават правата на инструментите, да изискват потвърждение за чувствителни действия и да наблюдават дейността на агентите.
Лидерството в бенчмарка е полезно, но не прави инжектирането на подкана невъзможно. Атакуващите могат да променят своя злонамерен код, да експлоатират слабости в работния процес и да се прицелят в интеграциите, а не само в модела.
Ключовият оперативен въпрос е дали една система с изкуствен интелект може да откаже по безопасен начин (fail safely), когато срещне враждебно съдържание. Резултатът на Opus 5 показва сериозен напредък, като същевременно оставя предприятията отговорни за сигурната архитектура, тестването и реагирането на инциденти.
Лидерите в областта на сигурността трябва също така да провеждат симулации на червения екип (red-team exercises), които имитират злонамерени файлове, извлечено уеб съдържание и компрометирани източници на данни от трети страни, преди да предоставят на агентите широк достъп в реални работни процеси.