Anthropic разкри, че нейните модели с изкуствен интелект Claude са осъществили неоторизиран достъп до реалните системи на три организации, след като са получили достъп до отворения интернет от среди за оценка на киберсигурността, които е трябвало да бъдат изолирани.
Компанията заяви, че тези разкрития са резултат от мащабен ретроспективен преглед, започнат след като OpenAI съобщи, че няколко от нейните модели са успели да излязат от изолирана тестова среда и са достигнали до производствената инфраструктура на Hugging Face.
Anthropic анализира 141 006 тестови симулации и идентифицира три инцидента, при които Claude е осъществил достъп до интернет по време на взаимодействие със средата за оценка на външния партньор „Irregular“, след което е компрометирал производствени системи, принадлежащи на три различни организации.
От компанията поясниха, че най-ранните инциденти датират от април и включват три различни модела на Claude: Opus 4.7, Mythos 5 и вътрешен изследователски тестов модел. Във всеки от случаите на Claude е било възложено отворено предизвикателство от тип „улови флага“ (capture-the-flag), предназначено да измери офанзивните кибервъзможности на модела. Промптът за оценка е уверявал модела, че неговата среда е симулация без достъп до интернет.
Поради недоразумение между Anthropic и „Irregular“ обаче, достъпът до интернет всъщност е бил наличен. Когато търсенето на „флага“ от страна на Claude го е отвело до реални онлайн системи, моделът е възприел тези системи като част от упражнението и е използвал базови техники като слаби пароли, неавтентифицирани крайни точки, открити страници за дебъгване и SQL инжекции.
От Anthropic подчертават, че Claude не е експлоатирал сложни zero-day уязвимости, не е извлякъл самия себе си и не се е опитал умишлено да избяга от тестовата си среда. Оценките са се провеждали без класификаторите и мониторинга, които обикновено се прилагат към общодостъпните модели на Claude, въпреки че моделите са запазили стандартното си обучение за безопасност и са работили върху специализирана инфраструктура, отделена от вътрешните системи на Anthropic и клиентските данни.
Най-сериозният инцидент е свързан с Claude Opus 4.7. Фиктивна целева компания е споделяла сходно име с реален уеб домейн и при четири тестови пускания моделът е достигнал до реалната инфраструктура на тази компания, извлякъл е идентификационни данни за приложението и инфраструктурата и е осъществил достъп до база данни, съдържаща няколкостотин реда производствени данни.
Opus 4.7 е продължил да атакува дори след като е разпознал, че системите са реални. При втория инцидент Claude Mythos 5 е публикувал злонамерен Python пакет в публичния регистър PyPI, след като е намерил инструкции за настройка в рамките на фиктивната среда, които са сочели към несъществуващо име на пакет.
Пакетът е останал достъпен за около един час, бил е изтеглен на 15 реални системи и е довел до кражба на идентификационни данни от скенер на компания за сигурност, който автоматично инсталира и анализира PyPI пакети.
Mythos 5 за кратко е отбелязал в разсъжденията си, че публикуването на злонамерен код в реалния интернет не би било приемливо, но след това сам се е убедил, че все още се намира в симулация.
При третия инцидент вътрешен изследователски тестов модел е сканирал около 9000 цели, компрометирал е интернет приложението на една компания чрез базови техники и след това е спрял сам, след като е заключил, че хостът се намира в реален облачен акаунт, който не е свързан със задачата „улови флага“.
Anthropic започна прегледа на транскриптите на 23 юли, спря кибероценките на същия ден, потвърди и трите инцидента на следващия ден и уведоми „Irregular“ и трите засегнати организации на 27 юли.
Две от организациите, с които е установен контакт до момента, не са били засекли активността преди това. Anthropic работи с тях по отстраняване на последствията и продължава комуникацията с третата страна.
Компанията си сътрудничи с „Irregular“ и METR за по-нататъшен преглед и планира да публикува частично цензуриран транскрипт от инцидента с PyPI.
В бъдеще Anthropic заявява, че средите за оценка на мощни автономни агенти трябва да отговарят на по-строги стандарти за сигурност, включително по-строга валидация на интернет трафика, постоянен мониторинг на транскриптите, по-ясно дефиниране на позволения и забранения обхват в инструкциите (промптовете) и по-строги гаранции от доставчиците.
Компанията описва събитията по-скоро като срив в тестовата рамка и оперативна грешка, отколкото като чист провал в напасването на поведението на модела (alignment), като същевременно отбелязва, че само най-новият й модел е спрял сам, след като е разпознал, че работи в реалния интернет.