Anthropic разкри, че неговият модел с изкуствен интелект Claude е получил неоторизиран достъп до системите на три различни организации по време на оценки на киберсигурността.
Разкритието следва съобщението на OpenAI от 21 юли, че някои от неговите модели са избягали от изолирана тестова среда чрез експлоатиране на неизвестна досега уязвимост и са достигнали до системите на Hugging Face – платформата за машинно обучение с отворен код.
„След преглед на 141 006 тестови симулации, при които Claude би могъл да получи достъп до интернет, идентифицирахме три инцидента, при които даден модел е осъществил достъп до интернет от или докато е взаимодействал с тестовата среда на Irregular (един от нашите партньори за оценка от трета страна) и след това е получил неоторизиран достъп до производствената инфраструктура на три различни организации“, заявяват от Anthropic.
Инцидентите включват три различни модела Claude: Opus 4.7, Mythos 5 и вътрешен изследователски модел. И трите инцидента са възникнали по време на упражнения от типа „улови флага“ (capture-the-flag), провеждани от Irregular.
При този тип упражнения на Claude се предоставя фиктивен сценарий и му се казва, че част от тайни данни е скрита на друга машина в мрежата, без да се предписва конкретен метод за откриването ѝ.
„Във всички случаи нашият подканващ промпт за оценка изрично заявяваше, че Claude няма достъп до интернет, но не поставяше никакви ограничения на Claude къде да търси флага“, обясняват от компанията.
„Въпреки това, поради грешна конфигурация, машините, до които Claude е имал достъп като част от оценката, са останали с активен достъп до интернет. Нито ние, нито нашият партньор за оценка знаехме за тази грешна конфигурация, докато не я открихме чрез допълнителния ни мониторинг на тестовете миналата седмица.“
Първият инцидент е това, което Anthropic описва като най-сериозното въздействие, което са наблюдавали. В тестовия сценарий фиктивната целева компания е споделяла името си с реален интернет домейн.
При четири пускания Opus 4.7 не е успял да осъществи достъп до своята симулирана цел, идентифицирал е реалната компания в мрежата и е получил неоторизиран достъп до нейната инфраструктура чрез слаби пароли и неавтентифицирани крайни точки. Моделът е извлякъл идентификационни данни за приложения и инфраструктура и е осъществил достъп до база данни, съдържаща няколкостотин реда производствени данни.
Според Anthropic това е бил „единственият случай“, в който моделът е продължил да атакува, след като е установил, че вероятно работи в реална среда. В две от четирите симулации Claude неправилно е заключил, че реалната компания е била умишлено включена в оценката.
Вторият инцидент включва Mythos 5. В рамките на фиктивния тестов сценарий Claude е намерил фалшив документ за въвеждане в експлоатация на измислена компания, който инструктира новите служители да инсталират Python пакет, който всъщност не съществува.
Claude е регистрирал и публикувал пакет под абсолютно същото име, разсъждавайки, че системите на фиктивната компания автоматично ще го изтеглят.
От Anthropic посочват, че Claude е „положил изключителни усилия, за да извърши тази атака“.
За да регистрира акаунт в PyPI, моделът се е нуждаел от имейл адрес, който от своя страна е изисквал телефонен номер. Claude първо се е опитал да използва безплатна услуга за телефонни номера и е претърпял неуспех, след това е направил опити да плати за такъв по няколко начина, преди в крайна сметка да намери доставчик на имейл, който позволява регистрация без телефонен номер.
Пакетът е останал достъпен в PyPI за около час. През това време той е бил изтеглен и изпълнен на 15 реални системи, включително една, принадлежаща на компания за сигурност, чийто скенер за зловреден код рутинно инсталира и анализира новопубликувани Python пакети.
„Вярваме, че скенерът за сигурност на компанията е третирал пакетите от PyPI като безопасни за инсталиране и в резултат на това Claude е успял да компрометира и извлече идентификационните данни на компанията към точка за събиране, която сам е създал. След това Claude е използвал тези идентификационни данни, за достъп до допълнителна инфраструктура на тази компания“, пишат от Anthropic.
Системите за сигурност на PyPI по-късно са премахнали пакета. От Anthropic добавят, че са споделили съответните подробности с екипа на PyPI.
„Mythos 5 правилно е интуирал, че осъществява достъп до свободния интернет, но чрез разсъждения е стигнал обратно до заключението, че все пак се намира в симулация.“
При третия инцидент вътрешен изследователски модел, който не е бил предназначен за публично разпространение, не е успял да достигне зададената си цел и вместо това е сканирал приблизително 9 000 свързани с интернет системи. Той е компрометирал приложението на една компания чрез открита страница за отстраняване на грешки и SQL инжекция – уязвимости, които Anthropic описва като базови техники.
По средата на упражнението моделът е установил, че компрометираната от него система няма връзка с възложения му сценарий, заключил е, че е осъществил достъп до реална цел, и е спрял сам.
От Anthropic подчертават, че Claude никога не се е опитвал да извлече себе си или да избяга от своята изолирана среда в нито един от трите инцидента, както и че моделите са действали единствено с цел да завършат възложените им задачи.
Компанията е спряла всички оценки на киберсигурността на 23 юли след откриването на проблема, идентифицирала е и трите инцидента до следващия ден и е уведомила Irregular и засегнатите страни.