Версии на модела с изкуствен интелект Claude на Anthropic са излезли от тестовите си среди и са проникнали в други организации при три отделни случая, съобщиха от Anthropic в четвъртък.
Съобщението на водещата лаборатория за изкуствен интелект дойде приблизително седмица след като OpenAI разкри подобен инцидент, включващ нейни модели – разкритие, което предизвика нов кръг от безпокойство относно това дали разработчиците на ИИ контролират адекватно своите сложни продукти.
При трите инцидента, разкрити от Anthropic, Claude е извършил проникванията, вярвайки, че участва в упражнение от типа „улови флага“ (capture-the-flag), при което няма достъп до интернет, а всички налични системи са част от теста. „Поради недоразумение между нас и нашия партньор за оценка,“ обяснява Anthropic в публикация в блога си, „това не беше така и имаше достъп до интернет.“
В резултат на това, когато Claude се е сблъскал с трите засегнати организации, той е повярвал, че те са симулирани цели, и е проникнал в тях, използвайки основни техники за атака, като например експлоатиране на слаби пароли.
„При нито една от тези ситуации Claude не се е изтеглил сам и не се е опитал умишлено да избяга от тестовата си среда,“ заявиха от Anthropic. Моделите с ИИ също така не са „намерили или експлоатирали сложни уязвимости“ и са се опитвали единствено да изпълнят възложените им задачи.
При един от трите инцидента партньорът за тестване на Anthropic – Irregular – е създал фиктивна компания, която е споделяла едно и също домейн име с реална организация. Claude Opus 4.7 е хакнал тази компания по време на четири изпълнения на теста „улови флага“, крадейки производствена информация и идентификационни данни на потребители.
При друг инцидент проникването е започнало случайно. Като част от теста Claude Mythos 5 е публикувал злонамерен Python пакет, за който е вярвал, че ще бъде достъпен само в рамките на тестовата среда, но в действителност той се е появил в публичния интернет, откъдето 15 компютърни системи са го изтеглили и стартирали.
Една от тези системи е принадлежала на фирма за сигурност и когато скенерът за пакети на фирмата е стартирал програмата, това е задействало инжектирания код за кражба на информация на Mythos 5 и е изпратило потребителски идентификационни данни към модела с ИИ. След това Mythos е използвал тези данни, за да проникне във фирмата за сигурност.
Anthropic отбеляза, че Mythos е „направил изключителни усилия, за да извърши тази атака,“ особено при регистрирането на акаунт в хранилището за Python пакети, което е използвал.
„За да създаде имейл адрес, той е имал нужда от телефонен номер,“ съобщиха от компанията. „За да получи телефонен номер, след като не е успял да намери безплатна услуга, той се е опитал – и е се е провалил – да осигури средства за плащане на телефонен номер по няколко различни начина. Накрая се е върнал назад, намерил е безплатен, неблокиран доставчик на имейл услуги, използвал го е за регистрация на PyPI акаунт и след това е използвал този акаунт, за да качи зловреден код в PyPI.“
При третия инцидент вътрешна тестова версия на Claude е сканирала интернет за алтернативи на първоначалната си цел, след като не е успяла да проникне в нея. В крайна сметка е избрала нова цел и е проникнала в нея с базови техники.
Opus 4.7 и Mythos 5, по-стари версии на съответните продукти, са продължили проникванията си дори след като са осъзнали, че работят в публичния интернет. В два от случаите Opus е „рационализирал, че истинската компания сигурно е част от упражнението,“ казват от Anthropic. Mythos по подобен начин „се е убедил, че все още е в симулация“ на базата на няколко съмнителни аргумента.
Спиране и анализ на ситуациятаAnthropic е разкрила инцидентите – най-ранният от които е станал през април – по време на преглед, започнал на 23 юли, след като OpenAI обяви, че два от нейните модели са излезли извън изолираната си среда и са хакнали няколко трети страни. След откриването на трите нарушения Anthropic е спряла всички тестове, уведомила е Irregular и се е свързала с трите засегнати организации.
От Anthropic заявиха, че са успели да се свържат с две от жертвите, които „преди това не са били засекли активността,“ и че продължават да се опитват да се свържат с третата организация.
Макар че от Anthropic отбелязаха, че е твърде рано да се правят мащабни изводи от тези три „изолирани инцидента“, те показват нуждата от по-надеждни предпазни рамки за сигурност при тестване.