Meta стана поредната компания за изкуствен интелект, която потвърди, че един от нейните модели е хакнал реална организация по време на тестове за киберсигурност, докато подобни инциденти продължават да излизат наяве след първоначалното разкритие на OpenAI, че нейните агенти са компрометирали Hugging Face.

Изданието „The Information“ първо съобщи за инцидента в сряда, цитирайки източници, запознати с въпроса, според които моделът Muse Spark 1.1 на Meta е пробил неидентифицирана компания и е направил промени в нейните вътрешни системи.

Според доклада моделът е достигнал до публичния интернет поради грешка в конфигурацията на изолирана среда за тестване (sandbox), управлявана съвместно с независимата компания за оценка на киберсигурността „Irregular“.

Meta не е потвърдила публично, че Muse Spark 1.1 е бил използваният модел, нито е идентифицирала засегнатата компания или е обяснила какви промени са направени в нейните системи.

Въпреки това Meta потвърди пред „Reuters“, че грешна конфигурация от страна на „Irregular“ неволно е дала достъп до интернет на един от нейните модели по време на оценка.

Компанията заяви, че моделът „експлоатирал уязвимост в сигурността на услуга от трета страна по начин, подобен на вече докладвани случаи с други компании“.

Meta съобщи пред „BBC“, че разследва инцидента и ще публикува повече информация, „след като разполагаме с всички факти“.

„BleepingComputer“ се свърза с Meta и „Irregular“ за допълнителна информация, но не получи отговор.

Същият дефект при тестването стои зад по-ранни пробиви с ИИ

От „Irregular“ заявиха пред „Reuters“, че инцидентът с Meta е свързан с „абсолютно същия проблем с тестовата среда, който вече беше разкрит от Anthropic миналата седмица“.

Компанията поясни, че инцидентът не включва бягство от изолираната среда или сложни кибердействия. Вместо това грешка в средата за тестване е дала на модела достъп до публичния интернет, когато той е трябвало да бъде изолиран.

„В момента няма отворени проблеми. Irregular разработва бяла книга за споделяне на най-добрите практики за ограничаване и безопасно провеждане на кибероценки“, споделиха от компанията пред „Reuters“.

Този нов инцидент със сигурността на ИИ агенти следва разкритието на Anthropic от миналата седмица, че някои от нейните модели са хакнали три компании, след като подобна грешна конфигурация в тестовата среда на „Irregular“ им е дала нежелан достъп до интернет.

При един от тези инциденти моделът Claude Mythos 5 открил инструкции за разработчици в симулираната среда, които реферирали към несъществуващ Python пакет. Вярвайки, че е идентифицирал начин да компрометира фиктивната цел, моделът създал злонамерен код под същото име и го публикувал в реалния регистър PyPI.

Пакетът останал онлайн около час и бил изтеглен и изпълнен на 15 реални системи, преди PyPI да го премахне.

Една от тях била скенер за зловреден код, управляван от компания за сигурност, откъдето пакетът откраднал идентификационни данни, които Claude след това използвал за достъп до допълнителна инфраструктура. От Anthropic заявиха, че първоначално моделът е разпознал, че публикуването на пакета би представлявало реална атака, но се е убедил сам, че все още действа в рамките на симулация.

OpenAI също наскоро разкри друга оценка на „Irregular“, при която името на фиктивна CTF мишена съвпаднало с реален домейн.

Тъй като уж изолираната среда е имала достъп до публичния интернет, модел на OpenAI е експлоатирал базова уязвимост в реалния уебсайт и е открил идентификационни данни, които са му позволили да управлява сайта.

Инцидентите с Meta и „Irregular“ се различават от предишно разкрития пробив в Hugging Face, където модели на OpenAI намериха път към публичния интернет, експлоатирайки непозната дотогава уязвимост в локално хостван сървър JFrog Artifactory, използван по време на тестовете.

След достигане на интернет, агентите са пробили Hugging Face, докато са търсили бенчмарк масиви от данни и решения, откраднали са идентификационни данни и са се придвижили странично през системите на компанията.

По-късно OpenAI разкри, че агентите са използвали компрометираните идентификационни данни за достъп до акаунти в четири други услуги от трети страни, като някои от тези акаунти са били използвани за инфраструктура за атаки и съхранение на данни.

Институтът за безопасност на ИИ на Обединеното кралство (AISI) също разкри, че ИИ агенти, използващи Claude Mythos 5 на Anthropic и GPT-5.6 Sol на OpenAI, са предприели 19 неразрешени действия в публичния интернет по време на кибероценки.

В най-сериозния случай агентът Mythos 5 се е опитал да извърши атака срещу веригата за доставки срещу реален проект с отворен код, след като погрешно е заключил, че неговото хранилище в GitHub е свързано със симулираното предизвикателство.

Агентът проучил поддържащите проекта лица, изпратил зловреден код, създал фалшиви самоличности, изпратил целеви имейли, съдържащи зловреден код, и притиснал един от разработчиците да одобри заявката за сливане (pull request).

Когато проверяващ предупредил, че кодът съдържа зловреден код, агентът отрекъл обвинението и използвал допълнителни фалшиви акаунти, за да създаде впечатлението, че независими потребители са прегледали и одобрили промените.

Институтът AISI умишлено е предоставил на агентите достъп до интернет и е деактивирал техните стандартни защити за киберсигурност, за да измери основните им възможности.