Компанията Irregular предостави подробности за разследване на инцидент при оценка на киберсигурността на изкуствен интелект (ИИ), при който неволен достъп до интернет е позволител на модели да си взаимодействат с реални системи.

От компанията заявиха, че проблемът е бил локализиран и коригиран преди първото публично оповестяване на 30 юли, като не са останали активни проблеми. Инцидентът е засегнал един сценарий за оценяване, а не няколко отделни пробива.

Irregular посочи, че не е открила доказателства за компрометиране на системи на клиенти или изтичане на клиентски данни. Засегнатите страни са уведомени, докато компанията е забавила пълния си доклад, за да го съгласува с процесите по разкриване на информация на клиентите.

Irregular настоява за сигурни стандарти за авангарден ИИ

Irregular провежда оценки на киберсигурността на авангардни лаборатории за ИИ преди пускането на нови модели. Тези тестове анализират дали даден модел може да планира, проучва и изпълнява многоетапни работни процеси за кибератаки. Подобни симулации могат да включват разузнаване, откриване на идентификационни данни, опити за експлоатация, достъп до данни и поведение за избягване на разкриването.

Компанията сподели, че реалистичните кибероценки понякога изискват контролиран достъп до интернет, тъй като реалните атакуващи разчитат на онлайн услуги, публични хранилища с код, уязвимости и изложена на риск инфраструктура.

Въпреки това, този достъп създава и риск от излизане от изолираната среда, ако даден модел сбърка външна цел с част от симулираната среда. В докладвания случай инженерите са избрали измислено име на компания за сценарий с вътрешна заплаха, включващ неоторизиран достъп до база данни.

Смятало се е, че името е измислено, но то е съвпаднало с реален и сравнително слабо известен интернет домейн. Докато повечето пускания на моделите са останали в рамките на предвидената лабораторна среда, малък брой от тях са се опитали да осъществят достъп до реалния домейн.

Тъй като достъпът до интернет е бил разрешен, някои модели са третирали реалния домейн като част от оценката. В отделни случаи някои модели са извършили офанзивни действия, включително експлоатиране на уязвимости, извличане на идентификационни данни и опит за достъп до производствена база данни.

В един от случаите моделът е достигнал до уебсайт с подобно име и е открил идентификационни данни, които вече са били публично компрометирани. Компанията подчерта, че инцидентът не демонстрира необичайно поведение от страна на конкретен авангарден модел.

Според Irregular в компрометирания домейн са липсвали няколко основни защити за сигурност, което го е направило сравнително лесен за компрометиране от съвременните авангардни модели. Подобно поведение се е наблюдавало рядко — при по-малко от 1 на 10 000 напреднали симулации и често едва след стотици стъпки на взаимодействие.

Irregular е деактивирала засегнатата оценка, прегледала е съответните регистрационни файлове и е добавила предпазни мерки, предназначени да предотвратят подобни грешки. Компанията разширява ръчния преглед на активността на моделите и сформира вътрешен екип, фокусиран върху подлагането на тест на предположенията относно контрола на достъпа, ограниченията на средата и поведението на моделите.

Инцидентът също така подчертава сериозен проблем с мониторинга при кибероценките на ИИ. Средата за оценка генерира голям обем активност, която по дизайн може да наподобява реални атаки. Традиционните инструменти за засичане могат да маркират легитимно поведение при тестване като злонамерено, което затруднява идентифицирането на редки действия, пресичащи границата на изолираната среда.

Планира се публикуването на бяла книга от Irregular относно практиките за сигурни оценки. Очаква се документът да разгледа по-ясна документация за настройка, по-строг мониторинг на регистрационните файлове, по-бърза координация при инциденти, сигурно споделяне на форензични доказателства (като транскрипти на модели) и периодични проверки за конфликти между имена на измислени сценарии и новорегистрирани реални домейни.

Тъй като системите с ИИ, притежаващи кибервъзможности, стават все по-напреднали, доставчиците на оценки ще се нуждаят от по-силни контроли за дълбочинна защита. Те трябва да включват строго филтриране на изходящия трафик, списъци с разрешени домейни, пренасочена инфраструктура (sinkholed), автоматизирани сигнали в реално време, човешки преглед на високорискови действия и непрекъснато валидиране, за да се гарантира, че симулираните цели не могат да се съпоставят с реални системи.

Инцидентът затвърждава основно предизвикателство пред безопасността на авангардния ИИ: оценките трябва да бъдат достатъчно реалистични, за да идентифицират опасни възможности, но и достатъчно изолирани, така че тестването на тези възможности да не причинява реална вреда.