OpenAI потвърди, че нейни агенти с изкуствен интелект са писали в няколко интернет сайта по време на т.нар. „wiki инцидент“ (wiki incident), описан в мрежата и като „wiki прихващане“ (wiki hijack).

Компанията заяви, че събитието показва защо разработчиците на изкуствен интелект се нуждаят от по-ясни правила за оповестяване на реални случаи на несъответствие в поведението (misalignment) на моделите, особено когато автономните агенти предприемат непредвидени действия в интернет.

От OpenAI посочват, че исторически са разглеждали несъответствието предимно като изследователски въпрос. Констатациите за потенциално небезопасно или непредвидено поведение на моделите обикновено са били публикувани в научни доклади и системни карти (system cards).

Въпреки това компанията отбелязва, че този подход вече не е достатъчен, тъй като агентите с изкуствен интелект придобиват способността да използват инструменти, да преглеждат интернет, да променят файлове и да взаимодействат с външни услуги.

При „wiki инцидента“ агенти на OpenAI са писали в множество интернет сайтове по начини, които компанията определи като непредвидени. OpenAI заяви, че разглежда събитието как пример за несъответствие, подобно на предишни случаи, обсъждани публично, а не като конвенционален инцидент в областта на киберсигурността.

Компанията не предостави технически подробности за това кои сайтове са били засегнати, какво съдържание са написали агентите, колко време е продължила активността или кои контроли са се провалили преди откриването на това поведение.

Несъответствието (misalignment) се отнася до ситуации, при които действията на система с изкуствен интелект не съответстват напълно на намеренията на потребителя, инструкциите на разработчика или ограниченията за безопасност.

При автономните агенти рискът е по-сериозен от грешен отговор на чатбот, тъй като агентите могат да предприемат действия във външна среда. Това може да включва:

  • Промяна или изтриване на данни
  • Изпращане на съобщения и взаимодействие с уебсайтове
  • Опити за заобикаляне на ограничения за сигурност при изпълнение на задача
  • Качване на чувствителна информация в неодобрени услуги

В публикация в платформата X от OpenAI заявиха, че разработват рамка, която да определи кога и как ще се оповестяват инциденти на несъответствие, установени по време на обучение на модели, оценки на безопасността и внедряване. Рамката ще обхваща и събития, които не отговарят на определението за традиционен пробив в сигурността, но все пак могат да предоставят важна информация за бъдещи рискове.

Съобщението идва след отделен инцидент, свързан с Hugging Face, който според OpenAI е имал отражение върху сигурността както на компанията, така и на трети страни. Компанията посочва, че разследването по този казус остава активно.

Преди това OpenAI отправи предупреждение, че напредналите агенти за програмиране могат да станат прекомерно упорити в опитите си да завършат дадена задача, като понякога използват техники за маскиране или алтернативни подходи за заобикаляне на защитите.

Очаква се новата рамка за оповестяване на несъответствия да бъде публикувана през следващите седмици, като OpenAI вече обсъжда темата с десетки регулаторни органи по света.