NVIDIA и още 36 организации създадоха Open Secure AI Alliance (Алианс за отворен и сигурен изкуствен интелект) с цел разработване и споделяне на отворени технологии, техники и инструменти за защита на софтуер и агенти с изкуствен интелект (ИИ).
Групата от 37 членове обхваща компании в сферата на облачните услуги, сигурността, корпоративния софтуер и ИИ, включително Microsoft, Cisco, Cloudflare, CrowdStrike, Hugging Face, IBM, Palo Alto Networks, Red Hat и Linux Foundation.
Обявеният обхват на дейност покрива целия стек на агентите, включително идентификация, разрешения, изолиране, предпазни огради (guardrails), регистрационни файлове, формати на модели, многомоделно сканиране и работни процеси за сигурно писане на код.
Идеята е, че защитниците в киберпространството се нуждаят от ИИ модели, които могат да четат, променят и изпълняват на собствен хардуер, а не само от затворени системи, достъпни през приложния програмен интерфейс (API) на даден доставчик.
Стартирането носи и първия му наименован технически принос: NVIDIA-labs OO Agents (NOOA) — изследователска рамка под лиценз Apache 2.0, проектирана да улесни тестването, проследяването, одита и управлението на поведението на агентите. Материалите по стартирането не включват устав, управителен съвет, технически работни групи, график на изпълнение или споделено хранилище на алианса, а самостоятелният му уебсайт все още е в процес на изграждане.
Медията The Hacker News се свърза с NVIDIA за подробности относно управлението на алианса, ангажиментите на членовете и първите планирани резултати, и ще актуализира тази история при получаване на отговор.
Първият код идва с предупреждение за изолирана среда
Прикачното устройство на агента (agent harness) е софтуерният слой около модела, който представя контекста, изпълнява действия, управлява състоянието и решава кога дадена задача е завършена. В NOOA този слой е представен като Python клас. Полетата съхраняват състоянието му, методите разкриват възможностите му, документационните низове (docstrings) действат като подкани (prompts), а анотациите за типове дефинират договорите, които моделът трябва да спазва.
Метод, съдържащ тяло с многоточие (...), се попълва по време на изпълнение от цикъл, управляван от голям езиков модел (LLM). Метод, съдържащ обикновен Python код, остава детерминистичен. Същата структура позволява на разработчиците да използват познати процеси за тестване, проследяване, контрол на версиите и рефакториране, вместо да разделят поведението на агента между подкани, схеми на инструменти, обратни повиквания (callbacks) и графики на работния процес.
В собствената си оценка NVIDIA съобщава, че рамката е постигнала резултат от 86.8% на теста за повторно откриване на уязвимости CyberGym L1, използвайки GPT-5.5, при блокиран достъп до мрежата и приложени проверки на базата на правила за всяка траектория.
Хранилището е също толкова директно по отношение на риска. NOOA може да бъде конфигуриран да изпълнява генериран от LLM Python код, който може да предава лични данни, да изтрива файлове или да променя средата си. Неговите проверки на абстрактното синтактично дърво (AST) и списъците с забранени модули са описани като контроли за дълбочинна защита, „а не като граница за ограничаване“.
NVIDIA поставя ограничаването извън самата NOOA. Агентите, които изпълняват генериран код, трябва да работят зад изолация на ниво операционна система, като например контейнер, виртуална машина или нейната изолирана среда OpenShell. NOOA осигурява инспекция и проследяване; изолираната среда на ниво ОС е границата за ограничаване.
Преглед на публичното хранилище от 27 юли установи маркер (tag) v0.0.6 с дата 22 юли. Ръководството за пускане на версии на проекта гласи, че маркирането на комит е церемонията по пускане на версията, а прикачването на компилирани пакети (wheels) към отделно издание в GitHub е незадължително.
Ръководството за сътрудничество посочва, че разработката се поддържа от NVIDIA, като външни приноси са добре дошли чрез заявки за изтегляне (pull requests). Хранилището няма управление на коренно ниво или файл с пътна карта.
Инцидентът с Hugging Face се превърна в основния аргумент
NVIDIA свърза аргументите на алианса в полза на локално контролирани защитни модели с юлското проникване в Hugging Face, където система от автономни агенти компрометира части от производствената инфраструктура на компанията.
Hugging Face идентифицира неразрешен достъп до ограничен набор от вътрешни масиви с данни (datasets) и няколко идентификационни данни, използвани от нейните услуги. Тя не откри доказателства за подмяна на публични модели, масиви с данни, Spaces, контейнерни изображения или публикувани пакети.
От Hugging Face заявиха, че първоначалният достъп до средата им е осъществен чрез злонамерен масив с данни, който е злоупотребил с отдалечено зареждане на данни и инжектиране на шаблони в конфигурацията на масива. Дейността е прогресирала до достъп до хостове (nodes), събиране на идентификационни данни и странично движение (lateral movement) в няколко вътрешни клъстера.
Компанията сподели, че е пуснала агенти за анализ, управлявани от LLM, върху повече от 17 000 записани действия, за да възстанови хронологията, да извлече индикатори за компрометиране и да картографира засегнатите идентификационни данни. Търговски хостваните API на водещи модели първоначално са отхвърляли командите за атака, инжектирания злонамерен код и артефактите за командване и управление, необходими за анализа.
Вместо това компанията е стартирала модела с отворени тегла GLM 5.2 на собствена инфраструктура, което също така е запазило данните за атаката и реферираните идентификационни данни в нейната среда. Техният оперативен съвет е „да имате на разположение способен модел, който можете да изпълнявате на собствена инфраструктура, тестван и готов преди възникването на инцидент“.
В този случай предимството е било оперативният контрол. Инцидентът не установява отвореността на модела като заместител на идентификацията, изолацията или ограничаването.