Pull request пристига с чист отчет за грешка в описанието. Бот го прочита преди всеки човек, извлича няколко конзолни команди от него, получава одобрение за тях и публикува резултата обратно в нишката. Поддържащият проекта чете целия разговор на следващата сутрин.
Елад Мегед, съосновател и инженер в Novee Security, изпълни тази последователност срещу хранилищата на трима доставчици, в конфигурациите, които те доставят по подразбиране. Работният поток на Anthropic предава тайни ключове. Всяка организация, която стартира един от тези агенти в конфигурация по подразбиране, носи същия риск.
Агентът е модел плюс рамка (harness). Моделът генерира намерението. Рамката превръща това намерение в конзолни команди, четене на файлове, API повиквания и мрежови заявки, и съдържа логиката за одобрение, разрешенията за инструментите, ограниченията на пътищата и обработката на изходните данни. Когато един работен процес се изпълнява без човек да проверява всяка стъпка, рамката се превръща в граница за сигурност.
Мегед изгражда ИИ агенти за автоматизирано тестване за проникване в Novee и насочи същите офанзивни техники обратно към самите агенти.
„Във всеки случай инжектирането на подкана (prompt injection) беше само механизмът за доставка, но действителните уязвимости бяха в начина, по който рамката вземаше решения за доверие и как тези решения се съчетаваха между различните етапи. Една команда се одобрява, защото изглежда безопасна. Изходният резултат се публикува, защото това е поведението по подразбиране. Нито едно от двете решения не е грешно само по себе си. Заедно обаче те съставляват верига за източване на данни. Ако наблюдавате само слоя на подканите, никога няма да видите предаването на данни, при което едно „безопасно“ решение захранва следващото“, сподели Мегед пред Help Net Security.
Мегед докладва множество констатации срещу Claude Code Action – конфигурацията по подразбиране за работния процес на anthropics/claude-code. Милиони хора инсталират този пакет.
„Докладвахме разкритие, те отстраняваха уязвимостта и в процеса на коригиране начертаваха наново линията около това какво се счита за безопасно. Самата корекция за сигурност ни казваше къде се е преместила границата, което ни показваше точно къде да търсим след това“, каза той.
Anthropic присъди награди за открити бъгове (bounties) в различните кръгове.
„Важно е да се подчертае, че техните корекции не бяха неадекватни или мързеливи. Anthropic изпълнява десетки проверки в този работен поток и всяка корекция за сигурност затваряше конкретната дупка, но проблемът беше, че атаките ставаха все по-трудни за откриване с всеки кръг. До последния кръг възстановявахме тайни ключове през канал, който оцеля след всяка предишна корекция: без изходяща връзка към атакуващия, без записи, без регистрационни файлове (logs)“, каза Мегед.
„Програмата за награди възнаграждава констатация, ограничена до „ето конкретна грешка, ето колко струва тя“, така че доставчикът може да плаща щедро кръг след кръг и пак да третира всеки случай като изолиран“, допълни Мегед.
„За да сме честни, изплащането на наградите е правилното решение и те се отнесоха добре с нас, така че не виждам зловредно намерение в действията им. Въпреки това, когато един и същ изследовател продължава да разбива един и същ архитектурен шев от различни ъгли, а всяко коригиране просто премества границата към следващата повърхност, моделът „награда за всяко заобикаляне“ всъщност създава измамен сигнал: той казва „считаме това за приключено“, когато същинският риск не е премахнат. Така че формулировката е важна; Google нарече своята промяна „Обновяване на модела на доверие“, което описва проблема структурно.“
Консултативният документ на Google носи оценка 10.0.
Gemini CLI работи на google-gemini/gemini-cli – хранилище с над 100 000 звезди. Мегед демонстрира веригата на компрометиране там, използвайки конфигурацията за сигурност, която документацията на Google препоръчва за CI работни процеси, обработващи ненадеждни входящи данни. Ограничение, конфигурирано от оператора, се оказа неприложено в момента на изпълнение.
Разкритието беше публикувано като част от GHSA-wpqr-6v78-jr5g. Сериозността е на самия връх на скалата на CVSS.
Изолираната среда на OpenAI защитава пътищата, за които знае.
Codex CLI се доставя с изолирана среда по подразбиране при всяко внедряване. При многоетапни работни процеси, които споделят общо работно пространство, състоянието, записано от един етап, се приема като доверен контекст от следващия. Списъкът със защитени пътища носи набор от предположения за това какво се нуждае от защита.
Anthropic изгради слоеве от проверки в своя работен поток, Google изгради множество режими на изпълнение със саниране на средата, а OpenAI създаде изолирана среда със защитени пътища. Защитите съществуват. Те се провалят при предаването на данни между етапите.
„Структурната корекция спира да се доверява на етикета и валидира отново доверието в точката на използване, а не само в точката на вземане на решение. В момента рамките правят преценка за безопасност на ранен етап – „тази команда е само за четене“, „този домейн е предварително одобрен“ – и компонентите надолу по веригата наследяват тази оценка, без да проверяват дали тя все още е валидна в техния контекст. Команда за четене, захранваща публичен канал за изходни данни, на практика не е само за четене. Предварително одобрен домейн, обслужващ контролирано от атакуващия съдържание, на практика не е безопасен“, каза Мегед.
„Един доставчик абсолютно може да внедри значителни подобрения и някои вече го направиха след нашите разкрития. Но моделът се повтаря при трите тествани от нас доставчици, което предполага, че има споделено архитектурно предположение в начина, по който рамките на агентите се изграждат в цялата индустрия. Дали това изисква формален стандарт или просто общо разбиране...“