Microsoft пусна първия си специализиран модел за киберсигурност в рамките на MDASH — своята система за идентифициране и отстраняване на уязвимости с множество модели.

Компанията споделя, че MDASH, използвайки MAI-Cyber-1-Flash и GPT-5.4, е постигнал резултат от 95,95% на CyberGym. Тя също така твърди, че тази конфигурация струва с 50% по-малко от настоящата й най-добра MDASH комбинация от GPT-5.4, GPT-5.4 mini и GPT-5.3 Codex. Достъпът е ограничен до одобрени клиенти на MDASH чрез ограничена предварителна версия в Azure AI Foundry.

MAI-Cyber-1-Flash е проектиран да се справя с до 90% от задачите на MDASH, като GPT-5.4 е запазен за най-трудните 10%. Той е наличен само в рамките на MDASH, а не като самостоятелен публичен модел или приложно-програмен интерфейс с общо предназначение.

Водещият резултат принадлежи на MDASH, работещ с MAI-Cyber-1-Flash съвместно с GPT-5.4, а не на самия нов модел самостоятелно. CyberGym Level 1 е тест за възпроизвеждане на известни уязвимости. Той предоставя на агента описание на уязвимостта и съответния изходен код без инсталирани корекции за сигурност, след което проверява дали той може да генерира работещ прототип за експлоатация (proof of concept). Тестът не измерва скритото откриване на уязвимости или дали генерираната корекция за сигурност е правилна.

Публичната класация на CyberGym не включваше резултата от 95,95% на Microsoft при проверка на 28 юли 2026 г. В нея все още фигурираше подаването на Microsoft от 12 май с 88,4%. Публичните материали на Microsoft не уточняват дали резултатът е бил изпратен за вписване.

По-ранният резултат на Microsoft от 96,55% на MDASH не изяснява сравнението. Тази юнска цифра отчиташе всеки срив, включително уязвимости извън целта. Материалите от юли не казват дали резултатът от 95,95% използва същия критерий, така че двата резултата не могат да се тълкуват със сигурност като тенденция за подобряване на производителността.

Според продуктовата спецификация (model card) на Microsoft, MAI-Cyber-1-Flash е трансформър с разредена смес от експерти (sparse mixture-of-experts) със 137 милиарда общи параметъра, 5 милиарда активни параметъра и контекстен прозорец от 256 000 токена. Той представлява донастроен за киберсигурност вариант на MAI-Code-1-Flash, разработен от междинна контролна точка при обучението на MAI-Thinking-1.

Спецификацията посочва, че оценяваната конфигурация е заменила 80% от съществуващите модели на MDASH и е повишила отчетения резултат на CyberGym от 88,4% на 95,95%. Цифрата от 80% представлява делът на подменените модели. Отделната цифра от 90% е максималният дял задачи, с които Microsoft твърди, че по-малкият модел може да се справи.

Взети заедно, оповестените данни сочат маршрутизирането като основно технологично предимство: MAI-Cyber-1-Flash има за цел да обработва по-голямата част от задачите, GPT-5.4 поема най-трудната останала част, а Microsoft отчита крайния резултат на ниво система MDASH.

Съобщението за пускане на Microsoft дефинира спестяването от 50% спрямо текущия най-добър микс от модели на MDASH: GPT-5.4, GPT-5.4 mini и GPT-5.3 Codex. Продуктовата страница отделно описва системата като предоставяща „сравнима производителност на 50% от цената на водещите модели“. Съобщението и спецификацията на модела не разкриват потреблението на токени, обема на повикванията, закъснението (latency), комбинацията от задачи или разпределението на изчислителния ресурс зад това сравнение, така че цифрата все още не може да бъде независимо възпроизведена или нормализирана спрямо други системи.

„Моделът е един входен компонент, системата около него е продуктът.“

Тесу Ким, вицепрезидент на Microsoft по сигурността на агентите, използва това разграничение при описанието на MDASH през юни. При олекотена терминална рамка спецификацията на модела отчита резултати от 0,314 на CVEBench, 0,553 на заплахите на CyberSecEval4, 0,33 на неговия тест за анализ на зловреден код и 0,651 на CRSBench при POV=1200.

Моделът постигна нулев резултат в категориите за ядро, потребителско пространство и браузър на ExploitGym, който изисква от агентите да превърнат предоставените уязвимости и сриващи се входни данни в работещи експлоати за изпълнение на код. Тези резултати идват от различни задачи и скали за оценяване, така че нито един от тях не е самостоятелен резултат на CyberGym за MAI-Cyber-1-Flash.

Microsoft заяви, че всички бенчмарк тестове са проведени в мрежово изолирана среда без достъп до производствени системи, публичния интернет или външни услуги. Спецификацията на модела също така предупреждава, че генерираният текст и код могат да бъдат неточни или непълни и трябва да бъдат прегледани преди съществена употреба.

Управлението на софтуерни уязвимости с използване на MAI-Cyber-1-Flash в MDASH е първият сценарий, който Microsoft обявява за Project Perception — нейната по-широка система за координиране на защитни агенти за сигурност. Планира се Project Perception да влезе в публична предварителна версия на 3 август, като Microsoft възнамерява да разшири модела извън работата по софтуерни уязвимости към допълнителни работни процеси за сигурност.