Google представи Gemini 3.8 — най-новата си серия модели за разсъждение и програмиране, включваща специализирания вариант Gemini 3.8 Flash Cyber. Той е създаден с цел автономно откриване на софтуерни уязвимости и генериране на работещи корекции за тях.

Релийзът идва само три седмици след Gemini 3.7 Flash, отбелязвайки третото пускане на модел от ниво Flash на Google за шест седмици. И двата нови модела споделят една и съща архитектура, но са настроени за различни сценарии на внедряване.

Моделът с общо предназначение Gemini 3.8 Flash е насочен към продължителни задачи в софтуерното инженерство и агентни работни товари. Той предлага значителни подобрения спрямо 3.7 Flash, запазвайки същата начална цена от $0.75 за милион входящи токена и $3.75 за милион изходящи токена.

В бенчмарка DeepSWE v1.1 за сложни инженерни задачи той превъзхожда редица по-големи водещи модели на много по-ниска цена. Моделът постига и 54.9% на HLE-Verified, което отразява силни способности за многоетапно разсъждение в технически и професионални области.

Google отдава тези постижения на възможността на модела да извършва допълнителни стъпки за разсъждение и да използва инструменти итеративно при решаване на трудни проблеми.

Ориентираният към киберсигурността Gemini 3.8 Flash Cyber е достъпен ексклузивно за проверени екипи по сигурност чрез новата програма Fairwind Program на Google, предвид чувствителността на модел, обучен да открива уязвимости, подходящи за експлоатация.

В CyberGym — широко използван индустриален бенчмарк за откриване на уязвимости — моделът превъзхожда както своя предшественик 3.5 Flash Cyber, така и значително по-големи конкуренти.

При вътрешни тестове на Google, обхващащи двадесет езика за програмиране извън C/C++ фокуса на CyberGym, моделът е постигнал успеваемост над 70%.

Вместо да акцентира върху възможности за атакуване, Google съобщава, че съзнателно е приоритетизирал защитното отстраняване на уязвимости. В бенчмарка CWE-Bench моделът постига резултат pass@1 от 47.2%, като почти изравнява водещ модел (47.8%) при значително по-ниски разходи.

Екипът по сигурност на Chrome е установил, че моделът генерира 2.6 пъти повече коректни корекции за сигурност в сравнение с по-големи търговски съперници. Компанията за сигурност Wiz отчита с 7.5 до 9.7 процента по-висока точност при вътрешни тестове за проникване на по-ниска цена.

В един от случаите екипът Cloud Vulnerability Research на Google е използвал модела, за да разкрие критична фундаментална уязвимост за под два часа — процес, който обикновено отнема месеци ръчно проучване.