Z.ai пусна GLM-5.3 – нов модел с изкуствен интелект, създаден за справяне със сложно програмиране, продължителни задачи на агенти и анализ на киберсигурността. Компанията споделя, че моделът използва същия базов модел като GLM-5.2, като подобренията идват изцяло от по-мащабно допълнително обучение (post-training).
Новата версия се фокусира върху обучението на AI агенти в реалистични работни среди, а не върху кратки упражнения за кодиране. Тези среди могат да включват кодови бази, документация, системи за съхранение, резултати от експерименти, инструменти за тестване и многостъпкови работни процеси.
В един от примерите агентът може да се наложи да идентифицира тясно място в стека за обучение на машинно обучение, да внедри оптимизация, да изпълни тестове и да демонстрира подобрена производителност, без да нарушава функционалността.
От Z.ai заявиха, че GLM-5.3 осигурява сериозни подобрения при програмирането в няколко бенчмарка. Моделът постигна резултат от 28.3 на Terminal-Bench 3.0 в сравнение с .6 за GLM-5.2. При DeepSWE v1.1 новият модел достигна 66.9 спрямо 46.2.
Компанията също така отчете 50% подобрение в своя вътрешен бенчмарк Z.ai Code Bench, който оценява агентите за програмиране в по-реалистични среди за локална разработка. Моделът включва три настройки за разсъждение: ниска, висока и максимална.
Z.ai препоръчва максималната настройка за задачи за програмиране, тъй като тя позволява на модела да инвестира повече усилия в планиране, внедряване, тестване и проверка на работата. За разлика от по-старите версии, GLM-5.3 не поддържа пълно изключване на разсъжденията.
Киберсигурността е една от най-забележителните области на подобряване. От Z.ai споделиха, че са добавили данни за откриване на уязвимости и среди за задачи, фокусирани върху сигурността, по време на допълнителното обучение.
Компанията очаква по-добро откриване на грешки, но заяви, че моделът се е подобрил и при свързването на няколко етапа от пътя на атаката, включително анализ на уязвимости и разсъждения за експлоатация.
В CyberGym, бенчмарк, който тества откриването на уязвимости от тип „бяла кутия“ в изходния код, GLM-5.3 постигна резултат от 84.5% в сравнение със 77.2% за GLM-5.2.
В ExploitBench резултатът му се повиши от 24.4% на 54.4%. В ExploitGym GLM-5.3 завърши 105 задачи за експлоатация в рамките на два часа и 130 в рамките на шест часа, докато GLM-5.2 завърши съответно 29 и 39 задачи при същите времеви ограничения.
Z.ai подчерта, че най-силните подобрения се появяват по-напред във веригата на експлоатация. Това би могло да помогне на защитниците да идентифицират сложни слабости, които включват множество компоненти, небезопасни предположения и верижни дефекти.
Въпреки това компанията призна, че водещите затворени модели все още постигат по-високи резултати в някои бенчмаркове за експлоатация. Моделът GLM-5.3 вече е тестван от екипи по сигурността срещу реални кодови бази.
След експертен преглед и отстраняване на дубликати се съобщава, че моделът е идентифицирал 2 436 уязвимости в 269 проекта. От тези констатации 1 097 са оценени със средна до висока степен на сериозност.
Засегнатият софтуер включва ядра, операционни системи, браузърни двигатели, уеб приложения, мрежови протоколи и инфраструктура с отворен код.
Z.ai създаде публичен регистър за разкриване на информация за сигурността (Security Disclosure Ledger) за проследяване на констатациите чрез координирано разкриване. При стартирането 53 констатации бяха публично оповестени, докато 2 383 останаха под ембарго.
Най-старият докладван дефект е въведен през 1981 г., което показва колко дълго уязвимостите могат да останат скрити в широко използван код. Теглата на модела се очаква да бъдат пуснати две седмици след старта, след оценка на безопасността и укрепване.