Z.ai выпускает GLM-5.3: прорыв в кодинге и кибербезопасности

Китайский стартап Z.ai официально представил языковую модель GLM-5.3, сделав ставку на значительное улучшение программирования, агентных сценариев и поиска уязвимостей. Это обновление позиционируется как ответ на растущие требования к ИИ-системам в разработке ПО и кибербезопасности.
Ключевые улучшения и бенчмарки
В Z.ai подчеркивают, что прирост производительности достигнут исключительно за счет посттренировки, без изменения базовой архитектуры, что отличает этот релиз от предыдущих итераций. На внутреннем тесте Code Bench новая модель показала улучшение на 50% по сравнению с GLM-5.2, что говорит о серьезной оптимизации алгоритмов.
В релизной таблице Z.ai приводит впечатляющие результаты по ряду специализированных тестов:
- Terminal Bench 3.0: 28,3 балла против 4,6 у GLM-5.2 — рост почти в шесть раз.
- DeepSWE v1.1: 66,9 против 46,2 — значительный скачок в решении задач разработки.
- Agents' Last Exam: 28,5 против 23,8 — улучшение агентных способностей.
- CyberGym: 84,5% против 77,2% — повышение эффективности в киберсреде.
- ExploitBench: 54,4% против 24,4% — удвоение результата в поиске эксплойтов.
Особо выделяется ExploitGym: модель закрыла 105 задач за двухчасовой бюджет против 29 у предшественника, а при шестичасовом бюджете — 130 против 39. Это демонстрирует не только скорость, но и глубину анализа.
Практическое применение и безопасность
Z.ai также провела тестирование на реальных кодовых базах совместно с командами по безопасности в Китае. После проверки и дедупликации система выявила 2436 уязвимостей в 269 проектах, включая 1097 проблем средней и высокой критичности. Публично раскрыты лишь 53 находки, остальные 2383 остаются под эмбарго. Средний «срок жизни» этих уязвимостей оценивается в 26,6 года, а самая старая датируется 1981 годом — это подчеркивает масштаб проблемы legacy-кода.
Для прозрачности запущен Z.ai Security Disclosure Ledger — публичный реестр, отслеживающий статус, затронутые проекты и критичность находок. Это важный шаг для индустрии, где часто не хватает открытости.
Продуктовая интеграция
GLM-5.3 уже развернута для подписчиков GLM Coding Plan, став основным движком для агентного программирования и длительных задач. Запросы к старым моделям автоматически маршрутизируются на новую, что упрощает миграцию для пользователей. Открытые веса появятся через две недели после оценки безопасности и харденинга.
Напомню, что в июле Anthropic обвиняла Z.ai в несанкционированной дистилляции GLM-5.2 на ответах Claude и GPT, что добавляет контекста к этому амбициозному релизу.
Мой анализ: GLM-5.3 — это не просто инкрементальное обновление, а целенаправленный рывок в нишевых, но критически важных областях. Улучшение ExploitBench и CyberGym в два раза говорит о том, что Z.ai серьезно инвестирует в безопасность, что может стать ключевым конкурентным преимуществом на фоне глобального спроса на ИИ-инструменты для защиты кода. Однако вопросы этики и происхождения технологий остаются открытыми, и это может сдерживать принятие модели на Западе.