Z.ai выпускает GLM-5.3: прорыв в агентном кодинге и охоте за уязвимостями

Китайский стартап Z.ai официально представил языковую модель GLM-5.3, сделав ставку на три ключевых направления: программирование, автономные агентские сценарии и кибербезопасность. Это не просто инкрементальное обновление — разработчики заявляют о радикальном скачке производительности в ряде специализированных бенчмарков.
Посттренировка без смены архитектуры
Примечательно, что прирост вычислительной мощности достигнут исключительно за счет посттренировки, без изменения базовой модели по сравнению с GLM-5.2. Это говорит о высоком потенциале оптимизации алгоритмов обучения, что в индустрии встречается нечасто. Открытые веса станут доступны через две недели, после завершения оценки безопасности и дополнительного харденинга.
На внутреннем тесте Code Bench, оценивающем качество кодинга, новая модель улучшила результат предшественника на 50%. Однако куда более впечатляющими выглядят данные по агентным и кибербезопасным сценариям:
- Terminal Bench 3.0 — 28,3 балла против 4,6 у GLM-5.2 (рост более чем в 6 раз);
- DeepSWE v1.1 — 66,9 против 46,2;
- Agents' Last Exam — 28,5 против 23,8;
- CyberGym — 84,5% против 77,2%;
- ExploitBench — 54,4% против 24,4%.
Охота за уязвимостями: 2436 находок
Особого внимания заслуживает ExploitGym. В двухчасовом бюджете модель закрыла 105 задач против 29 у GLM-5.2, а при шестичасовом — 130 против 39. Это демонстрирует не просто улучшение, а качественный переход к реальной автономной работе.
В рамках тестирования на реальных кодовых базах совместно с китайскими командами безопасности система выявила 2436 уязвимостей в 269 проектах, включая 1097 проблем средней и высокой критичности. Публично раскрыты лишь 53 находки, остальные 2383 остаются под эмбарго. Средний «возраст» обнаруженных уязвимостей — 26,6 года, а самая старая датируется 1981 годом.
Для прозрачности процесса Z.ai запустила Security Disclosure Ledger — публичный реестр, отслеживающий статус раскрытия и критичность каждой находки. Это редкий шаг для индустрии, повышающий доверие к модели.
Продуктовый запуск и контекст рынка
GLM-5.3 уже развернута для подписчиков GLM Coding Plan как основной движок для агентного программирования и длительных задач. Запросы к старым моделям автоматически маршрутизируются на новую, что облегчает миграцию пользователей.
Напомню, что в июле Anthropic обвиняла Z.ai в несанкционированной дистилляции GLM-5.2 на ответах Claude и GPT. Этот релиз, вероятно, усилит конкурентное напряжение в сегменте ИИ-агентов для разработчиков.
Мой анализ: Рост в агентных сценариях и кибербезопасности — это стратегический ход Z.ai для дифференциации от OpenAI и Anthropic, которые фокусируются на общих моделях. Однако 50% улучшение на Code Bench, полученное без смены архитектуры, вызывает вопросы о воспроизводимости таких результатов в реальных условиях. Индустрии нужны независимые бенчмарки, а не только внутренние метрики.