Z.ai представила GLM-5.3: прорыв в агентном программировании и кибербезопасности

Китайский стартап Z.ai официально представил языковую модель GLM-5.3, сделав ставку на значительное улучшение программирования, агентных сценариев и поиска уязвимостей. Это обновление — не просто итерация, а стратегический шаг, который переопределяет позиционирование компании в гонке ИИ-разработок.
Ключевые улучшения и бенчмарки
Вопреки ожиданиям рынка, прирост производительности достигнут исключительно за счет посттренировки, без изменения базовой архитектуры. Такой подход позволяет Z.ai быстро масштабировать improvements, сохраняя вычислительные затраты на прежнем уровне. На внутреннем тесте Code Bench, оценивающем навыки кодинга, GLM-5.3 показала улучшение на 50% относительно предшественницы GLM-5.2.
Особенно впечатляют результаты на специализированных бенчмарках:
- Terminal Bench 3.0 — 28,3 балла против 4,6 у GLM-5.2 (рост в 6 раз);
- DeepSWE v1.1 — 66,9 против 46,2;
- Agents' Last Exam — 28,5 против 23,8;
- CyberGym — 84,5% против 77,2%;
- ExploitBench — 54,4% против 24,4% (рост более чем вдвое).
Прорыв в поиске уязвимостей
Отдельного внимания заслуживает ExploitGym, где модель продемонстрировала выдающуюся эффективность: за двухчасовой бюджет она закрыла 105 задач против 29 у GLM-5.2, а при шестичасовом лимите — 130 задач вместо 39. Эти цифры говорят о качественном скачке в автономном анализе безопасности.
В реальных тестах на кодовых базах совместно с китайскими командами безопасности система выявила 2436 уязвимостей в 269 проектах, из которых 1097 — средней и высокой критичности. Публично раскрыты лишь 53 находки, остальные 2383 остаются под эмбарго. Средний «возраст» обнаруженных уязвимостей — 26,6 года, а самая старая датируется 1981 годом. Для прозрачности Z.ai запустила публичный реестр Z.ai Security Disclosure Ledger, отслеживающий статус и критичность находок.
Продуктовая интеграция и контекст
GLM-5.3 уже развернута для подписчиков GLM Coding Plan, где она становится основным движком для агентного программирования и длительных задач. Запросы к старым моделям автоматически маршрутизируются на новую версию, что упрощает миграцию пользователей. Открытые веса появятся через две недели после оценки безопасности и харденинга.
Напомню, что в июле Anthropic обвиняла Z.ai в несанкционированной дистилляции GLM-5.2 на ответах Claude и GPT. Этот контекст добавляет интриги: успех GLM-5.3 может быть как результатом собственных исследований, так и спорных методов, что ставит вопрос о границах инноваций в индустрии.
Мой взгляд: Z.ai демонстрирует, что посттренировка — это недооцененный рычаг для быстрого улучшения моделей, особенно в нишевых доменах вроде кибербезопасности. Однако столь агрессивный фокус на ExploitBench может сигнализировать о смещении рынка в сторону офенсивных ИИ-инструментов, что неизбежно вызовет новые этические и регуляторные дискуссии.