Новости криптомира

14.08.2026
07:25

Z.ai выпускает GLM-5.3: прорыв в агентном кодинге и охоте за уязвимостями

ИИ-агенты AI agents

Китайский стартап Z.ai официально представил языковую модель GLM-5.3, сделав ставку на три ключевых направления: программирование, автономные агентские сценарии и кибербезопасность. Это не просто инкрементальное обновление — разработчики заявляют о радикальном скачке производительности в ряде специализированных бенчмарков.

Посттренировка без смены архитектуры

Примечательно, что прирост вычислительной мощности достигнут исключительно за счет посттренировки, без изменения базовой модели по сравнению с GLM-5.2. Это говорит о высоком потенциале оптимизации алгоритмов обучения, что в индустрии встречается нечасто. Открытые веса станут доступны через две недели, после завершения оценки безопасности и дополнительного харденинга.

На внутреннем тесте Code Bench, оценивающем качество кодинга, новая модель улучшила результат предшественника на 50%. Однако куда более впечатляющими выглядят данные по агентным и кибербезопасным сценариям:

  • Terminal Bench 3.0 — 28,3 балла против 4,6 у GLM-5.2 (рост более чем в 6 раз);
  • DeepSWE v1.1 — 66,9 против 46,2;
  • Agents' Last Exam — 28,5 против 23,8;
  • CyberGym — 84,5% против 77,2%;
  • ExploitBench — 54,4% против 24,4%.

Охота за уязвимостями: 2436 находок

Особого внимания заслуживает ExploitGym. В двухчасовом бюджете модель закрыла 105 задач против 29 у GLM-5.2, а при шестичасовом — 130 против 39. Это демонстрирует не просто улучшение, а качественный переход к реальной автономной работе.

В рамках тестирования на реальных кодовых базах совместно с китайскими командами безопасности система выявила 2436 уязвимостей в 269 проектах, включая 1097 проблем средней и высокой критичности. Публично раскрыты лишь 53 находки, остальные 2383 остаются под эмбарго. Средний «возраст» обнаруженных уязвимостей — 26,6 года, а самая старая датируется 1981 годом.

Для прозрачности процесса Z.ai запустила Security Disclosure Ledger — публичный реестр, отслеживающий статус раскрытия и критичность каждой находки. Это редкий шаг для индустрии, повышающий доверие к модели.

Продуктовый запуск и контекст рынка

GLM-5.3 уже развернута для подписчиков GLM Coding Plan как основной движок для агентного программирования и длительных задач. Запросы к старым моделям автоматически маршрутизируются на новую, что облегчает миграцию пользователей.

Напомню, что в июле Anthropic обвиняла Z.ai в несанкционированной дистилляции GLM-5.2 на ответах Claude и GPT. Этот релиз, вероятно, усилит конкурентное напряжение в сегменте ИИ-агентов для разработчиков.

Мой анализ: Рост в агентных сценариях и кибербезопасности — это стратегический ход Z.ai для дифференциации от OpenAI и Anthropic, которые фокусируются на общих моделях. Однако 50% улучшение на Code Bench, полученное без смены архитектуры, вызывает вопросы о воспроизводимости таких результатов в реальных условиях. Индустрии нужны независимые бенчмарки, а не только внутренние метрики.