Рынок ИИ-агентов получил нового безоговорочного лидера. Модель Grok 4.5 от SpaceXAI не просто подтвердила заявления Илона Маска о своей производительности, но и разгромила прямых конкурентов в независимом бенчмарке AutomationBench-AA от Artificial Analysis.
Результаты впечатляют: Grok 4.5 набрал 51,4% успешных выполнений задач, оставив позади таких тяжеловесов, как Claude Fable 5 (48,6%) и Claude Opus 4.8 (48,5%). Однако ключевой момент — это не просто победа в сырых баллах, а колоссальный разрыв в стоимости операций.
Экономика нового поколения: скорость и цена
Главный козырь Grok 4.5 — это его экономическая эффективность. Стоимость выполнения одной задачи составляет всего $0,34. Для сравнения: у Fable 5 этот показатель равен $1,35, а у Opus 4.8 — $1,46. Это более чем четырехкратное преимущество. Ближайший преследователь по цене — Gemini 3.5 Flash ($0,49) — все равно значительно уступает.
Секрет такого доминирования кроется в архитектуре V9 с 1,5 трлн параметров. Grok 4.5 использует всего около 8000 выходных токенов на задачу — это лишь 25% от ресурсов, которые тратит Opus 4.8. Суммарное потребление в 0,44 млн токенов на задачу — один из самых низких показателей на рынке. Это не просто победа, это смена парадигмы: высокая производительность больше не требует пропорционально высоких затрат.
Глубокий анализ: финансы и надежность
Особого внимания заслуживает работа модели в финансовом секторе — самой сложной категории теста. Здесь Grok 4.5 показал результат в 71%, уверенно обойдя Fable 5 (64%) и Opus 4.8 (62%). Для компаний, внедряющих ИИ-агентов в реальные бизнес-процессы, этот разрыв имеет критическое значение.
При этом стоит отметить, что модель нарушает правила несколько чаще конкурентов: в среднем 0,63 нарушения на задачу против 0,55 у Opus 4.8 и 0,46 у Gemini 3.5 Flash. В финансовых системах, где одна ошибка может привести к значительным убыткам, это требует дополнительного внимания и настройки guardrails.
Экспертное мнение Cryptalist: Рынок ИИ-агентов вступает в фазу зрелости, где ключевым фактором становится не только качество, но и экономика. Grok 4.5 задает новый стандарт, демонстрируя, что эффективность не должна быть дорогой. Однако для критически важных финансовых приложений вопрос надежности и минимизации ошибок остается приоритетом №1. Я ожидаю, что в ближайшие кварталы мы увидим ожесточенную ценовую войну, и именно Grok 4.5 стал ее первым серьезным выстрелом.