Рынок ИИ-агентов получил нового лидера. Модель Grok 4.5 от SpaceXAI не просто обошла флагманов Anthropic — Claude Fable 5 и Claude Opus 4.8 — в независимом бенчмарке AutomationBench-AA, но и сделала это с колоссальным отрывом по экономической эффективности. Это не просто победа в тесте, это смена парадигмы.
Grok 4.5, построенная на архитектуре V9 с 1,5 триллиона параметров, продемонстрировала результат 51,4% в бенчмарке AutomationBench-AA от Artificial Analysis. Для сравнения, у Claude Fable 5 — 48,6%, а у Claude Opus 4.8 — 48,5%. Однако ключевой показатель — не только точность, но и стоимость.
Grok 4.5 выполняет задачу за $0,34, тогда как Fable 5 обходится в $1,35, а Opus 4.8 — в $1,46. Ближайший конкурент по цене, Gemini 3.5 Flash, стоит $0,49 за задачу. Столь низкая стоимость достигается за счет радикальной эффективности: Grok 4.5 использует около 8000 выходных токенов на задачу — это всего 25% от ресурсов, потребляемых Opus 4.8. Суммарное потребление токенов — 0,44 млн на задачу — один из самых низких показателей на рынке.
Финансовый сектор: где Grok 4.5 действительно блеснул
Наиболее показательным является результат модели в финансовой категории — самой сложной в тесте. Grok 4.5 набрала 71%, оставив позади Fable 5 (64%) и Opus 4.8 (62%). Для компаний, автоматизирующих финансовые процессы, этот разрыв критичен. Ошибка в финансовом агенте может обернуться прямыми убытками, и здесь Grok демонстрирует явное превосходство.
Однако есть и нюанс: Grok 4.5 нарушает правила в среднем 0,63 раза на задание, что выше, чем у Opus 4.8 (0,55) и Gemini 3.5 Flash (0,46). Это плата за агрессивную оптимизацию скорости и стоимости. Для бизнеса, запускающего агентов в production-средах, этот фактор требует особого внимания и дополнительных слоев валидации.
Тест включает 657 заданий в 40 симулированных приложениях, включая Gmail, Slack, Salesforce и HubSpot. Итоговый балл отражает долю задач, выполненных агентом без нарушения заложенных правил. Artificial Analysis держит список заданий в секрете, что гарантирует объективность результатов и исключает «натаскивание» моделей.
Мой профессиональный взгляд: Grok 4.5 задает новую планку для рынка ИИ-агентов. Сочетание высокой точности и радикально низкой стоимости — это именно то, что нужно для массового внедрения агентов в бизнес-процессы. Победа в финансовом секторе — сигнал для всего FinTech. Если Anthropic и Google не ответят адекватным снижением цен, доля Grok на корпоративном рынке будет расти экспоненциально.