Рынок ИИ-агентов получил нового безоговорочного лидера. Аналитическое агентство Artificial Analysis провело независимый бенчмарк AutomationBench-AA, и результаты оказались весьма показательными. Модель Grok 4.5 от SpaceXAI не просто обошла признанных гигантов — Claude Fable 5 и Claude Opus 4.8, — но и сделала это с колоссальным отрывом по экономической эффективности.
Победа по всем фронтам: производительность и стоимость
В тесте, который включал 657 заданий в 40 симулированных приложениях (Gmail, Slack, Salesforce, HubSpot и другие), Grok 4.5 набрал 51,4% успешных завершений. Для сравнения: у Claude Fable 5 — 48,6%, а у Claude Opus 4.8 — 48,5%. Однако главный сюрприз кроется в цене. Выполнение одной задачи Grok 4.5 стоит всего $0,34, тогда как Fable 5 обходится в $1,35, а Opus 4.8 — в $1,46. Ближайший конкурент по цене, Gemini 3.5 Flash, стоит $0,49 за задачу, но показывает значительно более скромные результаты.
Эффективность как ключевое преимущество
Секрет успеха Grok 4.5 кроется в его архитектуре V9 с 1,5 триллионами параметров. Для выполнения одной задачи модель использует около 8000 выходных токенов — это примерно 25% от ресурсов, которые тратит Opus 4.8. Суммарное потребление токенов на задачу составляет всего 0,44 млн — один из самых низких показателей среди всех моделей. Именно эта эффективность, помноженная на низкую цену токена, и формирует то самое конкурентное преимущество, о котором говорили представители SpaceXAI при запуске.
Финансовый сегмент: безоговорочное доминирование
Особого внимания заслуживает производительность Grok 4.5 в финансовом секторе — самой сложной категории теста. Модель показала 71% успешных решений, оставив позади Fable 5 (64%) и Opus 4.8 (62%). Это критически важный показатель для компаний, внедряющих ИИ-агентов в реальные финансовые системы. Однако стоит отметить, что Grok 4.5 допускает нарушения правил чаще конкурентов: в среднем 0,63 нарушения на задание против 0,55 у Opus 4.8 и 0,46 у Gemini 3.5 Flash. В высокорисковых сценариях это может стать серьезным недостатком.
Мой анализ: Grok 4.5 демонстрирует, что будущее ИИ-агентов — это не просто "умные" модели, а экономически эффективные решения. Разрыв в цене в 4 раза при сопоставимом качестве выполнения задач делает эту модель крайне привлекательной для массового внедрения в бизнес-процессы. Однако повышенный уровень нарушений правил требует дополнительного внимания и настройки, особенно в регулируемых секторах, таких как финансы. Рынок ИИ-агентов явно вступает в фазу прайс-войны, и это отличная новость для конечных пользователей.