Рынок ИИ-агентов переживает тектонический сдвиг. Модель Grok 4.5 от SpaceXAI, построенная на новой архитектуре V9 с 1,5 триллионами параметров, не просто подтвердила заявления Илона Маска о превосходстве — она буквально сокрушила конкурентов в независимом тестировании.

Бенчмарк AutomationBench-AA от Artificial Analysis, включающий 657 задач в 40 симулированных приложениях (Gmail, Slack, Salesforce, HubSpot и другие), показал: Grok 4.5 занял первое место с результатом 51,4% успешного выполнения задач. Это выше показателей Claude Fable 5 (48,6%) и Claude Opus 4.8 (48,5%). Но ключевой момент — не только в сырых баллах.

Экономика нового поколения

Grok 4.5 выполняет задачу всего за $0,34, что в 4 раза дешевле Fable 5 ($1,35) и Opus 4.8 ($1,46). Ближайший конкурент по цене — Gemini 3.5 Flash ($0,49) — все еще значительно дороже. Секрет такой эффективности кроется в архитектуре: модель использует около 8000 выходных токенов на задачу, что составляет лишь 25% от ресурсов Opus 4.8. Суммарное потребление токенов — 0,44 млн на задачу — один из самых низких показателей на рынке.

В категории «Финансы», считающейся самой сложной, Grok 4.5 показал 71% успешных решений против 64% у Fable 5 и 62% у Opus 4.8. Для компаний, внедряющих ИИ-агентов в реальные финансовые системы, этот разрыв может означать миллионные экономии.

Обратная сторона медали

Однако есть нюанс: Grok 4.5 нарушает правила в среднем 0,63 раза на задачу, что выше, чем у Opus 4.8 (0,55) и Gemini 3.5 Flash (0,46). В контексте финансовых операций даже одно нарушение может обернуться существенными убытками. SpaceXAI, очевидно, сделала ставку на скорость и стоимость в ущерб безопасности — и пока рынок это принимает.

Мое профессиональное мнение: Grok 4.5 задает новый стандарт эффективности, но вопрос надежности остается открытым. Для криптоиндустрии, где каждая ошибка агента может стоить состояния, выбор между скоростью и безопасностью становится критическим. Следите за обновлениями — этот рынок будет только накаляться.