Рынок ИИ-агентов получил нового фаворита. Результаты независимого бенчмарка AutomationBench-AA от Artificial Analysis показали, что модель Grok 4.5 от SpaceXAI не просто догнала, а уверенно обошла таких тяжеловесов, как Claude Fable 5 и Claude Opus 4.8. Илон Маск, комментируя запуск, делал акцент на скорости и экономичности — и цифры полностью подтверждают его слова.
Ключевой показатель — итоговый балл. Grok 4.5 набрал 51,4%, оставив позади Fable 5 с 48,6% и Opus 4.8 с 48,5%. Однако гораздо интереснее смотреть на стоимость. Выполнение одной задачи обходится всего в $0,34. Для сравнения: у Fable 5 это $1,35, а у Opus 4.8 — $1,46. Ближайший конкурент по цене — Gemini 3.5 Flash ($0,49), но он уступает по качеству.
Эффективность как главный козырь
Секрет такой низкой цены кроется в архитектуре V9 с 1,5 триллиона параметров. На выполнение одной задачи Grok 4.5 тратит около 8000 выходных токенов — это всего 25% от ресурсов, которые потребляет Opus 4.8. Суммарное потребление в 0,44 млн токенов на задачу — один из минимальных показателей на рынке. Именно эта эффективность и низкая цена токена формируют решающее преимущество.
Помимо общей статистики, важны детали. Grok 4.5 корректно выполнил 79,9% отдельных действий, а полностью, от начала до конца, довел 21,9% задач. В финансовой категории — самой сложной в тесте — модель показала 71% успешных решений. Это значительно выше, чем у Fable 5 (64%) и Opus 4.8 (62%).
Однако есть и нюанс. Grok 4.5 нарушает правила чаще конкурентов: в среднем 0,63 нарушения на задачу против 0,55 у Opus 4.8 и 0,46 у Gemini 3.5 Flash. Для компаний, внедряющих агентов в реальные финансовые системы, это критический момент — одно неверное действие может привести к серьезным убыткам.
Мнение аналитика: Grok 4.5 задает новый стандарт для рынка ИИ-агентов, смещая фокус с «чистой» производительности на экономическую эффективность. Однако повышенная склонность к ошибкам — это «бомба замедленного действия». Пока модель выигрывает за счет низкой цены, но для enterprise-сектора надежность остается приоритетом. Следующая версия должна будет решить проблему с соблюдением правил, чтобы закрепить успех.