Компания SpaceXAI официально запустила Grok 4.5 — новую флагманскую модель, ориентированную на программирование, работу с агентами и решение сложных интеллектуальных задач. В пресс-релизе модель названа «самой сильной системой» в портфеле компании. Однако ключевой акцент сделан не на абсолютном превосходстве в бенчмарках, а на балансе цены, скорости и эффективности.

Grok 4.5 уже доступна через API, а также встроена в платформы Grok Build и Cursor на всех тарифных планах. Пользователи из Евросоюза пока остаются за бортом — запуск в регионе ожидается в середине июля.

Ценообразование как главный козырь

SpaceXAI предлагает Grok 4.5 по цене $2 за 1 млн входных токенов и $6 за 1 млн выходных. Это значительно дешевле прямых конкурентов. Для сравнения: Claude Opus 4.8 от Anthropic стоит $5 и $25 соответственно, Claude Fable 5 — $10 и $50, а GPT-5.6 Sol от OpenAI — $5 и $30. Даже в рамках собственной линейки OpenAI модель Luna предлагается по $1 за входные токены, но за $6 за выходные, что сопоставимо с Grok 4.5.

Илон Маск охарактеризовал новинку как «модель класса Opus, но быстрее, дешевле и эффективнее по токенам». По его словам, внутренние тесты SpaceXAI показывают, что Grok 4.5 «примерно сопоставима с Opus 4.7, но намного быстрее».

Результаты бенчмарков: неоднозначно, но перспективно

Опубликованные SpaceXAI данные демонстрируют смешанную картину. На тесте DeepSWE 1.0 Grok 4.5 набрала 62%, уступив Fable (66,1%) и GPT-5.5 (64,31%), но обойдя Claude Opus 4.8 (55,75%) и Opus 4.7 (40,12%). Более свежий бенчмарк DeepSWE 1.1 показал результат 53% — ниже, чем у Opus 4.8 (59%), GPT-5.5 (67%) и Fable (70%).

На SWE Bench Pro модель показала 64,7%, что выше GPT-5.5 (58,6%) и почти на уровне Opus 4.7 (64,3%), но ниже Opus 4.8 (69,2%) и Fable (80,4%). В Terminal Bench 2.1 Grok 4.5 продемонстрировала 83,3% — почти идентично GPT-5.5 (83,4%) и немного уступая Fable (84,3%). Зато на SWE Marathon модель заняла первое место с 29%, опередив Opus 4.8 (26%) и Fable (24%). Также заявлено лидерство на Harvey's Legal Agent Benchmark.

Экономика токенов: где SpaceXAI действительно выигрывает

Наиболее сильный аргумент в пользу Grok 4.5 — не сырые баллы, а эффективность использования токенов. На задачах SWE Bench Pro модель расходовала в среднем 15 954 выходных токена на задачу. У Claude Opus 4.8 этот показатель составил 67 020 токенов — в 4,2 раза больше. При более низкой цене за токен это означает радикальное снижение итоговой стоимости для сценариев с большим числом итераций: исправление багов, генерация правок, проверка кода и агентные циклы.

SpaceXAI также заявляет скорость генерации около 80 токенов в секунду и контекстное окно на 500 000 токенов. Модель позиционируется как компромисс между качеством, скоростью и стоимостью — именно то, что нужно для масштабных промышленных внедрений.

Связь с Cursor и стратегический контекст

Примечательно, что Grok 4.5 обучалась в тесном сотрудничестве с ИИ-сервисом Cursor, который SpaceX недавно договорилась приобрести за $60 млрд. В обучении использовались данные сессий разработчиков Cursor, включая трассировки отладки и реальные правки кода, а не только статические репозитории. Это объясняет сильную ориентацию модели на практические задачи программирования.

Для обучения Grok 4.5 компания задействовала десятки тысяч GPU Nvidia GB300. Модель стала одной из первых крупных после объединения ИИ-направления Илона Маска со SpaceX.

Мой экспертный взгляд: SpaceXAI делает ставку не на то, чтобы быть лучшей во всех тестах, а на то, чтобы быть наиболее экономически эффективной в реальных сценариях использования. В эпоху, когда затраты на инференс становятся критическим фактором для масштабирования ИИ, такой подход может оказаться более выигрышным, чем погоня за абстрактными рекордами в бенчмарках. Если Grok 4.5 действительно обеспечит сопоставимое качество при в 4 раза меньших затратах токенов, это может серьезно перекроить рынок ИИ-моделей для enterprise-сектора.