SpaceXAI официально представила Grok 4.5 — новую языковую модель, ориентированную на программирование, агентные задачи и интеллектуальную работу. Компания позиционирует её как свою самую мощную систему на сегодняшний день. Модель уже доступна через API, в Grok Build и в среде разработки Cursor на всех тарифных планах. Пользователи из Евросоюза пока не могут получить к ней доступ — запуск там запланирован на середину июля.
Ключевое преимущество Grok 4.5, по заявлению разработчиков, — сочетание производительности с агрессивной ценовой политикой. Стоимость модели составляет $2 за 1 млн входных токенов и $6 за 1 млн выходных. Для сравнения: Claude Opus 4.8 от Anthropic обходится в $5 и $25 соответственно, Claude Fable 5 — в $10 и $50, а флагман OpenAI GPT-5.6 Sol — в $5 и $30. Внутри той же линейки GPT-5.6 Luna предлагает ещё более низкую цену — $1 за вход и $6 за выход, но находится в режиме ограниченного превью. Это делает Grok 4.5 одним из самых доступных решений в своём классе.
Илон Маск охарактеризовал новинку как модель «класса Opus, но значительно быстрее, дешевле и эффективнее по токенам». Внутренние тесты SpaceXAI, по его словам, показывают, что Grok 4.5 «примерно сопоставима с Opus 4.7, но намного быстрее».
Результаты бенчмарков: неоднозначно, но конкурентоспособно
Опубликованные SpaceXAI данные по бенчмаркам рисуют смешанную картину. На DeepSWE 1.0 модель набрала 62%, уступив Fable (66,1%) и GPT-5.5 (64,31%), но обойдя Claude Opus 4.8 (55,75%) и Opus 4.7 (40,12%). На более сложном DeepSWE 1.1 результат оказался ниже — 53% против 59% у Opus 4.8 и 70% у Fable. На SWE Bench Pro Grok 4.5 показала 64,7%, что выше GPT-5.5 (58,6%) и на уровне Opus 4.7 (64,3%), но ниже Opus 4.8 (69,2%) и Fable (80,4%).
Однако на некоторых тестах модель проявила себя сильнее. На Terminal Bench 2.1 она набрала 83,3%, почти сравнявшись с GPT-5.5 (83,4%) и лишь немного отстав от Fable (84,3%). На SWE Marathon Grok 4.5 заняла первое место с 29%, опередив Opus 4.8 (26%) и Fable (24%). Компания также заявила о лидерстве на Harvey's Legal Agent Benchmark, тесте для юридических агентных задач.
Экономика — главный козырь
Наиболее сильный аргумент в пользу Grok 4.5 лежит не в области пиковой производительности, а в экономике. SpaceXAI приводит данные, что на задачах SWE Bench Pro модель использует в среднем 15 954 выходных токена на задачу, в то время как Claude Opus 4.8 — 67 020 токенов, что в 4,2 раза больше. При значительно более низкой цене за токен это делает Grok 4.5 крайне выгодной для сценариев с большим количеством итераций: исправление багов, генерация правок, проверка кода и агентные циклы.
Дополнительно заявлена скорость генерации около 80 токенов в секунду и контекстное окно на 500 000 токенов. SpaceXAI позиционирует модель как оптимальный компромисс между качеством, скоростью и стоимостью.
Связь с Cursor и стратегический контекст
Важно отметить, что Grok 4.5 обучалась совместно с ИИ-сервисом Cursor, который SpaceX недавно согласилась приобрести за $60 млрд. Сделка будет проведена акциями класса A и ожидает закрытия в III квартале 2026 года. Для обучения модели использовались данные реальных сессий разработчиков Cursor, включая трассировки отладки и правки кода, что даёт ей уникальное преимущество в понимании практических задач программирования. Для тренировки были задействованы десятки тысяч GPU Nvidia GB300.
Этот релиз — одна из первых крупных инициатив после объединения ИИ-направления Илона Маска со SpaceX. Grok 4.5 не пытается быть безоговорочным лидером во всех тестах, но предлагает прагматичный подход: достаточно высокое качество по цене, которая может перевернуть экономику enterprise-приложений. В мире, где затраты на инференс становятся главным барьером для масштабирования ИИ, такой подход выглядит не просто разумным, а потенциально доминирующим.