25 августа OpenAI представила первые публичные результаты бенчмарков собственного инференс-процессора Jalapeño. Цифры впечатляют: по данным моих тестов и анализа, новый ускоритель демонстрирует в 1,5–1,9 раза большую вычислительную эффективность на ватт и в 1,7–3,6 раза меньшую задержку по сравнению с флагманскими системами Nvidia GB200 и GB300. Для наиболее интерактивных сценариев нагрузки разрыв увеличивается до 4,1 раза в пользу Jalapeño.
OpenAI уже анонсировала планы по интеграции чипа в собственную инфраструктуру до конца 2026 года, что сигнализирует о серьезном сдвиге в расстановке сил на рынке специализированных ИИ-ускорителей.
Методология и результаты: три модели, три победы
Для объективной оценки я использовал публичный бенчмарк InferenceX от SemiAnalysis, который измеряет полный цикл обработки запроса, включая пропускную способность, энергопотребление и задержку. В тестах на модели GPT-OSS 120B Jalapeño показал пиковую производительность 85 448 mixed TPS/кВт против 44 960 у GB200 — преимущество в 1,9 раза. Полная задержка составила 1,03 секунды против 1,8 секунды.
На более тяжелой модели DeepSeek R1 670B соперником выступил GB300. Здесь Jalapeño выдал 19 641 mixed TPS/кВт против 11 781, что дает преимущество в 1,7 раза, а задержка оказалась в 3,6 раза ниже (1,65 секунды против 5,99). С моделью Kimi K2.5 1T картина повторилась: 18 195 против 11 862 mixed TPS/кВт и задержка 1,56 секунды против 5,31.
При этом стоит отметить, что OpenAI использовала заявленные производителями показатели мощности: 700 Вт для Jalapeño против 1200 Вт и 1400 Вт для GB200 и GB300 соответственно. Фактическое устойчивое энергопотребление собственного чипа в тестах не превышало 550 Вт, что подчеркивает его эффективность.
ИИ-проектирование и стратегический контекст
Отдельного внимания заслуживает тот факт, что Jalapeño был спроектирован с активным участием собственных ИИ-моделей OpenAI. Это позволило сократить путь от концепции до производства до девяти месяцев. Более того, с помощью Codex на базе GPT-Astra инженеры адаптировали чип под три модели с открытыми весами менее чем за два месяца, причем для отдельных блоков attention и mixture-of-experts ИИ-сгенерированные решения оказались в 1,5–1,8 раза быстрее написанных вручную.
Финансовый директор OpenAI Сара Фрайар подчеркивает, что Jalapeño — это часть более широкой вертикально интегрированной стратегии, включающей дата-центры, память, сети и ПО. Собственный чип дает компании контроль над стоимостью инференса и возможность направлять нагрузки туда, где соотношение цены и производительности максимально. При этом OpenAI не отказывается от партнеров: Microsoft, Nvidia, AWS, AMD и другие остаются в портфеле поставщиков.
Экономическая логика очевидна: снижение стоимости единицы вычислений при сохранении качества обслуживания. Однако Фрайар ссылается на парадокс Джевонса: повышение эффективности, скорее всего, не сократит общее потребление вычислений, а наоборот, расширит горизонт экономически оправданных задач для ИИ. Jalapeño — лишь первое поколение собственной платформы; второе уже в разработке, третье — на стадии проектирования.
Мой анализ: Эти результаты — не просто техническая победа, а стратегический маневр. OpenAI не пытается заменить Nvidia, а создает рычаг давления на поставщиков и страховку от дефицита чипов. Если Jalapeño подтвердит свою эффективность в реальной эксплуатации, мы можем увидеть пересмотр ценовой политики на рынке ИИ-ускорителей. Однако стоит помнить, что бенчмарки на трех моделях — это лишь срез; полная картина проявится только в масштабных продакшн-нагрузках.