Первый кастомный AI-чип OpenAI «Jalapeño»:
инференс на 50% дешевле, создан для конкуренции с Nvidia

Если вы AI-разработчик, руководитель инфраструктуры или лицо, принимающее решения о затратах на вычисления, вас наверняка интересует, сможет ли собственный кремний OpenAI пошатнуть доминирование Nvidia и когда счета за инференс реально снизятся. В этой статье разбирается презентация Jalapeño 24 июня 2026 года — первого ASIC для LLM-инференса от OpenAI и Broadcom: ~50% экономии в ранних тестах, TSMC 3nm, рекордный tape-out за 9 месяцев, развёртывание в Microsoft Azure к концу года, а также сравнение с Blackwell, разделение цепочки поставок и цель 10 GW к 2029 году. Тарифы узлов — на странице цен NOVAKVM.

OpenAI — один из крупнейших потребителей GPU в мире. За каждым ответом ChatGPT на серверах выполняется инференс — генерация токенов по входным данным. По мере роста возможностей GPT-4 и GPT-5 инференс стал самой тяжёлой статьёй на пути к прибыльности. Годами OpenAI почти полностью опиралась на ускорители Nvidia H100, H200 и Blackwell — универсальные чипы, которые в однородных LLM-нагрузках тратят значительную часть вычислений впустую.

Аналогия: GPU Nvidia — швейцарский нож, Jalapeño — скальпель: только LLM-инференс, но в этой задаче исключительно эффективен.

  • Модели больше — счета выше: инференс — одна из крупнейших статей Opex при сотнях миллионов ежедневных пользователей.
  • Архитектурное несоответствие: GPU созданы для игр, обучения, симуляций и инференса — гибкость снижает эффективность в масштабе только LLM.
  • Поздно, но быстро: OpenAI — последний крупный hyperscaler с кастомным кремнием, но заявляет самый быстрый цикл продвинутого ASIC в истории.
  • Скрытые издержки разработчиков: ожидаемое снижение цен API и долгоживущие локальные агенты зависят от эффективности инференса upstream и стабильных сред 24/7.
Кастомный AI-кремний hyperscaler'ов (публичная информация)
Компания Чип Основное назначение
Google TPU Обучение + инференс
Amazon Trainium / Inferentia Обучение + инференс
Microsoft Maia 100 Инференс
Meta MTIA Инференс
OpenAI Jalapeño (2026) Инференс

Jalapeño — это ASIC, а не GPU. Одна задача: LLM-инференс. Ни игр, ни обучения, ни универсальных вычислений. Richard Ho, руководитель аппаратной программы OpenAI, говорит, что чип спроектирован с нуля для LLM-инференса с учётом выполнения ядер, перемещения памяти, сети и паттернов serving — ранние тесты выполняют критические нагрузки близко к теоретическим пределам железа.

  • Дизайн с чистого листа: каждое решение ориентировано на паттерны Transformer-инференса, а не на универсальные вычисления с доработкой в софте.
  • Минимизация перемещения данных: узкое место инференса часто — пропускная способность памяти; архитектура сокращает лишний трафик.
  • Баланс вычислений, памяти и сети: настроено под реальные соотношения LLM-нагрузок для более высокой утилизации.
  • Интерконнект Broadcom Tomahawk: сеть кластера для multi-chip serving frontier-моделей.
  • Системная интеграция Celestica: платы, стойки и серверная интеграция для серийного производства.
  • TSMC 3nm: тот же поколение, что Apple M4 и Nvidia Blackwell.
  • Уже в лаборатории: инженерные образцы выполняют ML-нагрузки, включая GPT-5.3-Codex-Spark, на целевой частоте и мощности.
Ранние метрики Jalapeño (заявления вендора; независимая проверка ожидается)
Метрика Jalapeño (ранние тесты) Базовая линия
Экономия на инференсе ~50% vs текущие mainstream AI GPU
Производительность на ватт Значительно выше SOTA По блогу OpenAI
Абсолютная производительность На уровне Blackwell и Google TPU CEO Broadcom Hock Tan (Reuters)
Тепловое поведение Лучше ожидаемого Внутренние тесты OpenAI

CEO Broadcom Hock Tan (Bloomberg): «На данный момент Jalapeño демонстрирует экономию около 50% по сравнению с типичными AI GPU».

Президент OpenAI Greg Brockman: от первоначального дизайна до tape-out прошло 9 месяцев; часть design flow ускорена с помощью собственных моделей OpenAI (поколение не раскрыто; VentureBeat ссылается на модели предыдущего поколения).

К «50%» относитесь скептически: пока ранние лабораторные данные Broadcom; полный технический отчёт обещан через месяцы; развёртывание в Azure и независимые бенчмарки ещё не проведены.

От первоначального дизайна до tape-out — 9 месяцев. OpenAI и Broadcom называют это самым быстрым циклом продвинутого high-performance ASIC за всю историю.

  • Глубокая co-разработка hardware и software: исследователи моделей и инженеры чипов работали вместе, избегая доработок «вслепую».
  • AI-ассистированное проектирование чипа: модели OpenAI ускорили часть оптимизации.
  • Повторное использование IP Broadcom: зрелые IP для реализации кремния и сети сократили путь к физическому дизайну.
Роли в цепочке поставок Jalapeño
Роль Компания Ответственность
Архитектура OpenAI Оптимизация LLM-инференса, full-stack design direction
Кремний и сеть Broadcom Реализация, сеть Tomahawk, поддержка производства
Foundry TSMC Производство 3nm
Системная интеграция Celestica Платы, стойки, серверные системы, серийная интеграция
Первый клиент развёртывания Microsoft Azure Rollout в дата-центрах с конца 2026

Broadcom становится ключевым партнёром по кастомным ASIC для Google (TPU v5/v6), Meta (MTIA) и OpenAI (Jalapeño). Рыночные данные: акции Broadcom выросли ~18% YTD к маю 2026 и почти в 7 раз с конца 2022. Как и все AI-ускорители, Jalapeño требует больших объёмов HBM — выигрывают SK Hynix и Samsung, по словам Tan.

Краткосрочно (конец 2026): инженерные образцы в лабораториях OpenAI; коммерческий rollout в Microsoft и у партнёров; приоритет — ChatGPT, Codex и API-инференс.

Среднесрочно (2027): серийное производство; Broadcom ожидает развёртывание выше прежнего прогноза 1,3 GW; чип «создан для текущих и будущих LLM индустрии» с возможной внешней доступностью.

Долгосрочно (до 2029): OpenAI нацелена на 10 GW вычислений на кастомном кремнии — примерно десять атомных станций; next-gen ожидается в 2028 с ежегодными итерациями; кремний для обучения возможен позже (сейчас только инференс).

Может ли Jalapeño заменить Nvidia? Краткосрочная матрица
Измерение Jalapeño сегодня Ров Nvidia
Нагрузки Только инференс Обучение + инференс
Software Специализированный стек Экосистема CUDA, миллионы разработчиков
Гибкость Эффективность ASIC, риск смены архитектуры Адаптивность универсального GPU
Капитальные связи Кастомный кремний + Broadcom 30 млрд USD прямых инвестиций Nvidia в OpenAI (февр. 2026)
Стратегия Диверсификация поставок, переговорный рычаг Платформа Vera Rubin, глубина экосистемы

Настоящая цель — рычаг, а не замена. Даже 20–30% инференса на Jalapeño экономит реальные деньги, усиливает закупочные переговоры и снижает риск одного поставщика. Тот же playbook, что у Google, Amazon и Microsoft: не отказываться от Nvidia, но перестать быть полностью от неё зависимыми.

«Nobody wants to be beholden to Nvidia.» — Ben Barringer, глава глобальных tech-исследований Quilter Cheviot (через CNN)

Реакция акций Nvidia была сдержанной; рынок считает доминирование в обучении безопасным в краткосрочной перспективе, а кастомный кремний — медленным структурным давлением.

  • Экономика инференса меняет бизнес-модели: если 50% подтвердятся в production, цены ChatGPT и API могут снизиться дальше, путь к марже OpenAI станет яснее, пол ценовой войны AI опустится.
  • Full-stack AI становится нормой: OpenAI проектирует архитектуру чипа, ядра, память, сеть, scheduling, deployment и продуктовый опыт — не только модели. Конкуренция смещается от «лучшая модель» к «лучшая end-to-end эффективность».
  • Победители и проигравшие в полупроводниках: выигрывают Broadcom, TSMC, поставщики HBM; давление на Nvidia (доля инференса) и AMD (слабая история inference ASIC).
Ключевые фигуры (публичная информация о запуске)
Имя Роль Роль при запуске
Greg Brockman Сооснователь и президент OpenAI Публичный запуск; framing full-stack infra
Richard Ho Руководитель hardware OpenAI Техническое лидерство архитектуры
Hock Tan CEO Broadcom Заявления о производительности класса Blackwell, экономии 50%
Sam Altman CEO OpenAI Общая стратегия; push к независимости в compute

  • Jalapeño заменяет GPU Nvidia? Пока нет. Только инференс; обучение остаётся на Nvidia — дополнение, не замена.
  • Реальны ли 50% экономии? Ранние лабораторные данные Broadcom через Bloomberg; независимой проверки нет; полный отчёт через месяцы.
  • Что изменится для конечных пользователей? Более дешёвый ChatGPT/API и, возможно, более быстрые ответы при масштабировании; AI станет доступнее в долгосрочной перспективе.
  • Почему «Jalapeño»? Официального объяснения нет; у OpenAI традиция пищевых названий — возможно, сигнал производительности или disruption.
  • Будет ли доступ другим AI-компаниям? Формулировки указывают на LLM индустрии; в ближайший срок приоритет — инфраструктура OpenAI.
  • Следующее поколение? Roadmap: gen 2 в 2028, затем ежегодный cadence.
  • Влияние на акции Nvidia? Немедленное движение ограничено; ров в обучении сохранён; кастомный кремний — медленный структурный headwind.

Хронология:

  • Окт. 2025: OpenAI и Broadcom объявляют партнёрство по кастомному чипу
  • Февр. 2026: прямые инвестиции Nvidia 30 млрд USD в OpenAI (сделка по compute Vera Rubin)
  • 24 июня 2026: публичный запуск Jalapeño; инженерные образцы в лабораториях
  • Конец 2026: первые коммерческие развёртывания Azure и партнёров
  • 2027: серийное производство; развёртывание выше 1,3 GW
  • 2028 (ожидается): чип второго поколения
  • 2029 (цель): 10 GW на кастомном кремнии

  1. Разделите бюджеты обучения и инференса: Jalapeño покрывает только инференс; frontier-обучение остаётся на Nvidia — учитывайте отдельно.
  2. Дисконтируйте бенчмарки вендора: 50% — гипотеза до технического отчёта OpenAI, production-данных Azure и независимых MLPerf-класса.
  3. Следите за цепочкой поставок: Broadcom, TSMC, поставщики HBM и Celestica сигнализируют готовность производства и supply risk.
  4. Пересмотрите допущения по ценам API: улучшение экономики инференса может снизить цены ChatGPT/Codex — проектируйте multi-vendor и кэширование заранее.
  5. Готовьтесь к full-stack конкуренции: качества модели недостаточно; эффективность от чипа до продукта умножается — согласуйте агентов и CI со стабильными low-latency средами.
  6. Закрепите dev-среды 24/7: coding agents и длительный инференс — на always-on узлах Apple Silicon; см. Центр помощи и страницу заказа.
  • Дата запуска: 24 июня 2026 (OpenAI + Broadcom)
  • Экономия на инференсе: ~50% (раннее лабораторное заявление CEO Broadcom; не проверено)
  • Цикл tape-out: 9 месяцев (заявление вендора: рекорд для продвинутого ASIC)
  • Процесс: TSMC 3nm
  • Долгосрочная цель compute: 10 GW к 2029

Запуск Codex, агентов Cursor и длительных API soak-тестов на ноутбуке упирается в прерывания сна, потолки памяти, отсутствие настоящего 24/7 и jitter трансграничной сети. Общие cloud VM добавляют overhead Metal и неконтролируемые версии macOS. Для production-сборок iOS/macOS, автоматизации AI-агентов и always-on coding assistants аренда bare-metal Mac Mini в облаке NOVAKVM обычно лучший выбор: выделенный Apple Silicon, multi-region узлы с низкой задержкой и гибкие сроки день/неделя/месяц — чтобы инженерные затраты ложились в предсказуемую среду выполнения по мере снижения upstream-стоимости инференса.

Источники на момент написания; при обновлении upstream ориентируйтесь на ссылки.

Официальный блог запуска OpenAI

TechCrunch: OpenAI unveils its first custom chip, built by Broadcom

VentureBeat: Jalapeño sped up with OpenAI models

The Next Web: Jalapeño and Nvidia

Bloomberg: OpenAI and Broadcom unveil Jalapeño

Axios: OpenAI moves beyond Nvidia