Если вы AI-разработчик, руководитель инфраструктуры или лицо, принимающее решения о затратах на вычисления, вас наверняка интересует, сможет ли собственный кремний OpenAI пошатнуть доминирование Nvidia и когда счета за инференс реально снизятся. В этой статье разбирается презентация Jalapeño 24 июня 2026 года — первого ASIC для LLM-инференса от OpenAI и Broadcom: ~50% экономии в ранних тестах, TSMC 3nm, рекордный tape-out за 9 месяцев, развёртывание в Microsoft Azure к концу года, а также сравнение с Blackwell, разделение цепочки поставок и цель 10 GW к 2029 году. Тарифы узлов — на странице цен NOVAKVM.
[ SECTION_01 ] // BACKGROUND Зачем OpenAI делает свой чип? Счета за инференс и кремний hyperscaler'ов
OpenAI — один из крупнейших потребителей GPU в мире. За каждым ответом ChatGPT на серверах выполняется инференс — генерация токенов по входным данным. По мере роста возможностей GPT-4 и GPT-5 инференс стал самой тяжёлой статьёй на пути к прибыльности. Годами OpenAI почти полностью опиралась на ускорители Nvidia H100, H200 и Blackwell — универсальные чипы, которые в однородных LLM-нагрузках тратят значительную часть вычислений впустую.
Аналогия: GPU Nvidia — швейцарский нож, Jalapeño — скальпель: только LLM-инференс, но в этой задаче исключительно эффективен.
- Модели больше — счета выше: инференс — одна из крупнейших статей Opex при сотнях миллионов ежедневных пользователей.
- Архитектурное несоответствие: GPU созданы для игр, обучения, симуляций и инференса — гибкость снижает эффективность в масштабе только LLM.
- Поздно, но быстро: OpenAI — последний крупный hyperscaler с кастомным кремнием, но заявляет самый быстрый цикл продвинутого ASIC в истории.
- Скрытые издержки разработчиков: ожидаемое снижение цен API и долгоживущие локальные агенты зависят от эффективности инференса upstream и стабильных сред 24/7.
| Компания | Чип | Основное назначение |
|---|---|---|
| TPU | Обучение + инференс | |
| Amazon | Trainium / Inferentia | Обучение + инференс |
| Microsoft | Maia 100 | Инференс |
| Meta | MTIA | Инференс |
| OpenAI | Jalapeño (2026) | Инференс |
[ SECTION_02 ] // ARCHITECTURE Что такое Jalapeño? ASIC, 3nm и заявления о производительности
Jalapeño — это ASIC, а не GPU. Одна задача: LLM-инференс. Ни игр, ни обучения, ни универсальных вычислений. Richard Ho, руководитель аппаратной программы OpenAI, говорит, что чип спроектирован с нуля для LLM-инференса с учётом выполнения ядер, перемещения памяти, сети и паттернов serving — ранние тесты выполняют критические нагрузки близко к теоретическим пределам железа.
- Дизайн с чистого листа: каждое решение ориентировано на паттерны Transformer-инференса, а не на универсальные вычисления с доработкой в софте.
- Минимизация перемещения данных: узкое место инференса часто — пропускная способность памяти; архитектура сокращает лишний трафик.
- Баланс вычислений, памяти и сети: настроено под реальные соотношения LLM-нагрузок для более высокой утилизации.
- Интерконнект Broadcom Tomahawk: сеть кластера для multi-chip serving frontier-моделей.
- Системная интеграция Celestica: платы, стойки и серверная интеграция для серийного производства.
- TSMC 3nm: тот же поколение, что Apple M4 и Nvidia Blackwell.
- Уже в лаборатории: инженерные образцы выполняют ML-нагрузки, включая GPT-5.3-Codex-Spark, на целевой частоте и мощности.
| Метрика | Jalapeño (ранние тесты) | Базовая линия |
|---|---|---|
| Экономия на инференсе | ~50% | vs текущие mainstream AI GPU |
| Производительность на ватт | Значительно выше SOTA | По блогу OpenAI |
| Абсолютная производительность | На уровне Blackwell и Google TPU | CEO Broadcom Hock Tan (Reuters) |
| Тепловое поведение | Лучше ожидаемого | Внутренние тесты OpenAI |
CEO Broadcom Hock Tan (Bloomberg): «На данный момент Jalapeño демонстрирует экономию около 50% по сравнению с типичными AI GPU».
Президент OpenAI Greg Brockman: от первоначального дизайна до tape-out прошло 9 месяцев; часть design flow ускорена с помощью собственных моделей OpenAI (поколение не раскрыто; VentureBeat ссылается на модели предыдущего поколения).
К «50%» относитесь скептически: пока ранние лабораторные данные Broadcom; полный технический отчёт обещан через месяцы; развёртывание в Azure и независимые бенчмарки ещё не проведены.
[ SECTION_03 ] // SUPPLY_CHAIN Tape-out за девять месяцев и распределение ролей
От первоначального дизайна до tape-out — 9 месяцев. OpenAI и Broadcom называют это самым быстрым циклом продвинутого high-performance ASIC за всю историю.
- Глубокая co-разработка hardware и software: исследователи моделей и инженеры чипов работали вместе, избегая доработок «вслепую».
- AI-ассистированное проектирование чипа: модели OpenAI ускорили часть оптимизации.
- Повторное использование IP Broadcom: зрелые IP для реализации кремния и сети сократили путь к физическому дизайну.
| Роль | Компания | Ответственность |
|---|---|---|
| Архитектура | OpenAI | Оптимизация LLM-инференса, full-stack design direction |
| Кремний и сеть | Broadcom | Реализация, сеть Tomahawk, поддержка производства |
| Foundry | TSMC | Производство 3nm |
| Системная интеграция | Celestica | Платы, стойки, серверные системы, серийная интеграция |
| Первый клиент развёртывания | Microsoft Azure | Rollout в дата-центрах с конца 2026 |
Broadcom становится ключевым партнёром по кастомным ASIC для Google (TPU v5/v6), Meta (MTIA) и OpenAI (Jalapeño). Рыночные данные: акции Broadcom выросли ~18% YTD к маю 2026 и почти в 7 раз с конца 2022. Как и все AI-ускорители, Jalapeño требует больших объёмов HBM — выигрывают SK Hynix и Samsung, по словам Tan.
[ SECTION_04 ] // ROADMAP Дорожная карта и Nvidia: диверсификация, а не разрыв
Краткосрочно (конец 2026): инженерные образцы в лабораториях OpenAI; коммерческий rollout в Microsoft и у партнёров; приоритет — ChatGPT, Codex и API-инференс.
Среднесрочно (2027): серийное производство; Broadcom ожидает развёртывание выше прежнего прогноза 1,3 GW; чип «создан для текущих и будущих LLM индустрии» с возможной внешней доступностью.
Долгосрочно (до 2029): OpenAI нацелена на 10 GW вычислений на кастомном кремнии — примерно десять атомных станций; next-gen ожидается в 2028 с ежегодными итерациями; кремний для обучения возможен позже (сейчас только инференс).
| Измерение | Jalapeño сегодня | Ров Nvidia |
|---|---|---|
| Нагрузки | Только инференс | Обучение + инференс |
| Software | Специализированный стек | Экосистема CUDA, миллионы разработчиков |
| Гибкость | Эффективность ASIC, риск смены архитектуры | Адаптивность универсального GPU |
| Капитальные связи | Кастомный кремний + Broadcom | 30 млрд USD прямых инвестиций Nvidia в OpenAI (февр. 2026) |
| Стратегия | Диверсификация поставок, переговорный рычаг | Платформа Vera Rubin, глубина экосистемы |
Настоящая цель — рычаг, а не замена. Даже 20–30% инференса на Jalapeño экономит реальные деньги, усиливает закупочные переговоры и снижает риск одного поставщика. Тот же playbook, что у Google, Amazon и Microsoft: не отказываться от Nvidia, но перестать быть полностью от неё зависимыми.
«Nobody wants to be beholden to Nvidia.» — Ben Barringer, глава глобальных tech-исследований Quilter Cheviot (через CNN)
Реакция акций Nvidia была сдержанной; рынок считает доминирование в обучении безопасным в краткосрочной перспективе, а кастомный кремний — медленным структурным давлением.
[ SECTION_05 ] // IMPACT Экономика инференса и эра full-stack AI
- Экономика инференса меняет бизнес-модели: если 50% подтвердятся в production, цены ChatGPT и API могут снизиться дальше, путь к марже OpenAI станет яснее, пол ценовой войны AI опустится.
- Full-stack AI становится нормой: OpenAI проектирует архитектуру чипа, ядра, память, сеть, scheduling, deployment и продуктовый опыт — не только модели. Конкуренция смещается от «лучшая модель» к «лучшая end-to-end эффективность».
- Победители и проигравшие в полупроводниках: выигрывают Broadcom, TSMC, поставщики HBM; давление на Nvidia (доля инференса) и AMD (слабая история inference ASIC).
| Имя | Роль | Роль при запуске |
|---|---|---|
| Greg Brockman | Сооснователь и президент OpenAI | Публичный запуск; framing full-stack infra |
| Richard Ho | Руководитель hardware OpenAI | Техническое лидерство архитектуры |
| Hock Tan | CEO Broadcom | Заявления о производительности класса Blackwell, экономии 50% |
| Sam Altman | CEO OpenAI | Общая стратегия; push к независимости в compute |
[ SECTION_06 ] // FAQ FAQ и хронология вех
- Jalapeño заменяет GPU Nvidia? Пока нет. Только инференс; обучение остаётся на Nvidia — дополнение, не замена.
- Реальны ли 50% экономии? Ранние лабораторные данные Broadcom через Bloomberg; независимой проверки нет; полный отчёт через месяцы.
- Что изменится для конечных пользователей? Более дешёвый ChatGPT/API и, возможно, более быстрые ответы при масштабировании; AI станет доступнее в долгосрочной перспективе.
- Почему «Jalapeño»? Официального объяснения нет; у OpenAI традиция пищевых названий — возможно, сигнал производительности или disruption.
- Будет ли доступ другим AI-компаниям? Формулировки указывают на LLM индустрии; в ближайший срок приоритет — инфраструктура OpenAI.
- Следующее поколение? Roadmap: gen 2 в 2028, затем ежегодный cadence.
- Влияние на акции Nvidia? Немедленное движение ограничено; ров в обучении сохранён; кастомный кремний — медленный структурный headwind.
Хронология:
- Окт. 2025: OpenAI и Broadcom объявляют партнёрство по кастомному чипу
- Февр. 2026: прямые инвестиции Nvidia 30 млрд USD в OpenAI (сделка по compute Vera Rubin)
- 24 июня 2026: публичный запуск Jalapeño; инженерные образцы в лабораториях
- Конец 2026: первые коммерческие развёртывания Azure и партнёров
- 2027: серийное производство; развёртывание выше 1,3 GW
- 2028 (ожидается): чип второго поколения
- 2029 (цель): 10 GW на кастомном кремнии
[ SECTION_07 ] // PLAYBOOK Шестишаговый playbook, цитируемые факты и инженерный вывод
- Разделите бюджеты обучения и инференса: Jalapeño покрывает только инференс; frontier-обучение остаётся на Nvidia — учитывайте отдельно.
- Дисконтируйте бенчмарки вендора: 50% — гипотеза до технического отчёта OpenAI, production-данных Azure и независимых MLPerf-класса.
- Следите за цепочкой поставок: Broadcom, TSMC, поставщики HBM и Celestica сигнализируют готовность производства и supply risk.
- Пересмотрите допущения по ценам API: улучшение экономики инференса может снизить цены ChatGPT/Codex — проектируйте multi-vendor и кэширование заранее.
- Готовьтесь к full-stack конкуренции: качества модели недостаточно; эффективность от чипа до продукта умножается — согласуйте агентов и CI со стабильными low-latency средами.
- Закрепите dev-среды 24/7: coding agents и длительный инференс — на always-on узлах Apple Silicon; см. Центр помощи и страницу заказа.
- Дата запуска: 24 июня 2026 (OpenAI + Broadcom)
- Экономия на инференсе: ~50% (раннее лабораторное заявление CEO Broadcom; не проверено)
- Цикл tape-out: 9 месяцев (заявление вендора: рекорд для продвинутого ASIC)
- Процесс: TSMC 3nm
- Долгосрочная цель compute: 10 GW к 2029
Запуск Codex, агентов Cursor и длительных API soak-тестов на ноутбуке упирается в прерывания сна, потолки памяти, отсутствие настоящего 24/7 и jitter трансграничной сети. Общие cloud VM добавляют overhead Metal и неконтролируемые версии macOS. Для production-сборок iOS/macOS, автоматизации AI-агентов и always-on coding assistants аренда bare-metal Mac Mini в облаке NOVAKVM обычно лучший выбор: выделенный Apple Silicon, multi-region узлы с низкой задержкой и гибкие сроки день/неделя/месяц — чтобы инженерные затраты ложились в предсказуемую среду выполнения по мере снижения upstream-стоимости инференса.
Источники на момент написания; при обновлении upstream ориентируйтесь на ссылки.
Официальный блог запуска OpenAI
TechCrunch: OpenAI unveils its first custom chip, built by Broadcom
VentureBeat: Jalapeño sped up with OpenAI models
The Next Web: Jalapeño and Nvidia