OpenAIs erster Custom-AI-Chip „Jalapeño":
50 % günstigere Inferenz, gebaut gegen Nvidia

Wer als AI-Entwickler, Infra-Leiter oder Entscheider mit Blick auf Compute-Kosten fragt, ob OpenAIs eigene Silizium Nvidia gefährden kann und wann Inferenzrechnungen wirklich sinken, findet hier die Vorstellung von Jalapeño am 24. Juni 2026 – dem ersten LLM-Inferenz-ASIC von OpenAI und Broadcom: ~50 % Inferenzkosteneinsparung in frühen Tests, TSMC 3nm, rekordverdächtiges 9-Monats-Tape-out, Microsoft-Azure-Deployment bis Jahresende sowie Blackwell-Vergleich, Lieferkettenaufteilung und 10-GW-Ziel bis 2029. Node-Optionen stehen auf der NOVAKVM-Preisseite.

OpenAI zählt zu den größten GPU-Verbrauchern weltweit. Hinter jeder ChatGPT-Antwort läuft serverseitige Inferenz – die Token-Generierung aus Eingaben. Mit wachsenden GPT-4- und GPT-5-Fähigkeiten ist Inferenz der schwerste Posten auf dem Weg zur Profitabilität. Jahrelang stützte sich OpenAI fast vollständig auf Nvidia H100, H200 und Blackwell – universelle Beschleuniger, die in homogenen LLM-Serving-Workloads erhebliche Compute-Leistung verschwenden.

Bild: Nvidia-GPUs sind ein Schweizer Taschenmesser; Jalapeño ein Skalpell – nur LLM-Inferenz, dafür außergewöhnlich effizient.

  • Größere Modelle, größere Rechnungen: Inferenz ist eine der größten Opex-Kategorien bei hunderten Millionen täglicher Nutzer.
  • Architektur-Mismatch: GPUs bedienen Gaming, Training, Simulation und Inferenz – Flexibilität kostet Effizienz im LLM-only-Maßstab.
  • Spät, aber schnell: OpenAI ist der letzte große Hyperscaler mit Custom Silicon, beansprucht aber den schnellsten fortgeschrittenen ASIC-Zyklus aller Zeiten.
  • Entwickler-Overhead: Erwartete API-Preissenkungen und lang laufende lokale Agents hängen von upstream Inferenzeffizienz und stabilen 24/7-Umgebungen ab.
Hyperscaler Custom-AI-Silizium (öffentliche Informationen)
Unternehmen Chip Hauptnutzung
Google TPU Training + Inferenz
Amazon Trainium / Inferentia Training + Inferenz
Microsoft Maia 100 Inferenz
Meta MTIA Inferenz
OpenAI Jalapeño (2026) Inferenz

Jalapeño ist ein ASIC – kein GPU. Eine Aufgabe: LLM-Inferenz. Kein Gaming, kein Training, keine Allzweck-Compute. Richard Ho, Leiter des OpenAI-Hardwareprogramms, sagt, der Chip sei von Grund auf für LLM-Inferenz entworfen – mit Erkenntnissen zu Kernel-Ausführung, Speicherbewegung, Netzwerk und Serving-Mustern. Frühe Tests laufen kritische Workloads nahe der theoretischen Hardwaregrenze.

  • Blank-slate-Design: Jede Entscheidung zielt auf Transformer-Inferenz, nicht auf nachträgliche Software-Anpassung.
  • Datenbewegung minimieren: Inferenz-Bottleneck ist oft Speicherbandbreite; die Architektur reduziert unnötigen Speicherverkehr.
  • Ausgewogenes Compute, Memory, Networking: Abgestimmt auf reale LLM-Lastverhältnisse für höhere Auslastung.
  • Broadcom Tomahawk-Interconnect: Cluster-Netzwerk für Multi-Chip-Serving frontier Modelle.
  • Celestica Systemintegration: Boards, Racks und Server-Integration für Serienproduktion.
  • TSMC 3nm: Gleiche Generation wie Apple M4 und Nvidia Blackwell.
  • Bereits im Labor: Engineering-Samples laufen ML-Workloads inklusive GPT-5.3-Codex-Spark bei Ziel-Frequenz und -Leistung.
Jalapeño Frühleistungsmetriken (Herstellerangaben; Drittvalidierung ausstehend)
Metrik Jalapeño (frühe Tests) Baseline
Inferenzkosteneinsparung ~50 % vs. aktuelle Mainstream-AI-GPUs
Leistung pro Watt Deutlich über SOTA Laut OpenAI-Blog
Absolute Leistung Auf Augenhöhe mit Blackwell und Google TPU Broadcom-CEO Hock Tan (Reuters)
Thermisches Verhalten Besser als erwartet OpenAI-Interna

Broadcom-CEO Hock Tan (Bloomberg): „Bisher zeigt Jalapeño Kosteneinsparungen von rund 50 % im Vergleich zu typischen AI-GPUs."

OpenAI-Präsident Greg Brockman: Jalapeño brauchte 9 Monate von Erstdesign bis Tape-out; Teile des Design-Flows wurden mit OpenAIs eigenen Modellen beschleunigt (Generation nicht genannt; VentureBeat berichtet von Vorgängermodellen).

„50 %" skeptisch betrachten: Noch frühe Labordaten von Broadcom; vollständiger Technikbericht in Monaten; Azure-Deployment und unabhängige Benchmarks stehen aus.

Vom Erstdesign bis Tape-out: 9 Monate – OpenAI und Broadcom nennen das den schnellsten fortgeschrittenen High-Performance-ASIC-Zyklus aller Zeiten.

  • Tiefe Hardware-Software-Co-Entwicklung: Modellforscher und Chip-Ingenieure gemeinsam, ohne ratendes Rework.
  • AI-unterstütztes Chipdesign: OpenAI-Modelle beschleunigten Teile der Optimierung.
  • Broadcom-IP-Wiederverwendung: Reife Silizium- und Netzwerk-IP verkürzten den Weg zum physischen Design.
Jalapeño Lieferkettenrollen
Rolle Unternehmen Verantwortung
Architektur OpenAI LLM-Inferenz-Optimierung, Full-Stack-Designrichtung
Silizium & Netzwerk Broadcom Implementierung, Tomahawk-Networking, Produktionsunterstützung
Foundry TSMC 3nm-Fertigung
Systemintegration Celestica Boards, Racks, Serversysteme, Serienintegration
Erster Deploy-Kunde Microsoft Azure Rechenzentrum-Rollout ab Ende 2026

Broadcom wird zum Custom-ASIC-Partner für Google (TPU v5/v6), Meta (MTIA) und OpenAI (Jalapeño). Marktdaten: Broadcom-Aktie ~18 % YTD bis Mai 2026, fast 7x seit Ende 2022. Wie alle AI-Beschleuniger braucht Jalapeño große HBM-Pools – SK Hynix und Samsung profitieren laut Tan.

Kurzfristig (Ende 2026): Engineering-Samples in OpenAI-Laboren; kommerzieller Rollout bei Microsoft und Partnern; Priorität: ChatGPT, Codex, API-Inferenz.

Mittelfristig (2027): Serienproduktion; Broadcom erwartet Deployment über die frühere 1,3-GW-Prognose; Chip „für aktuelle und zukünftige Branchen-LLMs" mit möglicher externer Verfügbarkeit.

Langfristig (bis 2029): OpenAI zielt auf 10 GW Compute auf Custom Silicon – etwa zehn Kernkraftwerke; Next-Gen-Chip 2028, danach jährliche Iterationen; Training-Silizium möglicherweise später (heute nur Inferenz).

Kann Jalapeño Nvidia ersetzen? Kurzfrist-Matrix
Dimension Jalapeño heute Nvidia-Moat
Workloads Nur Inferenz Training + Inferenz
Software Spezialisierter Stack CUDA-Ökosystem, Millionen Entwickler
Flexibilität ASIC-Effizienz, Architekturwechsel-Risiko GPU-Anpassungsfähigkeit
Kapitalbindung Custom Silicon + Broadcom 30 Mrd. USD Nvidia-Direktinvestition in OpenAI (Feb. 2026)
Strategie Lieferdiversifikation, Verhandlungsmacht Vera-Rubin-Plattform, Ökosystemtiefe

Der eigentliche Gewinn ist Hebel – kein Ersatz. Schon 20–30 % Inferenz auf Jalapeño spart echtes Geld, stärkt Einkaufsverhandlungen und reduziert Single-Vendor-Risiko. Gleiches Spielbuch wie Google, Amazon, Microsoft: Nvidia nicht verlassen, aber nicht mehr vollständig abhängig sein.

„Nobody wants to be beholden to Nvidia." — Ben Barringer, Global Tech Research Head bei Quilter Cheviot (via CNN)

Nvidias Aktienreaktion war gedämpft; Märkte sehen Trainingsdominanz kurzfristig sicher, Custom Silicon als langfristigen Strukturdruck.

  • Inferenzökonomie verändert Geschäftsmodelle: Hält 50 % in Produktion, können ChatGPT- und API-Preise weiter sinken; OpenAIs Margenpfad wird klarer; Boden des AI-Preiskriegs sinkt.
  • Full-Stack-AI wird Standard: OpenAI designt Chip-Architektur, Kernel, Memory, Netzwerk, Scheduling, Deployment und Produkterlebnis – nicht nur Modelle. Wettbewerb verschiebt sich von „bestes Modell" zu „beste End-to-End-Effizienz".
  • Halbleiter-Gewinner und -Verlierer: Gewinner: Broadcom, TSMC, HBM-Lieferanten; Druck auf Nvidia (Inferenzanteil) und AMD (schwache Inferenz-ASIC-Story).
Schlüsselpersonen (öffentliche Launch-Informationen)
Name Rolle Launch-Rolle
Greg Brockman OpenAI-Mitgründer & Präsident Öffentlicher Launch; Full-Stack-Infra-Framing
Richard Ho OpenAI Hardware Lead Technische Architektur-Führung
Hock Tan Broadcom-CEO Blackwell-Klasse, 50-%-Sparungen
Sam Altman OpenAI-CEO Gesamtstrategie; Compute-Unabhängigkeit

  • Ist Jalapeño ein Nvidia-GPU-Ersatz? Heute nicht. Nur Inferenz; Training bleibt Nvidia-zentriert – komplementär, nicht substitutiv.
  • Sind die 50 % real? Frühe Broadcom-Labordaten via Bloomberg; keine unabhängige Validierung; vollständiger Bericht in Monaten.
  • Was ändert sich für Endnutzer? Günstigeres ChatGPT/API und möglicherweise schnellere Antworten bei Skalierung; AI langfristig erschwinglicher.
  • Warum „Jalapeño"? Keine offizielle Erklärung; OpenAI hat Food-Naming-Tradition – möglicherweise Signal für Leistung oder Marktdynamik.
  • Bekommen andere AI-Firmen Zugang? Formulierung deutet auf branchenweite LLMs; kurzfristig Priorität OpenAI-Infrastruktur.
  • Nächste Generation? Roadmap: 2028 Gen zwei, dann jährlicher Takt.
  • Auswirkung auf Nvidia-Aktie? Begrenzte unmittelbare Bewegung; Trainings-Moat intakt; Custom Silicon als langsamer Strukturwind.

Zeitlinie:

  • Okt. 2025: OpenAI und Broadcom kündigen Custom-Chip-Partnerschaft an
  • Feb. 2026: Nvidia 30-Mrd.-USD-Direktinvestition in OpenAI (Vera-Rubin-Compute-Deal)
  • 24. Juni 2026: Jalapeño-Launch; Engineering-Samples in Laboren
  • Ende 2026: Erste kommerzielle Azure- und Partner-Deployments
  • 2027: Serienproduktion; Deployment über 1,3 GW
  • 2028 (erwartet): Chip der zweiten Generation
  • 2029 (Ziel): 10 GW auf Custom Silicon

  1. Training vs. Inferenz budgetieren: Jalapeño deckt nur Inferenz; Frontier-Training bleibt auf Nvidia – beides getrennt kalkulieren.
  2. Hersteller-Benchmarks diskontieren: 50 % als Hypothese bis OpenAI-Technikbericht, Azure-Produktionsdaten und MLPerf-ähnliche Dritte.
  3. Lieferkette beobachten: Broadcom, TSMC, HBM-Anbieter und Celestica signalisieren Produktionsreife und Supply-Risiko.
  4. API-Annahmen neu bewerten: Bessere Inferenzökonomie kann ChatGPT/Codex-Preise senken – Multi-Vendor und Caching jetzt planen.
  5. Auf Full-Stack-Wettbewerb vorbereiten: Modellqualität allein reicht nicht; Chip-zu-Produkt-Effizienz zählt – Agents und CI an stabile, latenzarme Umgebungen koppeln.
  6. 24/7-Dev-Umgebungen fixieren: Coding-Agents und lange Inferenzjobs auf always-on Apple-Silicon-Nodes; siehe Hilfezentrum und Bestellseite.
  • Launch-Datum: 24. Juni 2026 (OpenAI + Broadcom)
  • Inferenzkosteneinsparung: ~50 % (Broadcom-CEO frühe Lab-Angabe; unverifiziert)
  • Tape-out-Zyklus: 9 Monate (Herstellerangabe: Rekord für fortgeschrittenen ASIC)
  • Prozess: TSMC 3nm
  • Langfrist-Compute-Ziel: 10 GW bis 2029

Codex, Cursor-Agents und lange API-Soak-Tests auf dem Laptop scheitern an Schlaf-Unterbrechungen, Memory-Limits, fehlendem echten 24/7-Betrieb und grenzüberschreitendem Netzwerk-Jitter. Geteilte Cloud-VMs addieren Metal-Overhead und unkontrollierte macOS-Versionen. Für produktive iOS/macOS-Builds, AI-Agent-Automatisierung und always-on Coding-Assistenten ist NOVAKVM Mac Mini Bare-Metal-Cloud-Miete meist die bessere Wahl: dediziertes Apple Silicon, Multi-Region-Nodes mit niedriger Latenz und flexible Tages-/Wochen-/Monatslaufzeiten – damit Engineering-Ausgaben in einer vorhersagbaren Umgebung landen, während upstream Inferenzkosten sinken.

Quellen zum Zeitpunkt der Erstellung; bei upstream-Änderungen gelten die verlinkten Originale.

OpenAI offizieller Launch-Blog

TechCrunch: OpenAI unveils its first custom chip, built by Broadcom

VentureBeat: Jalapeño sped up with OpenAI models

The Next Web: Jalapeño and Nvidia

Bloomberg: OpenAI and Broadcom unveil Jalapeño

Axios: OpenAI moves beyond Nvidia