Warum hat DeepSeek die API-Preise um bis zu 1.100 % erhöht
genau nach der Open-Weight-Offensive aus China?

Binnen fünf Tagen haben drei führende chinesische KI-Labore Schritte gesetzt, die sich auf den ersten Blick widersprechen. DeepSeek zieht einzelne API-Tarife um bis zu 1.100 % an. Alibaba legt in derselben Woche erstmals die Gewichte eines 2,4-Billionen-Parameter-Flaggschiffs offen. Zhipu AI liefert GLM-5.3 und hebt Coding-Benchmarks am unveränderten Basismodell um rund das Sechsfache — ohne erneutes Pretraining. Gelesen als Cluster verschiebt das den Wettbewerb vom reinen Niedrigpreis zur Preissetzungsmacht. Der Artikel dokumentiert Zeitachse, Tarifblatt, Qwen-Lizenz, GLM-5.3-Scores, Strategietrennung, Direktvergleich, unbestätigte Behauptungen, Sechs-Schritte-Checkliste und FAQ. Querverweise: DeepSeek V4 GA, Qwen3.8-Max-Start, GPT-5.6-Luna-Senkung. Knotentarife: Mietpreisseite.

Drei Fragen blockieren die Entscheidung meist zuerst: welche Abrechnungszeile die 1.100-%-Schlagzeile trägt; ob Open Weights freie Kommerznutzung bedeuten oder ein Geo-Verbot; und ob DeepSeek noch der günstigste Frontier-API-Anbieter ist. Zuerst die Daten fixieren.

Open-Weight- und Preiszeitachse (Juli–August 2026)
Datum Ereignis
16. Juli 2026 Moonshot AI veröffentlicht Open Weights von Kimi K3 (2,8T Parameter); US-Sicherheitsbehörden nehmen Notiz
30. Juli 2026 OpenAI senkt GPT-5.6 Luna, die günstigste Stufe, um 80 %
2.–3. August 2026 Alibaba zeigt Qwen3.8-Max zuerst als Vorschau, dann als gehostete API
6.–7. August 2026 OpenAI macht Luna zur kostenlosen Voreinstellung mit unbegrenzten Textchats
10. August 2026 Meta veröffentlicht Muse Glimmer (30B, Apache 2.0) und kündigt Open Weights für das Flaggschiff Muse Spark 1.2 an
12. August 2026 Alibaba legt Qwen3.8-2.4T-A95B-Gewichte auf Hugging Face / ModelScope; xAI liefert Grok 4.6
13. August 2026 DeepSeek-V4-Pro geht GA und kündigt eine Preiserhöhung zum 17. August an; Google liefert vergünstigtes Gemini 3.7 Flash
14. August 2026 Zhipu liefert GLM-5.3 auf der 743B-Basis von GLM-5.2
17. August 2026, 00:00 Peking-Zeit Die neuen DeepSeek-Tarife gelten

Im Überblick wird das Muster klar. Chinesische Labore erhöhen Preise und öffnen Flaggschiff-Gewichte; US-Labore senken Preise und machen die Consumer-Schicht kostenlos. Das sind zwei Seiten desselben Preiskampfs. Chinesische Finanzmedien nennen den inländischen Takt 「一周三更」— drei wesentliche Updates pro Woche — mit MiniMax H3 in derselben Rotation wie DeepSeek, Alibaba und Zhipu.

  • Reibung 1 — Schlagzeilenarithmetik: «11×», «über 1.100 %» und «350 %» sind alle korrekt. Sie beschreiben verschiedene Zeilen: Cache-Treffer-Eingabe, Ausgabe und Cache-Miss-Eingabe.
  • Reibung 2 — Lizenzfolklore: Behauptungen, Alibaba habe Downloads aus den USA, der EU, dem Vereinigten Königreich und Südkorea gesperrt, sind falsch. Der veröffentlichte Text enthält keine Territorialklausel. Die echten Schranken sind Umsatz und Produkttyp.
  • Reibung 3 — offiziell ist nicht mehr automatisch am günstigsten: Zur Peak-Zeit liegt die offizielle DeepSeek-API über einzelnen Resellern (GMI Cloud, Novita und andere listen V4 Pro derzeit unter dem offiziellen Peak-Tarif).

Die neuen DeepSeek-Tarife gelten ab 00:00 Peking-Zeit am 17. August. Peak-Fenster: 9–12 Uhr und 14–18 Uhr Peking-Zeit (01:00–04:00 und 06:00–10:00 UTC).

DeepSeek-Preiserhöhung (je 1M Token, RMB; offizielle Ankündigung, abgeglichen mit Wall Street CN, IT Home, V2EX)
Abrechnungsposition Alt Neu Off-Peak Neu Peak Anstieg Peak
V4-Flash Cache-Treffer (Eingabe) ¥0.02 ¥0.05 ¥0.10 ~400%
V4-Flash Cache-Miss (Eingabe) ¥1.0 ¥1.5 ¥3.0 200%
V4-Flash Ausgabe ¥2.0 ¥4.5 ¥9.0 350%
V4-Pro Cache-Treffer (Eingabe) ¥0.025 ¥0.15 ¥0.30 ~1100%
V4-Pro Cache-Miss (Eingabe) ¥3.0 ¥4.5 ¥9.0 200%
V4-Pro Ausgabe ¥6.0 ¥13.5 ¥27.0 350%

Die 1.100 % gelten für Peak-Cache-Treffer-Eingabe — die Zeile, die zuvor am nächsten an null lag. Ausgabe, die die meisten realen Rechnungen dominiert, stieg um 350 %. Unabhängige Kostenmodelle für eine realistische Schwerlast (rund 84M Token/Monat, überwiegend Off-Peak, zur Hälfte Cache-Treffer) landen näher bei 1,8×.

Qwen3.8-2.4T-A95B (Qwen3.8-Max Open Weights): Kernspecs
Spec Detail
Parameter 2,4T gesamt, 95B aktiv je Token (MoE, 512 Experten, 10 geroutet + 1 shared)
Kontextfenster 262144 Token nativ (offener Checkpoint), erweiterbar auf ~1.01M; gehostetes Max standardmäßig 1M
Release-Takt Vorschau 2. August → API live 3. August → Open Weights 12. August
API-Preis (international) $2/M Eingabe, $6/M Ausgabe
Lizenz Nicht Apache 2.0 — eigene Qwen3.8-Max License
Warum das zählt Erstmals legt Alibaba ein Max-Flaggschiff als Open Weight frei; Qwen3.5 / 3.6 / 3.7 Max blieben API-only
GLM-5.3 vs. GLM-5.2: gleiche Basis, nur Post-Training (Zhipu-Selbstangabe; noch kein unabhängiger Rerun)
Benchmark GLM-5.2 GLM-5.3 Änderung
Terminal-Bench 3.0 4.6% 28.3% +23.7 pts
DeepSWE v1.1 46.2% 66.9% +20.7 pts
Agents' Last Exam (CLI) 23.8% 28.5% +4.7 pts
CyberGym 77.2% 84.5% +7.3 pts
AutomationBench 26.2% 48.2% +22.0 pts

GLM-5.3 liegt auf Terminal-Bench 3.0 weiter hinter GPT-5.6 Sol (34.6 %) und Claude Fable 5 (33.7 %). Das ist ein starkes Open-Weight-Ergebnis, kein uneingeschränkter Frontier-Sieg.

Ist DeepSeek noch das günstigste Frontier-Modell? (RMB/USD bei ~¥7.15/$1)
Modell Eingabe (je 1M Token) Ausgabe (je 1M Token) Open Weights?
DeepSeek V4-Pro (Peak) ¥9.0 (~$1.26) ¥27.0 (~$3.78) Nein
DeepSeek V4-Pro (Off-Peak) ¥4.5 (~$0.63) ¥13.5 (~$1.89) Nein
Qwen3.8-Max (internationale API) $2.00 $6.00 Ja (eigene Lizenz)
OpenAI GPT-5.6 Luna $0.20 $1.20 Nein
Claude Opus 5 (impliziert, laut Alibabas Vergleichsverhältnis) ~$5.00 ~$25.00 Nein

Auch nach der Erhöhung liegt DeepSeek V4-Pro Off-Peak klar unter Claude Opus 5. Es ist nicht mehr die uneingeschränkt günstigste Option. Der internationale Qwen3.8-Max-Tarif und OpenAI Luna unterbieten DeepSeek Off-Peak. «Chinesisches Modell = günstigstes Modell» galt den Großteil von 2025 und Anfang 2026. Als Planungsannahme trägt das nicht mehr.

1. DeepSeek: von pauschal günstig zu tageszeitabhängigen Tarifen — ein Kapazitätsproblem, keine Strategiekehrtwende. Die bequeme Lesart: Chinas günstigstes Modell weicht endlich der Margenpressung. Die Tarifstruktur liest sich eher wie ein Unternehmen, das Compute-Engpässe auf dem Preisblatt sichtbar macht. Flache Dumpingpreise funktionierten als Akquise, solange GPU-Kapazität mithielt. Als die Nutzung exponentiell wuchs und die Kapazität nicht, musste etwas explizit werden. «Flexiblere Workload-Planung anregen» ist Konzernsprache für: Peak-Compute ist knapp. Zur Peak-Zeit liegt die offizielle API über mehreren Resellern. Die Annahme, der offizielle Endpunkt sei stets der günstigste Weg zu DeepSeek, ist erstmals gebrochen.

2. Alibaba: Open Weights kaufen Ökosystem-Goodwill; eine eigene Lizenz schützt die Umsatzdecke. Der 2,4T-Checkpoint und eine eigene Lizenz — nicht Apache 2.0 — kamen zusammen. Jedes Model-as-a-Service- oder AI-Work-Assistant-Geschäft mit über 50 Millionen Dollar Umsatz in einem beliebigen 12-Monats-Zeitraum muss eine gesonderte Kommerzlizenz verhandeln. Produkte mit 100M+ monatlich aktiven Nutzern oder 20 Millionen Dollar+ Monatsumsatz müssen den Modellnamen prominent zeigen. Die Wette: internationale Entwickler-Mindshare gewinnen, Hebel gegenüber Firmen behalten, die ein konkurrierendes Inferenzgeschäft aufbauen können. Das ist eine andere Wette als Metas Muse Glimmer unter uneingeschränktem Apache 2.0.

Ein Gerücht verdient eine klare Absage. Behauptungen, die Lizenz verbiete Downloads aus den USA, der EU, dem Vereinigten Königreich und Südkorea, sind falsch. Die veröffentlichte LICENSE-Datei enthält keine geografische Klausel. In einem Release-Zyklus dieser Geschwindigkeit ist die LICENSE-Datei — nicht der Ankündigungsthread — die Primärquelle. Das Modell-Repository auf Hugging Face und ModelScope ist der Ort der Gewichte, nicht ein App-Store-Listing.

3. GLM-5.3: kein neues Basismodell, nur ein größerer Post-Training-Einsatz. Dieselbe 743B-Parameter-Basis wie GLM-5.2, kein Retraining, und ein Sprung um rund das Sechsfache auf Terminal-Bench 3.0 (4.6 % → 28.3 %) durch Skalierung der Reinforcement-Learning-Umgebungen. Während Pretraining-Skalierungsgesetze abnehmende Erträge zeigen, wird Post-Training-RL-Skalierung zu einem eigenen Hebel mit deutlich niedrigerer Kostenschwelle als ein neues Foundation-Modell. Mid-Tier-Labore ohne OpenAI-Compute können bei Agent- und Coding-Benchmarks aufholen.

Strittig oder unbestätigt:

  • Die 1.100-%-Schlagzeile ist korrekt und unvollständig. Sie gilt nur für Peak-Cache-Treffer-Eingabe. Ausgabe — der Posten, der die meisten realen Rechnungen trägt — stieg um 350 %.
  • Behauptungen, Qwen3.8-Max laufe auf Alibabas hauseigenen Zhenwu-M890-Chips und «Pangu AL128»-Supernodes, stehen in chinesischen Finanzmedien. Alibabas technische Dokumentation und Drittbenchmarks haben das nicht unabhängig bestätigt. Als vendor-nah, unbestätigt behandeln.
  • GLM-5.3s gemeldete Entdeckung einer schweren Schwachstelle in Cursor stammt von VentureBeat und Zhipus eigener Offenlegung. Technische Details sind nicht öffentlich. Vendor-Quelle, nicht unabhängig auditiert.
  • Berichte, Chinas Handelsministerium (MOFCOM) bereite Vergeltungs-Exportkontrollen für KI- oder Halbleitertechnik vor, sind spekulativ und stützen sich auf unbestätigte Medienberichte, nicht auf eine amtliche Ankündigung.

Warum das zählt: zwei Preiskämpfe parallel. Im vergangenen Monat haben Chinas Top-Labore in einem Takt geliefert, den Inlandmedien als drei Updates pro Woche bezeichnen. US-Labore liefen auf der Consumer-Schicht in die Gegenrichtung: OpenAI senkte Luna am 30. Juli um 80 %, machte es am 6.–7. August kostenlos und unbegrenzt; Google lieferte am 13. August ein coding-fokussiertes Modell zum halben Preis des drei Wochen alten Vorgängers. Chinesische Labore öffnen Flaggschiff-Gewichte und führen gestufte, höhere Preise am compute-knappen oberen Ende ein. US-Labore rennen am Consumer-Ende Richtung kostenlos und billig.

Es gibt auch eine geopolitische Schicht. Moonshots Kimi K3 hat bereits US-Sicherheitsprüfung ausgelöst. Einige Analysten lesen Alibabas Wahl dieses Fensters für ein 2,4T-Open-Weight-Flaggschiff als Versuch, internationale Mindshare zu sichern, bevor regulatorische Verengung möglich wird. Das ist eine informierte Interpretation, kein bestätigter Fakt. Siehe Kimi-K3-Open-Weight-Erklärer.

  1. Die Schlagzeile in Abrechnungszeilen zerlegen. Cache-Treffer-Eingabe (~1.100 %), Ausgabe (350 %) und Cache-Miss-Eingabe (200 %) als getrennte Zeilen führen. Nicht aus einem einzigen Multiplikator budgetieren.
  2. Offizielle Peak-Tarife mit Resellern vergleichen. GMI Cloud, Novita und weitere Listings gegen DeepSeeks Peak-Blatt legen. Offiziell ist nicht mehr der Default-Sparpfad.
  3. Die Qwen-LICENSE-Datei lesen, nicht den Launch-Thread. Bestätigen: kein Geo-Verbot. Prüfen, ob Ihr Produkt Model-as-a-Service / AI Work Assistant plus 50 Millionen Dollar in beliebigen 12 Monaten trifft, oder 100M MAU / 20 Millionen Dollar Monatsumsatz.
  4. GLM-5.3-Scores als Vendor-Run kennzeichnen. Terminal-Bench 3.0 bei 28.3 % hat keinen veröffentlichten unabhängigen Rerun. Wenn Sie Sol 34.6 % und Fable 5 33.7 % zitieren, die Quelle sichtbar halten.
  5. Die Rechnung mit Off-Peak- und Cache-Treffer-Quote neu bepreisen. Batch-Jobs, Evals und nächtliche Agent-Schleifen aus dem Peak schieben. Für Schwerlast ~1,8× modellieren, nicht 11×. Wer Nutzungs- und Abrechnungsdaten oder API-Logs in der Cloud verarbeitet, bleibt unter der DSGVO für Zweckbindung und Auftragsverarbeitung verantwortlich.
  6. Self-Hosting von Open Weights braucht einen stabilen Host. Lange Evals, Agent-Orchestrierung und Lizenz-Compliance-Logs brauchen eine 7×24 reproduzierbare Umgebung. Laptop-Sleep und driftende VMs zerbrechen die Audit-Spur. Trial-Node über Mietpreis- und Bestellseite starten und Versionen, Lizenztext sowie Logs festhalten.
china-llm-price-war-triage.md
China Open-Weight + Pricing-Cluster — Triage-Skizze (gegen Primärquellen prüfen)
deepseek  V4-Pro Peak Cache-Treffer-Input ~1100% · Output +350% · wirksam 17. Aug 00:00 CST
peak      Peking 09:00-12:00 und 14:00-18:00 · UTC 01:00-04:00 und 06:00-10:00
qwen      2.4T-A95B Gewichte live 12. Aug · eigene Lizenz · kein Geo-Verbot
glm53     gleiche 743B-Basis · TB3.0 4.6% → 28.3% · Vendor-Run, kein Dritt-Rerun
rumor     Zhenwu M890 / Cursor-Lücke / MOFCOM-Exportkontrollen = unbestätigt

  • DeepSeek V4-Pro Peak Cache-Treffer-Eingabe: ¥0.025 → ¥0.30, rund 1.100 %; Ausgabe ¥6.0 → ¥27.0, 350 %.
  • Qwen3.8-2.4T-A95B: 2,4T gesamt / 95B aktiv; 262144 Token nativ, ~1.01M erweiterbar; internationale API $2 / $6.
  • Qwen-Lizenzschranken: MaaS / AI Work Assistant über 50 Millionen Dollar in beliebigen 12 Monaten braucht eine gesonderte Lizenz; 100M MAU oder 20 Millionen Dollar Monatsumsatz braucht prominente Namensnennung; kein geografisches Verbot.
  • GLM-5.3: dieselbe 743B-Basis wie 5.2; Terminal-Bench 3.0 4.6 % → 28.3 %; weiter hinter Sol 34.6 % und Fable 5 33.7 %.
  • Schwerlast-Rechnung: Drittmodellierung ~1,8×, weit unter der 11×-Schlagzeile.
  • FX-Referenz: etwa ¥7.15 / $1, nur Näherung.

FAQ:

  • F: Ist DeepSeek noch günstiger als GPT-5.6 oder Claude? A: Off-Peak unterbietet weiter Claude Opus 5. Luna ($0.20 / $1.20) und Qwen3.8-Max international ($2 / $6) unterbieten DeepSeek Off-Peak mindestens in einer Dimension.
  • F: Darf ich Qwen3.8-Max Open Weights kommerziell kostenlos nutzen? A: Privat und intern ja. Die 50-Millionen-Dollar-Schranke für MaaS / AI Work Assistant ist der Haken.
  • F: Ist Qwen3.8-Max für US-, EU- oder UK-Nutzer gesperrt? A: Nein. Die veröffentlichte Lizenz hat keine geografische Beschränkung.
  • F: Was hat sich zwischen GLM-5.3 und GLM-5.2 geändert? A: Dieselbe 743B-Basis. Gewinne kommen aus skaliertem Post-Training-RL, nicht aus einem neuen Foundation-Modell.
  • F: Wird Meta Muse Spark 1.2 öffnen, nicht nur Glimmer? A: Noch nicht. Glimmer ist eine 30B-Destillation. Spark 1.2 bleibt erklärte Absicht.

Primärquellen beim Verfassen. Offizielle Preise und Lizenzbedingungen vor einer Weiterveröffentlichung erneut prüfen. Als unbestätigt gekennzeichnete Punkte (inländische Chip-Behauptungen, der Cursor-Schwachstellenbericht, Exportkontroll-Gerüchte) sind nicht unabhängig bestätigt. Zahlen spiegeln öffentliche Angaben zum 17. August 2026.

Offizielle DeepSeek-Preisseite (die Live-Seite gilt als Quelle der Wahrheit):

https://api-docs.deepseek.com/quick_start/pricing

Offizielle Alibaba-Qwen-Modell-Repositories auf Hugging Face:

https://huggingface.co/Qwen

ModelScope-Modell-Repositories:

https://www.modelscope.cn/

Offizielle Zhipu-GLM-5.3-Technikseite:

https://z.ai/blog/glm-5.3

Echte Grenzen der üblichen Workarounds: Aus einem einzigen 1.100-%-Multiplikator zu budgetieren überschätzt Off-Peak-Schwerlast und unterschätzt Peak-Batch-Schocks. Qwen-Gewichte wie Apache 2.0 zu behandeln und ein Model-as-a-Service-Produkt aufzusetzen kann die eigene Lizenz auslösen. 2,4T-Klasse-Evals und lange Agent-Schleifen auf einem Laptop, der in den Sleep geht, oder auf einer driftenden VM, zerbrechen Reproduzierbarkeit und die Lizenz-Audit-Spur.

Für Teams, die dediziertes Apple Silicon, 7×24-Betrieb und Tag/Woche/Monat-Elastizität brauchen, um Open-Weight-Evals, Agent-Orchestrierung und lange Inferenz auf einem stabilen macOS-Host zu fahren, ist NOVAKVM Mac-Mini-Bare-Metal-Miete meist der bessere Produktionsweg. Preisnarrative auf den Tarifkarten der Anbieter lassen; Ausführung auf einem residenten Bare-Metal-Knoten halten. Stufen auf der NOVAKVM Mietpreisseite vergleichen, Trial auf der Bestellseite starten, Remote-Sessions im Hilfezentrum klären.