DeepSeek V4 GA: Vollversion live —
Preise, Architektur und Vergleich mit GPT-5.6

Nach drei Monaten Wartezeit ist DeepSeek V4 in der Vollversion (GA) am 20. Juli 2026 offiziell live. Gegenüber der Preview vom April bringt GA gezielte Verbesserungen bei Agenten, mathematischer Reasoning und Code-Generierung sowie erstmals Peak-Off-Peak-Differenzierung — DeepSeek geht von „fast gratis“ zu disziplinierter Kommerzialisierung. Dieser Artikel richtet sich an Teams, die noch deepseek-chat nutzen und bis zum 24. Juli migrieren müssen, sowie an Entscheider zwischen GPT-5.6, Claude Fable 5 und V4: zuerst sieben Schmerzpunkte, dann Timeline, 1,6T-MoE-Architektur (CSA+HCA, mHC, Muon), Benchmarks, Drei-Wege-Vergleich, Peak-Preistabelle, Sechs-Schritte-Migrationscheckliste und zitierbare Technikparameter, abgeschlossen mit Mac-Self-Hosting und NOVAKVM-High-Memory-Knoten als Souveränitätsoption. Daten basieren auf DeepSeek-Dokumentation und arXiv:2606.19348; Links nach Release erneut prüfen. Preise: Mietpreisseite, Bestellung: Bestellseite; ergänzend ds4-Lokalinferenz und GPT-5.6-Release.

  • Legacy-API endet: deepseek-chat und deepseek-reasoner werden am 24. Juli 2026, 23:59 Uhr (Peking-Zeit) dauerhaft abgeschaltet. Produktionscode ohne Modellwechsel bricht hart ab.
  • Peak-Off-Peak erhöht Scheduling-Komplexität: Werktags 09:00–12:00 und 14:00–18:00 (Peking) verdoppeln die Tarife; 7×24-Agent-Pipelines ohne Zeitfensterplanung können die Rechnung sprengen.
  • Pro vs. Flash unklar: V4-Pro (1,6T / 49B aktiv) und V4-Flash (284B / 13B aktiv) unterscheiden sich in Preis und Fähigkeiten; falsches Routing verschwendet Tokens oder Qualität.
  • Closed-Source-Flaggschiffe führen weiter: Claude Fable 5 erreicht 80,3 % auf SWE-bench Pro, V4-Pro 55,4 % — „stärkstes Open Source“ heißt nicht „stärkstes Modell überhaupt“.
  • 1M Kontext ist kein Gratisbonus: KV-Cache zwar auf 10 % von V3.2 reduziert, lange Agent-Kontexte brauchen weiter RAM und Compute; Self-Hosting ab 96 GB+ Unified Memory (ds4-Pfad).
  • Datenschutz und Compliance: Finanz-, Medizin- und Behördenumfelder bevorzugen MIT-Open-Source plus Private Deployment; V4-Pro Vollgewichte lokal sind hardwareintensiv. EU-Teams: Verarbeitung personenbezogener Prompts gegen DSGVO und AV-Vertrag prüfen.
  • Drei Inferenzmodi konfigurieren: Non-think / Think High / Think Max plus empfohlene temperature=1.0, top_p=1.0 erfordern Szenen-Tuning; blindes Think Max erhöht Latenz und Kosten.

DeepSeek V4 — wichtige Timeline (2026)
Datum Ereignis
24. April V4-Preview live und Open Source (MIT): V4-Pro (1,6T) und V4-Flash (284B)
Mai Produktions-Tuning-Version, API offiziell nutzbar
Juni V4-Pro-Ausgabepreis dauerhaft −75 % auf $0,87/M Tokens
29. Juni E-Mail: GA Mitte Juli, erstmals Peak-Off-Peak-Preise
19. Juli GA-Grauzonen-Zugang für ausgewählte Entwickler, Medien: „Vollversion morgen“
20. Juli GA-Vollversion live (Veröffentlichungstag dieses Artikels)
24. Juli deepseek-chat / deepseek-reasoner endgültig offline

Kurzfassung: GA verbessert Agent, Mathe-Reasoning und Code gegenüber der Preview und führt formales Peak-Off-Peak-Billing ein; die MoE-Basisarchitektur bleibt.

V4-Pro vs. V4-Flash — Spezifikationen
Spezifikation V4-Pro V4-Flash
Gesamtparameter 1,6 Billionen (1,6T) 284 Milliarden (284B)
Aktive Parameter pro Token 49 Milliarden (49B) 13 Milliarden (13B)
Transformer-Schichten 61 43
Kontextfenster 1.000.000 Tokens 1.000.000 Tokens
Max. Ausgabe 384K Tokens 384K Tokens
Präzision FP4 (Experten) + FP8 (Rest) FP4 + FP8 gemischt
Pretraining-Daten 33T+ Tokens 32T+ Tokens
Lizenz MIT MIT

Kern-Innovationen (1M-Kontext):

  • Hybrid-Attention (CSA + HCA): Statt MLA aus V2/V3: Compressed Sparse Attention (CSA — KV per Softmax-Gating 4× komprimiert, FP4 Lightning Indexer für top-k, Pro top-1024 / Flash top-512, plus 128-Token-Sliding-Window) und Heavy Compressed Attention (HCA — 128× komprimiert, global dicht) im Wechsel. Bei 1M nur 27 % der V3.2-FLOPs, KV-Cache 10 % (Flash bis 7 %).
  • Manifold-Constrained Hyper-Connections (mHC): 4-Kanal-Residual-Stream plus doppelt-stochastische Matrix (Birkhoff-Polytop) für stabile Gradienten über 61 Schichten.
  • Muon-Optimierer: Newton-Schulz-Orthogonalisierung der Gradienten im Training — schnellere, stabilere Konvergenz statt AdamW.
Drei Inferenzmodi und Einsatz
Modus Eigenschaft Einsatz
Non-think Keine Chain-of-Thought, schnell Einfache Q&A, Routing
Think High Explizites Reasoning (CoT-Tags) Mittlere Komplexität, Code-Debug
Think Max Maximale Reasoning-Tiefe, 384K+ Kontext Schwere Mathe, lange Agent-Ketten

Offizielle Sampling-Defaults (alle Modi): temperature=1.0, top_p=1.0.

V4-Pro — Kernergebnisse (Juli 2026)
Benchmark DeepSeek V4-Pro Claude Fable 5 GPT-5.6 Ultra Claude Opus 4.8
SWE-bench Verified 80,6 % (Open-Source-Rekord) 96,0 % nicht separat veröffentlicht ~69 %
SWE-bench Pro 55,4 % 80,3 % 78,1 % 69,2 %
LiveCodeBench (Pass@1) 93,5 % 88,1 % 87,4 % 83,2 %
Codeforces Elo 3.206
Terminal-Bench 2.1 83,9 % 88,0 % 85,1 % 82,7 %

Artificial Analysis (Strategy & Ops): Claude Fable 5 $3,48 pro Lauf, Score 50; DeepSeek V4-Pro $0,03, Score 38 — Kostenfaktor 116×, Score nur ~31 % höher. V4-Flash unter $0,04 pro Lauf in allen sechs Index-Kategorien.

Gesamtposition: V4-Pro vs. GPT-5.6 Sol vs. Claude Fable 5
Dimension DeepSeek V4-Pro GPT-5.6 Sol Claude Fable 5
Open Source / Self-Hosting MIT, ja Closed, nein Closed, nein
Kontextfenster 1M Tokens unveröffentlicht 1M Tokens
API-Ausgabe (Off-Peak) $0,87/M Tokens ~$15/M $50/M
Peak-Ausgabe $1,74/M Tokens
Agent-Fähigkeit stark, Multi-Agent stark stärkste Klasse
Datenschutz Private Deployment möglich Drittanbieter-Cloud Drittanbieter-Cloud

Szenario-Kurzwahl: knappes Budget / hohe Frequenz / Private Deployment → V4-Pro oder V4-Flash; maximaler Code, Kosten egal → Claude Fable 5; komplexe Algorithmen + Mathe → GPT-5.6 Sol / Ultra; massive Logs / Dokumente → V4-Flash (Cache-Hit-Eingabe $0,0028/M).

GA bringt erstmals Peak-Off-Peak-Differenzierung wie Stromtarife. Peak (Peking-Zeit): Werktags 09:00–12:00 und 14:00–18:00, Tarife verdoppelt. DeepSeek kündigt Änderungen 24 Stunden per E-Mail an.

V4-Pro / V4-Flash — vollständige Preise (Off-Peak / Peak)
Modell Posten Off-Peak Peak
V4-Pro Eingabe (Cache-Hit) ¥0,025 / $0,0035 / 1M verdoppelt
V4-Pro Eingabe (Cache-Miss) ¥3,00 / $0,435 / 1M ¥6,00 / $0,87
V4-Pro Ausgabe ¥6,00 / $0,87 / 1M ¥12,00 / $1,74
V4-Flash Eingabe (Cache-Hit) ¥0,02 / $0,0028 / 1M verdoppelt
V4-Flash Eingabe (Cache-Miss) ¥1,00 / $0,14 / 1M ¥2,00 / $0,28
V4-Flash Ausgabe ¥2,00 / $0,28 / 1M ¥4,00 / $0,56
  • Nicht-Echtzeit in Off-Peak legen: Batch-Dokumente, Labeling, Code-Review nach 18:00 oder vor 09:00.
  • Prompt Cache nutzen: wiederholte System-Prompts cachen; V4-Flash Cache-Hit $0,0028/M.
  • Flash als Router: einfache Intents an V4-Flash, schwere Reasoning an V4-Pro — 60–80 % Ersparnis möglich.
  • Rechnungs-E-Mail abonnieren: Konto-E-Mail für Preisänderungen aktiv halten.

Selbst im Peak: V4-Pro-Ausgabe ($1,74/M) bleibt 8,6× günstiger als Claude Opus 4.8 ($15/M) und GPT-5.6 Sol (~$15/M).

Wichtig: deepseek-chat und deepseek-reasoner enden am 24. Juli 2026, 15:59 UTC (24. Juli 23:59 Peking) dauerhaft.

Migrations-Mapping
Altes Modell Neues Modell Hinweis
deepseek-chat deepseek-v4-flash (Non-think) Schnell, leichte Tasks
deepseek-reasoner deepseek-v4-flash (Think-Modus) oder Upgrade auf deepseek-v4-pro
  1. Repo-weit suchen: deepseek-chat und deepseek-reasoner in Code, CI, Env-Vars und Secrets.
  2. Modell nach Szenario wählen: leichte Dialoge → deepseek-v4-flash Non-think; ehemaliges Reasoner-Verhalten → Flash Think oder deepseek-v4-pro.
  3. OpenAI SDK anpassen: nur model ändern; Think-Modus via extra_body mit thinking.
  4. Anthropic-kompatiblen Pfad prüfen: base_url bleibt https://api.deepseek.com, model auf deepseek-v4-pro oder deepseek-v4-flash.
  5. Staging-Regression: Tool Calling, Streaming, langer Kontext; Think Max braucht ≥384K Fenster.
  6. Produktions-Rollout und Monitoring: vor 24. Juli canary deployen, Peak-Token und Fehlerrate beobachten, ggf. Zeitplanung aktivieren.
migrate_deepseek_v4.py
model="deepseek-chat"  (ungültig ab 24. Juli)
client.chat.completions.create(
    model="deepseek-chat",
    messages=[...]
)

model="deepseek-v4-pro"
client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[...],
    extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)

Offizielle Quellen (nach Release erneut prüfen):

https://api.deepseek.com

https://arxiv.org/abs/2606.19348

  • SWE-bench Verified 80,6 %: Open-Source-Rekord, Gleichstand mit Gemini 3.1 Pro; echte GitHub-Bugfixes (öffentliche Benchmark-Zusammenfassung, nach Release verifizieren).
  • KV-Cache 10 %: bei 1M nur 10 % von V3.2 (Flash 7 %), Quelle arXiv:2606.19348.
  • 116× Kosten: Artificial Analysis Strategy & Ops — Fable 5 $3,48 vs. V4-Pro $0,03 pro Lauf.
  • Juni-Preissenkung: V4-Pro-Ausgabe $0,87/M — historisch starke Preis-Leistung (DeepSeek-Preisseite).
  • MIT Open Source: V4-Pro- und Flash-Gewichte self-hostbar; für Daten, die die EU nicht verlassen sollen, plus DSGVO-konforme Verarbeitung prüfen.
  • Hard Deadline: ab 2026-07-24 23:59 Peking sind deepseek-chat / deepseek-reasoner tot (DeepSeek-API-Mail).

DeepSeek V4 GA ist 2026 einer der wichtigsten Meilensteine im Open-Source-LLM-Bereich. Der Wert liegt nicht darin, Claude Fable 5 oder GPT-5.6 sofort zu schlagen, sondern 1/10 bis 1/100 der Closed-Source-Kosten für die stärkste Open-Source-Leistung zu bieten.

Nachteile der Alternativen: ① Nur Claude/GPT-Cloud — teure Long-Context-Agenten, Code durch Dritte, Compliance-Aufwand; ② V4-Vollgewichte auf 16-GB-Laptop — unmöglich, verschwendete Debug-Zeit; ③ Mac Studio Ultra für kurze Experimente — Leerstand teurer als wöchentliche High-Memory-Miete. Für private V4-Flash-Tests siehe ds4 + 128GB-Mac-Deployment.

Für Teams mit Datenschutzanforderungen, knappem Budget, 1M-Agent-Kontext oder maximaler API-Effizienz ist DeepSeek V4 Pro derzeit die rundeste Open-Source-Option. Reproduierbare Infrastruktur statt Einmal-Experiment: NOVAKVM Mac Mini Bare-Metal — sechs Regionen, dediziertes Apple Silicon mit High Memory, flexibel Tag/Woche/Monat; 128GB-Knoten für lokale Inferenz, danach Kaufentscheidung. Migration bis 24. Juli abschließen. Mietpreisseite, Bestellseite, Hilfezentrum.