Nach drei Monaten Wartezeit ist DeepSeek V4 in der Vollversion (GA) am 20. Juli 2026 offiziell live. Gegenüber der Preview vom April bringt GA gezielte Verbesserungen bei Agenten, mathematischer Reasoning und Code-Generierung sowie erstmals Peak-Off-Peak-Differenzierung — DeepSeek geht von „fast gratis“ zu disziplinierter Kommerzialisierung. Dieser Artikel richtet sich an Teams, die noch deepseek-chat nutzen und bis zum 24. Juli migrieren müssen, sowie an Entscheider zwischen GPT-5.6, Claude Fable 5 und V4: zuerst sieben Schmerzpunkte, dann Timeline, 1,6T-MoE-Architektur (CSA+HCA, mHC, Muon), Benchmarks, Drei-Wege-Vergleich, Peak-Preistabelle, Sechs-Schritte-Migrationscheckliste und zitierbare Technikparameter, abgeschlossen mit Mac-Self-Hosting und NOVAKVM-High-Memory-Knoten als Souveränitätsoption. Daten basieren auf DeepSeek-Dokumentation und arXiv:2606.19348; Links nach Release erneut prüfen. Preise: Mietpreisseite, Bestellung: Bestellseite; ergänzend ds4-Lokalinferenz und GPT-5.6-Release.
[ SECTION_01 ] // PAIN_MAP Sieben Schmerzpunkte vor dem DeepSeek-V4-GA-Release
- Legacy-API endet:
deepseek-chatunddeepseek-reasonerwerden am 24. Juli 2026, 23:59 Uhr (Peking-Zeit) dauerhaft abgeschaltet. Produktionscode ohne Modellwechsel bricht hart ab. - Peak-Off-Peak erhöht Scheduling-Komplexität: Werktags 09:00–12:00 und 14:00–18:00 (Peking) verdoppeln die Tarife; 7×24-Agent-Pipelines ohne Zeitfensterplanung können die Rechnung sprengen.
- Pro vs. Flash unklar: V4-Pro (1,6T / 49B aktiv) und V4-Flash (284B / 13B aktiv) unterscheiden sich in Preis und Fähigkeiten; falsches Routing verschwendet Tokens oder Qualität.
- Closed-Source-Flaggschiffe führen weiter: Claude Fable 5 erreicht 80,3 % auf SWE-bench Pro, V4-Pro 55,4 % — „stärkstes Open Source“ heißt nicht „stärkstes Modell überhaupt“.
- 1M Kontext ist kein Gratisbonus: KV-Cache zwar auf 10 % von V3.2 reduziert, lange Agent-Kontexte brauchen weiter RAM und Compute; Self-Hosting ab 96 GB+ Unified Memory (ds4-Pfad).
- Datenschutz und Compliance: Finanz-, Medizin- und Behördenumfelder bevorzugen MIT-Open-Source plus Private Deployment; V4-Pro Vollgewichte lokal sind hardwareintensiv. EU-Teams: Verarbeitung personenbezogener Prompts gegen DSGVO und AV-Vertrag prüfen.
- Drei Inferenzmodi konfigurieren: Non-think / Think High / Think Max plus empfohlene
temperature=1.0, top_p=1.0erfordern Szenen-Tuning; blindes Think Max erhöht Latenz und Kosten.
[ SECTION_02 ] // ARCHITECTURE Von der Preview zur Vollversion: Timeline und V4-Pro-/Flash-Architektur
| Datum | Ereignis |
|---|---|
| 24. April | V4-Preview live und Open Source (MIT): V4-Pro (1,6T) und V4-Flash (284B) |
| Mai | Produktions-Tuning-Version, API offiziell nutzbar |
| Juni | V4-Pro-Ausgabepreis dauerhaft −75 % auf $0,87/M Tokens |
| 29. Juni | E-Mail: GA Mitte Juli, erstmals Peak-Off-Peak-Preise |
| 19. Juli | GA-Grauzonen-Zugang für ausgewählte Entwickler, Medien: „Vollversion morgen“ |
| 20. Juli | GA-Vollversion live (Veröffentlichungstag dieses Artikels) |
| 24. Juli | deepseek-chat / deepseek-reasoner endgültig offline |
Kurzfassung: GA verbessert Agent, Mathe-Reasoning und Code gegenüber der Preview und führt formales Peak-Off-Peak-Billing ein; die MoE-Basisarchitektur bleibt.
| Spezifikation | V4-Pro | V4-Flash |
|---|---|---|
| Gesamtparameter | 1,6 Billionen (1,6T) | 284 Milliarden (284B) |
| Aktive Parameter pro Token | 49 Milliarden (49B) | 13 Milliarden (13B) |
| Transformer-Schichten | 61 | 43 |
| Kontextfenster | 1.000.000 Tokens | 1.000.000 Tokens |
| Max. Ausgabe | 384K Tokens | 384K Tokens |
| Präzision | FP4 (Experten) + FP8 (Rest) | FP4 + FP8 gemischt |
| Pretraining-Daten | 33T+ Tokens | 32T+ Tokens |
| Lizenz | MIT | MIT |
Kern-Innovationen (1M-Kontext):
- Hybrid-Attention (CSA + HCA): Statt MLA aus V2/V3: Compressed Sparse Attention (CSA — KV per Softmax-Gating 4× komprimiert, FP4 Lightning Indexer für top-k, Pro top-1024 / Flash top-512, plus 128-Token-Sliding-Window) und Heavy Compressed Attention (HCA — 128× komprimiert, global dicht) im Wechsel. Bei 1M nur 27 % der V3.2-FLOPs, KV-Cache 10 % (Flash bis 7 %).
- Manifold-Constrained Hyper-Connections (mHC): 4-Kanal-Residual-Stream plus doppelt-stochastische Matrix (Birkhoff-Polytop) für stabile Gradienten über 61 Schichten.
- Muon-Optimierer: Newton-Schulz-Orthogonalisierung der Gradienten im Training — schnellere, stabilere Konvergenz statt AdamW.
| Modus | Eigenschaft | Einsatz |
|---|---|---|
| Non-think | Keine Chain-of-Thought, schnell | Einfache Q&A, Routing |
| Think High | Explizites Reasoning (CoT-Tags) | Mittlere Komplexität, Code-Debug |
| Think Max | Maximale Reasoning-Tiefe, 384K+ Kontext | Schwere Mathe, lange Agent-Ketten |
Offizielle Sampling-Defaults (alle Modi):
temperature=1.0,top_p=1.0.
[ SECTION_03 ] // BENCHMARK Benchmarks und Entscheidungsmatrix vs. GPT-5.6 / Claude Fable 5
| Benchmark | DeepSeek V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80,6 % (Open-Source-Rekord) | 96,0 % | nicht separat veröffentlicht | ~69 % |
| SWE-bench Pro | 55,4 % | 80,3 % | 78,1 % | 69,2 % |
| LiveCodeBench (Pass@1) | 93,5 % | 88,1 % | 87,4 % | 83,2 % |
| Codeforces Elo | 3.206 | — | — | — |
| Terminal-Bench 2.1 | 83,9 % | 88,0 % | 85,1 % | 82,7 % |
Artificial Analysis (Strategy & Ops): Claude Fable 5 $3,48 pro Lauf, Score 50; DeepSeek V4-Pro $0,03, Score 38 — Kostenfaktor 116×, Score nur ~31 % höher. V4-Flash unter $0,04 pro Lauf in allen sechs Index-Kategorien.
| Dimension | DeepSeek V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| Open Source / Self-Hosting | MIT, ja | Closed, nein | Closed, nein |
| Kontextfenster | 1M Tokens | unveröffentlicht | 1M Tokens |
| API-Ausgabe (Off-Peak) | $0,87/M Tokens | ~$15/M | $50/M |
| Peak-Ausgabe | $1,74/M Tokens | — | — |
| Agent-Fähigkeit | stark, Multi-Agent | stark | stärkste Klasse |
| Datenschutz | Private Deployment möglich | Drittanbieter-Cloud | Drittanbieter-Cloud |
Szenario-Kurzwahl: knappes Budget / hohe Frequenz / Private Deployment → V4-Pro oder V4-Flash; maximaler Code, Kosten egal → Claude Fable 5; komplexe Algorithmen + Mathe → GPT-5.6 Sol / Ultra; massive Logs / Dokumente → V4-Flash (Cache-Hit-Eingabe $0,0028/M).
[ SECTION_04 ] // PRICING Peak-Off-Peak-Billing: Zeiten, Preistabelle und vier Spartipps
GA bringt erstmals Peak-Off-Peak-Differenzierung wie Stromtarife. Peak (Peking-Zeit): Werktags 09:00–12:00 und 14:00–18:00, Tarife verdoppelt. DeepSeek kündigt Änderungen 24 Stunden per E-Mail an.
| Modell | Posten | Off-Peak | Peak |
|---|---|---|---|
| V4-Pro | Eingabe (Cache-Hit) | ¥0,025 / $0,0035 / 1M | verdoppelt |
| V4-Pro | Eingabe (Cache-Miss) | ¥3,00 / $0,435 / 1M | ¥6,00 / $0,87 |
| V4-Pro | Ausgabe | ¥6,00 / $0,87 / 1M | ¥12,00 / $1,74 |
| V4-Flash | Eingabe (Cache-Hit) | ¥0,02 / $0,0028 / 1M | verdoppelt |
| V4-Flash | Eingabe (Cache-Miss) | ¥1,00 / $0,14 / 1M | ¥2,00 / $0,28 |
| V4-Flash | Ausgabe | ¥2,00 / $0,28 / 1M | ¥4,00 / $0,56 |
- Nicht-Echtzeit in Off-Peak legen: Batch-Dokumente, Labeling, Code-Review nach 18:00 oder vor 09:00.
- Prompt Cache nutzen: wiederholte System-Prompts cachen; V4-Flash Cache-Hit $0,0028/M.
- Flash als Router: einfache Intents an V4-Flash, schwere Reasoning an V4-Pro — 60–80 % Ersparnis möglich.
- Rechnungs-E-Mail abonnieren: Konto-E-Mail für Preisänderungen aktiv halten.
Selbst im Peak: V4-Pro-Ausgabe ($1,74/M) bleibt 8,6× günstiger als Claude Opus 4.8 ($15/M) und GPT-5.6 Sol (~$15/M).
[ SECTION_05 ] // MIGRATION API-Migration: Sechs-Schritte-Checkliste (Deadline 24. Juli 23:59)
Wichtig: deepseek-chat und deepseek-reasoner enden am 24. Juli 2026, 15:59 UTC (24. Juli 23:59 Peking) dauerhaft.
| Altes Modell | Neues Modell | Hinweis |
|---|---|---|
deepseek-chat |
deepseek-v4-flash (Non-think) |
Schnell, leichte Tasks |
deepseek-reasoner |
deepseek-v4-flash (Think-Modus) |
oder Upgrade auf deepseek-v4-pro |
- Repo-weit suchen:
deepseek-chatunddeepseek-reasonerin Code, CI, Env-Vars und Secrets. - Modell nach Szenario wählen: leichte Dialoge →
deepseek-v4-flashNon-think; ehemaliges Reasoner-Verhalten → Flash Think oderdeepseek-v4-pro. - OpenAI SDK anpassen: nur
modeländern; Think-Modus viaextra_bodymitthinking. - Anthropic-kompatiblen Pfad prüfen:
base_urlbleibthttps://api.deepseek.com,modelaufdeepseek-v4-prooderdeepseek-v4-flash. - Staging-Regression: Tool Calling, Streaming, langer Kontext; Think Max braucht ≥384K Fenster.
- Produktions-Rollout und Monitoring: vor 24. Juli canary deployen, Peak-Token und Fehlerrate beobachten, ggf. Zeitplanung aktivieren.
model="deepseek-chat" (ungültig ab 24. Juli)
client.chat.completions.create(
model="deepseek-chat",
messages=[...]
)
model="deepseek-v4-pro"
client.chat.completions.create(
model="deepseek-v4-pro",
messages=[...],
extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)
Offizielle Quellen (nach Release erneut prüfen):
https://arxiv.org/abs/2606.19348
[ SECTION_06 ] // FACTS Zitierbare Fakten und Mac-Self-Hosting-Ausblick
- SWE-bench Verified 80,6 %: Open-Source-Rekord, Gleichstand mit Gemini 3.1 Pro; echte GitHub-Bugfixes (öffentliche Benchmark-Zusammenfassung, nach Release verifizieren).
- KV-Cache 10 %: bei 1M nur 10 % von V3.2 (Flash 7 %), Quelle arXiv:2606.19348.
- 116× Kosten: Artificial Analysis Strategy & Ops — Fable 5 $3,48 vs. V4-Pro $0,03 pro Lauf.
- Juni-Preissenkung: V4-Pro-Ausgabe $0,87/M — historisch starke Preis-Leistung (DeepSeek-Preisseite).
- MIT Open Source: V4-Pro- und Flash-Gewichte self-hostbar; für Daten, die die EU nicht verlassen sollen, plus DSGVO-konforme Verarbeitung prüfen.
- Hard Deadline: ab 2026-07-24 23:59 Peking sind
deepseek-chat/deepseek-reasonertot (DeepSeek-API-Mail).
DeepSeek V4 GA ist 2026 einer der wichtigsten Meilensteine im Open-Source-LLM-Bereich. Der Wert liegt nicht darin, Claude Fable 5 oder GPT-5.6 sofort zu schlagen, sondern 1/10 bis 1/100 der Closed-Source-Kosten für die stärkste Open-Source-Leistung zu bieten.
Nachteile der Alternativen: ① Nur Claude/GPT-Cloud — teure Long-Context-Agenten, Code durch Dritte, Compliance-Aufwand; ② V4-Vollgewichte auf 16-GB-Laptop — unmöglich, verschwendete Debug-Zeit; ③ Mac Studio Ultra für kurze Experimente — Leerstand teurer als wöchentliche High-Memory-Miete. Für private V4-Flash-Tests siehe ds4 + 128GB-Mac-Deployment.
Für Teams mit Datenschutzanforderungen, knappem Budget, 1M-Agent-Kontext oder maximaler API-Effizienz ist DeepSeek V4 Pro derzeit die rundeste Open-Source-Option. Reproduierbare Infrastruktur statt Einmal-Experiment: NOVAKVM Mac Mini Bare-Metal — sechs Regionen, dediziertes Apple Silicon mit High Memory, flexibel Tag/Woche/Monat; 128GB-Knoten für lokale Inferenz, danach Kaufentscheidung. Migration bis 24. Juli abschließen. Mietpreisseite, Bestellseite, Hilfezentrum.