Wenn Sie als AI-Entwickler oder Platform Lead Agent-APIs, Batch-Pipelines oder Provider-Migrationen unter FinOps-Druck evaluieren, liefert DeepSeek am 31. Juli 2026 eine Antwort, die gegen die Intuition „stärker = größer“ verstößt: V4-Flash-0731 behält exakt 284 Milliarden Gesamtparameter und 13 Milliarden aktiv, gewinnt aber durch neues Post-Training auf neun Agent- und Code-Benchmarks gegen die größere V4-Pro-Vorschau — bei Listenpreisen, die Claude Opus 4.8 um Faktoren zwischen 36× und 179× unterbieten. Dieser Artikel deckt Zeitachse April–August, Kerntabellen, CSA+HCA-Architektur, Harness-Vorbehalt, Vergleich Kimi K3 / GLM-5.2 / Qwen3.8-Max, Kill-Line-Preiskrieg, Benchmark-Caveats, Sechs-Schritte-Migrationscheckliste und FAQ ab. Querverweise: DeepSeek V4 GA, OpenRouter Juli-Rankings, Kimi K3 Open Weights. Tarife: Mietpreisseite.
[ SECTION_01 ] // TIMELINE Was am 31. Juli wirklich live ging — und welche Fallstricke vorher lauerten
- 24. April 2026: V4-Vorschau mit V4-Pro (1,6T / 49B aktiv) und V4-Flash (284B / 13B aktiv), beide 1M Token Kontext, MIT-Lizenz.
- 24. Juli: Legacy-Aliase
deepseek-chatunddeepseek-reasonerendgültig abgeschaltet — Produktionscode ohne Umbenennung bricht hart ab. - 27. Juli: Moonshot veröffentlicht Kimi K3 (2,8T) auf Hugging Face — größter Open-Weight-Drop der Woche, direkter Wettbewerbsdruck auf DeepSeek.
- 31. Juli: V4-Flash-0731 als offizielle API-Beta; gleiche Architektur, neues Post-Training; Gewichte auf Hugging Face; Changelog nennt erstmals DeepSeek Harness als „bald verfügbar“. Nur API — App und Web-Chat unverändert.
- 2.–3. August: Alibaba Qwen3.8-Max GA; chinesische Frontier-Liga verdichtet sich weiter.
- Stand 5. August: V4-Pro offiziell und Harness weiter „so schnell wie möglich“ — kein bestätigtes GA-Datum.
Kernbotschaft: V4-Flash-0731 ist kein neues Modell, sondern dasselbe 284B-MoE mit besserem Post-Training. Die Agent-Scores schlagen V4-Pro — aber sie stammen aus dem noch nicht veröffentlichten Harness im Minimalmodus. Externe Reproduktion fehlt.
Sieben Schmerzpunkte, die Teams vor dem Update trafen:
- Legacy-Namen tot: Wer nach dem 24. Juli noch
deepseek-chataufruft, erhält Fehler — kein sanftes Fallback. - Harness nicht öffentlich: Terminal Bench 2.0 (82,7 vs. V4-Pro-Vorschau 67,9) basiert auf unreleased Framework — nicht auf Claude Code oder Cursor übertragbar.
- Cache-Hit-Realität: Entwickler berichten niedrige Input-Cache-Trefferquoten trotz $0,0028/M Hit-Preis — Rechnung kann höher ausfallen als Tabellen suggerieren.
- Peak-Off-Peak angekündigt: DeepSeek kündigte 2×-Zuschlag werktags 09:00–12:00 und 14:00–18:00 Peking an — ohne festes Startdatum.
- V4-Pro offiziell fehlt: Wer auf den Flagship-GA-Termin Mitte Juli wartete, bekommt nur Flash — Pro bleibt Vorschau.
- Benchmark-Mischung: Artificial Analysis Intelligence Index (50) liegt hinter Kimi K3 (57) und GLM-5.2 — Flash gewinnt auf Kosten, nicht auf absolutem Index.
- DSGVO bei Cloud-API: DeepSeek-Inferenz verarbeitet Prompts auf Anbieter-Infrastruktur. EU-Teams mit Kundencode oder personenbezogenen Daten: vor Produktion AVV, Subprozessorliste und Datenstandort mit Legal klären.
[ SECTION_02 ] // SPECS DeepSeek V4-Flash-0731 Kerndaten: Preise, Parameter und Claude-Vergleich
| Modell | Status | Gesamt / aktiv | Input (Miss / Hit pro 1M) | Output pro 1M | Lizenz |
|---|---|---|---|---|---|
| DeepSeek V4-Flash-0731 | Offiziell (31.07.) | 284B / 13B | $0,14 / $0,0028 | $0,28 | MIT |
| DeepSeek V4-Pro | Nur Vorschau (24.04.) | 1,6T / 49B | $0,435 / $0,003625 | $0,87 | MIT |
| Claude Opus 4.8 | Geschlossen | Nicht offengelegt | $5,00 / — | $25,00 | Proprietär |
| Kimi K3 | Gewichte live (27.07.) | 2,8T / ~104B (Schätzung) | $3,00 / $0,30 | $15,00 | Modified MIT |
| Qwen3.8-Max | API GA (03.08.), Gewichte ausstehend | 2,4T / 95B | $2,00 / ~$0,17–0,25 | $6,00 | Open versprochen |
| GLM-5.2 | Open (Juni 2026) | ~744B / ~40B | Nicht in diesem Stück verifiziert | Nicht verifiziert | MIT |
Claude-Vergleich (Listenpreise, 21st Century Business Herald / DeepSeek-Dokumentation): V4-Flash Input ohne Cache etwa 36× günstiger als Opus 4.8, mit Cache-Hit etwa 179×, Output etwa 89×. Das ist keine unabhängige Auditierung — sondern Hersteller-Tarifblatt gegen Hersteller-Tarifblatt.
| Benchmark | V4-Flash-0731 | V4-Pro-Vorschau |
|---|---|---|
| Terminal Bench 2.0 | 82,7 | 67,9 |
| SWE-bench Verified | Angekündigt über V4-Pro-Vorschau | 80,6 % (GA-Material) |
| Neun Agent-/Code-Suites gesamt | Übertrifft V4-Pro-Vorschau | Basislinie April |
DeepSeek warnt im Changelog ausdrücklich: Agent-Scores sind „extrem sensitiv gegenüber Harness-Wahl“. Terminal Bench 2.0 wurde mit unreleased Harness, max Reasoning, top_p=0,95, temperature=1,0 gemessen — bis Community-Reproduktion mit Claude Code oder Cursor vorliegt, sind das Vendor-plus-Framework-Ergebnisse.
[ SECTION_03 ] // COMPARE Post-Training statt Skalierung: Kill Line, Kimi K3, GLM und Qwen im selben Fenster
Architektur unverändert — CSA+HCA, mHC, Muon: Laut Technical Report „DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence“ kombiniert V4 Compressed Sparse Attention (CSA) mit Heavily Compressed Attention (HCA). Bei 1M Token behauptet DeepSeek 27 % der V3.2-Inferenz-FLOPs und 10 % KV-Cache (Flash bis 7 %). Diese Effizienzzahlen sind Herstellerangaben ohne unabhängige Reproduktion — aber sie erklären, warum Million-Token-Kontext nicht nur Marketing bleiben muss.
| Modell | Intelligence Index | Kosten pro Task | Einordnung |
|---|---|---|---|
| DeepSeek V4-Flash-0731 | 50 | $0,03 | Kostenführer |
| Kimi K3 | 57 | $0,86 | Höherer Index, ~29× teurer |
| GLM-5.2 | ~1 Punkt über Flash | Nicht verifiziert | Index knapp vor Flash |
| GPT-5.6 Sol | 9+ Punkte über Flash | $1,86 | Geschlossen, ~62× teurer |
| Claude Fable 5 | 9+ Punkte über Flash | $3,15 | Geschlossen, ~105× teurer |
Die Kill Line (斩杀线): In chinesischen Entwicklerforen beschreibt der Begriff eine Preis-Leistungs-Schwelle: Wer weder deutlich besser noch deutlich günstiger ist als DeepSeek, verliert Marktanteil. OpenAI senkte GPT-5.6 Luna zeitgleich um 80 % — ein direkter Preiskrieg. Ein Branchenzitat aus 21st Century Business Herald: „Alle großen Modellanbieter laufen vor Liang Wenfeng — sie müssen vor DeepSeek bleiben, um zu überleben.“ Für EU-Engineering-Teams heißt das: Flash ist der Default für Volumen-Agenten; Premium-Modelle nur für echte Engpässe routen.
Harness — DeepSeek antwortet auf Claude Code: Erstmals im Changelog vom 31. Juli genannt. Soll Dateizugriff, Tool-Calls und mehrstufige Engineering-Tasks abdecken. Bis zur Veröffentlichung nutzen die meisten Teams Claude Code, OpenCode oder OpenClaw als Harness — und genau dort endet die Übertragbarkeit der Terminal-Bench-Zahlen.
Benchmark-Caveats in vier Punkten:
- Vendor vs. Drittanbieter trennen: Artificial Analysis und SWE-bench Verified ≠ Terminal Bench mit unreleased Harness.
- Pro-GA-Rumoren ignorieren: „8.–20. August“ stammt aus anonymen Quellen — DeepSeek sagt nur „so schnell wie möglich“.
- Usability vs. Score: Niedrige Cache-Hits und Safety-Classifier-Timeouts zeigen, dass Post-Training allein keine Infrastrukturprobleme löst.
- Finanzierungsgerüchte: Berichte über ~7,4 Mrd. USD Runde und ~48,7 Mrd. USD Bewertung sind Medien-Zitate ohne regulatorische Bestätigung.
[ SECTION_04 ] // DEPLOY Sechs Schritte: Von deepseek-chat zu V4-Flash-0731 in Produktion
- Legacy-Audit: Suche im Repo nach
deepseek-chat,deepseek-reasonerund alten Base-URLs. Alles aufdeepseek-v4-flashumstellen — seit 24. Juli gibt es kein Fallback. - Modell-ID und Endpoint prüfen: OpenAI-kompatibler Client, offizieller DeepSeek-Endpoint laut api-docs.deepseek.com. Model-ID
deepseek-v4-flashzeigt automatisch auf Build 0731. - Cache-Strategie konfigurieren: Wiederholte System-Prompts und Tool-Schemas cachen, um $0,0028/M Hit-Preis zu nutzen. Ohne Cache zahlen Sie $0,14/M Input — Faktor 50 Unterschied.
- Reasoning-Modus wählen: Non-think für Routing und Klassifikation; Think High für Debugging; Think Max nur bei langen Agent-Ketten mit 384K+ Kontext. Empfohlen: temperature=1,0, top_p=1,0.
- Tiered Routing aufbauen: Tagesvolumen auf V4-Flash; harte Schritte zu V4-Pro-Vorschau, Claude Opus 5 oder GPT-5.6 Sol. Siehe OpenRouter-Tiering und GPT-5.6-Preise.
- 24/7-Agent-Runtime verankern: OpenClaw, Claude Code und Batch-Agenten brauchen persistente macOS-Knoten — Laptop-Sleep killt OAuth und lange Terminal-Bench-Runs. Hilfe: Hilfezentrum; Bestellung: Bestellseite.
from openai import OpenAI
client = OpenAI(
api_key="YOUR_DEEPSEEK_API_KEY",
base_url="https://api.deepseek.com/v1"
)
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[{"role": "user", "content": "Refactor this agent step."}],
temperature=1.0,
top_p=1.0
)
print(response.choices[0].message.content)
[ SECTION_05 ] // FACTS_FAQ Zitierbare Daten, FAQ und 24/7-Agent-Hosting
- Parameter unverändert: 284B gesamt / 13B aktiv; Leistungssprung nur Post-Training (DeepSeek Changelog 2026-07-31).
- Terminal Bench 2.0: 82,7 (Flash-0731) vs. 67,9 (V4-Pro-Vorschau) — Harness Minimalmodus, unreleased.
- Preis vs. Claude Opus 4.8: Input ~36× / ~179× (Cache-Hit) / Output ~89× günstiger (Listenpreise).
- Artificial Analysis: Intelligence Index 50, $0,03 pro Task — Kimi K3 Index 57 bei $0,86.
- OpenRouter-Volumen: V4-Flash-Vorschau sieben Wochen #1 bei Token-Durchsatz (Juli-Rankings).
- Effizienz bei 1M Kontext: 27 % FLOPs und 10 % KV-Cache vs. V3.2 laut Technical Report — Herstellerangabe.
- Peak-Off-Peak: 2× werktags 09:00–12:00 und 14:00–18:00 Peking angekündigt, Startdatum offen.
FAQ-Kurzantworten:
- Neues Modell? Nein — gleiche Architektur, neues Post-Training.
- Flash oder Pro? Flash für Volumen und Agent-Pipelines; Pro-Vorschau nur für tiefe Reasoning-Schritte bis GA kommt.
- Harness verfügbar? Nein — Changelog nennt es, Veröffentlichung ausstehend.
- DSGVO? Cloud-Inferenz mit personenbezogenen Prompts erfordert AVV und Subprozessorprüfung vor EU-Produktion.
Die folgenden öffentlichen Quellen informierten diesen Artikel. Bei Änderungen upstream bitte gegen die Originale prüfen.
https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash
Echte Nachteile gängiger Alternativen (Engineering-Sicht): Nur-Cloud-Routing ohne persistenten macOS-Host unterbricht OAuth-Sessions und killt mehrstündige Agent-Batches. Self-Hosting der 284B-Gewichte auf einem 16-GB-Laptop scheitert an RAM und Disk — API bleibt der realistische Inferenzpfad, aber der Harness muss auf stabiler Hardware laufen. Ein Mac Studio nur für zweiwöchige V4-Flash-Validierung, danach drei Monate Leerlauf, kostet mehr Abschreibung als wochenweise Miete — und 2×-Peak-Preise treffen 7×24-Pipelines ohne Zeitfensterplanung hart.
Für Entwickler und AI-Automation-Teams, die dediziertes Apple Silicon, 24/7-Uptime und elastische Tag/Woche/Monat-Skalierung brauchen, um V4-Flash-API-Agenten (OpenClaw, Claude Code, OpenCode) neben iOS-CI auf demselben macOS-Host zu betreiben, ist NOVAKVM Mac Mini Bare-Metal-Miete meist die bessere Wahl: sechs Regionen, High-Memory-Tiers und direkter SSH-Zugang trennen Cloud-Flagship-Inferenz von stabiler macOS-Ausführung — ohne Laptop-Sleep und ohne Peak-Rechnungsüberraschungen durch fehlende Scheduling-Disziplin. Vergleichen Sie M4-Pro- und Storage-Tiers auf der NOVAKVM-Mietpreisseite, starten Sie einen Test auf der Bestellseite und lesen Sie Remote-Setup im Hilfezentrum.