Si vous êtes développeur IA ou responsable plateforme qui dimensionne des APIs agent, des pipelines batch ou une migration fournisseur sous contrainte FinOps, la mise à jour du 31 juillet 2026 contredit l'intuition « plus fort = plus gros » : V4-Flash-0731 conserve exactement 284 milliards de paramètres totaux et 13 milliards actifs, mais un nouveau post-entraînement le place devant la préversion V4-Pro sur neuf benchmarks agent et code — à des tarifs listés entre 36× et 179× en dessous de Claude Opus 4.8. Cet article couvre chronologie avril–août, tableaux clés, architecture CSA+HCA, réserve Harness, comparaison Kimi K3 / GLM-5.2 / Qwen3.8-Max, kill line du marché, caveats de benchmark, checklist migration en six étapes et FAQ. Liens croisés : DeepSeek V4 GA, classements OpenRouter juillet, Kimi K3 open weight. Tarifs : page tarifs.
[ SECTION_01 ] // TIMELINE Ce qui a réellement été livré le 31 juillet — et les pièges qui précèdent
- 24 avril 2026 : préversion V4 avec V4-Pro (1,6T / 49B actifs) et V4-Flash (284B / 13B actifs), contexte 1M tokens, licence MIT.
- 24 juillet : retrait définitif des alias
deepseek-chatetdeepseek-reasoner— le code production non migré casse net. - 27 juillet : Moonshot publie Kimi K3 (2,8T) sur Hugging Face — pression concurrentielle maximale la semaine précédant la mise à jour DeepSeek.
- 31 juillet : V4-Flash-0731 en bêta API officielle ; même architecture, post-entraînement renouvelé ; poids sur Hugging Face ; changelog cite pour la première fois DeepSeek Harness comme « bientôt disponible ». Mise à jour API uniquement — app et web inchangés.
- 2–3 août : Alibaba Qwen3.8-Max en GA ; la ligue chinoise se densifie encore.
- Au 5 août : V4-Pro officiel et Harness toujours « dès que possible » — aucune date GA confirmée.
Message central : V4-Flash-0731 n'est pas un nouveau modèle, mais le même MoE 284B avec un meilleur post-entraînement. Les scores agent battent V4-Pro — mais ils proviennent du Harness non publié en mode minimal. Reproduction externe absente.
Sept points de friction que les équipes rencontrent :
- Noms legacy morts : après le 24 juillet,
deepseek-chatrenvoie une erreur — pas de repli doux. - Harness fermé : Terminal Bench 2.0 (82,7 vs préversion V4-Pro 67,9) mesuré avec un framework non publié — non transposable à Claude Code ou Cursor.
- Cache-hit réel : retours développeurs sur un faible taux de cache malgré le tarif $0,0028/M — la facture peut dépasser le tableau.
- Peak annoncé : DeepSeek prévoit un surcoût ×2 en heures pleines Pékin (9h–12h, 14h–18h) — date d'effet non fixée.
- V4-Pro officiel absent : ceux qui attendaient le GA mi-juillet n'obtiennent que Flash — Pro reste en préversion.
- Index mixte : Artificial Analysis Intelligence Index (50) derrière Kimi K3 (57) et GLM-5.2 — Flash gagne sur le coût, pas sur l'index absolu.
- Données personnelles : l'inférence cloud traite les prompts sur l'infrastructure DeepSeek ; les équipes européennes doivent clarifier AVV, sous-traitants et localisation avant production.
[ SECTION_02 ] // SPECS Données clés V4-Flash-0731 : paramètres, tarifs et comparaison Claude
| Modèle | Statut | Total / actifs | Input (miss / hit par 1M) | Output par 1M | Licence |
|---|---|---|---|---|---|
| DeepSeek V4-Flash-0731 | Officiel (31 juil.) | 284B / 13B | 0,14 $ / 0,0028 $ | 0,28 $ | MIT |
| DeepSeek V4-Pro | Préversion (24 avr.) | 1,6T / 49B | 0,435 $ / 0,003625 $ | 0,87 $ | MIT |
| Claude Opus 4.8 | Fermé | Non divulgué | 5,00 $ / — | 25,00 $ | Propriétaire |
| Kimi K3 | Poids live (27 juil.) | 2,8T / ~104B (estimation) | 3,00 $ / 0,30 $ | 15,00 $ | MIT modifiée |
| Qwen3.8-Max | API GA (03 août), poids en attente | 2,4T / 95B | 2,00 $ / ~0,17–0,25 $ | 6,00 $ | Open promis |
| GLM-5.2 | Open (juin 2026) | ~744B / ~40B | Non vérifié ici | Non vérifié | MIT |
Comparaison Claude (tarifs publics) : input sans cache environ 36× moins cher qu'Opus 4.8, avec cache-hit environ 179×, output environ 89×. Grille éditeur contre grille éditeur — pas d'audit indépendant.
| Benchmark | V4-Flash-0731 | Préversion V4-Pro |
|---|---|---|
| Terminal Bench 2.0 | 82,7 | 67,9 |
| SWE-bench Verified | Annoncé au-dessus préversion selon changelog | 80,6 % (matériel GA) |
| Neuf suites agent/code | Dépasse préversion V4-Pro | Baseline avril |
DeepSeek avertit dans le changelog : les scores agent sont « extrêmement sensibles au choix du harness ». Terminal Bench 2.0 mesuré avec Harness non publié, reasoning max, top_p=0,95, temperature=1,0 — jusqu'à reproduction communautaire avec Claude Code ou Cursor, traiter comme résultat éditeur plus framework.
[ SECTION_03 ] // COMPARE Post-entraînement plutôt qu'échelle : kill line, Kimi K3, GLM et Qwen dans la même fenêtre
Architecture inchangée — CSA+HCA, mHC, Muon : selon le rapport technique « DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence », V4 combine Compressed Sparse Attention (CSA) et Heavily Compressed Attention (HCA). À 1M tokens, DeepSeek revendique 27 % des FLOPs d'inférence V3.2 et 10 % du KV cache (Flash jusqu'à 7 %). Chiffres éditeur sans reproduction tierce — mais ils expliquent pourquoi le contexte million-token peut devenir viable commercialement sur du matériel Apple Silicon en workflow créatif long format.
| Modèle | Intelligence Index | Coût par tâche | Lecture |
|---|---|---|---|
| DeepSeek V4-Flash-0731 | 50 | 0,03 $ | Leader coût |
| Kimi K3 | 57 | 0,86 $ | Index supérieur, ~29× plus cher |
| GLM-5.2 | ~1 point au-dessus Flash | Non vérifié | Index légèrement devant |
| GPT-5.6 Sol | 9+ points au-dessus Flash | 1,86 $ | Fermé, ~62× plus cher |
| Claude Fable 5 | 9+ points au-dessus Flash | 3,15 $ | Fermé, ~105× plus cher |
La kill line (斩杀线) : dans les forums développeurs chinois, le terme décrit un seuil prix-performance : sans net avantage qualité ou prix, un concurrent perd en pertinence. OpenAI a baissé GPT-5.6 Luna de 80 % dans la même période — guerre des prix explicite. Pour les équipes créatives sur Mac, Flash devient le défaut pour agents volume ; modèles premium réservés aux impasses réelles.
Harness — réponse à Claude Code : cité pour la première fois le 31 juillet. Doit couvrir I/O fichiers, appels d'outils et tâches engineering multi-étapes. Jusqu'à publication, la plupart des équipes utilisent Claude Code, OpenCode ou OpenClaw — là s'arrête la transférabilité des chiffres Terminal Bench.
Quatre réserves sur les benchmarks :
- Séparer éditeur et tiers : Artificial Analysis et SWE-bench Verified ≠ Terminal Bench avec Harness non publié.
- Ignorer les rumeurs Pro-GA : « 10–20 août » vient de sources anonymes — DeepSeek dit seulement « dès que possible ».
- Usabilité vs score : faibles cache-hits et timeouts classificateur sécurité montrent que le post-entraînement ne corrige pas seul l'infra.
- Rumeurs de financement : reports ~7,4 Md$ et valorisation ~48,7 Md$ sont des citations presse sans confirmation réglementaire.
[ SECTION_04 ] // DEPLOY Six étapes : de deepseek-chat à V4-Flash-0731 en production
- Audit legacy : chercher
deepseek-chat,deepseek-reasoneret anciennes base URLs. Tout basculer surdeepseek-v4-flash— depuis le 24 juillet, pas de repli. - Vérifier model ID et endpoint : client compatible OpenAI, endpoint officiel selon api-docs.deepseek.com. L'ID
deepseek-v4-flashpointe automatiquement vers le build 0731. - Configurer la stratégie cache : mettre en cache prompts système et schémas d'outils répétés pour exploiter 0,0028 $/M en hit. Sans cache : 0,14 $/M — facteur 50.
- Choisir le mode reasoning : non-think pour routage ; Think High pour debug ; Think Max pour agents longs 384K+. Recommandé : temperature=1,0, top_p=1,0.
- Construire le routage par paliers : volume quotidien sur V4-Flash ; étapes dures vers préversion V4-Pro, Claude Opus 5 ou GPT-5.6 Sol. Voir tiering OpenRouter et prix GPT-5.6.
- Ancrer le runtime agent 24/7 : OpenClaw, Claude Code et batch agents exigent un nœud macOS persistant — veille laptop tue OAuth et longs runs. Aide : centre d'aide ; commande : page commander.
from openai import OpenAI
client = OpenAI(
api_key="YOUR_DEEPSEEK_API_KEY",
base_url="https://api.deepseek.com/v1"
)
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[{"role": "user", "content": "Refactor this agent step."}],
temperature=1.0,
top_p=1.0
)
print(response.choices[0].message.content)
[ SECTION_05 ] // FACTS_FAQ Données citables, FAQ et hébergement agent 24/7
- Paramètres inchangés : 284B total / 13B actifs ; gain uniquement post-entraînement (changelog 2026-07-31).
- Terminal Bench 2.0 : 82,7 (Flash-0731) vs 67,9 (préversion V4-Pro) — Harness mode minimal, non publié.
- Prix vs Claude Opus 4.8 : input ~36× / ~179× (cache-hit) / output ~89× moins cher (tarifs listés).
- Artificial Analysis : Intelligence Index 50, 0,03 $ par tâche — Kimi K3 index 57 à 0,86 $.
- Volume OpenRouter : préversion V4-Flash #1 tokens sept semaines consécutives (juillet).
- Efficacité 1M contexte : 27 % FLOPs et 10 % KV cache vs V3.2 selon rapport technique — chiffre éditeur.
- Peak-off-peak : surcoût ×2 annoncé en heures pleines Pékin, date d'effet ouverte.
FAQ synthétique :
- Nouveau modèle ? Non — même architecture, nouveau post-entraînement.
- Flash ou Pro ? Flash pour volume et pipelines agent ; préversion Pro pour reasoning profond en attendant le GA.
- Harness disponible ? Non — cité au changelog, publication en attente.
- Données EU ? inférence cloud avec prompts personnels exige AVV et vérification sous-traitants avant production.
Les sources publiques suivantes ont informé cet article. En cas de mise à jour upstream, vérifier les originaux.
https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash
Vrais inconvénients des alternatives courantes (vue ingénierie) : router uniquement via cloud sans hôte macOS persistant interrompt les sessions OAuth et tue les batch agents multi-heures. Self-hosting 284B sur un MacBook 16 Go échoue sur RAM et disque — l'API reste le chemin d'inférence réaliste, mais le harness doit tourner sur hardware stable. Un Mac Studio acheté pour valider V4-Flash deux semaines puis laissé idle trois mois coûte plus en amortissement qu'une location hebdomadaire — et les tarifs peak ×2 frappent les pipelines 7×24 sans planification horaire.
Pour les développeurs et équipes d'automatisation IA qui ont besoin de Apple Silicon dédié, disponibilité 24/7 et scaling élastique jour/semaine/mois pour faire tourner des agents V4-Flash (OpenClaw, Claude Code, OpenCode) aux côtés de CI iOS sur le même hôte macOS, la location bare-metal Mac Mini NOVAKVM est généralement la meilleure option : six régions, tiers haute mémoire et accès SSH direct séparent l'inférence cloud flagship de l'exécution macOS stable — sans veille laptop ni surprise de facture peak faute de discipline de scheduling. Comparez les tiers M4 Pro et stockage sur la page tarifs NOVAKVM, lancez un essai sur la page commander et consultez la configuration distante dans le centre d'aide.