DeepSeek V4-Flash-0731 officiel :
benchmarks agent devant V4-Pro, prix sous Claude

Si vous êtes développeur IA ou responsable plateforme qui dimensionne des APIs agent, des pipelines batch ou une migration fournisseur sous contrainte FinOps, la mise à jour du 31 juillet 2026 contredit l'intuition « plus fort = plus gros » : V4-Flash-0731 conserve exactement 284 milliards de paramètres totaux et 13 milliards actifs, mais un nouveau post-entraînement le place devant la préversion V4-Pro sur neuf benchmarks agent et code — à des tarifs listés entre 36× et 179× en dessous de Claude Opus 4.8. Cet article couvre chronologie avril–août, tableaux clés, architecture CSA+HCA, réserve Harness, comparaison Kimi K3 / GLM-5.2 / Qwen3.8-Max, kill line du marché, caveats de benchmark, checklist migration en six étapes et FAQ. Liens croisés : DeepSeek V4 GA, classements OpenRouter juillet, Kimi K3 open weight. Tarifs : page tarifs.

  • 24 avril 2026 : préversion V4 avec V4-Pro (1,6T / 49B actifs) et V4-Flash (284B / 13B actifs), contexte 1M tokens, licence MIT.
  • 24 juillet : retrait définitif des alias deepseek-chat et deepseek-reasoner — le code production non migré casse net.
  • 27 juillet : Moonshot publie Kimi K3 (2,8T) sur Hugging Face — pression concurrentielle maximale la semaine précédant la mise à jour DeepSeek.
  • 31 juillet : V4-Flash-0731 en bêta API officielle ; même architecture, post-entraînement renouvelé ; poids sur Hugging Face ; changelog cite pour la première fois DeepSeek Harness comme « bientôt disponible ». Mise à jour API uniquement — app et web inchangés.
  • 2–3 août : Alibaba Qwen3.8-Max en GA ; la ligue chinoise se densifie encore.
  • Au 5 août : V4-Pro officiel et Harness toujours « dès que possible » — aucune date GA confirmée.

Message central : V4-Flash-0731 n'est pas un nouveau modèle, mais le même MoE 284B avec un meilleur post-entraînement. Les scores agent battent V4-Pro — mais ils proviennent du Harness non publié en mode minimal. Reproduction externe absente.

Sept points de friction que les équipes rencontrent :

  • Noms legacy morts : après le 24 juillet, deepseek-chat renvoie une erreur — pas de repli doux.
  • Harness fermé : Terminal Bench 2.0 (82,7 vs préversion V4-Pro 67,9) mesuré avec un framework non publié — non transposable à Claude Code ou Cursor.
  • Cache-hit réel : retours développeurs sur un faible taux de cache malgré le tarif $0,0028/M — la facture peut dépasser le tableau.
  • Peak annoncé : DeepSeek prévoit un surcoût ×2 en heures pleines Pékin (9h–12h, 14h–18h) — date d'effet non fixée.
  • V4-Pro officiel absent : ceux qui attendaient le GA mi-juillet n'obtiennent que Flash — Pro reste en préversion.
  • Index mixte : Artificial Analysis Intelligence Index (50) derrière Kimi K3 (57) et GLM-5.2 — Flash gagne sur le coût, pas sur l'index absolu.
  • Données personnelles : l'inférence cloud traite les prompts sur l'infrastructure DeepSeek ; les équipes européennes doivent clarifier AVV, sous-traitants et localisation avant production.

Comparaison flagship (données éditeur, au 2026-08-05)
Modèle Statut Total / actifs Input (miss / hit par 1M) Output par 1M Licence
DeepSeek V4-Flash-0731 Officiel (31 juil.) 284B / 13B 0,14 $ / 0,0028 $ 0,28 $ MIT
DeepSeek V4-Pro Préversion (24 avr.) 1,6T / 49B 0,435 $ / 0,003625 $ 0,87 $ MIT
Claude Opus 4.8 Fermé Non divulgué 5,00 $ / — 25,00 $ Propriétaire
Kimi K3 Poids live (27 juil.) 2,8T / ~104B (estimation) 3,00 $ / 0,30 $ 15,00 $ MIT modifiée
Qwen3.8-Max API GA (03 août), poids en attente 2,4T / 95B 2,00 $ / ~0,17–0,25 $ 6,00 $ Open promis
GLM-5.2 Open (juin 2026) ~744B / ~40B Non vérifié ici Non vérifié MIT

Comparaison Claude (tarifs publics) : input sans cache environ 36× moins cher qu'Opus 4.8, avec cache-hit environ 179×, output environ 89×. Grille éditeur contre grille éditeur — pas d'audit indépendant.

Benchmarks agent V4-Flash-0731 vs préversion V4-Pro (changelog DeepSeek, Harness mode minimal)
Benchmark V4-Flash-0731 Préversion V4-Pro
Terminal Bench 2.082,767,9
SWE-bench VerifiedAnnoncé au-dessus préversion selon changelog80,6 % (matériel GA)
Neuf suites agent/codeDépasse préversion V4-ProBaseline avril

DeepSeek avertit dans le changelog : les scores agent sont « extrêmement sensibles au choix du harness ». Terminal Bench 2.0 mesuré avec Harness non publié, reasoning max, top_p=0,95, temperature=1,0 — jusqu'à reproduction communautaire avec Claude Code ou Cursor, traiter comme résultat éditeur plus framework.

Architecture inchangée — CSA+HCA, mHC, Muon : selon le rapport technique « DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence », V4 combine Compressed Sparse Attention (CSA) et Heavily Compressed Attention (HCA). À 1M tokens, DeepSeek revendique 27 % des FLOPs d'inférence V3.2 et 10 % du KV cache (Flash jusqu'à 7 %). Chiffres éditeur sans reproduction tierce — mais ils expliquent pourquoi le contexte million-token peut devenir viable commercialement sur du matériel Apple Silicon en workflow créatif long format.

Artificial Analysis Intelligence Index et coût par tâche (tiers, via médias financiers)
Modèle Intelligence Index Coût par tâche Lecture
DeepSeek V4-Flash-0731500,03 $Leader coût
Kimi K3570,86 $Index supérieur, ~29× plus cher
GLM-5.2~1 point au-dessus FlashNon vérifiéIndex légèrement devant
GPT-5.6 Sol9+ points au-dessus Flash1,86 $Fermé, ~62× plus cher
Claude Fable 59+ points au-dessus Flash3,15 $Fermé, ~105× plus cher

La kill line (斩杀线) : dans les forums développeurs chinois, le terme décrit un seuil prix-performance : sans net avantage qualité ou prix, un concurrent perd en pertinence. OpenAI a baissé GPT-5.6 Luna de 80 % dans la même période — guerre des prix explicite. Pour les équipes créatives sur Mac, Flash devient le défaut pour agents volume ; modèles premium réservés aux impasses réelles.

Harness — réponse à Claude Code : cité pour la première fois le 31 juillet. Doit couvrir I/O fichiers, appels d'outils et tâches engineering multi-étapes. Jusqu'à publication, la plupart des équipes utilisent Claude Code, OpenCode ou OpenClaw — là s'arrête la transférabilité des chiffres Terminal Bench.

Quatre réserves sur les benchmarks :

  1. Séparer éditeur et tiers : Artificial Analysis et SWE-bench Verified ≠ Terminal Bench avec Harness non publié.
  2. Ignorer les rumeurs Pro-GA : « 10–20 août » vient de sources anonymes — DeepSeek dit seulement « dès que possible ».
  3. Usabilité vs score : faibles cache-hits et timeouts classificateur sécurité montrent que le post-entraînement ne corrige pas seul l'infra.
  4. Rumeurs de financement : reports ~7,4 Md$ et valorisation ~48,7 Md$ sont des citations presse sans confirmation réglementaire.

  1. Audit legacy : chercher deepseek-chat, deepseek-reasoner et anciennes base URLs. Tout basculer sur deepseek-v4-flash — depuis le 24 juillet, pas de repli.
  2. Vérifier model ID et endpoint : client compatible OpenAI, endpoint officiel selon api-docs.deepseek.com. L'ID deepseek-v4-flash pointe automatiquement vers le build 0731.
  3. Configurer la stratégie cache : mettre en cache prompts système et schémas d'outils répétés pour exploiter 0,0028 $/M en hit. Sans cache : 0,14 $/M — facteur 50.
  4. Choisir le mode reasoning : non-think pour routage ; Think High pour debug ; Think Max pour agents longs 384K+. Recommandé : temperature=1,0, top_p=1,0.
  5. Construire le routage par paliers : volume quotidien sur V4-Flash ; étapes dures vers préversion V4-Pro, Claude Opus 5 ou GPT-5.6 Sol. Voir tiering OpenRouter et prix GPT-5.6.
  6. Ancrer le runtime agent 24/7 : OpenClaw, Claude Code et batch agents exigent un nœud macOS persistant — veille laptop tue OAuth et longs runs. Aide : centre d'aide ; commande : page commander.
deepseek-v4-flash-api.py
from openai import OpenAI

client = OpenAI(
    api_key="YOUR_DEEPSEEK_API_KEY",
    base_url="https://api.deepseek.com/v1"
)

response = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[{"role": "user", "content": "Refactor this agent step."}],
    temperature=1.0,
    top_p=1.0
)
print(response.choices[0].message.content)

  • Paramètres inchangés : 284B total / 13B actifs ; gain uniquement post-entraînement (changelog 2026-07-31).
  • Terminal Bench 2.0 : 82,7 (Flash-0731) vs 67,9 (préversion V4-Pro) — Harness mode minimal, non publié.
  • Prix vs Claude Opus 4.8 : input ~36× / ~179× (cache-hit) / output ~89× moins cher (tarifs listés).
  • Artificial Analysis : Intelligence Index 50, 0,03 $ par tâche — Kimi K3 index 57 à 0,86 $.
  • Volume OpenRouter : préversion V4-Flash #1 tokens sept semaines consécutives (juillet).
  • Efficacité 1M contexte : 27 % FLOPs et 10 % KV cache vs V3.2 selon rapport technique — chiffre éditeur.
  • Peak-off-peak : surcoût ×2 annoncé en heures pleines Pékin, date d'effet ouverte.

FAQ synthétique :

  • Nouveau modèle ? Non — même architecture, nouveau post-entraînement.
  • Flash ou Pro ? Flash pour volume et pipelines agent ; préversion Pro pour reasoning profond en attendant le GA.
  • Harness disponible ? Non — cité au changelog, publication en attente.
  • Données EU ? inférence cloud avec prompts personnels exige AVV et vérification sous-traitants avant production.

Les sources publiques suivantes ont informé cet article. En cas de mise à jour upstream, vérifier les originaux.

https://api-docs.deepseek.com

https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash

https://artificialanalysis.ai

Vrais inconvénients des alternatives courantes (vue ingénierie) : router uniquement via cloud sans hôte macOS persistant interrompt les sessions OAuth et tue les batch agents multi-heures. Self-hosting 284B sur un MacBook 16 Go échoue sur RAM et disque — l'API reste le chemin d'inférence réaliste, mais le harness doit tourner sur hardware stable. Un Mac Studio acheté pour valider V4-Flash deux semaines puis laissé idle trois mois coûte plus en amortissement qu'une location hebdomadaire — et les tarifs peak ×2 frappent les pipelines 7×24 sans planification horaire.

Pour les développeurs et équipes d'automatisation IA qui ont besoin de Apple Silicon dédié, disponibilité 24/7 et scaling élastique jour/semaine/mois pour faire tourner des agents V4-Flash (OpenClaw, Claude Code, OpenCode) aux côtés de CI iOS sur le même hôte macOS, la location bare-metal Mac Mini NOVAKVM est généralement la meilleure option : six régions, tiers haute mémoire et accès SSH direct séparent l'inférence cloud flagship de l'exécution macOS stable — sans veille laptop ni surprise de facture peak faute de discipline de scheduling. Comparez les tiers M4 Pro et stockage sur la page tarifs NOVAKVM, lancez un essai sur la page commander et consultez la configuration distante dans le centre d'aide.