DeepSeek V4 GA : version complète —
tarifs, architecture et écart face à GPT-5.6

Après trois mois d'attente, DeepSeek V4 en version complète (GA) est officiellement en ligne le 20 juillet 2026. Par rapport à la preview d'avril, le GA améliore agents, raisonnement mathématique et génération de code, et introduit pour la première fois une tarification différenciée peak/off-peak — DeepSeek passe du « quasi gratuit » à une commercialisation structurée. Cet article s'adresse aux équipes encore sur deepseek-chat, avec migration obligatoire avant le 24 juillet, et à celles qui choisissent entre GPT-5.6, Claude Fable 5 et V4 : d'abord sept points de friction, puis timeline, architecture MoE 1,6T (CSA+HCA, mHC, Muon), benchmarks, comparaison triple, tableau peak, checklist migration en six étapes et paramètres techniques citables, clôturés par auto-hébergement Mac et nœuds NOVAKVM haute mémoire. Données : documentation DeepSeek et arXiv:2606.19348 ; revérifier les liens après release. Tarifs : page tarifs, commande : page commander ; croiser avec guide ds4 local et release GPT-5.6.

  • Fin des anciennes API : deepseek-chat et deepseek-reasoner cessent définitivement le 24 juillet 2026 à 23:59 (heure de Pékin). Le code prod sans changement de modèle subit une coupure brutale.
  • Peak/off-peak complique le scheduling : en semaine 09:00–12:00 et 14:00–18:00 (Pékin) les tarifs doublent ; un pipeline agent 7×24 sans fenêtres horaires peut exploser la facture.
  • Pro vs Flash flou : V4-Pro (1,6T / 49B actifs) et V4-Flash (284B / 13B actifs) diffèrent en prix et capacités ; un mauvais routage gaspille des tokens ou la qualité.
  • Les closed source dominent encore : Claude Fable 5 atteint 80,3 % sur SWE-bench Pro, V4-Pro 55,4 % — « meilleur open source » n'égale pas « meilleur modèle tout court ».
  • 1M de contexte n'est pas gratuit : KV cache réduit à 10 % de V3.2, mais les agents long contexte consomment RAM et compute ; auto-hébergement dès 96 Go+ unified memory (voie ds4).
  • Pression conformité : finance, santé, secteur public favorisent MIT + déploiement privé ; V4-Pro complet en local coûte cher en hardware.
  • Trois modes d'inférence : Non-think / Think High / Think Max plus temperature=1.0, top_p=1.0 recommandés exigent un réglage par scénario ; Think Max aveugle augmente latence et coût.

DeepSeek V4 — timeline clé (2026)
Date Événement
24 avril Preview V4 en ligne et open source (MIT) : V4-Pro (1,6T) et V4-Flash (284B)
Mai Version tuning production, API officiellement disponible
Juin Prix sortie V4-Pro −75 % permanent à $0,87/M tokens
29 juin Email : GA mi-juillet, première annonce tarifs peak/off-peak
19 juillet Accès grey GA pour certains devs, presse : « version complète demain »
20 juillet GA version complète en ligne (date de publication)
24 juillet deepseek-chat / deepseek-reasoner hors ligne définitivement

En bref : le GA améliore agent, raisonnement math et code vs preview et installe la facturation peak/off-peak ; l'architecture MoE sous-jacente est inchangée.

V4-Pro vs V4-Flash — spécifications
Spécification V4-Pro V4-Flash
Paramètres totaux 1,6 billion (1,6T) 284 milliards (284B)
Paramètres actifs par token 49 milliards (49B) 13 milliards (13B)
Couches Transformer 61 43
Fenêtre de contexte 1 000 000 tokens 1 000 000 tokens
Sortie max 384K tokens 384K tokens
Précision FP4 (experts) + FP8 (reste) FP4 + FP8 mixte
Données pretraining 33T+ tokens 32T+ tokens
Licence MIT MIT

Innovations clés (contexte 1M) :

  • Attention hybride (CSA + HCA) : remplace MLA V2/V3 : Compressed Sparse Attention (CSA — KV compressé 4× via gating Softmax, FP4 Lightning Indexer top-k, Pro top-1024 / Flash top-512, fenêtre glissante 128 tokens) et Heavy Compressed Attention (HCA — compression 128× puis attention dense globale) en alternance. À 1M : 27 % des FLOPs V3.2, KV cache 10 % (Flash 7 %).
  • Manifold-Constrained Hyper-Connections (mHC) : flux résiduel 4 canaux + matrice doublement stochastique (polytope de Birkhoff) pour gradients stables sur 61 couches.
  • Optimiseur Muon : orthogonalisation Newton-Schulz des gradients en entraînement — convergence plus rapide et stable qu'AdamW.
Trois modes d'inférence et usages
Mode Caractéristique Usage
Non-think Pas de chaîne de pensée, ultra-rapide Q&R simples, routage
Think High Raisonnement explicite (tags CoT) Complexité moyenne, debug code
Think Max Raisonnement maximal, contexte 384K+ Math avancée, agents longue chaîne

Paramètres d'échantillonnage officiels (tous modes) : temperature=1.0, top_p=1.0.

V4-Pro — résultats clés (juillet 2026)
Benchmark DeepSeek V4-Pro Claude Fable 5 GPT-5.6 Ultra Claude Opus 4.8
SWE-bench Verified 80,6 % (record open source) 96,0 % non publié séparément ~69 %
SWE-bench Pro 55,4 % 80,3 % 78,1 % 69,2 %
LiveCodeBench (Pass@1) 93,5 % 88,1 % 87,4 % 83,2 %
Codeforces Elo 3 206
Terminal-Bench 2.1 83,9 % 88,0 % 85,1 % 82,7 %

Artificial Analysis (Strategy & Ops) : Claude Fable 5 3,48 $ par run, score 50 ; DeepSeek V4-Pro 0,03 $, score 38 — écart de coût 116×, score seulement ~31 % supérieur. V4-Flash sous 0,04 $ par run dans les six indices.

Position globale : V4-Pro vs GPT-5.6 Sol vs Claude Fable 5
Dimension DeepSeek V4-Pro GPT-5.6 Sol Claude Fable 5
Open source / auto-hébergement MIT, oui Fermé, non Fermé, non
Fenêtre de contexte 1M tokens non publiée 1M tokens
API sortie (off-peak) 0,87 $/M tokens ~15 $/M 50 $/M
Sortie peak 1,74 $/M tokens
Capacité agent forte, multi-agents forte classe maximale
Confidentialité déploiement privé possible cloud tiers cloud tiers

Choix rapide : budget serré / haute fréquence / déploiement privé → V4-Pro ou V4-Flash ; code maximal, coût secondaire → Claude Fable 5 ; algorithmes + math → GPT-5.6 Sol / Ultra ; logs / docs massifs → V4-Flash (entrée cache hit 0,0028 $/M).

Le GA introduit la tarification différenciée peak/off-peak, comme l'électricité. Peak (heure Pékin) : en semaine 09:00–12:00 et 14:00–18:00, tarifs doublés. DeepSeek prévient 24 h par email avant tout changement.

V4-Pro / V4-Flash — grille complète (off-peak / peak)
Modèle Poste Off-peak Peak
V4-Pro Entrée (cache hit) ¥0,025 / 0,0035 $ / 1M doublé
V4-Pro Entrée (cache miss) ¥3,00 / 0,435 $ / 1M ¥6,00 / 0,87 $
V4-Pro Sortie ¥6,00 / 0,87 $ / 1M ¥12,00 / 1,74 $
V4-Flash Entrée (cache hit) ¥0,02 / 0,0028 $ / 1M doublé
V4-Flash Entrée (cache miss) ¥1,00 / 0,14 $ / 1M ¥2,00 / 0,28 $
V4-Flash Sortie ¥2,00 / 0,28 $ / 1M ¥4,00 / 0,56 $
  • Tâches non temps réel en off-peak : batch documents, labeling, revue code après 18:00 ou avant 09:00.
  • Exploiter le prompt cache : system prompts répétés ; V4-Flash cache hit 0,0028 $/M.
  • Flash en routeur : intents simples → V4-Flash, raisonnement lourd → V4-Pro — 60–80 % d'économie possible.
  • Email de facturation actif : recevoir les alertes tarifaires.

Même en peak, la sortie V4-Pro (1,74 $/M) reste 8,6× moins chère que Claude Opus 4.8 (15 $/M) et GPT-5.6 Sol (~15 $/M).

Alerte : deepseek-chat et deepseek-reasoner cessent le 24 juillet 2026 à 15:59 UTC (24 juillet 23:59 Pékin).

Table de migration
Ancien modèle Nouveau modèle Note
deepseek-chat deepseek-v4-flash (non-think) Rapide, tâches légères
deepseek-reasoner deepseek-v4-flash (mode think) ou upgrade deepseek-v4-pro
  1. Recherche globale : deepseek-chat et deepseek-reasoner dans code, CI, variables d'env et secrets.
  2. Modèle par scénario : dialogues légers → deepseek-v4-flash non-think ; ancien reasoner → Flash think ou deepseek-v4-pro.
  3. SDK OpenAI : changer uniquement model ; mode think via extra_body et thinking.
  4. Chemin compatible Anthropic : base_url reste https://api.deepseek.com, modeldeepseek-v4-pro ou deepseek-v4-flash.
  5. Régression staging : tool calling, streaming, long contexte ; Think Max exige fenêtre ≥384K.
  6. Rollout prod et monitoring : canary avant le 24 juillet, surveiller tokens peak et taux d'erreur, activer le scheduling si besoin.
migrate_deepseek_v4.py
model="deepseek-chat"  (invalide après le 24 juillet)
client.chat.completions.create(
    model="deepseek-chat",
    messages=[...]
)

model="deepseek-v4-pro"
client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[...],
    extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)

Sources officielles (revérifier après release) :

https://api.deepseek.com

https://arxiv.org/abs/2606.19348

  • SWE-bench Verified 80,6 % : record open source, égal Gemini 3.1 Pro ; bugs GitHub réels (synthèse publique, revérifier).
  • KV cache 10 % : à 1M seulement 10 % de V3.2 (Flash 7 %), source arXiv:2606.19348.
  • Coût 116× : Artificial Analysis Strategy & Ops — Fable 5 3,48 $ vs V4-Pro 0,03 $ par run.
  • Baisse juin : sortie V4-Pro 0,87 $/M — rapport qualité/prix historique (page tarifs DeepSeek).
  • MIT open source : poids V4-Pro et Flash auto-hébergeables ; idéal données sensibles sans sortie cloud.
  • Deadline dure : après 2026-07-24 23:59 Pékin, deepseek-chat / deepseek-reasoner morts (email API DeepSeek).

DeepSeek V4 GA est l'un des jalons open source majeurs de 2026. Sa valeur n'est pas de battre immédiatement Claude Fable 5 ou GPT-5.6, mais d'offrir la meilleure perf open source à 1/10 à 1/100 du coût closed source.

Inconvénients des alternatives : ① API Claude/GPT seule — agents long contexte chers, code via tiers, audit compliance lourd ; ② poids V4 complets sur laptop 16 Go — impossible, temps perdu ; ③ Mac Studio Ultra pour quelques semaines — immobilisation > location hebdo haute mémoire. Pour tests V4-Flash privés, voir ds4 + déploiement Mac 128 Go.

Pour équipes sensibles à la confidentialité, budget limité, agents 1M ou efficacité API maximale, DeepSeek V4 Pro est l'option open source la plus équilibrée. Infrastructure reproductible : location bare metal Mac Mini NOVAKVM — six régions, Apple Silicon dédié haute mémoire, flexibilité jour/semaine/mois ; nœud 128 Go pour inférence locale, puis décision d'achat. Finaliser la migration avant le 24 juillet. Page tarifs, Page commander, Centre d'aide.