Après trois mois d'attente, DeepSeek V4 en version complète (GA) est officiellement en ligne le 20 juillet 2026. Par rapport à la preview d'avril, le GA améliore agents, raisonnement mathématique et génération de code, et introduit pour la première fois une tarification différenciée peak/off-peak — DeepSeek passe du « quasi gratuit » à une commercialisation structurée. Cet article s'adresse aux équipes encore sur deepseek-chat, avec migration obligatoire avant le 24 juillet, et à celles qui choisissent entre GPT-5.6, Claude Fable 5 et V4 : d'abord sept points de friction, puis timeline, architecture MoE 1,6T (CSA+HCA, mHC, Muon), benchmarks, comparaison triple, tableau peak, checklist migration en six étapes et paramètres techniques citables, clôturés par auto-hébergement Mac et nœuds NOVAKVM haute mémoire. Données : documentation DeepSeek et arXiv:2606.19348 ; revérifier les liens après release. Tarifs : page tarifs, commande : page commander ; croiser avec guide ds4 local et release GPT-5.6.
[ SECTION_01 ] // PAIN_MAP Sept points de friction avant le GA DeepSeek V4
- Fin des anciennes API :
deepseek-chatetdeepseek-reasonercessent définitivement le 24 juillet 2026 à 23:59 (heure de Pékin). Le code prod sans changement de modèle subit une coupure brutale. - Peak/off-peak complique le scheduling : en semaine 09:00–12:00 et 14:00–18:00 (Pékin) les tarifs doublent ; un pipeline agent 7×24 sans fenêtres horaires peut exploser la facture.
- Pro vs Flash flou : V4-Pro (1,6T / 49B actifs) et V4-Flash (284B / 13B actifs) diffèrent en prix et capacités ; un mauvais routage gaspille des tokens ou la qualité.
- Les closed source dominent encore : Claude Fable 5 atteint 80,3 % sur SWE-bench Pro, V4-Pro 55,4 % — « meilleur open source » n'égale pas « meilleur modèle tout court ».
- 1M de contexte n'est pas gratuit : KV cache réduit à 10 % de V3.2, mais les agents long contexte consomment RAM et compute ; auto-hébergement dès 96 Go+ unified memory (voie ds4).
- Pression conformité : finance, santé, secteur public favorisent MIT + déploiement privé ; V4-Pro complet en local coûte cher en hardware.
- Trois modes d'inférence : Non-think / Think High / Think Max plus
temperature=1.0, top_p=1.0recommandés exigent un réglage par scénario ; Think Max aveugle augmente latence et coût.
[ SECTION_02 ] // ARCHITECTURE De la preview au GA : timeline et architecture V4-Pro / Flash
| Date | Événement |
|---|---|
| 24 avril | Preview V4 en ligne et open source (MIT) : V4-Pro (1,6T) et V4-Flash (284B) |
| Mai | Version tuning production, API officiellement disponible |
| Juin | Prix sortie V4-Pro −75 % permanent à $0,87/M tokens |
| 29 juin | Email : GA mi-juillet, première annonce tarifs peak/off-peak |
| 19 juillet | Accès grey GA pour certains devs, presse : « version complète demain » |
| 20 juillet | GA version complète en ligne (date de publication) |
| 24 juillet | deepseek-chat / deepseek-reasoner hors ligne définitivement |
En bref : le GA améliore agent, raisonnement math et code vs preview et installe la facturation peak/off-peak ; l'architecture MoE sous-jacente est inchangée.
| Spécification | V4-Pro | V4-Flash |
|---|---|---|
| Paramètres totaux | 1,6 billion (1,6T) | 284 milliards (284B) |
| Paramètres actifs par token | 49 milliards (49B) | 13 milliards (13B) |
| Couches Transformer | 61 | 43 |
| Fenêtre de contexte | 1 000 000 tokens | 1 000 000 tokens |
| Sortie max | 384K tokens | 384K tokens |
| Précision | FP4 (experts) + FP8 (reste) | FP4 + FP8 mixte |
| Données pretraining | 33T+ tokens | 32T+ tokens |
| Licence | MIT | MIT |
Innovations clés (contexte 1M) :
- Attention hybride (CSA + HCA) : remplace MLA V2/V3 : Compressed Sparse Attention (CSA — KV compressé 4× via gating Softmax, FP4 Lightning Indexer top-k, Pro top-1024 / Flash top-512, fenêtre glissante 128 tokens) et Heavy Compressed Attention (HCA — compression 128× puis attention dense globale) en alternance. À 1M : 27 % des FLOPs V3.2, KV cache 10 % (Flash 7 %).
- Manifold-Constrained Hyper-Connections (mHC) : flux résiduel 4 canaux + matrice doublement stochastique (polytope de Birkhoff) pour gradients stables sur 61 couches.
- Optimiseur Muon : orthogonalisation Newton-Schulz des gradients en entraînement — convergence plus rapide et stable qu'AdamW.
| Mode | Caractéristique | Usage |
|---|---|---|
| Non-think | Pas de chaîne de pensée, ultra-rapide | Q&R simples, routage |
| Think High | Raisonnement explicite (tags CoT) | Complexité moyenne, debug code |
| Think Max | Raisonnement maximal, contexte 384K+ | Math avancée, agents longue chaîne |
Paramètres d'échantillonnage officiels (tous modes) :
temperature=1.0,top_p=1.0.
[ SECTION_03 ] // BENCHMARK Benchmarks et matrice vs GPT-5.6 / Claude Fable 5
| Benchmark | DeepSeek V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80,6 % (record open source) | 96,0 % | non publié séparément | ~69 % |
| SWE-bench Pro | 55,4 % | 80,3 % | 78,1 % | 69,2 % |
| LiveCodeBench (Pass@1) | 93,5 % | 88,1 % | 87,4 % | 83,2 % |
| Codeforces Elo | 3 206 | — | — | — |
| Terminal-Bench 2.1 | 83,9 % | 88,0 % | 85,1 % | 82,7 % |
Artificial Analysis (Strategy & Ops) : Claude Fable 5 3,48 $ par run, score 50 ; DeepSeek V4-Pro 0,03 $, score 38 — écart de coût 116×, score seulement ~31 % supérieur. V4-Flash sous 0,04 $ par run dans les six indices.
| Dimension | DeepSeek V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| Open source / auto-hébergement | MIT, oui | Fermé, non | Fermé, non |
| Fenêtre de contexte | 1M tokens | non publiée | 1M tokens |
| API sortie (off-peak) | 0,87 $/M tokens | ~15 $/M | 50 $/M |
| Sortie peak | 1,74 $/M tokens | — | — |
| Capacité agent | forte, multi-agents | forte | classe maximale |
| Confidentialité | déploiement privé possible | cloud tiers | cloud tiers |
Choix rapide : budget serré / haute fréquence / déploiement privé → V4-Pro ou V4-Flash ; code maximal, coût secondaire → Claude Fable 5 ; algorithmes + math → GPT-5.6 Sol / Ultra ; logs / docs massifs → V4-Flash (entrée cache hit 0,0028 $/M).
[ SECTION_04 ] // PRICING Peak/off-peak : créneaux, grille tarifaire et quatre leviers d'économie
Le GA introduit la tarification différenciée peak/off-peak, comme l'électricité. Peak (heure Pékin) : en semaine 09:00–12:00 et 14:00–18:00, tarifs doublés. DeepSeek prévient 24 h par email avant tout changement.
| Modèle | Poste | Off-peak | Peak |
|---|---|---|---|
| V4-Pro | Entrée (cache hit) | ¥0,025 / 0,0035 $ / 1M | doublé |
| V4-Pro | Entrée (cache miss) | ¥3,00 / 0,435 $ / 1M | ¥6,00 / 0,87 $ |
| V4-Pro | Sortie | ¥6,00 / 0,87 $ / 1M | ¥12,00 / 1,74 $ |
| V4-Flash | Entrée (cache hit) | ¥0,02 / 0,0028 $ / 1M | doublé |
| V4-Flash | Entrée (cache miss) | ¥1,00 / 0,14 $ / 1M | ¥2,00 / 0,28 $ |
| V4-Flash | Sortie | ¥2,00 / 0,28 $ / 1M | ¥4,00 / 0,56 $ |
- Tâches non temps réel en off-peak : batch documents, labeling, revue code après 18:00 ou avant 09:00.
- Exploiter le prompt cache : system prompts répétés ; V4-Flash cache hit 0,0028 $/M.
- Flash en routeur : intents simples → V4-Flash, raisonnement lourd → V4-Pro — 60–80 % d'économie possible.
- Email de facturation actif : recevoir les alertes tarifaires.
Même en peak, la sortie V4-Pro (1,74 $/M) reste 8,6× moins chère que Claude Opus 4.8 (15 $/M) et GPT-5.6 Sol (~15 $/M).
[ SECTION_05 ] // MIGRATION Migration API : checklist six étapes (deadline 24 juillet 23:59)
Alerte : deepseek-chat et deepseek-reasoner cessent le 24 juillet 2026 à 15:59 UTC (24 juillet 23:59 Pékin).
| Ancien modèle | Nouveau modèle | Note |
|---|---|---|
deepseek-chat |
deepseek-v4-flash (non-think) |
Rapide, tâches légères |
deepseek-reasoner |
deepseek-v4-flash (mode think) |
ou upgrade deepseek-v4-pro |
- Recherche globale :
deepseek-chatetdeepseek-reasonerdans code, CI, variables d'env et secrets. - Modèle par scénario : dialogues légers →
deepseek-v4-flashnon-think ; ancien reasoner → Flash think oudeepseek-v4-pro. - SDK OpenAI : changer uniquement
model; mode think viaextra_bodyetthinking. - Chemin compatible Anthropic :
base_urlrestehttps://api.deepseek.com,model→deepseek-v4-prooudeepseek-v4-flash. - Régression staging : tool calling, streaming, long contexte ; Think Max exige fenêtre ≥384K.
- Rollout prod et monitoring : canary avant le 24 juillet, surveiller tokens peak et taux d'erreur, activer le scheduling si besoin.
model="deepseek-chat" (invalide après le 24 juillet)
client.chat.completions.create(
model="deepseek-chat",
messages=[...]
)
model="deepseek-v4-pro"
client.chat.completions.create(
model="deepseek-v4-pro",
messages=[...],
extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)
Sources officielles (revérifier après release) :
https://arxiv.org/abs/2606.19348
[ SECTION_06 ] // FACTS Faits citables et conclusion auto-hébergement Mac
- SWE-bench Verified 80,6 % : record open source, égal Gemini 3.1 Pro ; bugs GitHub réels (synthèse publique, revérifier).
- KV cache 10 % : à 1M seulement 10 % de V3.2 (Flash 7 %), source arXiv:2606.19348.
- Coût 116× : Artificial Analysis Strategy & Ops — Fable 5 3,48 $ vs V4-Pro 0,03 $ par run.
- Baisse juin : sortie V4-Pro 0,87 $/M — rapport qualité/prix historique (page tarifs DeepSeek).
- MIT open source : poids V4-Pro et Flash auto-hébergeables ; idéal données sensibles sans sortie cloud.
- Deadline dure : après 2026-07-24 23:59 Pékin,
deepseek-chat/deepseek-reasonermorts (email API DeepSeek).
DeepSeek V4 GA est l'un des jalons open source majeurs de 2026. Sa valeur n'est pas de battre immédiatement Claude Fable 5 ou GPT-5.6, mais d'offrir la meilleure perf open source à 1/10 à 1/100 du coût closed source.
Inconvénients des alternatives : ① API Claude/GPT seule — agents long contexte chers, code via tiers, audit compliance lourd ; ② poids V4 complets sur laptop 16 Go — impossible, temps perdu ; ③ Mac Studio Ultra pour quelques semaines — immobilisation > location hebdo haute mémoire. Pour tests V4-Flash privés, voir ds4 + déploiement Mac 128 Go.
Pour équipes sensibles à la confidentialité, budget limité, agents 1M ou efficacité API maximale, DeepSeek V4 Pro est l'option open source la plus équilibrée. Infrastructure reproductible : location bare metal Mac Mini NOVAKVM — six régions, Apple Silicon dédié haute mémoire, flexibilité jour/semaine/mois ; nœud 128 Go pour inférence locale, puis décision d'achat. Finaliser la migration avant le 24 juillet. Page tarifs, Page commander, Centre d'aide.