Pourquoi DeepSeek a relevé ses tarifs API jusqu'à 1 100 %
juste après l'offensive open weight chinoise

En cinq jours, trois laboratoires chinois de premier plan ont pris des décisions qui, lues séparément, semblent se contredire. DeepSeek relève certains paliers API jusqu'à 1 100 %. Alibaba, la même semaine, publie pour la première fois les poids d'un modèle phare à 2,4 billions de paramètres. Zhipu AI livre GLM-5.3 et fait progresser les benchmarks de code d'environ 6× sur la même base — sans réentraînement. Lues ensemble, ces décisions marquent le passage d'une guerre du prix le plus bas à une guerre du pouvoir de tarification. Cet article couvre la chronologie, la grille tarifaire, la licence Qwen, les scores GLM-5.3, le découpage stratégique, le face-à-face des prix, les allégations non vérifiées, une checklist en six étapes et une FAQ. À lire aussi : DeepSeek V4 GA, lancement Qwen3.8-Max, baisses GPT-5.6 Luna. Tarifs nœuds : page tarifs.

Trois questions reviennent avant toute décision d'achat : quelle ligne de facturation porte le titre à 1 100 % ; les poids ouverts autorisent-ils un usage commercial libre ou un ban géographique ; DeepSeek reste-t-il l'API frontier la moins chère. Posons d'abord les dates.

Chronologie open weight et tarifs (juillet–août 2026)
Date Événement
16 juillet 2026 Moonshot AI ouvre les poids de Kimi K3 (2,8T paramètres), ce qui attire l'attention des autorités de sécurité américaines
30 juillet 2026 OpenAI réduit de 80 % GPT-5.6 Luna, son palier le moins cher
2–3 août 2026 Alibaba prévisualise puis lance Qwen3.8-Max en API hébergée
6–7 août 2026 OpenAI fait de Luna le défaut gratuit, avec des chats texte illimités
10 août 2026 Meta publie Muse Glimmer (30B, Apache 2.0) et évoque des poids ouverts pour le phare Muse Spark 1.2
12 août 2026 Alibaba publie les poids Qwen3.8-2.4T-A95B sur Hugging Face / ModelScope ; xAI livre Grok 4.6
13 août 2026 DeepSeek-V4-Pro passe en GA et annonce une hausse au 17 août ; Google livre Gemini 3.7 Flash à tarif réduit
14 août 2026 Zhipu livre GLM-5.3 en réutilisant la base 743B de GLM-5.2
17 août 2026, 00:00 heure de Pékin La nouvelle grille DeepSeek entre en vigueur

En reculant d'un cran, le tableau se précise. Pendant que les laboratoires chinois relevaient leurs prix et ouvraient les poids de leurs phares, les laboratoires américains coupaient les tarifs et passaient au gratuit côté grand public. Ce sont les deux faces d'une même bataille tarifaire. La presse financière chinoise a commencé à parler de 「一周三更」— trois mises à jour majeures par semaine — avec MiniMax H3 dans la même rotation que DeepSeek, Alibaba et Zhipu.

  • Friction 1 — l'arithmétique des titres : « 11× », « plus de 1 100 % » et « 350 % » sont tous vrais. Ils décrivent des lignes différentes : entrée cache hit, sortie, entrée cache miss.
  • Friction 2 — le folklore de licence : les rumeurs d'un ban de téléchargement pour les États-Unis, l'UE, le Royaume-Uni et la Corée du Sud sont fausses. Le texte publié n'a pas de clause territoriale. Les vrais seuils sont le chiffre d'affaires et le type de produit.
  • Friction 3 — l'officiel n'est plus le moins cher par défaut : aux heures de pointe, l'API officielle DeepSeek cote désormais au-dessus de certains revendeurs (GMI Cloud, Novita et d'autres affichent aujourd'hui V4 Pro sous le tarif peak officiel).

Les nouveaux tarifs DeepSeek s'appliquent à 00:00 heure de Pékin le 17 août. Heures de pointe : 9 h–12 h et 14 h–18 h à Pékin (01:00–04:00 et 06:00–10:00 UTC).

Hausse DeepSeek (pour 1M tokens, RMB ; annonce officielle, recoupée avec Wall Street CN, IT Home, V2EX)
Poste de facturation Ancien Nouveau creux Nouveau peak Hausse peak
V4-Flash cache hit (entrée) ¥0.02 ¥0.05 ¥0.10 ~400%
V4-Flash cache miss (entrée) ¥1.0 ¥1.5 ¥3.0 200%
V4-Flash sortie ¥2.0 ¥4.5 ¥9.0 350%
V4-Pro cache hit (entrée) ¥0.025 ¥0.15 ¥0.30 ~1100%
V4-Pro cache miss (entrée) ¥3.0 ¥4.5 ¥9.0 200%
V4-Pro sortie ¥6.0 ¥13.5 ¥27.0 350%

Le chiffre de 1 100 % s'applique à l'entrée cache hit en heures de pointe — le palier qui était le plus proche de la gratuité. La sortie, qui pèse le plus sur les factures réelles, a augmenté de 350 %. Une modélisation indépendante d'une charge lourde réaliste (environ 84M tokens/mois, surtout en heures creuses, moitié cache hits) aboutit plutôt à un facteur 1,8×.

Qwen3.8-2.4T-A95B (poids ouverts Qwen3.8-Max) : specs clés
Spec Détail
Paramètres 2,4T au total, 95B actifs par token (MoE, 512 experts, 10 routés + 1 partagé)
Fenêtre de contexte 262144 tokens natifs (checkpoint ouvert), extensible à ~1.01M ; le Max hébergé est à 1M par défaut
Cadence de sortie Aperçu 2 août → API live 3 août → poids ouverts 12 août
Tarif API (international) $2/M entrée, $6/M sortie
Licence Pas Apache 2.0 — une Qwen3.8-Max License sur mesure
Pourquoi ça compte Première fois qu'Alibaba ouvre les poids d'un phare de rang Max ; Qwen3.5 / 3.6 / 3.7 Max étaient restés API only
GLM-5.3 vs GLM-5.2 : même base, post-training seul (chiffres Zhipu ; pas encore de rerun indépendant)
Benchmark GLM-5.2 GLM-5.3 Écart
Terminal-Bench 3.0 4.6% 28.3% +23.7 pts
DeepSWE v1.1 46.2% 66.9% +20.7 pts
Agents' Last Exam (CLI) 23.8% 28.5% +4.7 pts
CyberGym 77.2% 84.5% +7.3 pts
AutomationBench 26.2% 48.2% +22.0 pts

Sur Terminal-Bench 3.0, GLM-5.3 reste derrière GPT-5.6 Sol (34.6 %) et Claude Fable 5 (33.7 %). C'est un résultat open weight de premier plan, pas une victoire frontier nette.

DeepSeek est-il encore le modèle frontier le moins cher ? (RMB/USD à ~¥7.15/$1)
Modèle Entrée (pour 1M tokens) Sortie (pour 1M tokens) Poids ouverts ?
DeepSeek V4-Pro (peak) ¥9.0 (~$1.26) ¥27.0 (~$3.78) Non
DeepSeek V4-Pro (heures creuses) ¥4.5 (~$0.63) ¥13.5 (~$1.89) Non
Qwen3.8-Max (API internationale) $2.00 $6.00 Oui (licence sur mesure)
OpenAI GPT-5.6 Luna $0.20 $1.20 Non
Claude Opus 5 (implicite, selon le ratio de comparaison d'Alibaba) ~$5.00 ~$25.00 Non

Même après la hausse, DeepSeek V4-Pro en heures creuses reste nettement sous Claude Opus 5. Ce n'est plus l'option la moins chère dans l'absolu. Le tarif international Qwen3.8-Max et OpenAI Luna sous-cotent tous deux DeepSeek heures creuses. « Modèle chinois = modèle le moins cher » a tenu l'essentiel de 2025 et le début de 2026. Ce n'est plus une hypothèse de planification sûre.

1. DeepSeek : du tarif plat et bas à une grille selon l'heure — un problème de capacité, pas un revirement stratégique. La lecture facile voudrait que le modèle chinois le moins cher cède enfin à la pression sur les marges. La structure tarifaire ressemble davantage à une entreprise qui rend visibles, sur la grille, des contraintes de compute. Un prix toujours bas a servi d'acquisition tant que la capacité GPU suivait. Quand l'usage a crû de façon exponentielle et que la capacité n'a pas suivi, quelque chose devait devenir explicite. « Encourager une planification plus souple des charges » est le langage corporate pour : le compute de pointe est désormais rare. Aux heures de pointe, l'API officielle cote au-dessus de plusieurs revendeurs. L'hypothèse selon laquelle l'officiel est toujours le chemin le moins cher vers DeepSeek est rompue pour la première fois.

2. Alibaba : les poids ouverts achètent la bienveillance de l'écosystème ; une licence sur mesure protège le plafond de revenus. La publication du checkpoint 2,4T et l'attachement d'une licence maison — pas Apache 2.0 — sont allés de pair. Toute activité Model-as-a-Service ou AI Work Assistant dépassant 50 millions de dollars sur une période de 12 mois doit négocier une licence commerciale distincte. Les produits à 100M+ d'utilisateurs actifs mensuels ou 20 millions de dollars+ de revenus mensuels doivent afficher le nom du modèle de façon proéminente. Le pari : gagner l'esprit des développeurs à l'international, conserver un levier sur les firmes capables de monter une activité d'inférence concurrente. C'est un pari différent de celui de Muse Glimmer chez Meta, publié sous Apache 2.0 sans restriction.

Une rumeur mérite d'être tuée clairement. Les allégations d'un ban de téléchargement pour les États-Unis, l'UE, le Royaume-Uni et la Corée du Sud sont fausses. Le fichier LICENSE publié ne contient aucune clause géographique. Dans un cycle de sortie aussi rapide, le fichier LICENSE — pas le fil d'annonce — est la source primaire.

3. GLM-5.3 : pas de nouvelle base, seulement un pari plus large sur le post-training. Même fondation 743B que GLM-5.2, pas de réentraînement, et un saut d'environ 6× sur Terminal-Bench 3.0 (4.6 % → 28.3 %) grâce à l'amplification des environnements de reinforcement learning. Alors que les lois d'échelle du prétraining montrent des rendements décroissants, l'échelle du RL en post-training devient un levier autonome, avec un plancher de coût bien plus bas qu'un nouveau modèle de fondation. Des laboratoires de milieu de tableau, sans le compute d'OpenAI, peuvent encore refermer l'écart sur les benchmarks agents et code.

Ce qui est contesté ou non vérifié :

  • Le titre à 1 100 % est exact et incomplet. Il ne s'applique qu'à l'entrée cache hit en heures de pointe. La sortie — le poste qui domine la plupart des factures réelles — a augmenté de 350 %.
  • Les allégations selon lesquelles Qwen3.8-Max tournerait sur les puces maison Zhenwu M890 et des supernodes « Pangu AL128 » apparaissent dans la presse financière chinoise. Elles n'ont pas été confirmées de façon indépendante par la documentation technique d'Alibaba ni par des benchmarks tiers. À traiter comme un reportage proche du vendeur, non vérifié.
  • La découverte rapportée par GLM-5.3 d'une faille grave dans Cursor vient de VentureBeat et de la propre divulgation de Zhipu. Les détails techniques n'ont pas été rendus publics. Source vendeur, pas un audit indépendant.
  • Les reports selon lesquels le ministère chinois du Commerce (MOFCOM) préparerait des contrôles d'exportation de rétorsion sur les technologies d'IA ou de semi-conducteurs restent spéculatifs et s'appuient sur des articles non confirmés, pas sur une annonce officielle.

Pourquoi cela compte : deux guerres de prix en parallèle. Ce dernier mois, les laboratoires chinois de tête ont livré à un rythme que la presse intérieure appelle trois mises à jour par semaine. Les laboratoires américains ont joué le mouvement inverse côté grand public : OpenAI a coupé Luna de 80 % le 30 juillet, puis l'a rendue gratuite et illimitée les 6–7 août ; Google a livré le 13 août un modèle orienté code à la moitié du prix de son prédécesseur vieux de trois semaines. Les laboratoires chinois ouvrent les poids de leurs phares et introduisent une tarification étagée, plus élevée, sur le haut de gamme contraint en compute. Les laboratoires américains courent vers le gratuit et le bon marché à l'extrémité consommateur.

Il y a aussi une couche géopolitique. Le Kimi K3 de Moonshot a déjà attiré l'attention des autorités de sécurité américaines. Certains analystes lisent le choix d'Alibaba d'ouvrir un phare 2,4T dans cette fenêtre comme une manière de verrouiller l'esprit des développeurs internationaux avant un éventuel resserrement réglementaire. C'est une interprétation informée, pas un fait confirmé. Voir aussi l'explicatif open weight Kimi K3.

  1. Éclater le titre en lignes de facturation. Noter l'entrée cache hit (~1 100 %), la sortie (350 %) et l'entrée cache miss (200 %) sur des lignes séparées. Ne pas budgéter à partir d'un seul multiple.
  2. Comparer les tarifs peak officiels aux revendeurs. Contrôler GMI Cloud, Novita et d'autres listings contre la grille peak DeepSeek. L'officiel n'est plus le chemin le moins cher par défaut.
  3. Lire le fichier LICENSE Qwen, pas le fil de lancement. Confirmer l'absence de ban géographique. Vérifier si votre produit atteint Model-as-a-Service / AI Work Assistant plus 50 millions de dollars sur 12 mois, ou 100M MAU / 20 millions de dollars de revenus mensuels.
  4. Étiqueter les scores GLM-5.3 comme vendor-run. Terminal-Bench 3.0 à 28.3 % n'a pas de rerun indépendant publié. Quand vous citez Sol 34.6 % et Fable 5 33.7 %, gardez la source visible.
  5. Recalculer la facture avec le taux heures creuses et le taux de cache hit. Déplacer les jobs batch, les evals et les boucles d'agents de nuit hors des heures de pointe. Pour les gros volumes, modéliser ~1,8×, pas 11×.
  6. L'auto-hébergement de poids ouverts exige un hôte stable. Les evals longues, l'orchestration d'agents et les journaux de conformité de licence ont besoin d'un environnement reproductible 7×24. Le sleep d'un portable et la dérive d'une VM cassent la piste d'audit. Lancez un nœud d'essai depuis les pages tarifs et commande, puis consignez versions, texte de licence et journaux.
china-llm-price-war-triage.md
Cluster Chine open-weight + tarifs — triage (vérifier contre sources primaires)
deepseek  V4-Pro peak cache-hit input ~1100% · output +350% · en vigueur 17 août 00:00 CST
peak      Pékin 09:00-12:00 et 14:00-18:00 · UTC 01:00-04:00 et 06:00-10:00
qwen      poids 2.4T-A95B live 12 août · licence sur mesure · pas de ban geo
glm53     même base 743B · TB3.0 4.6% → 28.3% · vendor-run, pas de rerun tiers
rumeur    Zhenwu M890 / faille Cursor / contrôles export MOFCOM = non vérifié

  • DeepSeek V4-Pro entrée cache hit peak : ¥0.025 → ¥0.30, environ 1 100 % ; sortie ¥6.0 → ¥27.0, 350 %.
  • Qwen3.8-2.4T-A95B : 2,4T total / 95B actifs ; 262144 tokens natifs, ~1.01M extensible ; API internationale $2 / $6.
  • Seuils de licence Qwen : MaaS / AI Work Assistant au-delà de 50 millions de dollars sur 12 mois exige une licence distincte ; 100M MAU ou 20 millions de dollars de revenus mensuels exigent un nommage proéminent ; pas de ban géographique.
  • GLM-5.3 : même base 743B que 5.2 ; Terminal-Bench 3.0 4.6 % → 28.3 % ; toujours derrière Sol 34.6 % et Fable 5 33.7 %.
  • Facture gros volume : modélisation tierce ~1,8×, loin du titre 11×.
  • Référence de change : environ ¥7.15 / $1, approximation seulement.

FAQ :

  • Q : DeepSeek reste-t-il moins cher que GPT-5.6 ou Claude ? R : Les heures creuses sous-cotent encore Claude Opus 5. Luna ($0.20 / $1.20) et Qwen3.8-Max international ($2 / $6) sous-cotent désormais DeepSeek heures creuses sur au moins une dimension.
  • Q : Puis-je utiliser gratuitement les poids ouverts Qwen3.8-Max à des fins commerciales ? R : Usage personnel et interne : oui. Le seuil de 50 millions de dollars MaaS / AI Work Assistant est le piège.
  • Q : Qwen3.8-Max est-il interdit aux utilisateurs US, UE ou UK ? R : Non. La licence publiée n'a pas de restriction géographique.
  • Q : Qu'est-ce qui a changé entre GLM-5.3 et GLM-5.2 ? R : Même base 743B. Les gains viennent du RL de post-training mis à l'échelle, pas d'un nouveau modèle de fondation.
  • Q : Meta ouvrira-t-il Muse Spark 1.2, pas seulement Glimmer ? R : Pas encore. Glimmer est une distillation 30B. Spark 1.2 reste une intention déclarée.

Sources primaires utilisées à la rédaction. Vérifier les derniers tarifs officiels et termes de licence avant republication. Les points signalés plus haut comme non vérifiés (allégations de puces nationales, le rapport de faille Cursor, les rumeurs de contrôle à l'export) n'ont pas été confirmés de façon indépendante. Les chiffres reflètent l'information publique au 17 août 2026.

Page tarifaire officielle DeepSeek (traiter la page live comme source de vérité) :

https://api-docs.deepseek.com/quick_start/pricing

Dépôts officiels des modèles Alibaba Qwen sur Hugging Face :

https://huggingface.co/Qwen

Dépôts de modèles ModelScope :

https://www.modelscope.cn/

Page technique officielle Zhipu GLM-5.3 :

https://z.ai/blog/glm-5.3

Vraies limites des contournements habituels : budgéter à partir d'un seul multiple de 1 100 % surestime les factures gros volume en heures creuses et sous-estime le choc des batchs en pointe. Traiter les poids Qwen comme Apache 2.0 et monter un produit Model-as-a-Service peut déclencher la licence sur mesure. Lancer des evals de classe 2,4T et de longues boucles d'agents sur un portable qui s'endort, ou sur une VM qui dérive, casse la reproductibilité et la piste d'audit de licence.

Pour les équipes qui ont besoin d'Apple Silicon dédié, d'une disponibilité 7×24 et d'une élasticité jour/semaine/mois afin de faire tourner des evals open weight, de l'orchestration d'agents et de longues inférences sur un hôte macOS stable — y compris les flux créatifs et de développement qui s'appuient déjà sur Xcode, Final Cut ou un atelier local sur silicium Apple — la location bare metal Mac Mini NOVAKVM est généralement le meilleur chemin de production. Laisser les récits tarifaires sur les grilles des éditeurs ; garder l'exécution sur un nœud bare metal résident. Comparez les offres sur la page tarifs NOVAKVM, lancez un essai sur la page commande, sessions distantes via le centre d'aide.