En cinq jours, trois laboratoires chinois de premier plan ont pris des décisions qui, lues séparément, semblent se contredire. DeepSeek relève certains paliers API jusqu'à 1 100 %. Alibaba, la même semaine, publie pour la première fois les poids d'un modèle phare à 2,4 billions de paramètres. Zhipu AI livre GLM-5.3 et fait progresser les benchmarks de code d'environ 6× sur la même base — sans réentraînement. Lues ensemble, ces décisions marquent le passage d'une guerre du prix le plus bas à une guerre du pouvoir de tarification. Cet article couvre la chronologie, la grille tarifaire, la licence Qwen, les scores GLM-5.3, le découpage stratégique, le face-à-face des prix, les allégations non vérifiées, une checklist en six étapes et une FAQ. À lire aussi : DeepSeek V4 GA, lancement Qwen3.8-Max, baisses GPT-5.6 Luna. Tarifs nœuds : page tarifs.
[ SECTION_01 ] // TIMELINE Ce qui s'est joué en deux semaines, et où les équipes bloquent
Trois questions reviennent avant toute décision d'achat : quelle ligne de facturation porte le titre à 1 100 % ; les poids ouverts autorisent-ils un usage commercial libre ou un ban géographique ; DeepSeek reste-t-il l'API frontier la moins chère. Posons d'abord les dates.
| Date | Événement |
|---|---|
| 16 juillet 2026 | Moonshot AI ouvre les poids de Kimi K3 (2,8T paramètres), ce qui attire l'attention des autorités de sécurité américaines |
| 30 juillet 2026 | OpenAI réduit de 80 % GPT-5.6 Luna, son palier le moins cher |
| 2–3 août 2026 | Alibaba prévisualise puis lance Qwen3.8-Max en API hébergée |
| 6–7 août 2026 | OpenAI fait de Luna le défaut gratuit, avec des chats texte illimités |
| 10 août 2026 | Meta publie Muse Glimmer (30B, Apache 2.0) et évoque des poids ouverts pour le phare Muse Spark 1.2 |
| 12 août 2026 | Alibaba publie les poids Qwen3.8-2.4T-A95B sur Hugging Face / ModelScope ; xAI livre Grok 4.6 |
| 13 août 2026 | DeepSeek-V4-Pro passe en GA et annonce une hausse au 17 août ; Google livre Gemini 3.7 Flash à tarif réduit |
| 14 août 2026 | Zhipu livre GLM-5.3 en réutilisant la base 743B de GLM-5.2 |
| 17 août 2026, 00:00 heure de Pékin | La nouvelle grille DeepSeek entre en vigueur |
En reculant d'un cran, le tableau se précise. Pendant que les laboratoires chinois relevaient leurs prix et ouvraient les poids de leurs phares, les laboratoires américains coupaient les tarifs et passaient au gratuit côté grand public. Ce sont les deux faces d'une même bataille tarifaire. La presse financière chinoise a commencé à parler de 「一周三更」— trois mises à jour majeures par semaine — avec MiniMax H3 dans la même rotation que DeepSeek, Alibaba et Zhipu.
- Friction 1 — l'arithmétique des titres : « 11× », « plus de 1 100 % » et « 350 % » sont tous vrais. Ils décrivent des lignes différentes : entrée cache hit, sortie, entrée cache miss.
- Friction 2 — le folklore de licence : les rumeurs d'un ban de téléchargement pour les États-Unis, l'UE, le Royaume-Uni et la Corée du Sud sont fausses. Le texte publié n'a pas de clause territoriale. Les vrais seuils sont le chiffre d'affaires et le type de produit.
- Friction 3 — l'officiel n'est plus le moins cher par défaut : aux heures de pointe, l'API officielle DeepSeek cote désormais au-dessus de certains revendeurs (GMI Cloud, Novita et d'autres affichent aujourd'hui V4 Pro sous le tarif peak officiel).
[ SECTION_02 ] // MATRIX Les chiffres : grilles DeepSeek, specs Qwen et matrice des prix
Les nouveaux tarifs DeepSeek s'appliquent à 00:00 heure de Pékin le 17 août. Heures de pointe : 9 h–12 h et 14 h–18 h à Pékin (01:00–04:00 et 06:00–10:00 UTC).
| Poste de facturation | Ancien | Nouveau creux | Nouveau peak | Hausse peak |
|---|---|---|---|---|
| V4-Flash cache hit (entrée) | ¥0.02 | ¥0.05 | ¥0.10 | ~400% |
| V4-Flash cache miss (entrée) | ¥1.0 | ¥1.5 | ¥3.0 | 200% |
| V4-Flash sortie | ¥2.0 | ¥4.5 | ¥9.0 | 350% |
| V4-Pro cache hit (entrée) | ¥0.025 | ¥0.15 | ¥0.30 | ~1100% |
| V4-Pro cache miss (entrée) | ¥3.0 | ¥4.5 | ¥9.0 | 200% |
| V4-Pro sortie | ¥6.0 | ¥13.5 | ¥27.0 | 350% |
Le chiffre de 1 100 % s'applique à l'entrée cache hit en heures de pointe — le palier qui était le plus proche de la gratuité. La sortie, qui pèse le plus sur les factures réelles, a augmenté de 350 %. Une modélisation indépendante d'une charge lourde réaliste (environ 84M tokens/mois, surtout en heures creuses, moitié cache hits) aboutit plutôt à un facteur 1,8×.
| Spec | Détail |
|---|---|
| Paramètres | 2,4T au total, 95B actifs par token (MoE, 512 experts, 10 routés + 1 partagé) |
| Fenêtre de contexte | 262144 tokens natifs (checkpoint ouvert), extensible à ~1.01M ; le Max hébergé est à 1M par défaut |
| Cadence de sortie | Aperçu 2 août → API live 3 août → poids ouverts 12 août |
| Tarif API (international) | $2/M entrée, $6/M sortie |
| Licence | Pas Apache 2.0 — une Qwen3.8-Max License sur mesure |
| Pourquoi ça compte | Première fois qu'Alibaba ouvre les poids d'un phare de rang Max ; Qwen3.5 / 3.6 / 3.7 Max étaient restés API only |
| Benchmark | GLM-5.2 | GLM-5.3 | Écart |
|---|---|---|---|
| Terminal-Bench 3.0 | 4.6% | 28.3% | +23.7 pts |
| DeepSWE v1.1 | 46.2% | 66.9% | +20.7 pts |
| Agents' Last Exam (CLI) | 23.8% | 28.5% | +4.7 pts |
| CyberGym | 77.2% | 84.5% | +7.3 pts |
| AutomationBench | 26.2% | 48.2% | +22.0 pts |
Sur Terminal-Bench 3.0, GLM-5.3 reste derrière GPT-5.6 Sol (34.6 %) et Claude Fable 5 (33.7 %). C'est un résultat open weight de premier plan, pas une victoire frontier nette.
| Modèle | Entrée (pour 1M tokens) | Sortie (pour 1M tokens) | Poids ouverts ? |
|---|---|---|---|
| DeepSeek V4-Pro (peak) | ¥9.0 (~$1.26) | ¥27.0 (~$3.78) | Non |
| DeepSeek V4-Pro (heures creuses) | ¥4.5 (~$0.63) | ¥13.5 (~$1.89) | Non |
| Qwen3.8-Max (API internationale) | $2.00 | $6.00 | Oui (licence sur mesure) |
| OpenAI GPT-5.6 Luna | $0.20 | $1.20 | Non |
| Claude Opus 5 (implicite, selon le ratio de comparaison d'Alibaba) | ~$5.00 | ~$25.00 | Non |
Même après la hausse, DeepSeek V4-Pro en heures creuses reste nettement sous Claude Opus 5. Ce n'est plus l'option la moins chère dans l'absolu. Le tarif international Qwen3.8-Max et OpenAI Luna sous-cotent tous deux DeepSeek heures creuses. « Modèle chinois = modèle le moins cher » a tenu l'essentiel de 2025 et le début de 2026. Ce n'est plus une hypothèse de planification sûre.
[ SECTION_03 ] // DEEP_DIVE Trois stratégies, deux guerres de prix, et ce qui reste non vérifié
1. DeepSeek : du tarif plat et bas à une grille selon l'heure — un problème de capacité, pas un revirement stratégique. La lecture facile voudrait que le modèle chinois le moins cher cède enfin à la pression sur les marges. La structure tarifaire ressemble davantage à une entreprise qui rend visibles, sur la grille, des contraintes de compute. Un prix toujours bas a servi d'acquisition tant que la capacité GPU suivait. Quand l'usage a crû de façon exponentielle et que la capacité n'a pas suivi, quelque chose devait devenir explicite. « Encourager une planification plus souple des charges » est le langage corporate pour : le compute de pointe est désormais rare. Aux heures de pointe, l'API officielle cote au-dessus de plusieurs revendeurs. L'hypothèse selon laquelle l'officiel est toujours le chemin le moins cher vers DeepSeek est rompue pour la première fois.
2. Alibaba : les poids ouverts achètent la bienveillance de l'écosystème ; une licence sur mesure protège le plafond de revenus. La publication du checkpoint 2,4T et l'attachement d'une licence maison — pas Apache 2.0 — sont allés de pair. Toute activité Model-as-a-Service ou AI Work Assistant dépassant 50 millions de dollars sur une période de 12 mois doit négocier une licence commerciale distincte. Les produits à 100M+ d'utilisateurs actifs mensuels ou 20 millions de dollars+ de revenus mensuels doivent afficher le nom du modèle de façon proéminente. Le pari : gagner l'esprit des développeurs à l'international, conserver un levier sur les firmes capables de monter une activité d'inférence concurrente. C'est un pari différent de celui de Muse Glimmer chez Meta, publié sous Apache 2.0 sans restriction.
Une rumeur mérite d'être tuée clairement. Les allégations d'un ban de téléchargement pour les États-Unis, l'UE, le Royaume-Uni et la Corée du Sud sont fausses. Le fichier LICENSE publié ne contient aucune clause géographique. Dans un cycle de sortie aussi rapide, le fichier LICENSE — pas le fil d'annonce — est la source primaire.
3. GLM-5.3 : pas de nouvelle base, seulement un pari plus large sur le post-training. Même fondation 743B que GLM-5.2, pas de réentraînement, et un saut d'environ 6× sur Terminal-Bench 3.0 (4.6 % → 28.3 %) grâce à l'amplification des environnements de reinforcement learning. Alors que les lois d'échelle du prétraining montrent des rendements décroissants, l'échelle du RL en post-training devient un levier autonome, avec un plancher de coût bien plus bas qu'un nouveau modèle de fondation. Des laboratoires de milieu de tableau, sans le compute d'OpenAI, peuvent encore refermer l'écart sur les benchmarks agents et code.
Ce qui est contesté ou non vérifié :
- Le titre à 1 100 % est exact et incomplet. Il ne s'applique qu'à l'entrée cache hit en heures de pointe. La sortie — le poste qui domine la plupart des factures réelles — a augmenté de 350 %.
- Les allégations selon lesquelles Qwen3.8-Max tournerait sur les puces maison Zhenwu M890 et des supernodes « Pangu AL128 » apparaissent dans la presse financière chinoise. Elles n'ont pas été confirmées de façon indépendante par la documentation technique d'Alibaba ni par des benchmarks tiers. À traiter comme un reportage proche du vendeur, non vérifié.
- La découverte rapportée par GLM-5.3 d'une faille grave dans Cursor vient de VentureBeat et de la propre divulgation de Zhipu. Les détails techniques n'ont pas été rendus publics. Source vendeur, pas un audit indépendant.
- Les reports selon lesquels le ministère chinois du Commerce (MOFCOM) préparerait des contrôles d'exportation de rétorsion sur les technologies d'IA ou de semi-conducteurs restent spéculatifs et s'appuient sur des articles non confirmés, pas sur une annonce officielle.
Pourquoi cela compte : deux guerres de prix en parallèle. Ce dernier mois, les laboratoires chinois de tête ont livré à un rythme que la presse intérieure appelle trois mises à jour par semaine. Les laboratoires américains ont joué le mouvement inverse côté grand public : OpenAI a coupé Luna de 80 % le 30 juillet, puis l'a rendue gratuite et illimitée les 6–7 août ; Google a livré le 13 août un modèle orienté code à la moitié du prix de son prédécesseur vieux de trois semaines. Les laboratoires chinois ouvrent les poids de leurs phares et introduisent une tarification étagée, plus élevée, sur le haut de gamme contraint en compute. Les laboratoires américains courent vers le gratuit et le bon marché à l'extrémité consommateur.
Il y a aussi une couche géopolitique. Le Kimi K3 de Moonshot a déjà attiré l'attention des autorités de sécurité américaines. Certains analystes lisent le choix d'Alibaba d'ouvrir un phare 2,4T dans cette fenêtre comme une manière de verrouiller l'esprit des développeurs internationaux avant un éventuel resserrement réglementaire. C'est une interprétation informée, pas un fait confirmé. Voir aussi l'explicatif open weight Kimi K3.
[ SECTION_04 ] // CHECKLIST Six étapes pour vérifier la guerre des prix avant de bouger le budget
- Éclater le titre en lignes de facturation. Noter l'entrée cache hit (~1 100 %), la sortie (350 %) et l'entrée cache miss (200 %) sur des lignes séparées. Ne pas budgéter à partir d'un seul multiple.
- Comparer les tarifs peak officiels aux revendeurs. Contrôler GMI Cloud, Novita et d'autres listings contre la grille peak DeepSeek. L'officiel n'est plus le chemin le moins cher par défaut.
- Lire le fichier LICENSE Qwen, pas le fil de lancement. Confirmer l'absence de ban géographique. Vérifier si votre produit atteint Model-as-a-Service / AI Work Assistant plus 50 millions de dollars sur 12 mois, ou 100M MAU / 20 millions de dollars de revenus mensuels.
- Étiqueter les scores GLM-5.3 comme vendor-run. Terminal-Bench 3.0 à 28.3 % n'a pas de rerun indépendant publié. Quand vous citez Sol 34.6 % et Fable 5 33.7 %, gardez la source visible.
- Recalculer la facture avec le taux heures creuses et le taux de cache hit. Déplacer les jobs batch, les evals et les boucles d'agents de nuit hors des heures de pointe. Pour les gros volumes, modéliser ~1,8×, pas 11×.
- L'auto-hébergement de poids ouverts exige un hôte stable. Les evals longues, l'orchestration d'agents et les journaux de conformité de licence ont besoin d'un environnement reproductible 7×24. Le sleep d'un portable et la dérive d'une VM cassent la piste d'audit. Lancez un nœud d'essai depuis les pages tarifs et commande, puis consignez versions, texte de licence et journaux.
Cluster Chine open-weight + tarifs — triage (vérifier contre sources primaires)
deepseek V4-Pro peak cache-hit input ~1100% · output +350% · en vigueur 17 août 00:00 CST
peak Pékin 09:00-12:00 et 14:00-18:00 · UTC 01:00-04:00 et 06:00-10:00
qwen poids 2.4T-A95B live 12 août · licence sur mesure · pas de ban geo
glm53 même base 743B · TB3.0 4.6% → 28.3% · vendor-run, pas de rerun tiers
rumeur Zhenwu M890 / faille Cursor / contrôles export MOFCOM = non vérifié
[ SECTION_05 ] // FACTS_FAQ Chiffres citables, FAQ et un hôte pour la boucle d'eval
- DeepSeek V4-Pro entrée cache hit peak : ¥0.025 → ¥0.30, environ 1 100 % ; sortie ¥6.0 → ¥27.0, 350 %.
- Qwen3.8-2.4T-A95B : 2,4T total / 95B actifs ; 262144 tokens natifs, ~1.01M extensible ; API internationale $2 / $6.
- Seuils de licence Qwen : MaaS / AI Work Assistant au-delà de 50 millions de dollars sur 12 mois exige une licence distincte ; 100M MAU ou 20 millions de dollars de revenus mensuels exigent un nommage proéminent ; pas de ban géographique.
- GLM-5.3 : même base 743B que 5.2 ; Terminal-Bench 3.0 4.6 % → 28.3 % ; toujours derrière Sol 34.6 % et Fable 5 33.7 %.
- Facture gros volume : modélisation tierce ~1,8×, loin du titre 11×.
- Référence de change : environ ¥7.15 / $1, approximation seulement.
FAQ :
- Q : DeepSeek reste-t-il moins cher que GPT-5.6 ou Claude ? R : Les heures creuses sous-cotent encore Claude Opus 5. Luna ($0.20 / $1.20) et Qwen3.8-Max international ($2 / $6) sous-cotent désormais DeepSeek heures creuses sur au moins une dimension.
- Q : Puis-je utiliser gratuitement les poids ouverts Qwen3.8-Max à des fins commerciales ? R : Usage personnel et interne : oui. Le seuil de 50 millions de dollars MaaS / AI Work Assistant est le piège.
- Q : Qwen3.8-Max est-il interdit aux utilisateurs US, UE ou UK ? R : Non. La licence publiée n'a pas de restriction géographique.
- Q : Qu'est-ce qui a changé entre GLM-5.3 et GLM-5.2 ? R : Même base 743B. Les gains viennent du RL de post-training mis à l'échelle, pas d'un nouveau modèle de fondation.
- Q : Meta ouvrira-t-il Muse Spark 1.2, pas seulement Glimmer ? R : Pas encore. Glimmer est une distillation 30B. Spark 1.2 reste une intention déclarée.
Sources primaires utilisées à la rédaction. Vérifier les derniers tarifs officiels et termes de licence avant republication. Les points signalés plus haut comme non vérifiés (allégations de puces nationales, le rapport de faille Cursor, les rumeurs de contrôle à l'export) n'ont pas été confirmés de façon indépendante. Les chiffres reflètent l'information publique au 17 août 2026.
Page tarifaire officielle DeepSeek (traiter la page live comme source de vérité) :
https://api-docs.deepseek.com/quick_start/pricing
Dépôts officiels des modèles Alibaba Qwen sur Hugging Face :
Dépôts de modèles ModelScope :
Page technique officielle Zhipu GLM-5.3 :
Vraies limites des contournements habituels : budgéter à partir d'un seul multiple de 1 100 % surestime les factures gros volume en heures creuses et sous-estime le choc des batchs en pointe. Traiter les poids Qwen comme Apache 2.0 et monter un produit Model-as-a-Service peut déclencher la licence sur mesure. Lancer des evals de classe 2,4T et de longues boucles d'agents sur un portable qui s'endort, ou sur une VM qui dérive, casse la reproductibilité et la piste d'audit de licence.
Pour les équipes qui ont besoin d'Apple Silicon dédié, d'une disponibilité 7×24 et d'une élasticité jour/semaine/mois afin de faire tourner des evals open weight, de l'orchestration d'agents et de longues inférences sur un hôte macOS stable — y compris les flux créatifs et de développement qui s'appuient déjà sur Xcode, Final Cut ou un atelier local sur silicium Apple — la location bare metal Mac Mini NOVAKVM est généralement le meilleur chemin de production. Laisser les récits tarifaires sur les grilles des éditeurs ; garder l'exécution sur un nœud bare metal résident. Comparez les offres sur la page tarifs NOVAKVM, lancez un essai sur la page commande, sessions distantes via le centre d'aide.