Si vous êtes développeur IA ou responsable technique évaluant des modèles flagship pour workflows agent, FinOps API ou migration de fournisseur, le Qwen3.8-Max d'Alibaba en GA du 3 août 2026 redéfinit le tempo de la ligue chinoise : 2,4 billions de paramètres totaux, 95 milliards actifs, contexte 1M tokens et 5e place provisoire sur Arena texte — seul modèle non-Anthropic du top 8. L'agent « Qwen Office » a été lancé en parallèle. Cet article couvre chronologie sur deux semaines, tableaux clés, architecture MoE, comparaison Kimi K3 / DeepSeek V4-Flash / Claude, controverse du label open source, playbook en six étapes et FAQ. Liens croisés : analyse Kimi K3 open weight, baisse de prix GPT-5.6, Apple Intelligence et Qwen. Tarifs : page tarifs.
[ SECTION_01 ] // TIMELINE De la préversion au GA : la cadence du frontier chinois en août 2026
- 16 juillet : Moonshot publie Kimi K3 — 2,8 billions de paramètres, 896 experts dont 16 actifs, avec rapport technique et benchmarks indépendants.
- 19 juillet : Qwen3.8-Max en préversion via Token Plan, Qoder et QoderWork à 10 % du prix GA attendu — sans nombre de paramètres actifs ni tableau de scores ; CGU interdisant les appels automatisés en production.
- 27 juillet : Kimi K3 publie ses poids sur Hugging Face plus MoonEP, FlashKDA et AgentEnv.
- 31 juillet : DeepSeek sort V4-Flash en GA — même taille que V4-Pro, gains majeurs sur benchmarks agent et code grâce à l'optimisation architecture et entraînement.
- 3 août : Qwen3.8-Max passe en GA avec tableau de scores complet ; « Qwen Office » répond à Tencent WorkBuddy et Kimi Work. Actions Alibaba : Hong Kong +7 %, cotation US +4,5 %.
- Attendu ~10 août : Qwen3.8-Max et Qwen3.8-27B sur Hugging Face et ModelScope — à la rédaction, aucun dépôt, licence ni date fixe.
Point clé : Qwen3.8-Max est le seul modèle non-Anthropic du top 8 Arena texte — mais tous les scores proviennent des tests internes d'Alibaba ; les plateformes indépendantes n'ont pas encore reproduit la version GA. « Première ligue mondiale » exige confirmation externe.
Lacunes de transparence déjà visibles en préversion :
- Paramètres actifs tardifs : aucune divulgation en préversion ; 95 milliards annoncés seulement au GA.
- Interdiction production en preview : CGU du 19 juillet — les testeurs indépendants recommandaient sandbox oui, migration production non.
- Label open source avant les poids : le site GA affiche « Open-Source » — Hugging Face et ModelScope vides à la rédaction.
- Méthodologie benchmark opaque : PaperBench, QwenSWEBench, RecreationBench — Artificial Analysis n'a pas vérifié la GA indépendamment.
[ SECTION_02 ] // SPECS Données clés Qwen3.8-Max : ce que signifient 2,4 billions de paramètres
| Champ | Valeur |
|---|---|
| Date GA | 3 août 2026 |
| Total / actifs | 2,4 billions / 95 milliards |
| Architecture | MoE sparse sur base Qwen3.5 + attention hybride |
| Contexte | 1M tokens (mode thinking ~983k, plafond sortie ~131k) |
| Modalités | Texte / image / vidéo |
| Tarif API | Entrée 2 $/M, sortie 6 $/M |
| Arena texte (snapshot 1er août) | 5e place, 1496 points (provisoire) |
| Arena vision | 2e place, derrière Claude Fable 5 |
| PaperBench (interne Alibaba) | 93,0 (+28,2 vs prédécesseur) |
| SWE-bench Pro (interne Alibaba) | 67,7 (Fable 5 : 80,0) |
| Poids | Promis « semaine prochaine », non publiés à la rédaction |
Les valeurs marquées « interne Alibaba » proviennent du matériel GA officiel ; Artificial Analysis et Arena.ai n'avaient pas reproduit la version GA à la rédaction.
Pourquoi MoE + attention hybride plutôt qu'empilement dense ? Le MoE sparse maintient 2,4 billions de paramètres totaux avec seulement 95 milliards activés — coût d'inférence proche des modèles cent milliards, pas d'un dense 2,4T complet. D'où entrée 2 $/M et sortie 6 $/M — sous Claude Opus 5 (5 $/25 $) et Fable 5 (10 $/50 $).
reasoning_effort en trois niveaux : low / medium / xhigh (défaut xhigh). Contrôle via enable_thinking ou champ Anthropic-compatible reasoning.effort.
[ SECTION_03 ] // COMPARE Qwen3.8-Max vs Kimi K3 vs DeepSeek V4 vs Claude : lequel brancher ?
| Modèle | Total / actifs | Prix entrée/sortie par M | Poids | Tests indépendants |
|---|---|---|---|---|
| Qwen3.8-Max | 2,4T / 95B | 2 $ / 6 $ | Promis, non livrés | Aucun pour GA |
| Kimi K3 | 2,8T / ~50B | 3 $ / 15 $ | Ouverts (27 juillet) | Artificial Analysis ~57,11 |
| DeepSeek V4-Flash | inchangé vs V4-Pro | table incomplète | Ouverts | 9 benchmarks agent/code au-dessus de V4-Pro |
| Claude Opus 5 | non publié | 5 $ / 25 $ | Fermé | Sommet Arena |
| Claude Fable 5 | non publié | 10 $ / 50 $ | Fermé | Arena texte #1 |
Kimi K3 et DeepSeek divulguent tôt les paramètres actifs (~50B et 49B) ; Alibaba n'a annoncé 95B qu'au GA — source de critiques sur la transparence en juillet.
Dans un test aveugle indépendant (269 fichiers d'architecture, projets réels), Kimi K3 a obtenu 83 points, la préversion Qwen3.8-Max 80 — même ligue, pas de vainqueur net.
Quatre signaux d'alerte sur le label « open source » :
- Site dit open source, poids absents. Pas de dépôt Hugging Face, pas de licence, pas de date fixe.
- Tous les scores de frameworks internes — PaperBench, QwenSWEBench, RecreationBench.
- Note de bas de tableau contre Fable 5 : Alibaba évoque un possible « fallback routing » — sa propre méthodologie n'est pas documentée pour reproduction tierce.
- Preview sans fiche modèle : pas de paramètres actifs, pas de rapport sécurité — les testeurs indépendants déconseillaient la migration production.
[ SECTION_04 ] // DEPLOY Six étapes : du test API à la production agent avec Qwen3.8-Max
- Choisir le chemin : API QwenCloud (double protocole OpenAI/Anthropic) vs attendre les poids Qwen3.8-27B. La version 2,4T complète exige un datacenter multi-nœuds ; la plupart des équipes démarrent par l'API. Voir guide intégration OpenRouter pour l'abstraction multi-fournisseur.
- Vérifier CGU et tarifs : cache implicite hit 0,25 $/M, écriture cache explicite 2,5 $/M, lecture cache 0,17 $/M. Équipes UE : clarifier AVV et localisation des données avant production avec prompts personnels.
- Configurer le client API : clé QwenCloud, base URL vers endpoint Alibaba ; projets OpenAI ou Anthropic SDK existants : changer base URL et ID modèle — compatible Claude Code, Codex, Qoder CLI, Qwen Code, OpenClaw.
- Régler reasoning_effort : low/medium/xhigh selon profondeur de tâche ; xhigh pour orchestration agent complexe, low pour maîtriser les coûts.
- Routage par couches : volume coding sur Qwen3.8-Max ou DeepSeek V4-Flash ; étapes difficiles vers Claude Opus 5 ou GPT-5.6 Sol. Voir tiering OpenRouter juillet.
- Ancrer l'hôte agent 7×24 : orchestration longue durée (Alibaba a démontré 16 jours sans intervention humaine) exige macOS always-on, pas un portable en veille. Voir centre d'aide et page commande.
# Appel compatible SDK OpenAI (vérifier endpoint et ID modèle contre docs officielles avant production)
from openai import OpenAI
client = OpenAI(
api_key="YOUR_QWEN_API_KEY",
base_url="https://dashscope.aliyuncs.com/compatible-mode/v1"
)
response = client.chat.completions.create(
model="qwen3.8-max",
messages=[{"role": "user", "content": "Explain sparse MoE architecture in one paragraph."}],
extra_body={"enable_thinking": True}
)
print(response.choices[0].message.content)
[ SECTION_05 ] // FACTS_FAQ Hard data citables, contexte sectoriel, FAQ et hébergement agent 7×24
- Total / actifs : 2,4 billions / 95 milliards ; coût d'inférence suit l'activation, pas le total (GA Alibaba, 2026-08-03).
- Arena texte : 5e place, 1496 points, provisoire ; seul non-Anthropic du top 8 (Arena.ai, snapshot 1er août).
- Avantage tarif API : 2 $/6 $ par M — sous Opus 5 (5 $/25 $) et Fable 5 (10 $/50 $).
- Test aveugle : Kimi K3 83 vs préversion Qwen3.8-Max 80 sur 269 fichiers architecture (tiers indépendant).
- Bourse : Alibaba Hong Kong +7 %, US +4,5 % le jour du GA.
- Grand public : Qwen alimente Apple Intelligence en Chine (compressé en local).
- Poids : Qwen3.8-Max et Qwen3.8-27B annoncés pour ~10 août ; non publiés à la rédaction.
Contexte sectoriel : 2026 est l'année des modèles billionnaires — DeepSeek V4-Pro a démarré en avril à 1,6T, la préversion Qwen3.8-Max en juillet à 2,4T, Kimi K3 en juillet à 2,8T comme plus grand open weight publié. Le 31 juillet, DeepSeek V4-Flash a prouvé que l'efficacité architecturale peut battre la course aux paramètres. OpenAI et Anthropic ont signalé des incidents de sécurité dans leurs évals ; la Maison Blanche a consulté le 4 août sur des cadres de test cybersécurité volontaires — contraste saisissant avec la densité des sorties chinoises la même semaine.
FAQ en bref :
- Q : Utilisable maintenant ? Open source ? R : API oui via QwenCloud. Poids non — promis la semaine suivant le 3 août, non livrés à la rédaction.
- Q : Qwen3.8-Max vs Kimi K3 ? R : Même ligue au test aveugle. K3 : poids ouverts, scores indépendants. Qwen : API moins chère, multimodal plus large.
- Q : Faut-il un datacenter pour 2,4T ? R : Uniquement pour self-hosting complet. L'API suit 95B actifs. Qwen3.8-27B est le chemin local réaliste.
- Q : Faire confiance aux benchmarks Alibaba ? R : Orientation oui, verdict final non. Tests A/B sur votre stack recommandés.
- Q : Impact utilisateur ? R : APIs flagship moins chères ; Apple Intelligence Chine alimenté par Qwen. Équipes UE : clarifier conformité données avant production cloud.
Sources à la rédaction ; en cas de mise à jour en amont, se référer aux originaux.
https://github.com/qwen-code-dev-bot/oh-my-cli
Vrais inconvénients des alternatives : (1) Attendre les poids 2,4T et inférer localement sur un portable 16 Go — disque et RAM saturés immédiatement ; aucun routage API ne lève le plafond matériel. (2) Veille portable tue OAuth et batches agent de 16 jours — un modèle top 5 Arena ne tient pas une pipeline 7×24 sur notebook. (3) Acheter un Mac Studio maxé pour des workflows Qwen agent et le laisser inactif trois mois coûte plus qu'une location hebdomadaire élastique — l'inférence 2,4T va sur l'API, macOS sert à l'orchestration.
Pour les équipes qui ont besoin de Apple Silicon dédié, disponibilité 7×24 et montée en charge élastique jour/semaine/mois pour faire tourner des agents pilotés par l'API Qwen3.8-Max (Qwen Code, OpenClaw, Claude Code) avec CI iOS sur le même hôte macOS, la location bare-metal Mac Mini NOVAKVM est en général la meilleure voie production : six régions, paliers haute mémoire, SSH direct — API Qwen pour l'inférence, macOS bare-metal pour l'orchestration, sans cluster multi-nœuds ni veille portable. Comparez les paliers sur la page tarifs NOVAKVM, lancez un essai sur la page commande, accès distant dans le centre d'aide.