Alibaba Qwen3.8-Max en GA :
MoE 2,4T, 5e Arena provisoire, poids promis la semaine prochaine

Si vous êtes développeur IA ou responsable technique évaluant des modèles flagship pour workflows agent, FinOps API ou migration de fournisseur, le Qwen3.8-Max d'Alibaba en GA du 3 août 2026 redéfinit le tempo de la ligue chinoise : 2,4 billions de paramètres totaux, 95 milliards actifs, contexte 1M tokens et 5e place provisoire sur Arena texte — seul modèle non-Anthropic du top 8. L'agent « Qwen Office » a été lancé en parallèle. Cet article couvre chronologie sur deux semaines, tableaux clés, architecture MoE, comparaison Kimi K3 / DeepSeek V4-Flash / Claude, controverse du label open source, playbook en six étapes et FAQ. Liens croisés : analyse Kimi K3 open weight, baisse de prix GPT-5.6, Apple Intelligence et Qwen. Tarifs : page tarifs.

  • 16 juillet : Moonshot publie Kimi K3 — 2,8 billions de paramètres, 896 experts dont 16 actifs, avec rapport technique et benchmarks indépendants.
  • 19 juillet : Qwen3.8-Max en préversion via Token Plan, Qoder et QoderWork à 10 % du prix GA attendu — sans nombre de paramètres actifs ni tableau de scores ; CGU interdisant les appels automatisés en production.
  • 27 juillet : Kimi K3 publie ses poids sur Hugging Face plus MoonEP, FlashKDA et AgentEnv.
  • 31 juillet : DeepSeek sort V4-Flash en GA — même taille que V4-Pro, gains majeurs sur benchmarks agent et code grâce à l'optimisation architecture et entraînement.
  • 3 août : Qwen3.8-Max passe en GA avec tableau de scores complet ; « Qwen Office » répond à Tencent WorkBuddy et Kimi Work. Actions Alibaba : Hong Kong +7 %, cotation US +4,5 %.
  • Attendu ~10 août : Qwen3.8-Max et Qwen3.8-27B sur Hugging Face et ModelScope — à la rédaction, aucun dépôt, licence ni date fixe.

Point clé : Qwen3.8-Max est le seul modèle non-Anthropic du top 8 Arena texte — mais tous les scores proviennent des tests internes d'Alibaba ; les plateformes indépendantes n'ont pas encore reproduit la version GA. « Première ligue mondiale » exige confirmation externe.

Lacunes de transparence déjà visibles en préversion :

  • Paramètres actifs tardifs : aucune divulgation en préversion ; 95 milliards annoncés seulement au GA.
  • Interdiction production en preview : CGU du 19 juillet — les testeurs indépendants recommandaient sandbox oui, migration production non.
  • Label open source avant les poids : le site GA affiche « Open-Source » — Hugging Face et ModelScope vides à la rédaction.
  • Méthodologie benchmark opaque : PaperBench, QwenSWEBench, RecreationBench — Artificial Analysis n'a pas vérifié la GA indépendamment.

Qwen3.8-Max — données clés (source : matériel GA Alibaba, 2026-08-03)
Champ Valeur
Date GA3 août 2026
Total / actifs2,4 billions / 95 milliards
ArchitectureMoE sparse sur base Qwen3.5 + attention hybride
Contexte1M tokens (mode thinking ~983k, plafond sortie ~131k)
ModalitésTexte / image / vidéo
Tarif APIEntrée 2 $/M, sortie 6 $/M
Arena texte (snapshot 1er août)5e place, 1496 points (provisoire)
Arena vision2e place, derrière Claude Fable 5
PaperBench (interne Alibaba)93,0 (+28,2 vs prédécesseur)
SWE-bench Pro (interne Alibaba)67,7 (Fable 5 : 80,0)
PoidsPromis « semaine prochaine », non publiés à la rédaction

Les valeurs marquées « interne Alibaba » proviennent du matériel GA officiel ; Artificial Analysis et Arena.ai n'avaient pas reproduit la version GA à la rédaction.

Pourquoi MoE + attention hybride plutôt qu'empilement dense ? Le MoE sparse maintient 2,4 billions de paramètres totaux avec seulement 95 milliards activés — coût d'inférence proche des modèles cent milliards, pas d'un dense 2,4T complet. D'où entrée 2 $/M et sortie 6 $/M — sous Claude Opus 5 (5 $/25 $) et Fable 5 (10 $/50 $).

reasoning_effort en trois niveaux : low / medium / xhigh (défaut xhigh). Contrôle via enable_thinking ou champ Anthropic-compatible reasoning.effort.

Comparaison flagship (données publiques, début août 2026)
Modèle Total / actifs Prix entrée/sortie par M Poids Tests indépendants
Qwen3.8-Max 2,4T / 95B 2 $ / 6 $ Promis, non livrés Aucun pour GA
Kimi K3 2,8T / ~50B 3 $ / 15 $ Ouverts (27 juillet) Artificial Analysis ~57,11
DeepSeek V4-Flash inchangé vs V4-Pro table incomplète Ouverts 9 benchmarks agent/code au-dessus de V4-Pro
Claude Opus 5 non publié 5 $ / 25 $ Fermé Sommet Arena
Claude Fable 5 non publié 10 $ / 50 $ Fermé Arena texte #1

Kimi K3 et DeepSeek divulguent tôt les paramètres actifs (~50B et 49B) ; Alibaba n'a annoncé 95B qu'au GA — source de critiques sur la transparence en juillet.

Dans un test aveugle indépendant (269 fichiers d'architecture, projets réels), Kimi K3 a obtenu 83 points, la préversion Qwen3.8-Max 80 — même ligue, pas de vainqueur net.

Quatre signaux d'alerte sur le label « open source » :

  1. Site dit open source, poids absents. Pas de dépôt Hugging Face, pas de licence, pas de date fixe.
  2. Tous les scores de frameworks internes — PaperBench, QwenSWEBench, RecreationBench.
  3. Note de bas de tableau contre Fable 5 : Alibaba évoque un possible « fallback routing » — sa propre méthodologie n'est pas documentée pour reproduction tierce.
  4. Preview sans fiche modèle : pas de paramètres actifs, pas de rapport sécurité — les testeurs indépendants déconseillaient la migration production.

  1. Choisir le chemin : API QwenCloud (double protocole OpenAI/Anthropic) vs attendre les poids Qwen3.8-27B. La version 2,4T complète exige un datacenter multi-nœuds ; la plupart des équipes démarrent par l'API. Voir guide intégration OpenRouter pour l'abstraction multi-fournisseur.
  2. Vérifier CGU et tarifs : cache implicite hit 0,25 $/M, écriture cache explicite 2,5 $/M, lecture cache 0,17 $/M. Équipes UE : clarifier AVV et localisation des données avant production avec prompts personnels.
  3. Configurer le client API : clé QwenCloud, base URL vers endpoint Alibaba ; projets OpenAI ou Anthropic SDK existants : changer base URL et ID modèle — compatible Claude Code, Codex, Qoder CLI, Qwen Code, OpenClaw.
  4. Régler reasoning_effort : low/medium/xhigh selon profondeur de tâche ; xhigh pour orchestration agent complexe, low pour maîtriser les coûts.
  5. Routage par couches : volume coding sur Qwen3.8-Max ou DeepSeek V4-Flash ; étapes difficiles vers Claude Opus 5 ou GPT-5.6 Sol. Voir tiering OpenRouter juillet.
  6. Ancrer l'hôte agent 7×24 : orchestration longue durée (Alibaba a démontré 16 jours sans intervention humaine) exige macOS always-on, pas un portable en veille. Voir centre d'aide et page commande.
qwen3-8-max-api-example.py
# Appel compatible SDK OpenAI (vérifier endpoint et ID modèle contre docs officielles avant production)
from openai import OpenAI

client = OpenAI(
    api_key="YOUR_QWEN_API_KEY",
    base_url="https://dashscope.aliyuncs.com/compatible-mode/v1"
)

response = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[{"role": "user", "content": "Explain sparse MoE architecture in one paragraph."}],
    extra_body={"enable_thinking": True}
)
print(response.choices[0].message.content)

  • Total / actifs : 2,4 billions / 95 milliards ; coût d'inférence suit l'activation, pas le total (GA Alibaba, 2026-08-03).
  • Arena texte : 5e place, 1496 points, provisoire ; seul non-Anthropic du top 8 (Arena.ai, snapshot 1er août).
  • Avantage tarif API : 2 $/6 $ par M — sous Opus 5 (5 $/25 $) et Fable 5 (10 $/50 $).
  • Test aveugle : Kimi K3 83 vs préversion Qwen3.8-Max 80 sur 269 fichiers architecture (tiers indépendant).
  • Bourse : Alibaba Hong Kong +7 %, US +4,5 % le jour du GA.
  • Grand public : Qwen alimente Apple Intelligence en Chine (compressé en local).
  • Poids : Qwen3.8-Max et Qwen3.8-27B annoncés pour ~10 août ; non publiés à la rédaction.

Contexte sectoriel : 2026 est l'année des modèles billionnaires — DeepSeek V4-Pro a démarré en avril à 1,6T, la préversion Qwen3.8-Max en juillet à 2,4T, Kimi K3 en juillet à 2,8T comme plus grand open weight publié. Le 31 juillet, DeepSeek V4-Flash a prouvé que l'efficacité architecturale peut battre la course aux paramètres. OpenAI et Anthropic ont signalé des incidents de sécurité dans leurs évals ; la Maison Blanche a consulté le 4 août sur des cadres de test cybersécurité volontaires — contraste saisissant avec la densité des sorties chinoises la même semaine.

FAQ en bref :

  • Q : Utilisable maintenant ? Open source ? R : API oui via QwenCloud. Poids non — promis la semaine suivant le 3 août, non livrés à la rédaction.
  • Q : Qwen3.8-Max vs Kimi K3 ? R : Même ligue au test aveugle. K3 : poids ouverts, scores indépendants. Qwen : API moins chère, multimodal plus large.
  • Q : Faut-il un datacenter pour 2,4T ? R : Uniquement pour self-hosting complet. L'API suit 95B actifs. Qwen3.8-27B est le chemin local réaliste.
  • Q : Faire confiance aux benchmarks Alibaba ? R : Orientation oui, verdict final non. Tests A/B sur votre stack recommandés.
  • Q : Impact utilisateur ? R : APIs flagship moins chères ; Apple Intelligence Chine alimenté par Qwen. Équipes UE : clarifier conformité données avant production cloud.

Sources à la rédaction ; en cas de mise à jour en amont, se référer aux originaux.

https://qwen.ai

https://arena.ai

https://github.com/qwen-code-dev-bot/oh-my-cli

Vrais inconvénients des alternatives : (1) Attendre les poids 2,4T et inférer localement sur un portable 16 Go — disque et RAM saturés immédiatement ; aucun routage API ne lève le plafond matériel. (2) Veille portable tue OAuth et batches agent de 16 jours — un modèle top 5 Arena ne tient pas une pipeline 7×24 sur notebook. (3) Acheter un Mac Studio maxé pour des workflows Qwen agent et le laisser inactif trois mois coûte plus qu'une location hebdomadaire élastique — l'inférence 2,4T va sur l'API, macOS sert à l'orchestration.

Pour les équipes qui ont besoin de Apple Silicon dédié, disponibilité 7×24 et montée en charge élastique jour/semaine/mois pour faire tourner des agents pilotés par l'API Qwen3.8-Max (Qwen Code, OpenClaw, Claude Code) avec CI iOS sur le même hôte macOS, la location bare-metal Mac Mini NOVAKVM est en général la meilleure voie production : six régions, paliers haute mémoire, SSH direct — API Qwen pour l'inférence, macOS bare-metal pour l'orchestration, sans cluster multi-nœuds ni veille portable. Comparez les paliers sur la page tarifs NOVAKVM, lancez un essai sur la page commande, accès distant dans le centre d'aide.