Classements OpenRouter juillet 2026 :
Mimo V2.5, DeepSeek V4 Flash et Hy3 — qui gagne vraiment ?

En fin juillet 2026, choisir un LLM à partir d'un benchmark figé revient souvent à ignorer le signal le plus honnête du marché : où les développeurs routent réellement leurs tokens payants. OpenRouter publie précisément cela — pas une démo marketing, mais des volumes de production. Cet article (données au 25 juillet 2026) décrypte la montée de Mimo V2.5, la part cumulée des labs chinois à ~46 %, l'écart entre popularité et capacité, la couche applicative dominée par Hermes Agent (~45 %) et Kilo Code (~13 %), les perspectives d'août et un guide de routage en six étapes. Tarifs : page tarifs NOVAKVM ; approfondissement API : guide OpenRouter.

Le marché des LLM n'a jamais basculé aussi vite. En douze mois, la part chinoise sur OpenRouter est passée de moins de 2 % à environ 46 %, tandis que le trio américain (OpenAI, Anthropic, Google) est tombé d'environ 70 % à 30–36 %. Ce n'est pas un récit géopolitique : c'est de l'arithmétique tarifaire — DeepSeek V4 Flash autour de 0,05–0,14 $/M tokens en entrée contre ~5 $/M pour GPT-5.5, soit un écart d'environ 35×.

  • Le #1 du jour n'est pas un contrat durable : Mimo V2.5 succède à MiMo-V2-Pro ; DeepSeek reste le fournisseur le plus stable (~16–18 %).
  • Les benchmarks mentent par omission : ils mesurent la réponse unique, pas des milliers d'appels d'outils en production Agent.
  • La couche apps est invisible dans la presse enterprise : Hermes Agent seul absorbe ~45 % des tokens applicatifs — le « cerveau » du classement modèles ne dit pas pour quoi il travaille.
  • Conformité et souveraineté : les achats enterprise et les contraintes RGPD freinent l'adoption chinoise en production régulée ; le volume public reflète surtout développeurs et startups.
  • L'hôte compte autant que le modèle : une passerelle multi-modèles sur Mac personnel s'arrête au sommeil, à la RAM et à l'absence de 7×24.
  • Série temporelle : comparez avec juin 2026 et l'analyse hebdomadaire pour éviter les décisions sur un snapshot.

À retenir : capability et popularity divergent. Les open weights chinois ont acheté la moitié du trafic au prix ; les frontier fermés américains défendent la facturation sur les tâches difficiles.

Chiffres au 25 juillet 2026 (tokens journaliers ; cumul 30 jours entre parenthèses conceptuellement en tableau). Avant toute citation en production, rouvrez la source officielle.

Classement modèles par volume journalier (cutoff 2026-07-25)
Rang Modèle Éditeur Tokens/jour Cumul 30 j
1 Mimo V2.5 Xiaomi 1,4T 31,2T
2 DeepSeek V4 Flash DeepSeek 943,9B 23,6T
3 Hy3 Tencent 590B 23,4T
4 Nemotron 3 Ultra 550B (gratuit) NVIDIA 428,6B 9T
5 DeepSeek V4 Pro DeepSeek 413,7B 11,6T
6 GLM 5.2 Z.ai 316,7B 13,3T
7 MiniMax M3 MiniMax 262,5B 15,1T
8 Step 3.7 Flash StepFun 204,8B 5,9T
9 Kimi K3 Moonshot AI 157,6B 1,6T
10 Ling 3.0 Flash InclusionAI 128,3B 417,3B
11 Gemini 3 Flash Preview Google 106,3B 4T
12 Claude Sonnet 5 Anthropic 99,5B 3,6T
Parts fournisseurs (fenêtre 7 jours, estimations croisées)
Fournisseur Origine Part tokens (env.)
DeepSeek Chine 16–18 %
Xiaomi Chine 8–18 %
Anthropic États-Unis 10–15 %
Tencent Chine 8–13 %
Google États-Unis 8–13 %
OpenAI États-Unis 6–8 %
Chine total ~46 %
États-Unis total ~30–36 %
Positionnement tarifaire (USD / 1M tokens, ordres de grandeur)
Modèle Entrée Sortie Contexte Rôle
DeepSeek V4 Flash ~0,05–0,14 ~0,24–0,28 1M Coding agentique, volume
GLM 5.2 0,45 3,31 Planification open weight
Kimi K3 ~3 ~15 1M 1,4 To de poids ouverts
Claude Opus 5 5 (rapide 10) 25 (rapide 50) 1M Frontier fermé

Méthodologie et chiffres live : consultez la plateforme avant intégration.

https://openrouter.ai/rankings

Par dépenses par catégorie de tâche, le portrait change : chat général ~35,7 %, workflows agentiques ~30,4 %, code ~26,5 %. Sur la classification et le raisonnement complexe, Claude Sonnet 4.6 et Opus 4.7 partagent ~13,5 % chacun, GPT-5.5 ~11,6 % — les leaders bon marché du volume brut y sont quasi absents.

Le marché se structure en haltère : open weights chinois pour les charges tolérantes aux erreurs (chat, création, roleplay, coding routinier) ; modèles frontier fermés pour planification agentique et décisions à faible marge d'erreur. Le lancement de Claude Opus 5 le 24 juillet (FrontierBench v0.1 ~43,3 %) illustre la défense par la qualité mesurable, pas par le volume.

OpenRouter Apps — part de tokens (env., juillet 2026)
Rang Application Type Part
1 Hermes Agent Agent CLI auto-améliorant ~45 %
2 Kilo Code Agent de code ~13 %
3 OpenClaw Agent généraliste ~9 %
4 Claude Code Agent de code ~6 %
5–10 Descript, pi, Lemonade, ISEKAI ZERO, Janitor AI, Cline Contenu / RP / IDE 1,7–4,5 %

La lignée Cline → Roo Code → Kilo Code montre qu'un fork tardif peut dépasser ses ancêtres en volume — la vitesse d'itération open source compresse les avantages du premier entrant. Les apps de roleplay (Janitor AI, SillyTavern) mobilisent un trafic massif rarement couvert par la presse enterprise ; le rapport OpenRouter × a16z estime que le roleplay créatif dépasse la moitié de l'usage des modèles ouverts.

Classement apps : source officielle à reconsulter avant citation.

https://openrouter.ai/apps

Cinq signaux pour août :

  1. Part cumulée chinoise probablement vers 50 %+ sans mouvement tarifaire majeur côté US.
  2. Rotation continue du « modèle du mois » entre Xiaomi, DeepSeek, Tencent, Z.ai, MiniMax et Moonshot.
  3. Anthropic pourrait livrer un palier volume moins cher après la salve Opus 5 / Sonnet 5 / Fable 5.
  4. Kimi K3 (1,4 To) : quantification communautaire attendue sous 2–4 semaines.
  5. Gouvernance et sécurité comme critère d'achat — sandbox OpenAI, AI Kill Switch Act, revue pré-release US.

Guide en six étapes :

  1. Double registre : tendances OpenRouter pour le volume ; eval interne (taux d'acceptation, erreurs, latence) pour la qualité.
  2. Routage par complexité : 5–10 % les plus durs → Opus 5 / GPT-5.6 ; quotidien → DeepSeek V4 Flash, Mimo V2.5, GLM 5.2.
  3. Abstraction passerelle : LiteLLM ou équivalent — éviter le hardcoding avant la salve de releases d'août.
  4. Conformité : contrats, localisation des données et sous-traitants avant routage vers modèles hors UE.
  5. Lire la couche apps : Hermes et Kilo Code expliquent les pics modèles — ne pas suivre le #1 du jour aveuglément.
  6. Hôte 7×24 : les agents longue durée exigent un nœud Apple Silicon éveillé — centre d'aide, commander.

  • Mimo V2.5 : 1,4T tokens/jour (#1 au 25.07.2026)
  • DeepSeek V4 Flash : 943,9B/jour ; DeepSeek ~16–18 % en part fournisseur
  • Chine cumulée : ~46 % (contre <2 % il y a 12 mois)
  • Hermes Agent : ~45 % des tokens applicatifs
  • Écart tarifaire : ~35× entre DeepSeek V4 Flash et GPT-5.5 en entrée
  • Claude Opus 5 : FrontierBench v0.1 ~43,3 % (24.07.2026)

Q : Quel modèle domine en juillet 2026 ?
R : Mimo V2.5, puis DeepSeek V4 Flash et Hy3 — avec volatilité quotidienne.

Q : Le volume garantit-il la qualité ?
R : Non — il reflète prix et apps, pas la performance sur les tâches les plus exigeantes.

Q : Plus grande app sur la plateforme ?
R : Hermes Agent (~45 %), puis Kilo Code (~13 %).

Passerelles multi-modèles, routage OpenRouter et poids locaux sur Mac personnel échouent face au sommeil du portable, à la RAM limitée, à l'absence de 7×24 et au surcoût VM. Pour des pipelines iOS/macOS stables, l'automatisation Agent et les assistants de code branchés sur Apple Silicon natif, la location Mac Mini bare metal NOVAKVM reste en général l'option la plus fiable : matériel dédié, régions multiples, durées flexibles — voir tarifs.

Sources au moment de la rédaction ; vérifiez les liens officiels avant citation.

https://openrouter.ai/rankings

https://openrouter.ai/apps

https://openrouter.ai/state-of-ai

https://www.anthropic.com/news/claude-opus-5