En fin juillet 2026, choisir un LLM à partir d'un benchmark figé revient souvent à ignorer le signal le plus honnête du marché : où les développeurs routent réellement leurs tokens payants. OpenRouter publie précisément cela — pas une démo marketing, mais des volumes de production. Cet article (données au 25 juillet 2026) décrypte la montée de Mimo V2.5, la part cumulée des labs chinois à ~46 %, l'écart entre popularité et capacité, la couche applicative dominée par Hermes Agent (~45 %) et Kilo Code (~13 %), les perspectives d'août et un guide de routage en six étapes. Tarifs : page tarifs NOVAKVM ; approfondissement API : guide OpenRouter.
[ SECTION_01 ] // PAIN_MAP Pourquoi les classements OpenRouter de juillet 2026 changent la donne pour votre stack
Le marché des LLM n'a jamais basculé aussi vite. En douze mois, la part chinoise sur OpenRouter est passée de moins de 2 % à environ 46 %, tandis que le trio américain (OpenAI, Anthropic, Google) est tombé d'environ 70 % à 30–36 %. Ce n'est pas un récit géopolitique : c'est de l'arithmétique tarifaire — DeepSeek V4 Flash autour de 0,05–0,14 $/M tokens en entrée contre ~5 $/M pour GPT-5.5, soit un écart d'environ 35×.
- Le #1 du jour n'est pas un contrat durable : Mimo V2.5 succède à MiMo-V2-Pro ; DeepSeek reste le fournisseur le plus stable (~16–18 %).
- Les benchmarks mentent par omission : ils mesurent la réponse unique, pas des milliers d'appels d'outils en production Agent.
- La couche apps est invisible dans la presse enterprise : Hermes Agent seul absorbe ~45 % des tokens applicatifs — le « cerveau » du classement modèles ne dit pas pour quoi il travaille.
- Conformité et souveraineté : les achats enterprise et les contraintes RGPD freinent l'adoption chinoise en production régulée ; le volume public reflète surtout développeurs et startups.
- L'hôte compte autant que le modèle : une passerelle multi-modèles sur Mac personnel s'arrête au sommeil, à la RAM et à l'absence de 7×24.
- Série temporelle : comparez avec juin 2026 et l'analyse hebdomadaire pour éviter les décisions sur un snapshot.
À retenir : capability et popularity divergent. Les open weights chinois ont acheté la moitié du trafic au prix ; les frontier fermés américains défendent la facturation sur les tâches difficiles.
[ SECTION_02 ] // DECISION_MATRIX Juillet 2026 : Top 12 modèles, parts fournisseurs et matrice tarifaire
Chiffres au 25 juillet 2026 (tokens journaliers ; cumul 30 jours entre parenthèses conceptuellement en tableau). Avant toute citation en production, rouvrez la source officielle.
| Rang | Modèle | Éditeur | Tokens/jour | Cumul 30 j |
|---|---|---|---|---|
| 1 | Mimo V2.5 | Xiaomi | 1,4T | 31,2T |
| 2 | DeepSeek V4 Flash | DeepSeek | 943,9B | 23,6T |
| 3 | Hy3 | Tencent | 590B | 23,4T |
| 4 | Nemotron 3 Ultra 550B (gratuit) | NVIDIA | 428,6B | 9T |
| 5 | DeepSeek V4 Pro | DeepSeek | 413,7B | 11,6T |
| 6 | GLM 5.2 | Z.ai | 316,7B | 13,3T |
| 7 | MiniMax M3 | MiniMax | 262,5B | 15,1T |
| 8 | Step 3.7 Flash | StepFun | 204,8B | 5,9T |
| 9 | Kimi K3 | Moonshot AI | 157,6B | 1,6T |
| 10 | Ling 3.0 Flash | InclusionAI | 128,3B | 417,3B |
| 11 | Gemini 3 Flash Preview | 106,3B | 4T | |
| 12 | Claude Sonnet 5 | Anthropic | 99,5B | 3,6T |
| Fournisseur | Origine | Part tokens (env.) |
|---|---|---|
| DeepSeek | Chine | 16–18 % |
| Xiaomi | Chine | 8–18 % |
| Anthropic | États-Unis | 10–15 % |
| Tencent | Chine | 8–13 % |
| États-Unis | 8–13 % | |
| OpenAI | États-Unis | 6–8 % |
| Chine total | — | ~46 % |
| États-Unis total | — | ~30–36 % |
| Modèle | Entrée | Sortie | Contexte | Rôle |
|---|---|---|---|---|
| DeepSeek V4 Flash | ~0,05–0,14 | ~0,24–0,28 | 1M | Coding agentique, volume |
| GLM 5.2 | 0,45 | 3,31 | — | Planification open weight |
| Kimi K3 | ~3 | ~15 | 1M | 1,4 To de poids ouverts |
| Claude Opus 5 | 5 (rapide 10) | 25 (rapide 50) | 1M | Frontier fermé |
Méthodologie et chiffres live : consultez la plateforme avant intégration.
https://openrouter.ai/rankings
[ SECTION_03 ] // BAR_BELL Volume de tokens ≠ qualité : marché en haltère et couche applicative
Par dépenses par catégorie de tâche, le portrait change : chat général ~35,7 %, workflows agentiques ~30,4 %, code ~26,5 %. Sur la classification et le raisonnement complexe, Claude Sonnet 4.6 et Opus 4.7 partagent ~13,5 % chacun, GPT-5.5 ~11,6 % — les leaders bon marché du volume brut y sont quasi absents.
Le marché se structure en haltère : open weights chinois pour les charges tolérantes aux erreurs (chat, création, roleplay, coding routinier) ; modèles frontier fermés pour planification agentique et décisions à faible marge d'erreur. Le lancement de Claude Opus 5 le 24 juillet (FrontierBench v0.1 ~43,3 %) illustre la défense par la qualité mesurable, pas par le volume.
| Rang | Application | Type | Part |
|---|---|---|---|
| 1 | Hermes Agent | Agent CLI auto-améliorant | ~45 % |
| 2 | Kilo Code | Agent de code | ~13 % |
| 3 | OpenClaw | Agent généraliste | ~9 % |
| 4 | Claude Code | Agent de code | ~6 % |
| 5–10 | Descript, pi, Lemonade, ISEKAI ZERO, Janitor AI, Cline | Contenu / RP / IDE | 1,7–4,5 % |
La lignée Cline → Roo Code → Kilo Code montre qu'un fork tardif peut dépasser ses ancêtres en volume — la vitesse d'itération open source compresse les avantages du premier entrant. Les apps de roleplay (Janitor AI, SillyTavern) mobilisent un trafic massif rarement couvert par la presse enterprise ; le rapport OpenRouter × a16z estime que le roleplay créatif dépasse la moitié de l'usage des modèles ouverts.
Classement apps : source officielle à reconsulter avant citation.
[ SECTION_04 ] // PLAYBOOK Perspectives août 2026 et guide de sélection en six étapes
Cinq signaux pour août :
- Part cumulée chinoise probablement vers 50 %+ sans mouvement tarifaire majeur côté US.
- Rotation continue du « modèle du mois » entre Xiaomi, DeepSeek, Tencent, Z.ai, MiniMax et Moonshot.
- Anthropic pourrait livrer un palier volume moins cher après la salve Opus 5 / Sonnet 5 / Fable 5.
- Kimi K3 (1,4 To) : quantification communautaire attendue sous 2–4 semaines.
- Gouvernance et sécurité comme critère d'achat — sandbox OpenAI, AI Kill Switch Act, revue pré-release US.
Guide en six étapes :
- Double registre : tendances OpenRouter pour le volume ; eval interne (taux d'acceptation, erreurs, latence) pour la qualité.
- Routage par complexité : 5–10 % les plus durs → Opus 5 / GPT-5.6 ; quotidien → DeepSeek V4 Flash, Mimo V2.5, GLM 5.2.
- Abstraction passerelle : LiteLLM ou équivalent — éviter le hardcoding avant la salve de releases d'août.
- Conformité : contrats, localisation des données et sous-traitants avant routage vers modèles hors UE.
- Lire la couche apps : Hermes et Kilo Code expliquent les pics modèles — ne pas suivre le #1 du jour aveuglément.
- Hôte 7×24 : les agents longue durée exigent un nœud Apple Silicon éveillé — centre d'aide, commander.
[ SECTION_05 ] // DATA_FAQ Données citables, FAQ et conclusion NOVAKVM
- Mimo V2.5 : 1,4T tokens/jour (#1 au 25.07.2026)
- DeepSeek V4 Flash : 943,9B/jour ; DeepSeek ~16–18 % en part fournisseur
- Chine cumulée : ~46 % (contre <2 % il y a 12 mois)
- Hermes Agent : ~45 % des tokens applicatifs
- Écart tarifaire : ~35× entre DeepSeek V4 Flash et GPT-5.5 en entrée
- Claude Opus 5 : FrontierBench v0.1 ~43,3 % (24.07.2026)
Q : Quel modèle domine en juillet 2026 ?
R : Mimo V2.5, puis DeepSeek V4 Flash et Hy3 — avec volatilité quotidienne.
Q : Le volume garantit-il la qualité ?
R : Non — il reflète prix et apps, pas la performance sur les tâches les plus exigeantes.
Q : Plus grande app sur la plateforme ?
R : Hermes Agent (~45 %), puis Kilo Code (~13 %).
Passerelles multi-modèles, routage OpenRouter et poids locaux sur Mac personnel échouent face au sommeil du portable, à la RAM limitée, à l'absence de 7×24 et au surcoût VM. Pour des pipelines iOS/macOS stables, l'automatisation Agent et les assistants de code branchés sur Apple Silicon natif, la location Mac Mini bare metal NOVAKVM reste en général l'option la plus fiable : matériel dédié, régions multiples, durées flexibles — voir tarifs.
Sources au moment de la rédaction ; vérifiez les liens officiels avant citation.
https://openrouter.ai/rankings