Juli 2026 OpenRouter-Rankings:
Mimo V2.5, DeepSeek V4 Flash und Hy3 — wer gewinnt wirklich?

Für Tech-Leads und Entwickler, die LLM-APIs nach Benchmarks statt nach Produktionsverhalten wählen, liefert OpenRouter im Juli 2026 ein klares Signal: Mimo V2.5 führt die Tages-Tokens an, chinesische Labs halten zusammen etwa 46 %, und Token-Volumen ist kein Qualitätsproxy. Dieser Beitrag (Stichtag 25. Juli 2026) bündelt Modell-Top-12, Anbieteranteile, App-Schicht (Hermes Agent ~45 %, Kilo Code ~13 %), Preis-Matrix, August-Prognose und ein Sechs-Schritte-Routing-Runbook. Tarife: NOVAKVM-Mietpreisseite; Vertiefung: OpenRouter-API-Leitfaden.

OpenRouter misst bezahltes Token-Volumen — Wallet-Voting globaler Entwickler, keine Hersteller-Slides. Wer nur MMLU oder SWE-bench liest, übersieht die stärkste Marktverschiebung seit 2025.

  • Ranking-Fehldeutung: Platz 1 heute kann morgen wechseln — Mimo V2.5 löste MiMo-V2-Pro ab; DeepSeek bleibt als Anbieter stabiler #1 (~16–18 %).
  • Geopolitik vs. Preislogik: Der Sprung chinesischer Labs von unter 2 % auf ~46 % folgt vor allem 35× günstigeren Input-Preisen (DeepSeek V4 Flash ~0,05–0,14 USD/M vs. GPT-5.5 ~5 USD/M).
  • Compliance-Blindspot: Enterprise-Einkauf und DSGVO (AVV, Datenstandort, Subunternehmer) begrenzen chinesische Open-Weight-Routen — Privatnutzer und Startups treiben das Volumen.
  • App-Schicht unsichtbar: Hermes Agent allein ~45 % App-Tokens — Modell-Rankings ohne Apps-Lesart erklären kaum, wofür inferiert wird.
  • Agent-Hosting: Multi-Model-Gateways auf dem privaten Mac scheitern an Sleep, RAM und fehlendem 7×24 — Routing spart nichts, wenn der Host ausfällt.
  • Serien-Blindheit: Ohne monatlichen Re-Check veralten Routing-Tabellen in Wochen — siehe auch Juni-2026-Rankings und Wochen-Traffic-Analyse.

Kernzahl: Chinesische Anbieter ~46 % Token-Anteil; US-Big-Three von ~70 % (Mitte 2025) auf ~30–36 %. Ökonomie schlägt Narrativ.

Stand 25. Juli 2026 (Tages-Tokens; 30-Tage-Kumuliert in Klammern). Vor Produktions-Commits openrouter.ai/rankings erneut öffnen.

Modell-Ranking nach Tages-Token-Volumen (Stichtag 2026-07-25)
Rang Modell Anbieter Tages-Tokens 30-Tage kum.
1 Mimo V2.5 Xiaomi 1,4T 31,2T
2 DeepSeek V4 Flash DeepSeek 943,9B 23,6T
3 Hy3 Tencent 590B 23,4T
4 Nemotron 3 Ultra 550B (free) NVIDIA 428,6B 9T
5 DeepSeek V4 Pro DeepSeek 413,7B 11,6T
6 GLM 5.2 Z.ai 316,7B 13,3T
7 MiniMax M3 MiniMax 262,5B 15,1T
8 Step 3.7 Flash StepFun 204,8B 5,9T
9 Kimi K3 Moonshot AI 157,6B 1,6T
10 Ling 3.0 Flash InclusionAI 128,3B 417,3B
11 Gemini 3 Flash Preview Google 106,3B 4T
12 Claude Sonnet 5 Anthropic 99,5B 3,6T
Anbieteranteile (7-Tage-Fenster, Schätzung mehrerer Quellen)
Anbieter Region Token-Anteil (ca.)
DeepSeek China 16–18 %
Xiaomi China 8–18 %
Anthropic USA 10–15 %
Tencent China 8–13 %
Google USA 8–13 %
OpenAI USA 6–8 %
Z.ai / MiniMax / Moonshot China je 3–8 %
China gesamt ~46 %
USA gesamt ~30–36 %
Preis- und Positionierungs-Matrix (USD pro 1M Tokens, Richtwerte)
Modell Input Output Kontext Rolle
DeepSeek V4 Flash ~0,05–0,14 ~0,24–0,28 1M Agentic Coding, Volumen
MiniMax M3 0,10 1,21 lang Multimodal-Budget
GLM 5.2 0,45 3,31 Open-Weight-Planung
Kimi K3 ~3 ~15 1M 1,4 TB Open Weights
Claude Opus 5 5 (Fast 10) 25 (Fast 50) 1M Closed Frontier

Spend nach Aufgabentyp zeigt ein anderes Bild als reine Token-Ranglisten: Chat ~35,7 %, Agent-Workflows ~30,4 %, Code ~26,5 %. In Classification / schwerer Inferenz teilen sich Claude Sonnet 4.6 und Opus 4.7 je ~13,5 % Spend, GPT-5.5 ~11,6 % — die Billig-Leader der Volumenliste fehlen hier fast vollständig.

Der Markt bildet eine Hantel: günstige chinesische Open Weights für fehlertolerante Massenlast; Closed Frontier (Claude Opus 5, FrontierBench v0.1 ~43,3 %) für die schwersten 5–10 %. Capability und Popularity divergieren.

OpenRouter Apps — Token-Anteil (ca., Stichtag Juli 2026)
Rang App Typ Anteil
1 Hermes Agent CLI / Self-Improving Agent ~45 %
2 Kilo Code Coding Agent ~13 %
3 OpenClaw General Agent ~9 %
4 Claude Code Coding Agent ~6 %
5–10 Descript, pi, Lemonade, ISEKAI ZERO, Janitor AI, Cline Content / RP / IDE 1,7–4,5 %

Cline → Roo Code → Kilo Code ist eine dreistufige Fork-Linie; Kilo Code überholt die Vorgänger — in Open-Source-Dev-Tools ist First-Mover-Vorteil dünn. Roleplay-Apps (Janitor AI, SillyTavern) bewegen massiv Volumen, taucht aber selten in Enterprise-Berichten auf — laut OpenRouter × a16z State of AI über die Hälfte des Open-Model-Traffics in kreativen Szenarien.

App-Rankings und Methodik ändern sich. Primärquelle vor Zitaten prüfen.

https://openrouter.ai/apps

August-Prognose (datenbasiert, keine Garantie):

  1. Chinesische Open Weights likely Richtung 50 %+ ohne US-Preiskrieg.
  2. „Modell des Monats“ rotiert weiter — Xiaomi, DeepSeek, Tencent, Z.ai, MiniMax, Moonshot shippen parallel.
  3. Anthropic könnte ein günstigeres Volumen-Tier (Haiku-Äquivalent) nach Opus 5 (24.07.) nachlegen.
  4. Kimi K3 (1,4 TB Weights): Community-Quantisierung in 2–4 Wochen erwartet; bis dahin vor allem Inference-Hosts.
  5. Sicherheit als Auswahlkriterium: OpenAI-Sandbox-Escape, US „AI Kill Switch Act“, White-House-Pre-Release-Review — Vendor-Track-Record in Scorecards.

Sechs-Schritte-Runbook:

  1. Dual-Ledger führen: OpenRouter für Volumen-Trends; eigene Eval (Acceptance, Fehlerrate, Latenz) für Qualität — kein Single-Metric-Buy.
  2. Komplexitäts-Routing: Top 5–10 % → Claude Opus 5 / GPT-5.6; Daily Coding → DeepSeek V4 Flash, Mimo V2.5, GLM 5.2.
  3. LiteLLM oder Gateway-Abstraktion: Hardcodierte Provider-IDs vermeiden — August-Releases machen Starrheit teuer.
  4. Compliance-Gate: Bei EU-Daten AVV, DPA und Verarbeitungsort dokumentieren; DSGVO vor chinesischen Routen ohne Rechtsgrundlage.
  5. App-Schicht mitlesen: Hermes- und Kilo-Code-Traffic erklärt Modell-Spitzen — nicht blind dem Tages-#1 folgen.
  6. 7×24-Host fixieren: Agent-Gateways brauchen wachen Apple-Silicon-Knoten — Hilfezentrum, Bestellseite.

  • Mimo V2.5 Tages-Tokens: 1,4T (#1 Modell, 25.07.2026)
  • DeepSeek V4 Flash: 943,9B/Tag; Anbieter DeepSeek ~16–18 % Gesamtanteil
  • China gesamt: ~46 % vs. <2 % vor 12 Monaten
  • US-Big-Three: ~70 % (Mitte 2025) → ~30–36 % (Juli 2026)
  • Hermes Agent: ~45 % App-Token-Anteil
  • Preis-Gap: DeepSeek V4 Flash vs. GPT-5.5 Input ~35×
  • Claude Opus 5: FrontierBench v0.1 ~43,3 % (Launch 24.07.2026)

F: Welches Modell führt OpenRouter im Juli 2026?
A: Mimo V2.5 (~1,4T/Tag), dann DeepSeek V4 Flash und Hy3 — tägliche Schwankung beachten.

F: Bedeutet hohes Volumen hohe Qualität?
A: Nein — Volumen misst Preissensibilität und App-Anbindung, nicht Frontier-Fähigkeit auf schweren Tasks.

F: Größte App auf der Plattform?
A: Hermes Agent (~45 %), gefolgt von Kilo Code (~13 %).

Multi-Model-Routing, OpenRouter-Gateway und lokale Weights auf dem privaten Mac scheitern an Deckel-Sleep, RAM, fehlendem 7×24 und VM-Overhead. Für stabile iOS/macOS-CI, Agent-Automation und Coding-Assistenten mit Metal-nativer Kette ist NOVAKVM Mac Mini Bare-Metal-Miete meist die robustere Option: dediziertes Apple Silicon, Multi-Region, flexible Laufzeiten — siehe Mietpreise.

Quellen zum Redaktionsstand; bei Updates Primärquellen prüfen.

https://openrouter.ai/rankings

https://openrouter.ai/apps

https://openrouter.ai/state-of-ai

https://www.anthropic.com/news/claude-opus-5