Für Tech-Leads und Entwickler, die LLM-APIs nach Benchmarks statt nach Produktionsverhalten wählen, liefert OpenRouter im Juli 2026 ein klares Signal: Mimo V2.5 führt die Tages-Tokens an, chinesische Labs halten zusammen etwa 46 %, und Token-Volumen ist kein Qualitätsproxy. Dieser Beitrag (Stichtag 25. Juli 2026) bündelt Modell-Top-12, Anbieteranteile, App-Schicht (Hermes Agent ~45 %, Kilo Code ~13 %), Preis-Matrix, August-Prognose und ein Sechs-Schritte-Routing-Runbook. Tarife: NOVAKVM-Mietpreisseite; Vertiefung: OpenRouter-API-Leitfaden.
[ SECTION_01 ] // PAIN_POINTS Warum OpenRouter-Juli-2026-Daten Ihr Modell-Routing neu schreiben sollten
OpenRouter misst bezahltes Token-Volumen — Wallet-Voting globaler Entwickler, keine Hersteller-Slides. Wer nur MMLU oder SWE-bench liest, übersieht die stärkste Marktverschiebung seit 2025.
- Ranking-Fehldeutung: Platz 1 heute kann morgen wechseln — Mimo V2.5 löste MiMo-V2-Pro ab; DeepSeek bleibt als Anbieter stabiler #1 (~16–18 %).
- Geopolitik vs. Preislogik: Der Sprung chinesischer Labs von unter 2 % auf ~46 % folgt vor allem 35× günstigeren Input-Preisen (DeepSeek V4 Flash ~0,05–0,14 USD/M vs. GPT-5.5 ~5 USD/M).
- Compliance-Blindspot: Enterprise-Einkauf und DSGVO (AVV, Datenstandort, Subunternehmer) begrenzen chinesische Open-Weight-Routen — Privatnutzer und Startups treiben das Volumen.
- App-Schicht unsichtbar: Hermes Agent allein ~45 % App-Tokens — Modell-Rankings ohne Apps-Lesart erklären kaum, wofür inferiert wird.
- Agent-Hosting: Multi-Model-Gateways auf dem privaten Mac scheitern an Sleep, RAM und fehlendem 7×24 — Routing spart nichts, wenn der Host ausfällt.
- Serien-Blindheit: Ohne monatlichen Re-Check veralten Routing-Tabellen in Wochen — siehe auch Juni-2026-Rankings und Wochen-Traffic-Analyse.
Kernzahl: Chinesische Anbieter ~46 % Token-Anteil; US-Big-Three von ~70 % (Mitte 2025) auf ~30–36 %. Ökonomie schlägt Narrativ.
[ SECTION_02 ] // DECISION_MATRIX OpenRouter Juli 2026: Top-12-Modelle, Anbieteranteile und Preis-Matrix
Stand 25. Juli 2026 (Tages-Tokens; 30-Tage-Kumuliert in Klammern). Vor Produktions-Commits openrouter.ai/rankings erneut öffnen.
| Rang | Modell | Anbieter | Tages-Tokens | 30-Tage kum. |
|---|---|---|---|---|
| 1 | Mimo V2.5 | Xiaomi | 1,4T | 31,2T |
| 2 | DeepSeek V4 Flash | DeepSeek | 943,9B | 23,6T |
| 3 | Hy3 | Tencent | 590B | 23,4T |
| 4 | Nemotron 3 Ultra 550B (free) | NVIDIA | 428,6B | 9T |
| 5 | DeepSeek V4 Pro | DeepSeek | 413,7B | 11,6T |
| 6 | GLM 5.2 | Z.ai | 316,7B | 13,3T |
| 7 | MiniMax M3 | MiniMax | 262,5B | 15,1T |
| 8 | Step 3.7 Flash | StepFun | 204,8B | 5,9T |
| 9 | Kimi K3 | Moonshot AI | 157,6B | 1,6T |
| 10 | Ling 3.0 Flash | InclusionAI | 128,3B | 417,3B |
| 11 | Gemini 3 Flash Preview | 106,3B | 4T | |
| 12 | Claude Sonnet 5 | Anthropic | 99,5B | 3,6T |
| Anbieter | Region | Token-Anteil (ca.) |
|---|---|---|
| DeepSeek | China | 16–18 % |
| Xiaomi | China | 8–18 % |
| Anthropic | USA | 10–15 % |
| Tencent | China | 8–13 % |
| USA | 8–13 % | |
| OpenAI | USA | 6–8 % |
| Z.ai / MiniMax / Moonshot | China | je 3–8 % |
| China gesamt | — | ~46 % |
| USA gesamt | — | ~30–36 % |
| Modell | Input | Output | Kontext | Rolle |
|---|---|---|---|---|
| DeepSeek V4 Flash | ~0,05–0,14 | ~0,24–0,28 | 1M | Agentic Coding, Volumen |
| MiniMax M3 | 0,10 | 1,21 | lang | Multimodal-Budget |
| GLM 5.2 | 0,45 | 3,31 | — | Open-Weight-Planung |
| Kimi K3 | ~3 | ~15 | 1M | 1,4 TB Open Weights |
| Claude Opus 5 | 5 (Fast 10) | 25 (Fast 50) | 1M | Closed Frontier |
[ SECTION_03 ] // BAR_BELL Token-Volumen ≠ Modellqualität: Hantel-Markt und App-Schicht
Spend nach Aufgabentyp zeigt ein anderes Bild als reine Token-Ranglisten: Chat ~35,7 %, Agent-Workflows ~30,4 %, Code ~26,5 %. In Classification / schwerer Inferenz teilen sich Claude Sonnet 4.6 und Opus 4.7 je ~13,5 % Spend, GPT-5.5 ~11,6 % — die Billig-Leader der Volumenliste fehlen hier fast vollständig.
Der Markt bildet eine Hantel: günstige chinesische Open Weights für fehlertolerante Massenlast; Closed Frontier (Claude Opus 5, FrontierBench v0.1 ~43,3 %) für die schwersten 5–10 %. Capability und Popularity divergieren.
| Rang | App | Typ | Anteil |
|---|---|---|---|
| 1 | Hermes Agent | CLI / Self-Improving Agent | ~45 % |
| 2 | Kilo Code | Coding Agent | ~13 % |
| 3 | OpenClaw | General Agent | ~9 % |
| 4 | Claude Code | Coding Agent | ~6 % |
| 5–10 | Descript, pi, Lemonade, ISEKAI ZERO, Janitor AI, Cline | Content / RP / IDE | 1,7–4,5 % |
Cline → Roo Code → Kilo Code ist eine dreistufige Fork-Linie; Kilo Code überholt die Vorgänger — in Open-Source-Dev-Tools ist First-Mover-Vorteil dünn. Roleplay-Apps (Janitor AI, SillyTavern) bewegen massiv Volumen, taucht aber selten in Enterprise-Berichten auf — laut OpenRouter × a16z State of AI über die Hälfte des Open-Model-Traffics in kreativen Szenarien.
App-Rankings und Methodik ändern sich. Primärquelle vor Zitaten prüfen.
[ SECTION_04 ] // PLAYBOOK August-2026-Ausblick und Sechs-Schritte-Modell-Routing
August-Prognose (datenbasiert, keine Garantie):
- Chinesische Open Weights likely Richtung 50 %+ ohne US-Preiskrieg.
- „Modell des Monats“ rotiert weiter — Xiaomi, DeepSeek, Tencent, Z.ai, MiniMax, Moonshot shippen parallel.
- Anthropic könnte ein günstigeres Volumen-Tier (Haiku-Äquivalent) nach Opus 5 (24.07.) nachlegen.
- Kimi K3 (1,4 TB Weights): Community-Quantisierung in 2–4 Wochen erwartet; bis dahin vor allem Inference-Hosts.
- Sicherheit als Auswahlkriterium: OpenAI-Sandbox-Escape, US „AI Kill Switch Act“, White-House-Pre-Release-Review — Vendor-Track-Record in Scorecards.
Sechs-Schritte-Runbook:
- Dual-Ledger führen: OpenRouter für Volumen-Trends; eigene Eval (Acceptance, Fehlerrate, Latenz) für Qualität — kein Single-Metric-Buy.
- Komplexitäts-Routing: Top 5–10 % → Claude Opus 5 / GPT-5.6; Daily Coding → DeepSeek V4 Flash, Mimo V2.5, GLM 5.2.
- LiteLLM oder Gateway-Abstraktion: Hardcodierte Provider-IDs vermeiden — August-Releases machen Starrheit teuer.
- Compliance-Gate: Bei EU-Daten AVV, DPA und Verarbeitungsort dokumentieren; DSGVO vor chinesischen Routen ohne Rechtsgrundlage.
- App-Schicht mitlesen: Hermes- und Kilo-Code-Traffic erklärt Modell-Spitzen — nicht blind dem Tages-#1 folgen.
- 7×24-Host fixieren: Agent-Gateways brauchen wachen Apple-Silicon-Knoten — Hilfezentrum, Bestellseite.
[ SECTION_05 ] // DATA_FAQ Zitierbare Kennzahlen, FAQ und NOVAKVM-Brücke
- Mimo V2.5 Tages-Tokens: 1,4T (#1 Modell, 25.07.2026)
- DeepSeek V4 Flash: 943,9B/Tag; Anbieter DeepSeek ~16–18 % Gesamtanteil
- China gesamt: ~46 % vs. <2 % vor 12 Monaten
- US-Big-Three: ~70 % (Mitte 2025) → ~30–36 % (Juli 2026)
- Hermes Agent: ~45 % App-Token-Anteil
- Preis-Gap: DeepSeek V4 Flash vs. GPT-5.5 Input ~35×
- Claude Opus 5: FrontierBench v0.1 ~43,3 % (Launch 24.07.2026)
F: Welches Modell führt OpenRouter im Juli 2026?
A: Mimo V2.5 (~1,4T/Tag), dann DeepSeek V4 Flash und Hy3 — tägliche Schwankung beachten.
F: Bedeutet hohes Volumen hohe Qualität?
A: Nein — Volumen misst Preissensibilität und App-Anbindung, nicht Frontier-Fähigkeit auf schweren Tasks.
F: Größte App auf der Plattform?
A: Hermes Agent (~45 %), gefolgt von Kilo Code (~13 %).
Multi-Model-Routing, OpenRouter-Gateway und lokale Weights auf dem privaten Mac scheitern an Deckel-Sleep, RAM, fehlendem 7×24 und VM-Overhead. Für stabile iOS/macOS-CI, Agent-Automation und Coding-Assistenten mit Metal-nativer Kette ist NOVAKVM Mac Mini Bare-Metal-Miete meist die robustere Option: dediziertes Apple Silicon, Multi-Region, flexible Laufzeiten — siehe Mietpreise.
Quellen zum Redaktionsstand; bei Updates Primärquellen prüfen.
https://openrouter.ai/rankings