Для разработчиков и tech lead, которые выбирают LLM API по бенчмаркам, а не по production-трафику, рейтинг OpenRouter за июль 2026 даёт жёсткую коррекцию: Mimo V2.5 лидирует по суточным токенам, китайские лаборатории держат ~46 %, а объём использования не равен качеству. Материал (cutoff 25 июля 2026) включает Top-12 моделей, доли вендоров, слой приложений (Hermes Agent ~45 %, Kilo Code ~13 %), ценовую матрицу, прогноз на август и шестишаговый runbook маршрутизации. Тарифы: страница аренды NOVAKVM; API: гайд OpenRouter.
[ SECTION_01 ] // PAIN_POINTS Почему данные OpenRouter за июль 2026 переписывают политику выбора моделей
OpenRouter агрегирует оплаченный объём токенов через нейтральный marketplace — это wallet-voting разработчиков, а не слайды вендоров. За 12 месяцев доля Китая выросла с <2 % до ~46 %; US big three (OpenAI, Anthropic, Google) упали с ~70 % до ~30–36 %. Драйвер — не геополитика, а разрыв цен ~35× (DeepSeek V4 Flash ~$0,05–0,14/M input vs GPT-5.5 ~$5/M).
- Ошибка snapshot-мышления: #1 модели меняется еженедельно (Mimo V2.5 сменил MiMo-V2-Pro); стабильнее DeepSeek как вендор (~16–18 %).
- Бенчмарк ≠ agentic loop: статичные eval не отражают тысячи tool calls в production pipeline.
- Слой apps скрыт: Hermes Agent один тянет ~45 % app-токенов — рейтинг моделей без apps не объясняет workload.
- Compliance gate: enterprise-закупки и трансграничная обработка данных ограничивают китайские open weights в regulated-средах.
- Хост критичен: multi-model gateway на личном Mac ломается на sleep, RAM и отсутствии 7×24.
- Серия: сравните с июньским рейтингом и недельным разбором.
Ключ: capability и popularity расходятся. Китайские open weights купили половину трафика ценой; US closed frontier держит pricing power на сложных задачах.
[ SECTION_02 ] // DECISION_MATRIX Июль 2026: Top-12 моделей, доли вендоров и ценовая матрица
Данные на 25.07.2026 (суточные токены; 30-дневный кумулятив в таблице). Перед продакшеном откройте первичный источник.
| Ранг | Модель | Вендор | Токены/сутки | 30 дней |
|---|---|---|---|---|
| 1 | Mimo V2.5 | Xiaomi | 1,4T | 31,2T |
| 2 | DeepSeek V4 Flash | DeepSeek | 943,9B | 23,6T |
| 3 | Hy3 | Tencent | 590B | 23,4T |
| 4 | Nemotron 3 Ultra 550B (free) | NVIDIA | 428,6B | 9T |
| 5 | DeepSeek V4 Pro | DeepSeek | 413,7B | 11,6T |
| 6 | GLM 5.2 | Z.ai | 316,7B | 13,3T |
| 7 | MiniMax M3 | MiniMax | 262,5B | 15,1T |
| 8 | Step 3.7 Flash | StepFun | 204,8B | 5,9T |
| 9 | Kimi K3 | Moonshot AI | 157,6B | 1,6T |
| 10 | Ling 3.0 Flash | InclusionAI | 128,3B | 417,3B |
| 11 | Gemini 3 Flash Preview | 106,3B | 4T | |
| 12 | Claude Sonnet 5 | Anthropic | 99,5B | 3,6T |
| Вендор | Регион | Доля токенов |
|---|---|---|
| DeepSeek | Китай | 16–18 % |
| Xiaomi | Китай | 8–18 % |
| Anthropic | США | 10–15 % |
| Tencent | Китай | 8–13 % |
| США | 8–13 % | |
| OpenAI | США | 6–8 % |
| Китай суммарно | — | ~46 % |
| США суммарно | — | ~30–36 % |
| Модель | Input | Output | Контекст | Роль |
|---|---|---|---|---|
| DeepSeek V4 Flash | ~0,05–0,14 | ~0,24–0,28 | 1M | Agentic coding, volume |
| GLM 5.2 | 0,45 | 3,31 | — | Open-weight planning |
| Kimi K3 | ~3 | ~15 | 1M | 1,4 TB open weights |
| Claude Opus 5 | 5 (fast 10) | 25 (fast 50) | 1M | Closed frontier |
Методология и live-цифры меняются. Проверьте перед интеграцией.
https://openrouter.ai/rankings
[ SECTION_03 ] // BAR_BELL Объём токенов ≠ качество: рынок-штанга и слой приложений
Разбивка по spend и типу задач: general chat ~35,7 %, agentic workflows ~30,4 %, code ~26,5 %. В категории classification / сложный reasoning Claude Sonnet 4.6 и Opus 4.7 делят ~13,5 % spend каждый, GPT-5.5 ~11,6 % — лидеры дешёвого volume почти не видны.
Формируется штанга: китайские open weights на error-tolerant нагрузках; closed frontier (Claude Opus 5, FrontierBench v0.1 ~43,3 %, релиз 24.07) — на верхних 5–10 % по сложности. Capability и popularity расходятся.
| Ранг | Приложение | Тип | Доля |
|---|---|---|---|
| 1 | Hermes Agent | CLI / self-improving agent | ~45 % |
| 2 | Kilo Code | Coding agent | ~13 % |
| 3 | OpenClaw | General agent | ~9 % |
| 4 | Claude Code | Coding agent | ~6 % |
| 5–10 | Descript, pi, Lemonade, ISEKAI ZERO, Janitor AI, Cline | Content / RP / IDE | 1,7–4,5 % |
Линия Cline → Roo Code → Kilo Code — три поколения форка; младший Kilo Code обогнал предков по трафику. Roleplay-приложения (Janitor AI, SillyTavern) двигают огромный объём вне enterprise-отчётов; отчёт OpenRouter × a16z оценивает creative roleplay >50 % open-model usage.
Рейтинг apps: первичный источник перед цитированием.
[ SECTION_04 ] // PLAYBOOK Прогноз на август 2026 и шестишаговая маршрутизация моделей
Пять сигналов на август:
- Китайские open weights likely к 50 %+ без US price war.
- Ротация «модели месяца» — Xiaomi, DeepSeek, Tencent, Z.ai, MiniMax, Moonshot ship параллельно.
- Anthropic может выкатить дешёвый volume-tier после Opus 5 (24.07).
- Kimi K3 (1,4 TB weights): community quantization через 2–4 недели; до этого — inference-хосты.
- Security как критерий: OpenAI sandbox escape, AI Kill Switch Act, White House pre-release review.
Шесть шагов:
- Dual ledger: OpenRouter для volume-трендов; внутренний eval (acceptance rate, error rate, p95 latency) для качества.
- Routing по сложности: top 5–10 % → Opus 5 / GPT-5.6; daily coding → DeepSeek V4 Flash, Mimo V2.5, GLM 5.2.
- Gateway-абстракция: LiteLLM или аналог — не хардкодить provider/model ID перед августовскими релизами.
- Compliance: DPA, регион обработки, subprocessors до маршрута в нерегулируемые юрисдикции.
- Читать apps-слой: Hermes и Kilo Code объясняют пики моделей — не слепо следовать #1 дня.
- 7×24 host: agent gateway требует бодрствующий Apple Silicon — центр помощи, оформить заказ.
[ SECTION_05 ] // DATA_FAQ Цитируемые метрики, FAQ и заключение NOVAKVM
- Mimo V2.5: 1,4T токенов/сутки (#1 на 25.07.2026)
- DeepSeek V4 Flash: 943,9B/сутки; DeepSeek ~16–18 % как вендор
- Китай суммарно: ~46 % (было <2 % год назад)
- Hermes Agent: ~45 % app-токенов
- Ценовой разрыв: ~35× DeepSeek V4 Flash vs GPT-5.5 input
- Claude Opus 5: FrontierBench v0.1 ~43,3 % (24.07.2026)
В: Какая модель #1 в июле 2026?
О: Mimo V2.5, затем DeepSeek V4 Flash и Hy3 — с ежедневной волатильностью.
В: Высокий объём = высокое качество?
О: Нет — volume отражает цену и app-binding, не frontier на hard tasks.
В: Крупнейшее приложение?
О: Hermes Agent (~45 %), далее Kilo Code (~13 %).
Multi-model gateway, OpenRouter routing и локальные weights на личном Mac ломаются на lid-close sleep, RAM ceiling, отсутствии 7×24 и VM overhead без нативного Metal. Для стабильных iOS/macOS CI, agent automation и coding assistants на выделенном Apple Silicon аренда Mac Mini bare metal NOVAKVM обычно надёжнее: dedicated hardware, multi-region, гибкие сроки — цены аренды.
Источники на момент публикации; перед цитированием проверьте актуальные ссылки.
https://openrouter.ai/rankings