Почему benchmark-чарты в июле 2026 не работают
Leaderboard OpenRouter и vendor whitepaper — разные вселенные. Пять параметров, которые ломают старые стратегии выбора модели:
- Дневная волатильность: Mimo V2.5 сдвинулся на несколько позиций между 24 и 25 июля. Один snapshot — не policy.
- Объём ≠ качество: Дешёвая модель за consumer-app с высоким трафиком обгоняет frontier, зарезервированный для hardest 10 % workload.
- Слепая зона app-layer: Roleplay/companion apps генерируют серьёзный open-model volume — enterprise coverage его почти не видит.
- Price gap ~35×: DeepSeek V4 Flash: ~$0,05–0,14/M input; GPT-5.5: ~$5/M. Миграция трафика — арифметика цен, не геополитика.
- Security в scorecard: Sandbox escape disclosure от OpenAI и draft US «AI Kill Switch» legislation — vendor safety track record входит в formal procurement review.
Top-12 моделей по суточному токен-объёму (25 июля)
Семь из top-10 — китайские labs. DeepSeek остаётся стабильным #1 провайдером (16–18 % share), но «модель месяца» ротируется еженедельно.
| Ранг | Модель | Провайдер | Токены/сут | 30-дн сумма |
|---|---|---|---|---|
| 1 | Mimo V2.5 | Xiaomi | 1,4 T | 31,2 T |
| 2 | DeepSeek V4 Flash | DeepSeek | 943,9 млрд | 23,6 T |
| 3 | Hy3 | Tencent | 590 млрд | 23,4 T |
| 4 | Nemotron 3 Ultra 550B (free) | NVIDIA | 428,6 млрд | 9 T |
| 5 | DeepSeek V4 Pro | DeepSeek | 413,7 млрд | 11,6 T |
| 6 | GLM 5.2 | Z.ai | 316,7 млрд | 13,3 T |
| 7 | MiniMax M3 | MiniMax | 262,5 млрд | 15,1 T |
| 8 | Step 3.7 Flash | StepFun | 204,8 млрд | 5,9 T |
| 9 | Kimi K3 | Moonshot AI | 157,6 млрд | 1,6 T (новый) |
| 10 | Ling 3.0 Flash | InclusionAI | 128,3 млрд | 417,3 млрд |
| 11 | Gemini 3 Flash Preview | 106,3 млрд | 4 T | |
| 12 | Claude Sonnet 5 | Anthropic | 99,5 млрд | 3,6 T |
Доли провайдеров и input-цены: Китай ~46 %, США ~30–36 %
Китайские labs держат ~46 % идентифицированного токен-объёма — год назад <2 %. US-origin (OpenAI, Anthropic, Google) упали с ~70 % (mid-2025) до ~30–36 %. Это price math.
| Провайдер | Доля (approx.) | Позиционирование |
|---|---|---|
| DeepSeek | 16–18 % | Best value; agentic coding default |
| Xiaomi | 8–18 % | Mimo V2.5 surge; max volatility |
| Anthropic | 10–15 % | Closed frontier; hard-task pricing |
| Tencent | 8–13 % | Hy3 volume play |
| 8–13 % | Gemini Flash family | |
| Z.ai | 4–7 % | GLM 5.2 Opus-class planning |
| OpenAI | 6–8 % | GPT-5.5 premium tier |
Input price comparison (USD/M tokens):
| Модель | Input/M | Output/M | Роль |
|---|---|---|---|
| DeepSeek V4 Flash | ~$0,05–0,14 | ~$0,24–0,28 | Value leader |
| MiniMax M3 | $0,10 | $1,21 | Long-context budget |
| GLM 5.2 | $0,45 | $3,31 | Open Opus-style planning |
| Kimi K3 | ~$3 | ~$15 | Largest open weights (1,4 TB) |
| Claude Opus 5 | $5 (fast $10) | $25 (fast $50) | Closed flagship |
Рынок-штанга: usage rank и capability profile расходятся
Spend breakdown OpenRouter по task category: general chat 35,7 %, agentic workflows 30,4 %, code 26,5 %, data work 7,5 %. В hardest bucket — classification/complex reasoning — Claude Sonnet 4.6 и Claude Opus 4.7 по 13,5 % spend каждый, GPT-5.5 третий с 11,6 %. Дешёвые open-model лидеры volume charts здесь почти не видны.
Рынок бифурцируется: китайские open-weight модели поглощают error-tolerant high-volume workloads (chat, creative, roleplay, routine coding). Closed frontier модели держат pricing power на low-error-tolerance tasks. Claude Opus 5 (24 июля) — FrontierBench v0.1: 43,3 % vs GPT-5.6 Sol 37,5 % при неизменном Opus-tier $5/$25 per million tokens.
App-leaderboard: coding agents и невидимый roleplay-блок
Model rankings — какой «мозг» routed. App leaderboard — для чего:
- Hermes Agent (Nous Research): ~45 % app token share — крупнейшая single app на платформе.
- Coding agents занимают остальное: Kilo Code (~13 %), OpenClaw (~9 %), Claude Code (~6 %), Cline (~1,7 %).
- Cline → Roo Code → Kilo Code — три поколения одной open-source lineage; youngest fork теперь лидирует family volume.
- Roleplay/companion apps (Janitor AI, ISEKAI ZERO, SillyTavern, HammerAI) двигают серьёзный volume. OpenRouter × a16z State of AI: creative roleplay — >50 % всего open-model usage.
| Ранг | App | Категория | Доля (approx.) |
|---|---|---|---|
| 1 | Hermes Agent | Personal agent / CLI | ~45 % |
| 2 | Kilo Code | Coding agent | ~13 % |
| 3 | OpenClaw | General agent | ~9 % |
| 4 | Claude Code | Coding agent | ~6 % |
| 5 | Descript | Content production | ~4,5 % |
| 6 | pi | Agent | ~3,3 % |
| 7 | Lemonade | Companion / gaming | ~2,1 % |
| 8 | ISEKAI ZERO | Roleplay | ~2,0 % |
| 9 | Janitor AI | Roleplay | ~1,8 % |
| 10 | Cline | Coding agent (IDE) | ~1,7 % |
Прогноз на август: пять сигналов
- Combined Chinese open-weight share движется к 50 % — если US-провайдер не сделает real pricing move.
- «Модель месяца» продолжит ротацию между Xiaomi, DeepSeek, Tencent, Z.ai, MiniMax, Moonshot.
- Anthropic может выпустить cheaper volume tier — Opus 5 уже четвёртый flagship за <2 месяцев.
- Kimi K3 (1,4 TB open weights) — community quantization вероятна за 2–4 недели до practical deploy для smaller teams.
- Security и governance — formal selection criteria — sandbox escapes, pre-release review frameworks, vendor safety track records в enterprise scorecards.
Шесть шагов для layered model routing
Usage rank alone — не engineering policy. Шесть шагов превращают OpenRouter data в routing policy (новичкам: OpenRouter API guide):
- Data stamp + monthly review cadence: openrouter.ai/rankings, записать check date; ranks shift daily.
- Split eval sets по task type: chat/creative, agentic, code, complex reasoning — acceptance rate, error rate, P95 latency per bucket.
- Route volume work на cheap open models: DeepSeek V4 Flash для cost-efficiency, GLM 5.2 для open-weight Opus-style planning на tolerant tasks.
- Reserve closed frontier для hard steps: classification, complex reasoning, high-stakes agent decisions → Claude Opus 5 / GPT-5.6 — только где cheaper models fail.
- A/B coding agents на том же repo: Kilo Code, Cline, OpenClaw — default backends и fallback chains; log token cost и fix success rate.
- Vendor safety в scorecard: sandbox incidents, data retention, permission boundaries; autonomous agent flows — least-privilege defaults и human approval gates.
OpenRouter отлично подходит для prototyping за одним API key. В production — тестируйте свои latency и compliance requirements; regional routing и invoicing vary by team.
Hard numbers и primary sources
- ~46 % Chinese provider token share: С <2 % год назад — одна из steepest share migrations за 12 месяцев, cross-validated с OpenRouter official data.
- ~35× input price gap (DeepSeek V4 Flash vs GPT-5.5): ~$0,05–0,14/M vs ~$5/M — core driver volume migration.
- Hermes Agent ~45 % app-layer share: Далеко впереди #2 Kilo Code (~13 %) — personal/CLI agents — largest single traffic entry point.
- Claude Opus 5 FrontierBench v0.1: 43,3 %: Ahead of GPT-5.6 Sol 37,5 % at unchanged Opus-tier pricing — Anthropic launch 24 июля.
Rankings shift daily. Verify current figures before citing.
Primary source — OpenRouter model rankings:
Primary source — OpenRouter app leaderboard:
OpenRouter × a16z State of AI report:
Anthropic Claude Opus 5 launch:
Introducing Claude Opus 5 — Anthropic
FAQ по рейтингу OpenRouter
По какому критерию строится рейтинг?
Real paid token volume в production — не benchmark scores. Дешёвая модель за viral app может top chart без оптимальности для вашего workload.
Кто лидировал в июле 2026?
На 25 июля: Xiaomi Mimo V2.5 ~1,4 T tokens/day, затем DeepSeek V4 Flash (~943,9 млрд/day) и Tencent Hy3 (~590 млрд/day).
Какую долю держат китайские модели?
~46 % combined Chinese provider share vs ~30–36 % US-origin, по 7-day estimates.
Что делать indie-разработчику?
OpenRouter как sandbox: DeepSeek V4 Flash + GLM 5.2 для coding, Claude Opus 5 для steps где cheaper models fail — hybrid routing резко режет cost.
A/B Kilo Code, Cline или Hermes Agent на daily driver загрязняет global config и agent state. KVMFLUX cloud Mac mini даёт root, SSH + VNC и dedicated physical M4 hardware с daily rental — тестируйте DeepSeek V4 Flash vs Claude Opus 5 fallback chains в clean environment и возвращайте машину. При выборе периода аренды daily billing лучше всего подходит для monthly leaderboard-driven validation sprints.
Тест routing coding agents на реальном Apple Silicon
Арендуйте Mac mini M4 посуточно, прогоните Kilo Code / Cline model A/B и fallback validation — верните машину когда выйдет следующий ranking drop.