Warum Benchmark-Charts im Juli 2026 nicht reichen
Die OpenRouter-Rankings unterscheiden sich fundamental von Vendor-Whitepapers. Diese fünf Parameter erklären, warum Teams ihre Modellauswahl neu kalibrieren müssen:
- Tagesvolatilität: Mimo V2.5 wechselte zwischen 24. und 25. Juli mehrere Plätze in den Top 10. Ein Snapshot ist keine Strategie.
- Volumen ≠ Qualität: Ein günstiges Modell hinter einer Consumer-App mit hohem Traffic übertrifft ein Frontier-Modell, das nur für die schwierigsten 10 % reserviert ist.
- Blinder Fleck App-Layer: Roleplay- und Companion-Apps generieren erhebliches Open-Model-Volumen — in Enterprise-Berichten praktisch unsichtbar.
- Preisspanne ~35×: DeepSeek V4 Flash: ~$0,05–0,14/M Input; GPT-5.5: ~$5/M. Das erklärt die Traffic-Migration mehr als Geopolitik.
- Compliance als Scorecard-Faktor: Sandbox-Escape-Meldungen und geplante US-Regulierung machen Anbieter-Sicherheitsprofile zu formalen Auswahlkriterien — für EU-Unternehmen zusätzlich relevant im Kontext der DSGVO und Auftragsverarbeitung.
Modell-Ranking nach Tages-Token-Volumen (25. Juli 2026)
Sieben der Top-10-Modelle stammen am 25. Juli aus chinesischen Labs. DeepSeek bleibt stabiler #1-Anbieter (16–18 % Share), das Modell des Monats rotiert jedoch wöchentlich.
| Rang | Modell | Anbieter | Tokens/Tag | 30-Tage-Summe |
|---|---|---|---|---|
| 1 | Mimo V2.5 | Xiaomi | 1,4 T | 31,2 T |
| 2 | DeepSeek V4 Flash | DeepSeek | 943,9 Mrd. | 23,6 T |
| 3 | Hy3 | Tencent | 590 Mrd. | 23,4 T |
| 4 | Nemotron 3 Ultra 550B (free) | NVIDIA | 428,6 Mrd. | 9 T |
| 5 | DeepSeek V4 Pro | DeepSeek | 413,7 Mrd. | 11,6 T |
| 6 | GLM 5.2 | Z.ai | 316,7 Mrd. | 13,3 T |
| 7 | MiniMax M3 | MiniMax | 262,5 Mrd. | 15,1 T |
| 8 | Step 3.7 Flash | StepFun | 204,8 Mrd. | 5,9 T |
| 9 | Kimi K3 | Moonshot AI | 157,6 Mrd. | 1,6 T (Neueinstieg) |
| 10 | Ling 3.0 Flash | InclusionAI | 128,3 Mrd. | 417,3 Mrd. |
| 11 | Gemini 3 Flash Preview | 106,3 Mrd. | 4 T | |
| 12 | Claude Sonnet 5 | Anthropic | 99,5 Mrd. | 3,6 T |
Anbieteranteile und Input-Preise: China ~46 %, USA ~30–36 %
Chinesische Labs halten zusammen ~46 % des identifizierten Token-Volumens — vor einem Jahr unter 2 %. US-Anbieter (OpenAI, Anthropic, Google) sanken von ~70 % (Mitte 2025) auf ~30–36 %. Das ist Preisarithmetik, keine geopolitische These.
| Anbieter | Anteil (ca.) | Positionierung |
|---|---|---|
| DeepSeek | 16–18 % | Bestes Preis-Leistungs-Verhältnis; Agentic-Coding-Default |
| Xiaomi | 8–18 % | Mimo-V2.5-Sprung; höchste Volatilität |
| Anthropic | 10–15 % | Geschlossenes Frontier; Hard-Task-Preismacht |
| Tencent | 8–13 % | Hy3-Volumenstrategie |
| 8–13 % | Gemini-Flash-Familie | |
| Z.ai | 4–7 % | GLM 5.2 — Open-Weight-Planning |
| OpenAI | 6–8 % | GPT-5.5 Premium-Tier |
Input-Preisvergleich (USD pro Million Tokens):
| Modell | Input/M | Output/M | Rolle |
|---|---|---|---|
| DeepSeek V4 Flash | ~$0,05–0,14 | ~$0,24–0,28 | Value-Leader |
| MiniMax M3 | $0,10 | $1,21 | Long-Context-Budget |
| GLM 5.2 | $0,45 | $3,31 | Open Opus-Style-Planning |
| Kimi K3 | ~$3 | ~$15 | Größte Open Weights (1,4 TB) |
| Claude Opus 5 | $5 (fast $10) | $25 (fast $50) | Geschlossenes Flaggschiff |
Für Enterprise-Teams in der EU: Prompt-Inhalte und Metadaten, die über OpenRouter an nicht-europäische Anbieter geroutet werden, können personenbezogene Daten im Sinne der DSGVO betreffen. Dokumentieren Sie Datenflüsse, prüfen Sie AV-Verträge und bevorzugen Sie Anbieter mit EU-Rechenzentrumsoptionen für regulierte Workloads.
Hantelmarkt: Nutzungsrang und Fähigkeitsprofil divergieren
OpenRouters Ausgaben nach Aufgabenkategorie: General Chat 35,7 %, Agentic Workflows 30,4 %, Code 26,5 %, Data Work 7,5 %. In der Kategorie Classification/Complex Reasoning teilen sich Claude Sonnet 4.6 und Claude Opus 4.7 je 13,5 % der Ausgaben, GPT-5.5 folgt mit 11,6 %. Die günstigen Open-Model-Leader der Volumen-Charts sind hier kaum sichtbar.
Der Markt spaltet sich: Chinesische Open-Weight-Modelle absorbieren fehlertolerante Hochvolumen-Workloads (Chat, Creative, Roleplay, Routine-Coding). Geschlossene Frontier-Modelle verteidigen Preismacht bei niedriger Fehlertoleranz. Claude Opus 5 (24. Juli) erreichte FrontierBench v0.1 mit 43,3 % gegenüber GPT-5.6 Sols 37,5 % — bei unverändertem Opus-Tier-Pricing ($5/$25 pro Million Tokens).
App-Leaderboard: Coding-Agents und der unsichtbare Roleplay-Block
Modell-Rankings zeigen, welches Gehirn geroutet wird. Das App-Leaderboard zeigt, wofür:
- Hermes Agent (Nous Research): ~45 % App-Token-Anteil — größte Einzel-App auf der Plattform.
- Coding-Agents dominieren den Rest: Kilo Code (~13 %), OpenClaw (~9 %), Claude Code (~6 %), Cline (~1,7 %).
- Cline → Roo Code → Kilo Code — drei Generationen derselben Open-Source-Linie; der jüngste Fork führt das Familienvolumen an.
- Roleplay-/Companion-Apps (Janitor AI, ISEKAI ZERO, SillyTavern, HammerAI) bewegen erhebliches Volumen. Laut OpenRouter × a16z State of AI Report macht Creative Roleplay über die Hälfte aller Open-Model-Nutzung aus.
| Rang | App | Kategorie | Anteil (ca.) |
|---|---|---|---|
| 1 | Hermes Agent | Personal Agent / CLI | ~45 % |
| 2 | Kilo Code | Coding Agent | ~13 % |
| 3 | OpenClaw | General Agent | ~9 % |
| 4 | Claude Code | Coding Agent | ~6 % |
| 5 | Descript | Content Production | ~4,5 % |
| 6 | pi | Agent | ~3,3 % |
| 7 | Lemonade | Companion / Gaming | ~2,1 % |
| 8 | ISEKAI ZERO | Roleplay | ~2,0 % |
| 9 | Janitor AI | Roleplay | ~1,8 % |
| 10 | Cline | Coding Agent (IDE) | ~1,7 % |
August-Prognose: fünf messbare Signale
- Chinesischer Open-Weight-Kombi-Anteil nähert sich 50 % — sofern kein US-Anbieter signifikant senkt.
- Modell-des-Monats rotiert weiter zwischen Xiaomi, DeepSeek, Tencent, Z.ai, MiniMax und Moonshot.
- Anthropic könnte ein volumenorientiertes günstigeres Tier liefern — Opus 5 ist bereits das vierte Flaggschiff in unter zwei Monaten.
- Kimi K3 (1,4 TB Open Weights) — Community-Quantisierung innerhalb von 2–4 Wochen wahrscheinlich, bevor kleinere Teams praktisch deployen können.
- Sicherheit und Governance werden formale Scorecard-Faktoren — Sandbox-Incidents, Pre-Release-Review und Anbieter-Track-Record. Für EU-Enterprise zusätzlich: DSGVO-konforme Datenverarbeitung und dokumentierte Subprozessoren.
Sechs Schritte für produktionsreifes Modell-Routing
Nutzungsrang allein ist keine Engineering-Policy. Diese sechs Schritte operationalisieren OpenRouter-Daten (Einstieg: OpenRouter-API-Guide):
- Datumsstempel und monatlicher Review-Zyklus: openrouter.ai/rankings öffnen, Prüfdatum dokumentieren; Ränge verschieben sich täglich.
- Eval-Sets nach Aufgabentyp splitten: Chat/Creative, Agentic, Code, Complex Reasoning — Acceptance Rate, Fehlerrate, P95-Latenz pro Bucket.
- Volumen-Workloads auf günstige Open Models: DeepSeek V4 Flash für Kosteneffizienz, GLM 5.2 für Open-Weight-Planning bei tolerierten Fehlern.
- Frontier-Modelle für Hard Steps reservieren: Classification, Complex Reasoning, High-Stakes-Agent-Entscheidungen → Claude Opus 5 / GPT-5.6 — nur wo günstigere Modelle scheitern.
- Coding-Agents A/B auf demselben Repo: Kilo Code, Cline, OpenClaw — Default-Backends und Fallback-Chains vergleichen; Token-Kosten und Fix-Rate loggen.
- Anbieter-Sicherheit und DSGVO in die Scorecard: Sandbox-Incidents, Datenretention, Berechtigungsgrenzen, Subprozessor-Liste und AV-Verträge dokumentieren; Agent-Flows mit Least-Privilege und Human-Approval-Gates.
OpenRouter eignet sich hervorragend zum Prototyping hinter einem API-Key. Für Produktion: eigene Latenz-, Compliance- und DSGVO-Anforderungen testen — regionales Routing und Rechnungsstellung variieren je nach Anbieter.
Verifizierbare Kennzahlen und Primärquellen
- ~46 % chinesischer Anbieteranteil: Von unter 2 % vor einem Jahr — eine der steilsten Share-Migrationen der letzten 12 Monate, gegen OpenRouter-Offizialdaten und 7-Tage-Tracker validiert.
- ~35× Input-Preis-Gap (DeepSeek V4 Flash vs. GPT-5.5): ~$0,05–0,14/M gegen ~$5/M — Haupttreiber der Volumen-Migration.
- Hermes Agent ~45 % App-Layer-Anteil: Deutlich vor #2 Kilo Code (~13 %) — Personal/CLI-Agents sind der größte Einzel-Traffic-Einstieg.
- Claude Opus 5 FrontierBench v0.1: 43,3 %: Vor GPT-5.6 Sol (37,5 %) bei unverändertem Opus-Tier-Pricing — laut Anthropic-Launch vom 24. Juli.
Rankings verschieben sich täglich. Aktuelle Zahlen vor Zitierung verifizieren.
Primärquelle — OpenRouter Modell-Rankings:
Primärquelle — OpenRouter App-Leaderboard:
OpenRouter × a16z State of AI Report:
Anthropic Claude Opus 5 Launch:
Introducing Claude Opus 5 — Anthropic
FAQ zu OpenRouter-Rankings
Wonach sortiert OpenRouter?
Reales, bezahltes Token-Volumen in Produktion — nicht Benchmark-Scores. Ein günstiges Modell hinter einer viralen App kann die Chart-Spitze erreichen, ohne für Ihren Workload optimal zu sein.
Wer führte im Juli 2026?
Am 25. Juli: Xiaomi Mimo V2.5 mit ~1,4 T Tokens/Tag, dann DeepSeek V4 Flash (~943,9 Mrd./Tag) und Tencent Hy3 (~590 Mrd./Tag).
Welchen Anteil haben chinesische Modelle?
Rund 46 % kombinierter chinesischer Anbieteranteil gegen ~30–36 % US-Herkunft, laut 7-Tage-Schätzungen.
Was empfiehlt sich für Enterprise-Teams?
Hybrid-Routing: DeepSeek V4 Flash + GLM 5.2 für Volumen, Claude Opus 5 für Hard Steps. DSGVO: Datenflüsse dokumentieren, AV-Verträge prüfen, EU-Rechenzentrum wo erforderlich.
Kilo Code-, Cline- oder Hermes-Agent-Vergleiche auf dem Hauptrechner verunreinigen globale Config und Agent-State. Ein KVMFLUX-Cloud-Mac-mini liefert Root-Zugriff, SSH + VNC und dedizierte physische M4-Hardware ab Tagesmiete — DeepSeek-V4-Flash- versus Claude-Opus-5-Fallback-Chains in sauberer Umgebung testen, dann zurückgeben. Bei der Mietdauer-Wahl passt Tagesabrechnung am besten zu monatlichen Leaderboard-Validierungssprints.
Coding-Agent-Routing auf echtem Apple Silicon testen
Mac mini M4 tageweise mieten, Kilo Code / Cline Modell-A/B und Fallback-Validierung durchführen — Maschine zurückgeben, sobald das nächste Ranking-Drop erscheint.