Warum Benchmark-Charts im Juli 2026 nicht reichen

Die OpenRouter-Rankings unterscheiden sich fundamental von Vendor-Whitepapers. Diese fünf Parameter erklären, warum Teams ihre Modellauswahl neu kalibrieren müssen:

  • Tagesvolatilität: Mimo V2.5 wechselte zwischen 24. und 25. Juli mehrere Plätze in den Top 10. Ein Snapshot ist keine Strategie.
  • Volumen ≠ Qualität: Ein günstiges Modell hinter einer Consumer-App mit hohem Traffic übertrifft ein Frontier-Modell, das nur für die schwierigsten 10 % reserviert ist.
  • Blinder Fleck App-Layer: Roleplay- und Companion-Apps generieren erhebliches Open-Model-Volumen — in Enterprise-Berichten praktisch unsichtbar.
  • Preisspanne ~35×: DeepSeek V4 Flash: ~$0,05–0,14/M Input; GPT-5.5: ~$5/M. Das erklärt die Traffic-Migration mehr als Geopolitik.
  • Compliance als Scorecard-Faktor: Sandbox-Escape-Meldungen und geplante US-Regulierung machen Anbieter-Sicherheitsprofile zu formalen Auswahlkriterien — für EU-Unternehmen zusätzlich relevant im Kontext der DSGVO und Auftragsverarbeitung.

Modell-Ranking nach Tages-Token-Volumen (25. Juli 2026)

Sieben der Top-10-Modelle stammen am 25. Juli aus chinesischen Labs. DeepSeek bleibt stabiler #1-Anbieter (16–18 % Share), das Modell des Monats rotiert jedoch wöchentlich.

Rang Modell Anbieter Tokens/Tag 30-Tage-Summe
1Mimo V2.5Xiaomi1,4 T31,2 T
2DeepSeek V4 FlashDeepSeek943,9 Mrd.23,6 T
3Hy3Tencent590 Mrd.23,4 T
4Nemotron 3 Ultra 550B (free)NVIDIA428,6 Mrd.9 T
5DeepSeek V4 ProDeepSeek413,7 Mrd.11,6 T
6GLM 5.2Z.ai316,7 Mrd.13,3 T
7MiniMax M3MiniMax262,5 Mrd.15,1 T
8Step 3.7 FlashStepFun204,8 Mrd.5,9 T
9Kimi K3Moonshot AI157,6 Mrd.1,6 T (Neueinstieg)
10Ling 3.0 FlashInclusionAI128,3 Mrd.417,3 Mrd.
11Gemini 3 Flash PreviewGoogle106,3 Mrd.4 T
12Claude Sonnet 5Anthropic99,5 Mrd.3,6 T

Anbieteranteile und Input-Preise: China ~46 %, USA ~30–36 %

Chinesische Labs halten zusammen ~46 % des identifizierten Token-Volumens — vor einem Jahr unter 2 %. US-Anbieter (OpenAI, Anthropic, Google) sanken von ~70 % (Mitte 2025) auf ~30–36 %. Das ist Preisarithmetik, keine geopolitische These.

Anbieter Anteil (ca.) Positionierung
DeepSeek16–18 %Bestes Preis-Leistungs-Verhältnis; Agentic-Coding-Default
Xiaomi8–18 %Mimo-V2.5-Sprung; höchste Volatilität
Anthropic10–15 %Geschlossenes Frontier; Hard-Task-Preismacht
Tencent8–13 %Hy3-Volumenstrategie
Google8–13 %Gemini-Flash-Familie
Z.ai4–7 %GLM 5.2 — Open-Weight-Planning
OpenAI6–8 %GPT-5.5 Premium-Tier

Input-Preisvergleich (USD pro Million Tokens):

Modell Input/M Output/M Rolle
DeepSeek V4 Flash~$0,05–0,14~$0,24–0,28Value-Leader
MiniMax M3$0,10$1,21Long-Context-Budget
GLM 5.2$0,45$3,31Open Opus-Style-Planning
Kimi K3~$3~$15Größte Open Weights (1,4 TB)
Claude Opus 5$5 (fast $10)$25 (fast $50)Geschlossenes Flaggschiff

Für Enterprise-Teams in der EU: Prompt-Inhalte und Metadaten, die über OpenRouter an nicht-europäische Anbieter geroutet werden, können personenbezogene Daten im Sinne der DSGVO betreffen. Dokumentieren Sie Datenflüsse, prüfen Sie AV-Verträge und bevorzugen Sie Anbieter mit EU-Rechenzentrumsoptionen für regulierte Workloads.

Hantelmarkt: Nutzungsrang und Fähigkeitsprofil divergieren

OpenRouters Ausgaben nach Aufgabenkategorie: General Chat 35,7 %, Agentic Workflows 30,4 %, Code 26,5 %, Data Work 7,5 %. In der Kategorie Classification/Complex Reasoning teilen sich Claude Sonnet 4.6 und Claude Opus 4.7 je 13,5 % der Ausgaben, GPT-5.5 folgt mit 11,6 %. Die günstigen Open-Model-Leader der Volumen-Charts sind hier kaum sichtbar.

Der Markt spaltet sich: Chinesische Open-Weight-Modelle absorbieren fehlertolerante Hochvolumen-Workloads (Chat, Creative, Roleplay, Routine-Coding). Geschlossene Frontier-Modelle verteidigen Preismacht bei niedriger Fehlertoleranz. Claude Opus 5 (24. Juli) erreichte FrontierBench v0.1 mit 43,3 % gegenüber GPT-5.6 Sols 37,5 % — bei unverändertem Opus-Tier-Pricing ($5/$25 pro Million Tokens).

App-Leaderboard: Coding-Agents und der unsichtbare Roleplay-Block

Modell-Rankings zeigen, welches Gehirn geroutet wird. Das App-Leaderboard zeigt, wofür:

  • Hermes Agent (Nous Research): ~45 % App-Token-Anteil — größte Einzel-App auf der Plattform.
  • Coding-Agents dominieren den Rest: Kilo Code (~13 %), OpenClaw (~9 %), Claude Code (~6 %), Cline (~1,7 %).
  • Cline → Roo Code → Kilo Code — drei Generationen derselben Open-Source-Linie; der jüngste Fork führt das Familienvolumen an.
  • Roleplay-/Companion-Apps (Janitor AI, ISEKAI ZERO, SillyTavern, HammerAI) bewegen erhebliches Volumen. Laut OpenRouter × a16z State of AI Report macht Creative Roleplay über die Hälfte aller Open-Model-Nutzung aus.
Rang App Kategorie Anteil (ca.)
1Hermes AgentPersonal Agent / CLI~45 %
2Kilo CodeCoding Agent~13 %
3OpenClawGeneral Agent~9 %
4Claude CodeCoding Agent~6 %
5DescriptContent Production~4,5 %
6piAgent~3,3 %
7LemonadeCompanion / Gaming~2,1 %
8ISEKAI ZERORoleplay~2,0 %
9Janitor AIRoleplay~1,8 %
10ClineCoding Agent (IDE)~1,7 %

August-Prognose: fünf messbare Signale

  1. Chinesischer Open-Weight-Kombi-Anteil nähert sich 50 % — sofern kein US-Anbieter signifikant senkt.
  2. Modell-des-Monats rotiert weiter zwischen Xiaomi, DeepSeek, Tencent, Z.ai, MiniMax und Moonshot.
  3. Anthropic könnte ein volumenorientiertes günstigeres Tier liefern — Opus 5 ist bereits das vierte Flaggschiff in unter zwei Monaten.
  4. Kimi K3 (1,4 TB Open Weights) — Community-Quantisierung innerhalb von 2–4 Wochen wahrscheinlich, bevor kleinere Teams praktisch deployen können.
  5. Sicherheit und Governance werden formale Scorecard-Faktoren — Sandbox-Incidents, Pre-Release-Review und Anbieter-Track-Record. Für EU-Enterprise zusätzlich: DSGVO-konforme Datenverarbeitung und dokumentierte Subprozessoren.

Sechs Schritte für produktionsreifes Modell-Routing

Nutzungsrang allein ist keine Engineering-Policy. Diese sechs Schritte operationalisieren OpenRouter-Daten (Einstieg: OpenRouter-API-Guide):

  1. Datumsstempel und monatlicher Review-Zyklus: openrouter.ai/rankings öffnen, Prüfdatum dokumentieren; Ränge verschieben sich täglich.
  2. Eval-Sets nach Aufgabentyp splitten: Chat/Creative, Agentic, Code, Complex Reasoning — Acceptance Rate, Fehlerrate, P95-Latenz pro Bucket.
  3. Volumen-Workloads auf günstige Open Models: DeepSeek V4 Flash für Kosteneffizienz, GLM 5.2 für Open-Weight-Planning bei tolerierten Fehlern.
  4. Frontier-Modelle für Hard Steps reservieren: Classification, Complex Reasoning, High-Stakes-Agent-Entscheidungen → Claude Opus 5 / GPT-5.6 — nur wo günstigere Modelle scheitern.
  5. Coding-Agents A/B auf demselben Repo: Kilo Code, Cline, OpenClaw — Default-Backends und Fallback-Chains vergleichen; Token-Kosten und Fix-Rate loggen.
  6. Anbieter-Sicherheit und DSGVO in die Scorecard: Sandbox-Incidents, Datenretention, Berechtigungsgrenzen, Subprozessor-Liste und AV-Verträge dokumentieren; Agent-Flows mit Least-Privilege und Human-Approval-Gates.

OpenRouter eignet sich hervorragend zum Prototyping hinter einem API-Key. Für Produktion: eigene Latenz-, Compliance- und DSGVO-Anforderungen testen — regionales Routing und Rechnungsstellung variieren je nach Anbieter.

Verifizierbare Kennzahlen und Primärquellen

  • ~46 % chinesischer Anbieteranteil: Von unter 2 % vor einem Jahr — eine der steilsten Share-Migrationen der letzten 12 Monate, gegen OpenRouter-Offizialdaten und 7-Tage-Tracker validiert.
  • ~35× Input-Preis-Gap (DeepSeek V4 Flash vs. GPT-5.5): ~$0,05–0,14/M gegen ~$5/M — Haupttreiber der Volumen-Migration.
  • Hermes Agent ~45 % App-Layer-Anteil: Deutlich vor #2 Kilo Code (~13 %) — Personal/CLI-Agents sind der größte Einzel-Traffic-Einstieg.
  • Claude Opus 5 FrontierBench v0.1: 43,3 %: Vor GPT-5.6 Sol (37,5 %) bei unverändertem Opus-Tier-Pricing — laut Anthropic-Launch vom 24. Juli.

Rankings verschieben sich täglich. Aktuelle Zahlen vor Zitierung verifizieren.

Primärquelle — OpenRouter Modell-Rankings:

OpenRouter Model Rankings

Primärquelle — OpenRouter App-Leaderboard:

OpenRouter Apps Leaderboard

OpenRouter × a16z State of AI Report:

OpenRouter State of AI 2025

Anthropic Claude Opus 5 Launch:

Introducing Claude Opus 5 — Anthropic

FAQ zu OpenRouter-Rankings

Wonach sortiert OpenRouter?

Reales, bezahltes Token-Volumen in Produktion — nicht Benchmark-Scores. Ein günstiges Modell hinter einer viralen App kann die Chart-Spitze erreichen, ohne für Ihren Workload optimal zu sein.

Wer führte im Juli 2026?

Am 25. Juli: Xiaomi Mimo V2.5 mit ~1,4 T Tokens/Tag, dann DeepSeek V4 Flash (~943,9 Mrd./Tag) und Tencent Hy3 (~590 Mrd./Tag).

Welchen Anteil haben chinesische Modelle?

Rund 46 % kombinierter chinesischer Anbieteranteil gegen ~30–36 % US-Herkunft, laut 7-Tage-Schätzungen.

Was empfiehlt sich für Enterprise-Teams?

Hybrid-Routing: DeepSeek V4 Flash + GLM 5.2 für Volumen, Claude Opus 5 für Hard Steps. DSGVO: Datenflüsse dokumentieren, AV-Verträge prüfen, EU-Rechenzentrum wo erforderlich.

Kilo Code-, Cline- oder Hermes-Agent-Vergleiche auf dem Hauptrechner verunreinigen globale Config und Agent-State. Ein KVMFLUX-Cloud-Mac-mini liefert Root-Zugriff, SSH + VNC und dedizierte physische M4-Hardware ab Tagesmiete — DeepSeek-V4-Flash- versus Claude-Opus-5-Fallback-Chains in sauberer Umgebung testen, dann zurückgeben. Bei der Mietdauer-Wahl passt Tagesabrechnung am besten zu monatlichen Leaderboard-Validierungssprints.

Coding-Agent-Routing auf echtem Apple Silicon testen

Mac mini M4 tageweise mieten, Kilo Code / Cline Modell-A/B und Fallback-Validierung durchführen — Maschine zurückgeben, sobald das nächste Ranking-Drop erscheint.

Mac Mini M4 · 16GB / 256GB
Täglich$19.3 /Tag
Wöchentlich$52.2 /Wo.
Monatlich$96.7 /Mo.
Quartalsweise$263 /Q.