Pourquoi l'intuition ne suffit plus pour choisir un modèle
Le tableau de juillet 2026 ne ressemble en rien à celui d'il y a un an. Cinq frictions poussent les équipes à repenser leur sélection :
- Volatilité quotidienne : Mimo V2.5 a changé de place plusieurs fois entre le 24 et le 25 juillet. Un instantané n'est pas une stratégie.
- Usage ≠ qualité : Un modèle bon marché branché sur une app grand public peut devancer un modèle plus capable réservé aux 10 % de tâches les plus exigeantes.
- Demande invisible : Les apps de roleplay et de compagnon génèrent un volume open-model que la couverture enterprise ignore presque toujours.
- Écart de prix ~35× : DeepSeek V4 Flash : ~$0,05–0,14/M tokens input ; GPT-5.5 : ~$5/M. La migration de trafic s'explique par l'arithmétique tarifaire.
- Sécurité dans la scorecard : Les fuites sandbox d'OpenAI et la législation US sur les « kill switches » IA placent la traçabilité des fournisseurs au centre des revues d'achat.
Top 12 modèles par volume quotidien (25 juillet)
Sept des dix premiers modèles proviennent de labs chinois. DeepSeek reste le fournisseur #1 le plus stable (16–18 % de parts), mais le titre de « modèle du mois » tourne en permanence.
| Rang | Modèle | Fournisseur | Tokens/jour | Total 30 j |
|---|---|---|---|---|
| 1 | Mimo V2.5 | Xiaomi | 1,4 T | 31,2 T |
| 2 | DeepSeek V4 Flash | DeepSeek | 943,9 Md | 23,6 T |
| 3 | Hy3 | Tencent | 590 Md | 23,4 T |
| 4 | Nemotron 3 Ultra 550B (free) | NVIDIA | 428,6 Md | 9 T |
| 5 | DeepSeek V4 Pro | DeepSeek | 413,7 Md | 11,6 T |
| 6 | GLM 5.2 | Z.ai | 316,7 Md | 13,3 T |
| 7 | MiniMax M3 | MiniMax | 262,5 Md | 15,1 T |
| 8 | Step 3.7 Flash | StepFun | 204,8 Md | 5,9 T |
| 9 | Kimi K3 | Moonshot AI | 157,6 Md | 1,6 T (nouvelle entrée) |
| 10 | Ling 3.0 Flash | InclusionAI | 128,3 Md | 417,3 Md |
| 11 | Gemini 3 Flash Preview | 106,3 Md | 4 T | |
| 12 | Claude Sonnet 5 | Anthropic | 99,5 Md | 3,6 T |
Parts fournisseurs et tarifs : Chine ~46 %, États-Unis ~30–36 %
Les labs d'origine chinoise représentent ~46 % du volume identifié — contre moins de 2 % il y a un an. Les modèles US (OpenAI, Anthropic, Google) sont passés de ~70 % (mi-2025) à ~30–36 %. C'est une équation de prix, pas un récit géopolitique.
| Fournisseur | Part (approx.) | Positionnement |
|---|---|---|
| DeepSeek | 16–18 % | Meilleur rapport qualité-prix ; default agentic coding |
| Xiaomi | 8–18 % | Surge Mimo V2.5 ; volatilité maximale |
| Anthropic | 10–15 % | Frontier fermé ; pricing power sur tâches difficiles |
| Tencent | 8–13 % | Stratégie volume Hy3 |
| 8–13 % | Famille Gemini Flash | |
| Z.ai | 4–7 % | GLM 5.2 — planning open-weight de classe Opus |
| OpenAI | 6–8 % | Tier premium GPT-5.5 |
Comparaison tarifaire input (USD par million de tokens) :
| Modèle | Input/M | Output/M | Rôle |
|---|---|---|---|
| DeepSeek V4 Flash | ~$0,05–0,14 | ~$0,24–0,28 | Leader value |
| MiniMax M3 | $0,10 | $1,21 | Long contexte budget |
| GLM 5.2 | $0,45 | $3,31 | Planning open Opus-style |
| Kimi K3 | ~$3 | ~$15 | Plus gros poids ouverts (1,4 TB) |
| Claude Opus 5 | $5 (fast $10) | $25 (fast $50) | Flagship fermé ; lead juillet |
Le marché en haltère : rang d'usage et profil de capacité divergent
La répartition des dépenses OpenRouter par catégorie raconte une autre histoire : chat général 35,7 %, workflows agentiques 30,4 %, code 26,5 %, data 7,5 %. Dans la catégorie la plus exigeante — classification/reasoning complexe — Claude Sonnet 4.6 et Claude Opus 4.7 se partagent 13,5 % des dépenses chacun, GPT-5.5 est troisième à 11,6 %. Les modèles open bon marché qui dominent les charts de volume y sont quasi absents.
Le marché se scinde : les modèles open-weight chinois absorbent les workloads tolérants aux erreurs (chat, créatif, roleplay, code routinier), tandis que les frontier fermés défendent leur pricing sur les tâches à faible marge d'erreur. Claude Opus 5 (24 juillet) a atteint 43,3 % sur FrontierBench v0.1 contre 37,5 % pour GPT-5.6 Sol — à un tarif Opus inchangé ($5/$25 par million de tokens).
Leaderboard apps : les agents de code et la moitié roleplay du marché
Les classements modèles montrent quel « cerveau » est routé. Le leaderboard apps montre à quoi il sert :
- Hermes Agent (Nous Research) : ~45 % des tokens apps — la plus grande app de la plateforme.
- Les agents de code occupent le reste : Kilo Code (~13 %), OpenClaw (~9 %), Claude Code (~6 %), Cline (~1,7 %).
- Cline → Roo Code → Kilo Code — trois générations d'une même lignée open source ; le fork le plus jeune mène désormais le volume familial.
- Les apps roleplay/compagnon (Janitor AI, ISEKAI ZERO, SillyTavern, HammerAI) mobilisent un volume sérieux. Le rapport OpenRouter × a16z State of AI estime le roleplay créatif à plus de la moitié de l'usage open-model.
| Rang | App | Catégorie | Part (approx.) |
|---|---|---|---|
| 1 | Hermes Agent | Agent personnel / CLI | ~45 % |
| 2 | Kilo Code | Agent de code | ~13 % |
| 3 | OpenClaw | Agent général | ~9 % |
| 4 | Claude Code | Agent de code | ~6 % |
| 5 | Descript | Production de contenu | ~4,5 % |
| 6 | pi | Agent | ~3,3 % |
| 7 | Lemonade | Compagnon / gaming | ~2,1 % |
| 8 | ISEKAI ZERO | Roleplay | ~2,0 % |
| 9 | Janitor AI | Roleplay | ~1,8 % |
| 10 | Cline | Agent de code (IDE) | ~1,7 % |
Perspectives août : cinq signaux à suivre
- La part combinée open-weight chinoise devrait approcher 50 % — sauf baisse tarifaire majeure d'un fournisseur US.
- Le « modèle du mois » continuera de tourner entre Xiaomi, DeepSeek, Tencent, Z.ai, MiniMax et Moonshot.
- Anthropic pourrait lancer un tier volume moins cher — Opus 5 est déjà leur quatrième flagship en moins de deux mois.
- Kimi K3 (1,4 TB de poids ouverts) — quantisation communautaire probable sous 2–4 semaines avant un déploiement pratique pour les petites équipes.
- Sécurité et gouvernance deviennent des critères formels — fuites sandbox, cadres de revue pré-release et historique des fournisseurs entrent dans les scorecards enterprise.
Six étapes pour construire un routage modèle en couches
Ne sélectionnez pas un modèle par son rang d'usage seul. Ces six étapes transforment les données OpenRouter en politique d'ingénierie (première fois sur la plateforme ? Consultez notre guide OpenRouter API) :
- Horodater les données et planifier une revue mensuelle : Ouvrir openrouter.ai/rankings, noter la date ; les rangs bougent chaque jour.
- Segmenter les jeux d'évaluation par type de tâche : Chat/créatif, agentique, code, reasoning complexe — taux d'acceptation, erreurs, latence P95 par bucket.
- Router le volume vers les modèles open bon marché : DeepSeek V4 Flash pour l'efficacité coût, GLM 5.2 pour le planning open-weight sur tâches tolérantes.
- Réserver les frontier fermés aux étapes difficiles : Classification, reasoning complexe, décisions agent à enjeu → Claude Opus 5 / GPT-5.6 — uniquement où les modèles moins chers échouent.
- A/B des agents de code sur le même dépôt : Comparer Kilo Code, Cline et OpenClaw — backends par défaut et chaînes de fallback ; journaliser coût token et taux de correction.
- Intégrer la sécurité fournisseur à la scorecard : Incidents sandbox, rétention des données, périmètres de permissions ; flux agentiques avec moindre privilège et gates d'approbation humaine.
OpenRouter excelle pour prototyper derrière une clé API. En production, testez vos propres exigences de latence et de conformité — le routage régional et la facturation varient selon les équipes.
Chiffres vérifiables et sources primaires
- ~46 % de parts chinoises : De moins de 2 % il y a un an — l'une des migrations de parts les plus abruptes des 12 derniers mois, croisée avec les données officielles OpenRouter.
- Écart input ~35× (DeepSeek V4 Flash vs GPT-5.5) : ~$0,05–0,14/M contre ~$5/M — moteur principal de la migration de trafic.
- Hermes Agent ~45 % de la couche apps : Largement devant #2 Kilo Code (~13 %) — les agents personnels/CLI sont le plus grand point d'entrée trafic.
- Claude Opus 5 FrontierBench v0.1 : 43,3 % : Devant GPT-5.6 Sol (37,5 %) à tarif Opus inchangé — lancement Anthropic du 24 juillet.
Les classements évoluent quotidiennement. Vérifiez les chiffres avant de les citer.
Source primaire — classements modèles OpenRouter :
Source primaire — leaderboard apps OpenRouter :
Rapport OpenRouter × a16z State of AI :
Lancement Anthropic Claude Opus 5 :
Introducing Claude Opus 5 — Anthropic
FAQ sur les classements OpenRouter
Sur quoi se base le classement ?
Volume réel de tokens payés en production — pas les benchmarks. Un modèle bon marché derrière une app virale peut mener le chart sans être optimal pour votre workload.
Qui a mené en juillet 2026 ?
Au 25 juillet : Mimo V2.5 de Xiaomi à ~1,4 T tokens/jour, puis DeepSeek V4 Flash (~943,9 Md/jour) et Hy3 de Tencent (~590 Md/jour).
Quelle part pour les modèles chinois ?
Environ 46 % de parts combinées chinoises contre ~30–36 % pour les modèles US, selon estimations sur 7 jours.
Que faire côté développeur indépendant ?
Utiliser OpenRouter comme bac à sable : DeepSeek V4 Flash + GLM 5.2 pour le code, Claude Opus 5 pour les étapes où les modèles moins chers échouent — le routage hybride réduit fortement les coûts.
Comparer Kilo Code, Cline ou Hermes Agent sur votre machine de travail pollue la config globale et l'état des agents. Un Mac mini cloud KVMFLUX offre un accès root, SSH + VNC et du hardware M4 physique dédié à la location journalière — testez vos chaînes DeepSeek V4 Flash / Claude Opus 5 dans un environnement propre, puis rendez la machine. Pour choisir une durée de location, la facturation journalière convient le mieux à ces sprints de validation mensuels pilotés par les classements.
Tester le routage agent sur du vrai Apple Silicon
Louez un Mac mini M4 à la journée, lancez vos A/B Kilo Code / Cline et validez vos fallbacks — rendez la machine quand le prochain drop de classement arrive.