Pourquoi l'intuition ne suffit plus pour choisir un modèle

Le tableau de juillet 2026 ne ressemble en rien à celui d'il y a un an. Cinq frictions poussent les équipes à repenser leur sélection :

  • Volatilité quotidienne : Mimo V2.5 a changé de place plusieurs fois entre le 24 et le 25 juillet. Un instantané n'est pas une stratégie.
  • Usage ≠ qualité : Un modèle bon marché branché sur une app grand public peut devancer un modèle plus capable réservé aux 10 % de tâches les plus exigeantes.
  • Demande invisible : Les apps de roleplay et de compagnon génèrent un volume open-model que la couverture enterprise ignore presque toujours.
  • Écart de prix ~35× : DeepSeek V4 Flash : ~$0,05–0,14/M tokens input ; GPT-5.5 : ~$5/M. La migration de trafic s'explique par l'arithmétique tarifaire.
  • Sécurité dans la scorecard : Les fuites sandbox d'OpenAI et la législation US sur les « kill switches » IA placent la traçabilité des fournisseurs au centre des revues d'achat.

Top 12 modèles par volume quotidien (25 juillet)

Sept des dix premiers modèles proviennent de labs chinois. DeepSeek reste le fournisseur #1 le plus stable (16–18 % de parts), mais le titre de « modèle du mois » tourne en permanence.

Rang Modèle Fournisseur Tokens/jour Total 30 j
1Mimo V2.5Xiaomi1,4 T31,2 T
2DeepSeek V4 FlashDeepSeek943,9 Md23,6 T
3Hy3Tencent590 Md23,4 T
4Nemotron 3 Ultra 550B (free)NVIDIA428,6 Md9 T
5DeepSeek V4 ProDeepSeek413,7 Md11,6 T
6GLM 5.2Z.ai316,7 Md13,3 T
7MiniMax M3MiniMax262,5 Md15,1 T
8Step 3.7 FlashStepFun204,8 Md5,9 T
9Kimi K3Moonshot AI157,6 Md1,6 T (nouvelle entrée)
10Ling 3.0 FlashInclusionAI128,3 Md417,3 Md
11Gemini 3 Flash PreviewGoogle106,3 Md4 T
12Claude Sonnet 5Anthropic99,5 Md3,6 T

Parts fournisseurs et tarifs : Chine ~46 %, États-Unis ~30–36 %

Les labs d'origine chinoise représentent ~46 % du volume identifié — contre moins de 2 % il y a un an. Les modèles US (OpenAI, Anthropic, Google) sont passés de ~70 % (mi-2025) à ~30–36 %. C'est une équation de prix, pas un récit géopolitique.

Fournisseur Part (approx.) Positionnement
DeepSeek16–18 %Meilleur rapport qualité-prix ; default agentic coding
Xiaomi8–18 %Surge Mimo V2.5 ; volatilité maximale
Anthropic10–15 %Frontier fermé ; pricing power sur tâches difficiles
Tencent8–13 %Stratégie volume Hy3
Google8–13 %Famille Gemini Flash
Z.ai4–7 %GLM 5.2 — planning open-weight de classe Opus
OpenAI6–8 %Tier premium GPT-5.5

Comparaison tarifaire input (USD par million de tokens) :

Modèle Input/M Output/M Rôle
DeepSeek V4 Flash~$0,05–0,14~$0,24–0,28Leader value
MiniMax M3$0,10$1,21Long contexte budget
GLM 5.2$0,45$3,31Planning open Opus-style
Kimi K3~$3~$15Plus gros poids ouverts (1,4 TB)
Claude Opus 5$5 (fast $10)$25 (fast $50)Flagship fermé ; lead juillet

Le marché en haltère : rang d'usage et profil de capacité divergent

La répartition des dépenses OpenRouter par catégorie raconte une autre histoire : chat général 35,7 %, workflows agentiques 30,4 %, code 26,5 %, data 7,5 %. Dans la catégorie la plus exigeante — classification/reasoning complexe — Claude Sonnet 4.6 et Claude Opus 4.7 se partagent 13,5 % des dépenses chacun, GPT-5.5 est troisième à 11,6 %. Les modèles open bon marché qui dominent les charts de volume y sont quasi absents.

Le marché se scinde : les modèles open-weight chinois absorbent les workloads tolérants aux erreurs (chat, créatif, roleplay, code routinier), tandis que les frontier fermés défendent leur pricing sur les tâches à faible marge d'erreur. Claude Opus 5 (24 juillet) a atteint 43,3 % sur FrontierBench v0.1 contre 37,5 % pour GPT-5.6 Sol — à un tarif Opus inchangé ($5/$25 par million de tokens).

Leaderboard apps : les agents de code et la moitié roleplay du marché

Les classements modèles montrent quel « cerveau » est routé. Le leaderboard apps montre à quoi il sert :

  • Hermes Agent (Nous Research) : ~45 % des tokens apps — la plus grande app de la plateforme.
  • Les agents de code occupent le reste : Kilo Code (~13 %), OpenClaw (~9 %), Claude Code (~6 %), Cline (~1,7 %).
  • Cline → Roo Code → Kilo Code — trois générations d'une même lignée open source ; le fork le plus jeune mène désormais le volume familial.
  • Les apps roleplay/compagnon (Janitor AI, ISEKAI ZERO, SillyTavern, HammerAI) mobilisent un volume sérieux. Le rapport OpenRouter × a16z State of AI estime le roleplay créatif à plus de la moitié de l'usage open-model.
Rang App Catégorie Part (approx.)
1Hermes AgentAgent personnel / CLI~45 %
2Kilo CodeAgent de code~13 %
3OpenClawAgent général~9 %
4Claude CodeAgent de code~6 %
5DescriptProduction de contenu~4,5 %
6piAgent~3,3 %
7LemonadeCompagnon / gaming~2,1 %
8ISEKAI ZERORoleplay~2,0 %
9Janitor AIRoleplay~1,8 %
10ClineAgent de code (IDE)~1,7 %

Perspectives août : cinq signaux à suivre

  1. La part combinée open-weight chinoise devrait approcher 50 % — sauf baisse tarifaire majeure d'un fournisseur US.
  2. Le « modèle du mois » continuera de tourner entre Xiaomi, DeepSeek, Tencent, Z.ai, MiniMax et Moonshot.
  3. Anthropic pourrait lancer un tier volume moins cher — Opus 5 est déjà leur quatrième flagship en moins de deux mois.
  4. Kimi K3 (1,4 TB de poids ouverts) — quantisation communautaire probable sous 2–4 semaines avant un déploiement pratique pour les petites équipes.
  5. Sécurité et gouvernance deviennent des critères formels — fuites sandbox, cadres de revue pré-release et historique des fournisseurs entrent dans les scorecards enterprise.

Six étapes pour construire un routage modèle en couches

Ne sélectionnez pas un modèle par son rang d'usage seul. Ces six étapes transforment les données OpenRouter en politique d'ingénierie (première fois sur la plateforme ? Consultez notre guide OpenRouter API) :

  1. Horodater les données et planifier une revue mensuelle : Ouvrir openrouter.ai/rankings, noter la date ; les rangs bougent chaque jour.
  2. Segmenter les jeux d'évaluation par type de tâche : Chat/créatif, agentique, code, reasoning complexe — taux d'acceptation, erreurs, latence P95 par bucket.
  3. Router le volume vers les modèles open bon marché : DeepSeek V4 Flash pour l'efficacité coût, GLM 5.2 pour le planning open-weight sur tâches tolérantes.
  4. Réserver les frontier fermés aux étapes difficiles : Classification, reasoning complexe, décisions agent à enjeu → Claude Opus 5 / GPT-5.6 — uniquement où les modèles moins chers échouent.
  5. A/B des agents de code sur le même dépôt : Comparer Kilo Code, Cline et OpenClaw — backends par défaut et chaînes de fallback ; journaliser coût token et taux de correction.
  6. Intégrer la sécurité fournisseur à la scorecard : Incidents sandbox, rétention des données, périmètres de permissions ; flux agentiques avec moindre privilège et gates d'approbation humaine.

OpenRouter excelle pour prototyper derrière une clé API. En production, testez vos propres exigences de latence et de conformité — le routage régional et la facturation varient selon les équipes.

Chiffres vérifiables et sources primaires

  • ~46 % de parts chinoises : De moins de 2 % il y a un an — l'une des migrations de parts les plus abruptes des 12 derniers mois, croisée avec les données officielles OpenRouter.
  • Écart input ~35× (DeepSeek V4 Flash vs GPT-5.5) : ~$0,05–0,14/M contre ~$5/M — moteur principal de la migration de trafic.
  • Hermes Agent ~45 % de la couche apps : Largement devant #2 Kilo Code (~13 %) — les agents personnels/CLI sont le plus grand point d'entrée trafic.
  • Claude Opus 5 FrontierBench v0.1 : 43,3 % : Devant GPT-5.6 Sol (37,5 %) à tarif Opus inchangé — lancement Anthropic du 24 juillet.

Les classements évoluent quotidiennement. Vérifiez les chiffres avant de les citer.

Source primaire — classements modèles OpenRouter :

OpenRouter Model Rankings

Source primaire — leaderboard apps OpenRouter :

OpenRouter Apps Leaderboard

Rapport OpenRouter × a16z State of AI :

OpenRouter State of AI 2025

Lancement Anthropic Claude Opus 5 :

Introducing Claude Opus 5 — Anthropic

FAQ sur les classements OpenRouter

Sur quoi se base le classement ?

Volume réel de tokens payés en production — pas les benchmarks. Un modèle bon marché derrière une app virale peut mener le chart sans être optimal pour votre workload.

Qui a mené en juillet 2026 ?

Au 25 juillet : Mimo V2.5 de Xiaomi à ~1,4 T tokens/jour, puis DeepSeek V4 Flash (~943,9 Md/jour) et Hy3 de Tencent (~590 Md/jour).

Quelle part pour les modèles chinois ?

Environ 46 % de parts combinées chinoises contre ~30–36 % pour les modèles US, selon estimations sur 7 jours.

Que faire côté développeur indépendant ?

Utiliser OpenRouter comme bac à sable : DeepSeek V4 Flash + GLM 5.2 pour le code, Claude Opus 5 pour les étapes où les modèles moins chers échouent — le routage hybride réduit fortement les coûts.

Comparer Kilo Code, Cline ou Hermes Agent sur votre machine de travail pollue la config globale et l'état des agents. Un Mac mini cloud KVMFLUX offre un accès root, SSH + VNC et du hardware M4 physique dédié à la location journalière — testez vos chaînes DeepSeek V4 Flash / Claude Opus 5 dans un environnement propre, puis rendez la machine. Pour choisir une durée de location, la facturation journalière convient le mieux à ces sprints de validation mensuels pilotés par les classements.

Tester le routage agent sur du vrai Apple Silicon

Louez un Mac mini M4 à la journée, lancez vos A/B Kilo Code / Cline et validez vos fallbacks — rendez la machine quand le prochain drop de classement arrive.

Mac Mini M4 · 16GB / 256GB
Journalier$19.3 /jour
Hebdomadaire$52.2 /sem.
Mensuel$96.7 /mois
Trimestriel$263 /trim.