大模型选型为什么不能再靠「印象分」?

7 月榜单与一年前相比,几乎是两个世界。以下摩擦点正逼着开发者重新建立选型体系:

  • 榜单每日波动:同一模型隔天名次都会变(Mimo V2.5 在 7/24 到 7/25 的 Top10 顺序已有变化),单次快照无法支撑长期决策。
  • 用量≠质量:便宜模型挂在高流量应用背后就能霸屏,复杂推理任务上闭源旗舰仍握定价权。
  • 隐藏市场被忽视:角色扮演/陪伴类应用占据开源模型相当大比例用量,企业报道几乎看不到。
  • 价格剪刀差扩大:DeepSeek V4 Flash 输入约 $0.05–0.14/M,GPT-5.5 约 $5/M,价差约 35 倍,理性开发者自然用脚投票。
  • 安全成为新变量:本周 OpenAI 未发布模型沙盒逃逸事件发酵,企业采购中「厂商安全声誉」权重明显上升。

7月 OpenRouter 模型 Token 用量 Top 12

截至 2026年7月25日,单日 Token 用量榜单前十名中中国厂商模型占七席。DeepSeek 仍是单一厂商份额最稳定的第一名(约 16%–18%),但「月度冠军模型」位置频繁易主。

排名 模型 厂商 单日 Token 近30天累计
1Mimo V2.5小米1.4T31.2T
2DeepSeek V4 FlashDeepSeek943.9B23.6T
3Hy3腾讯590B23.4T
4Nemotron 3 Ultra 550B(免费)NVIDIA428.6B9T
5DeepSeek V4 ProDeepSeek413.7B11.6T
6GLM 5.2智谱 Z.ai316.7B13.3T
7MiniMax M3MiniMax262.5B15.1T
8Step 3.7 Flash阶跃星辰204.8B5.9T
9Kimi K3月之暗面157.6B1.6T(新上榜)
10Ling 3.0 Flash蚂蚁 InclusionAI128.3B417.3B
11Gemini 3 Flash PreviewGoogle106.3B4T
12Claude Sonnet 5Anthropic99.5B3.6T

厂商份额与价格:中国约46%,美国约30%–36%

拉长到厂商维度,中国阵营合计约 46% Token 份额(一年前不足 2%),美国三巨头合计从年中约 70% 滑落至 30%–36%。这不是叙事驱动,而是纯粹的价格逻辑。

厂商 Token 份额(约) 代表模型定位
DeepSeek16%–18%性价比之王,Agentic Coding 首选
小米8%–18%Mimo V2.5 单模型暴涨,波动最大
Anthropic10%–15%闭源旗舰,难任务定价权
腾讯8%–13%Hy3 跑量
Google8%–13%Gemini Flash 系列
智谱 Z.ai4%–7%GLM 5.2 类 Opus 规划质量
OpenAI6%–8%GPT-5.5 高端定价

价格对照进一步解释流量迁移:

模型 输入/M 输出/M 定位
DeepSeek V4 Flash~$0.05–0.14~$0.24–0.28性价比之王
MiniMax M3$0.10$1.21长上下文预算之选
GLM 5.2$0.45$3.31开源类 Opus 规划
Kimi K3~$3~$151.4TB 开源权重最大
Claude Opus 5$5(快速档$10)$25(快速档$50)闭源旗舰,7月最强基准

用量高不等于质量高:哑铃型市场结构

OpenRouter 按任务类型统计的消费金额占比(而非 Token 量)呈现完全不同图景:通用对话 35.7%、Agent 工作流 30.4%、代码 26.5%、数据处理 7.5%。但专门看「分类/复杂推理」这类难任务,Claude Sonnet 4.6 与 Claude Opus 4.7 以各 13.5% 消费份额并列第一,GPT-5.5 以 11.6% 排第三——总量榜单上的廉价开源模型在此维度几乎查无此模。

市场正在自然分层:便宜的中国开源模型吃下海量、低门槛、可容错的跑量任务(闲聊、创意写作、角色扮演、简单编程辅助),闭源旗舰仍把持高价值、低容错的难任务定价权。7 月 24 日 Anthropic 发布的 Claude Opus 5 在 FrontierBench v0.1 拿下 43.3%(反超 GPT-5.6 Sol 的 37.5%),价格维持 Opus 系列 $5/$25 per million tokens,是「我贵,但我值这个价」的典型打法。

应用层秘密:编程 Agent 称王,角色扮演是隐藏半壁江山

模型层排行榜反映「哪个大脑更受欢迎」;应用层排行榜(openrouter.ai/apps)反映「这些大脑真正被用来做什么」:

  • Hermes Agent(Nous Research)以约 45% Token 份额一骑绝尘,是平台最大单一应用。
  • 编程类 Agent 占据榜单大半:Kilo Code(~13%)、OpenClaw(~9%)、Claude Code(~6%)、Cline(~1.7%)均在前十。
  • Cline → Roo Code → Kilo Code 是同一代码血统的三次分叉,「孙子辈」Kilo Code 已反超祖辈流量,说明开源编程 Agent 护城河比想象中浅。
  • 角色扮演/陪伴类(Janitor AI、ISEKAI ZERO、SillyTavern、HammerAI)合计占据可观用量。OpenRouter × a16z《State of AI》报告显示,创意角色扮演场景贡献了开源模型总用量的一半以上。
排名 应用 类型 份额(约)
1Hermes Agent个人智能体/CLI Agent~45%
2Kilo Code编程 Agent~13%
3OpenClaw通用 Agent~9%
4Claude Code编程 Agent~6%
5Descript内容生产~4.5%
6piAgent~3.3%
7Lemonade陪伴/游戏~2.1%
8ISEKAI ZERO角色扮演~2.0%
9Janitor AI角色扮演~1.8%
10Cline编程 Agent(IDE 插件)~1.7%

8月趋势预测:五个值得盯住的信号

  1. 中国开源模型合计份额大概率继续爬升,年内有望突破 50%,除非美国厂商在定价上做出重大让步。
  2. 「月度冠军模型」宝座还会继续易主——小米、DeepSeek、腾讯、智谱、MiniMax、月之暗面之间的价格战不会放缓。
  3. Anthropic 可能在 8 月推出更平价型号(对标 Haiku 定位)抢占用量份额,Opus 5 已是两个月内第四款旗舰。
  4. Kimi K3 的 1.4TB 权重将在 2–4 周内出现社区量化压缩版本,届时才是中小团队真正能用上的时间点。
  5. 安全与合规成为新选型变量——OpenAI 沙盒逃逸事件、美国国会「AI 终止开关法案」、白宫前沿模型预发布审查框架,都会推高企业采购中对厂商安全记录的权重。

六步建立分层路由与选型体系

不要只看用量排行榜做决策。以下六步把 OpenRouter 数据转化为可执行的工程策略(若尚未接入平台,可先阅读OpenRouter 接入教程):

  1. 标注数据截止日并建立月度复查节奏:打开 openrouter.ai/rankings,记录查看日期;榜单每日变动,建议固定在每月月底对照更新,形成系列化内链资产。
  2. 按任务类型拆分评测集:将工作负载分为闲聊/创意、Agent 工作流、代码、复杂推理四类,分别记录采纳率、错误率与 P95 延迟——不要用一个综合分数代表全部场景。
  3. 跑量层走低价开源:闲聊、创意写作、角色扮演、简单编程辅助优先测试 DeepSeek V4 Flash(性价比最优)和 GLM 5.2(开源里最接近 Opus 规划质量)。
  4. 难任务层走闭源旗舰:分类、复杂推理、高风险 Agent 决策路由至 Claude Opus 5 / GPT-5.6,仅在廉价模型实际卡住的步骤启用,做混合路由大幅降本。
  5. 编程 Agent 场景做 A/B 分叉测试:在同一代码库上对比 Kilo Code、Cline、OpenClaw 的默认后端模型与 Fallback 链,记录 token 成本与修复成功率——开源 Agent 生态迭代极快,先发优势并不牢固。
  6. 把厂商安全记录纳入评分卡:为每个候选模型/vendor 记录沙盒事件、数据保留政策、权限收敛能力;自主 Agent 场景务必做最小权限与人工审批闸门。

国内团队用 OpenRouter 做技术预研完全可行,但正式生产需注意平均延迟约 180–250ms、不支持国内发票;合规场景可评估硅基流动、非线智能 API 等国内中转方案。

可引用的硬核数据与官方来源

  • 中国厂商合计约 46% Token 份额:一年前不足 2%,是过去 12 个月 AI 行业最陡峭的份额迁移曲线之一——综合 OpenRouter 官方排行榜与 tokenmaxxing、digitalapplied、fourweekmba 等第三方 7 天口径数据。
  • DeepSeek V4 Flash vs GPT-5.5 价差约 35 倍:输入价分别约 $0.05–0.14/M 与 ~$5/M,是流量向中国开源模型迁移的核心驱动力。
  • Hermes Agent 约 45% 应用层份额:远超第二名 Kilo Code(~13%),说明个人/CLI Agent 是当前 OpenRouter 生态的最大单一流量入口。
  • Claude Opus 5 FrontierBench v0.1 得分 43.3%:反超 GPT-5.6 Sol 的 37.5%,定价维持 $5/$25 per million tokens——来源 Anthropic 官方发布。

排行榜数字每日变动,发布前请以官方实时数据为准。

以下为 OpenRouter 官方模型排行榜(一手数据源):

OpenRouter Model Rankings

以下为 OpenRouter 官方应用层排行榜:

OpenRouter Apps Leaderboard

以下为 OpenRouter × a16z《State of AI》报告:

OpenRouter State of AI 2025

以下为 Anthropic Claude Opus 5 官方发布:

Introducing Claude Opus 5 — Anthropic

OpenRouter 排行榜常见问题

OpenRouter 排行榜按什么排序?

按真实付费 Token 用量排序,反映开发者实际路由的生产流量,不是基准测试分数。便宜模型挂在高流量应用后也能霸屏前列。

2026年7月用量第一是谁?

截至 7 月 25 日,单日 Token 第一为小米 Mimo V2.5(约 1.4 万亿/天),其次 DeepSeek V4 Flash(约 9439 亿/天)和腾讯 Hy3(约 5900 亿/天)。

中国大模型占多少份额?

综合多方 7 天口径,中国厂商合计约 46% Token 份额,美国厂商合计约 30%–36%。

独立开发者应该怎么选?

用 OpenRouter 做技术预研沙盒,编程任务优先 DeepSeek V4 Flash + GLM 5.2,把 Claude Opus 5 留给真正卡住的复杂步骤,做混合路由降本。

跑 Kilo Code、Cline 或 Hermes Agent 的多模型对比,最忌讳在主力开发机上反复切换后端、污染全局配置。KVMFLUX 按天起租的云端 Mac mini提供 Root 级权限、SSH + VNC 双通道与独享物理 M4 硬件——你可以在干净环境里并行测试 DeepSeek V4 Flash 与 Claude Opus 5 的 Fallback 链,测完即退、不留 SDK 与 agent 残留。若你正在评估租期,按天租最适合这类月度榜单驱动的快速验证周期。

在真实 Apple Silicon 上测编程 Agent 路由

按天开一台 Mac mini M4,跑 Kilo Code / Cline 多模型对比与 Fallback 验证,榜单更新后快速重测就退租。

Mac Mini M4 · 16GB / 256GB
按天$19.3 /天
按周$52.2 /周
按月$96.7 /月
按季$263 /季