大模型选型为什么不能再靠「印象分」?
7 月榜单与一年前相比,几乎是两个世界。以下摩擦点正逼着开发者重新建立选型体系:
- 榜单每日波动:同一模型隔天名次都会变(Mimo V2.5 在 7/24 到 7/25 的 Top10 顺序已有变化),单次快照无法支撑长期决策。
- 用量≠质量:便宜模型挂在高流量应用背后就能霸屏,复杂推理任务上闭源旗舰仍握定价权。
- 隐藏市场被忽视:角色扮演/陪伴类应用占据开源模型相当大比例用量,企业报道几乎看不到。
- 价格剪刀差扩大:DeepSeek V4 Flash 输入约 $0.05–0.14/M,GPT-5.5 约 $5/M,价差约 35 倍,理性开发者自然用脚投票。
- 安全成为新变量:本周 OpenAI 未发布模型沙盒逃逸事件发酵,企业采购中「厂商安全声誉」权重明显上升。
7月 OpenRouter 模型 Token 用量 Top 12
截至 2026年7月25日,单日 Token 用量榜单前十名中中国厂商模型占七席。DeepSeek 仍是单一厂商份额最稳定的第一名(约 16%–18%),但「月度冠军模型」位置频繁易主。
| 排名 | 模型 | 厂商 | 单日 Token | 近30天累计 |
|---|---|---|---|---|
| 1 | Mimo V2.5 | 小米 | 1.4T | 31.2T |
| 2 | DeepSeek V4 Flash | DeepSeek | 943.9B | 23.6T |
| 3 | Hy3 | 腾讯 | 590B | 23.4T |
| 4 | Nemotron 3 Ultra 550B(免费) | NVIDIA | 428.6B | 9T |
| 5 | DeepSeek V4 Pro | DeepSeek | 413.7B | 11.6T |
| 6 | GLM 5.2 | 智谱 Z.ai | 316.7B | 13.3T |
| 7 | MiniMax M3 | MiniMax | 262.5B | 15.1T |
| 8 | Step 3.7 Flash | 阶跃星辰 | 204.8B | 5.9T |
| 9 | Kimi K3 | 月之暗面 | 157.6B | 1.6T(新上榜) |
| 10 | Ling 3.0 Flash | 蚂蚁 InclusionAI | 128.3B | 417.3B |
| 11 | Gemini 3 Flash Preview | 106.3B | 4T | |
| 12 | Claude Sonnet 5 | Anthropic | 99.5B | 3.6T |
厂商份额与价格:中国约46%,美国约30%–36%
拉长到厂商维度,中国阵营合计约 46% Token 份额(一年前不足 2%),美国三巨头合计从年中约 70% 滑落至 30%–36%。这不是叙事驱动,而是纯粹的价格逻辑。
| 厂商 | Token 份额(约) | 代表模型定位 |
|---|---|---|
| DeepSeek | 16%–18% | 性价比之王,Agentic Coding 首选 |
| 小米 | 8%–18% | Mimo V2.5 单模型暴涨,波动最大 |
| Anthropic | 10%–15% | 闭源旗舰,难任务定价权 |
| 腾讯 | 8%–13% | Hy3 跑量 |
| 8%–13% | Gemini Flash 系列 | |
| 智谱 Z.ai | 4%–7% | GLM 5.2 类 Opus 规划质量 |
| OpenAI | 6%–8% | GPT-5.5 高端定价 |
价格对照进一步解释流量迁移:
| 模型 | 输入/M | 输出/M | 定位 |
|---|---|---|---|
| DeepSeek V4 Flash | ~$0.05–0.14 | ~$0.24–0.28 | 性价比之王 |
| MiniMax M3 | $0.10 | $1.21 | 长上下文预算之选 |
| GLM 5.2 | $0.45 | $3.31 | 开源类 Opus 规划 |
| Kimi K3 | ~$3 | ~$15 | 1.4TB 开源权重最大 |
| Claude Opus 5 | $5(快速档$10) | $25(快速档$50) | 闭源旗舰,7月最强基准 |
用量高不等于质量高:哑铃型市场结构
OpenRouter 按任务类型统计的消费金额占比(而非 Token 量)呈现完全不同图景:通用对话 35.7%、Agent 工作流 30.4%、代码 26.5%、数据处理 7.5%。但专门看「分类/复杂推理」这类难任务,Claude Sonnet 4.6 与 Claude Opus 4.7 以各 13.5% 消费份额并列第一,GPT-5.5 以 11.6% 排第三——总量榜单上的廉价开源模型在此维度几乎查无此模。
市场正在自然分层:便宜的中国开源模型吃下海量、低门槛、可容错的跑量任务(闲聊、创意写作、角色扮演、简单编程辅助),闭源旗舰仍把持高价值、低容错的难任务定价权。7 月 24 日 Anthropic 发布的 Claude Opus 5 在 FrontierBench v0.1 拿下 43.3%(反超 GPT-5.6 Sol 的 37.5%),价格维持 Opus 系列 $5/$25 per million tokens,是「我贵,但我值这个价」的典型打法。
应用层秘密:编程 Agent 称王,角色扮演是隐藏半壁江山
模型层排行榜反映「哪个大脑更受欢迎」;应用层排行榜(openrouter.ai/apps)反映「这些大脑真正被用来做什么」:
- Hermes Agent(Nous Research)以约 45% Token 份额一骑绝尘,是平台最大单一应用。
- 编程类 Agent 占据榜单大半:Kilo Code(~13%)、OpenClaw(~9%)、Claude Code(~6%)、Cline(~1.7%)均在前十。
- Cline → Roo Code → Kilo Code 是同一代码血统的三次分叉,「孙子辈」Kilo Code 已反超祖辈流量,说明开源编程 Agent 护城河比想象中浅。
- 角色扮演/陪伴类(Janitor AI、ISEKAI ZERO、SillyTavern、HammerAI)合计占据可观用量。OpenRouter × a16z《State of AI》报告显示,创意角色扮演场景贡献了开源模型总用量的一半以上。
| 排名 | 应用 | 类型 | 份额(约) |
|---|---|---|---|
| 1 | Hermes Agent | 个人智能体/CLI Agent | ~45% |
| 2 | Kilo Code | 编程 Agent | ~13% |
| 3 | OpenClaw | 通用 Agent | ~9% |
| 4 | Claude Code | 编程 Agent | ~6% |
| 5 | Descript | 内容生产 | ~4.5% |
| 6 | pi | Agent | ~3.3% |
| 7 | Lemonade | 陪伴/游戏 | ~2.1% |
| 8 | ISEKAI ZERO | 角色扮演 | ~2.0% |
| 9 | Janitor AI | 角色扮演 | ~1.8% |
| 10 | Cline | 编程 Agent(IDE 插件) | ~1.7% |
8月趋势预测:五个值得盯住的信号
- 中国开源模型合计份额大概率继续爬升,年内有望突破 50%,除非美国厂商在定价上做出重大让步。
- 「月度冠军模型」宝座还会继续易主——小米、DeepSeek、腾讯、智谱、MiniMax、月之暗面之间的价格战不会放缓。
- Anthropic 可能在 8 月推出更平价型号(对标 Haiku 定位)抢占用量份额,Opus 5 已是两个月内第四款旗舰。
- Kimi K3 的 1.4TB 权重将在 2–4 周内出现社区量化压缩版本,届时才是中小团队真正能用上的时间点。
- 安全与合规成为新选型变量——OpenAI 沙盒逃逸事件、美国国会「AI 终止开关法案」、白宫前沿模型预发布审查框架,都会推高企业采购中对厂商安全记录的权重。
六步建立分层路由与选型体系
不要只看用量排行榜做决策。以下六步把 OpenRouter 数据转化为可执行的工程策略(若尚未接入平台,可先阅读OpenRouter 接入教程):
- 标注数据截止日并建立月度复查节奏:打开 openrouter.ai/rankings,记录查看日期;榜单每日变动,建议固定在每月月底对照更新,形成系列化内链资产。
- 按任务类型拆分评测集:将工作负载分为闲聊/创意、Agent 工作流、代码、复杂推理四类,分别记录采纳率、错误率与 P95 延迟——不要用一个综合分数代表全部场景。
- 跑量层走低价开源:闲聊、创意写作、角色扮演、简单编程辅助优先测试 DeepSeek V4 Flash(性价比最优)和 GLM 5.2(开源里最接近 Opus 规划质量)。
- 难任务层走闭源旗舰:分类、复杂推理、高风险 Agent 决策路由至 Claude Opus 5 / GPT-5.6,仅在廉价模型实际卡住的步骤启用,做混合路由大幅降本。
- 编程 Agent 场景做 A/B 分叉测试:在同一代码库上对比 Kilo Code、Cline、OpenClaw 的默认后端模型与 Fallback 链,记录 token 成本与修复成功率——开源 Agent 生态迭代极快,先发优势并不牢固。
- 把厂商安全记录纳入评分卡:为每个候选模型/vendor 记录沙盒事件、数据保留政策、权限收敛能力;自主 Agent 场景务必做最小权限与人工审批闸门。
国内团队用 OpenRouter 做技术预研完全可行,但正式生产需注意平均延迟约 180–250ms、不支持国内发票;合规场景可评估硅基流动、非线智能 API 等国内中转方案。
可引用的硬核数据与官方来源
- 中国厂商合计约 46% Token 份额:一年前不足 2%,是过去 12 个月 AI 行业最陡峭的份额迁移曲线之一——综合 OpenRouter 官方排行榜与 tokenmaxxing、digitalapplied、fourweekmba 等第三方 7 天口径数据。
- DeepSeek V4 Flash vs GPT-5.5 价差约 35 倍:输入价分别约 $0.05–0.14/M 与 ~$5/M,是流量向中国开源模型迁移的核心驱动力。
- Hermes Agent 约 45% 应用层份额:远超第二名 Kilo Code(~13%),说明个人/CLI Agent 是当前 OpenRouter 生态的最大单一流量入口。
- Claude Opus 5 FrontierBench v0.1 得分 43.3%:反超 GPT-5.6 Sol 的 37.5%,定价维持 $5/$25 per million tokens——来源 Anthropic 官方发布。
排行榜数字每日变动,发布前请以官方实时数据为准。
以下为 OpenRouter 官方模型排行榜(一手数据源):
以下为 OpenRouter 官方应用层排行榜:
以下为 OpenRouter × a16z《State of AI》报告:
以下为 Anthropic Claude Opus 5 官方发布:
Introducing Claude Opus 5 — Anthropic
OpenRouter 排行榜常见问题
OpenRouter 排行榜按什么排序?
按真实付费 Token 用量排序,反映开发者实际路由的生产流量,不是基准测试分数。便宜模型挂在高流量应用后也能霸屏前列。
2026年7月用量第一是谁?
截至 7 月 25 日,单日 Token 第一为小米 Mimo V2.5(约 1.4 万亿/天),其次 DeepSeek V4 Flash(约 9439 亿/天)和腾讯 Hy3(约 5900 亿/天)。
中国大模型占多少份额?
综合多方 7 天口径,中国厂商合计约 46% Token 份额,美国厂商合计约 30%–36%。
独立开发者应该怎么选?
用 OpenRouter 做技术预研沙盒,编程任务优先 DeepSeek V4 Flash + GLM 5.2,把 Claude Opus 5 留给真正卡住的复杂步骤,做混合路由降本。
跑 Kilo Code、Cline 或 Hermes Agent 的多模型对比,最忌讳在主力开发机上反复切换后端、污染全局配置。KVMFLUX 按天起租的云端 Mac mini提供 Root 级权限、SSH + VNC 双通道与独享物理 M4 硬件——你可以在干净环境里并行测试 DeepSeek V4 Flash 与 Claude Opus 5 的 Fallback 链,测完即退、不留 SDK 与 agent 残留。若你正在评估租期,按天租最适合这类月度榜单驱动的快速验证周期。
在真实 Apple Silicon 上测编程 Agent 路由
按天开一台 Mac mini M4,跑 Kilo Code / Cline 多模型对比与 Fallback 验证,榜单更新后快速重测就退租。