為什麼不能再靠「印象分」選大模型?
七月榜單與一年前相比,幾乎是兩個世界。以下摩擦點正迫使開發者重建選型體系:
- 榜單日更波動:Mimo V2.5 在 7/24 到 7/25 的 Top 10 順序已有變動,單次快照無法支撐長期決策。
- 用量不等於品質:低價模型掛在高流量應用背後就能霸榜,複雜推理任務上閉源旗艦仍握定價權。
- 隱藏市場被忽略:角色扮演/陪伴類應用佔開源模型相當比例用量,企業報導幾乎看不到。
- 價格剪刀差擴大:DeepSeek V4 Flash 輸入約 $0.05–0.14/M,GPT-5.5 約 $5/M,價差約 35 倍,理性開發者自然用腳投票。
- 安全成為新變數:本週 OpenAI 未發布模型沙盒逃逸事件發酵,企業採購中「廠商安全聲譽」權重明顯上升。
七月 OpenRouter 模型 Token 用量 Top 12
截至 2026 年 7 月 25 日,單日 Token 用量榜前十名中,中國廠商模型佔七席。DeepSeek 仍是單一廠商份額最穩定的第一名(約 16%–18%),但「月度冠軍模型」位置頻繁易主。
| 排名 | 模型 | 廠商 | 單日 Token | 近 30 天累計 |
|---|---|---|---|---|
| 1 | Mimo V2.5 | 小米 | 1.4T | 31.2T |
| 2 | DeepSeek V4 Flash | DeepSeek | 943.9B | 23.6T |
| 3 | Hy3 | 騰訊 | 590B | 23.4T |
| 4 | Nemotron 3 Ultra 550B(免費) | NVIDIA | 428.6B | 9T |
| 5 | DeepSeek V4 Pro | DeepSeek | 413.7B | 11.6T |
| 6 | GLM 5.2 | 智譜 Z.ai | 316.7B | 13.3T |
| 7 | MiniMax M3 | MiniMax | 262.5B | 15.1T |
| 8 | Step 3.7 Flash | 階躍星辰 | 204.8B | 5.9T |
| 9 | Kimi K3 | 月之暗面 | 157.6B | 1.6T(新上榜) |
| 10 | Ling 3.0 Flash | 螞蟻 InclusionAI | 128.3B | 417.3B |
| 11 | Gemini 3 Flash Preview | 106.3B | 4T | |
| 12 | Claude Sonnet 5 | Anthropic | 99.5B | 3.6T |
廠商份額與定價:中國約 46%,美國約 30%–36%
拉長到廠商維度,中國陣營合計約 46% Token 份額(一年前不足 2%),美國三巨頭合計從年中約 70% 滑落至 30%–36%。這不是敘事驅動,而是純粹的價格邏輯。
| 廠商 | Token 份額(約) | 代表模型定位 |
|---|---|---|
| DeepSeek | 16%–18% | 性價比之王,Agentic Coding 首選 |
| 小米 | 8%–18% | Mimo V2.5 單模型暴漲,波動最大 |
| Anthropic | 10%–15% | 閉源旗艦,難任務定價權 |
| 騰訊 | 8%–13% | Hy3 跑量 |
| 8%–13% | Gemini Flash 系列 | |
| 智譜 Z.ai | 4%–7% | GLM 5.2 類 Opus 規劃品質 |
| OpenAI | 6%–8% | GPT-5.5 高端定價 |
定價對照進一步解釋流量遷移:
| 模型 | 輸入/M | 輸出/M | 定位 |
|---|---|---|---|
| DeepSeek V4 Flash | ~$0.05–0.14 | ~$0.24–0.28 | 性價比之王 |
| MiniMax M3 | $0.10 | $1.21 | 長上下文預算之選 |
| GLM 5.2 | $0.45 | $3.31 | 開源類 Opus 規劃 |
| Kimi K3 | ~$3 | ~$15 | 1.4TB 開源權重最大 |
| Claude Opus 5 | $5(快速檔 $10) | $25(快速檔 $50) | 閉源旗艦,7 月最強基準 |
用量高不等於品質高:啞鈴型市場結構
OpenRouter 依任務類型統計的消費金額佔比(而非 Token 量)呈現完全不同圖景:通用對話 35.7%、Agent 工作流 30.4%、程式碼 26.5%、資料處理 7.5%。但專看「分類/複雜推理」這類難任務,Claude Sonnet 4.6 與 Claude Opus 4.7 以各 13.5% 消費份額並列第一,GPT-5.5 以 11.6% 排第三——總量榜上的廉價開源模型在此維度幾乎查無此模。
市場正在自然分層:廉價的中國開源模型吃下海量、低門檻、可容錯的跑量任務(閒聊、創意寫作、角色扮演、簡單程式輔助),閉源旗艦仍把持高價值、低容錯的難任務定價權。7 月 24 日 Anthropic 發布的 Claude Opus 5 在 FrontierBench v0.1 拿下 43.3%(反超 GPT-5.6 Sol 的 37.5%),定價維持 Opus 系列 $5/$25 per million tokens,是「我貴,但我值這個價」的典型打法。
應用層秘密:程式 Agent 稱王,角色扮演是隱藏半壁江山
模型層排行榜反映「哪個大腦更受歡迎」;應用層排行榜(openrouter.ai/apps)反映「這些大腦真正被用來做什麼」:
- Hermes Agent(Nous Research)以約 45% Token 份額一騎絕塵,是平台最大單一應用。
- 程式類 Agent 佔榜單大半:Kilo Code(~13%)、OpenClaw(~9%)、Claude Code(~6%)、Cline(~1.7%)均在前十。
- Cline → Roo Code → Kilo Code 是同一代碼血統的三次分叉,「孫輩」Kilo Code 已反超祖輩流量,說明開源程式 Agent 護城河比想像中淺。
- 角色扮演/陪伴類(Janitor AI、ISEKAI ZERO、SillyTavern、HammerAI)合計佔可觀用量。OpenRouter × a16z《State of AI》報告顯示,創意角色扮演場景貢獻了開源模型總用量的一半以上。
| 排名 | 應用 | 類型 | 份額(約) |
|---|---|---|---|
| 1 | Hermes Agent | 個人智慧體/CLI Agent | ~45% |
| 2 | Kilo Code | 程式 Agent | ~13% |
| 3 | OpenClaw | 通用 Agent | ~9% |
| 4 | Claude Code | 程式 Agent | ~6% |
| 5 | Descript | 內容生產 | ~4.5% |
| 6 | pi | Agent | ~3.3% |
| 7 | Lemonade | 陪伴/遊戲 | ~2.1% |
| 8 | ISEKAI ZERO | 角色扮演 | ~2.0% |
| 9 | Janitor AI | 角色扮演 | ~1.8% |
| 10 | Cline | 程式 Agent(IDE 外掛) | ~1.7% |
八月趨勢展望:五個值得盯住的訊號
- 中國開源模型合計份額大概率繼續爬升,年內有望突破 50%,除非美國廠商在定價上做出重大讓步。
- 「月度冠軍模型」寶座還會繼續易主——小米、DeepSeek、騰訊、智譜、MiniMax、月之暗面之間的價格戰不會放緩。
- Anthropic 可能在 8 月推出更平價型號(對標 Haiku 定位)搶佔用量份額,Opus 5 已是兩個月內第四款旗艦。
- Kimi K3 的 1.4TB 權重將在 2–4 週內出現社群量化壓縮版本,屆時才是中小團隊真正能用上的時間點。
- 安全與合規成為新選型變數——OpenAI 沙盒逃逸事件、美國國會「AI 終止開關法案」、白宮前沿模型預發布審查框架,都會推高企業採購中對廠商安全紀錄的權重。
六步建立分層路由與選型體系
不要只看用量排行榜做決策。以下六步把 OpenRouter 資料轉化為可執行的工程策略(若尚未接入平台,可先閱讀OpenRouter 接入教學):
- 標注資料截止日並建立月度複查節奏:開啟 openrouter.ai/rankings,記錄查看日期;榜單每日變動,建議固定在每月月底對照更新。
- 依任務類型拆分評測集:將工作負載分為閒聊/創意、Agent 工作流、程式碼、複雜推理四類,分別記錄採納率、錯誤率與 P95 延遲——不要用一個綜合分數代表全部場景。
- 跑量層走低價開源:閒聊、創意寫作、角色扮演、簡單程式輔助優先測試 DeepSeek V4 Flash(性價比最優)和 GLM 5.2(開源裡最接近 Opus 規劃品質)。
- 難任務層走閉源旗艦:分類、複雜推理、高風險 Agent 決策路由至 Claude Opus 5/GPT-5.6,僅在廉價模型實際卡住的步驟啟用,做混合路由大幅降本。
- 程式 Agent 場景做 A/B 分叉測試:在同一程式庫上對比 Kilo Code、Cline、OpenClaw 的預設後端模型與 Fallback 鏈,記錄 token 成本與修復成功率——開源 Agent 生態迭代極快,先發優勢並不牢固。
- 把廠商安全紀錄納入評分卡:為每個候選模型/vendor 記錄沙盒事件、資料保留政策、權限收斂能力;自主 Agent 場景務必做最小權限與人工審批閘門。
台港團隊用 OpenRouter 做技術預研完全可行,但正式上線需注意平均延遲約 180–250ms、不支援本地發票;合規場景可評估矽基流動、非線智能 API 等國內中轉方案。
可引用的硬核資料與官方來源
- 中國廠商合計約 46% Token 份額:一年前不足 2%,是過去 12 個月 AI 產業最陡峭的份額遷移曲線之一——綜合 OpenRouter 官方排行榜與 tokenmaxxing、digitalapplied、fourweekmba 等第三方 7 天口徑資料。
- DeepSeek V4 Flash vs GPT-5.5 價差約 35 倍:輸入價分別約 $0.05–0.14/M 與 ~$5/M,是流量向中國開源模型遷移的核心驅動力。
- Hermes Agent 約 45% 應用層份額:遠超第二名 Kilo Code(~13%),說明個人/CLI Agent 是當前 OpenRouter 生態的最大單一流量入口。
- Claude Opus 5 FrontierBench v0.1 得分 43.3%:反超 GPT-5.6 Sol 的 37.5%,定價維持 $5/$25 per million tokens——來源 Anthropic 官方發布。
排行榜數字每日變動,發布前請以官方即時資料為準。
以下為 OpenRouter 官方模型排行榜(一手資料源):
以下為 OpenRouter 官方應用層排行榜:
以下為 OpenRouter × a16z《State of AI》報告:
以下為 Anthropic Claude Opus 5 官方發布:
Introducing Claude Opus 5 — Anthropic
OpenRouter 排行榜常見問題
OpenRouter 排行榜依什麼排序?
依真實付費 Token 用量排序,反映開發者實際路由的生產流量,不是基準測試分數。廉價模型掛在高流量應用後也能霸屏前列。
2026 年 7 月用量第一是誰?
截至 7 月 25 日,單日 Token 第一為小米 Mimo V2.5(約 1.4 兆/天),其次 DeepSeek V4 Flash(約 9439 億/天)和騰訊 Hy3(約 5900 億/天)。
中國大模型佔多少份額?
綜合多方 7 天口徑,中國廠商合計約 46% Token 份額,美國廠商合計約 30%–36%。
獨立開發者應該怎麼選?
用 OpenRouter 做技術預研沙盒,程式任務優先 DeepSeek V4 Flash + GLM 5.2,把 Claude Opus 5 留給真正卡住的複雜步驟,做混合路由降本。
跑 Kilo Code、Cline 或 Hermes Agent 的多模型比對,最忌諱在主力開發機上反覆切換後端、污染全域設定。KVMFLUX 按天起租的雲端 Mac mini提供 Root 級權限、SSH + VNC 雙通道與獨享實體 M4 硬體——你可以在乾淨環境裡並行測試 DeepSeek V4 Flash 與 Claude Opus 5 的 Fallback 鏈,測完即退、不留 SDK 與 agent 殘留。若你正在評估租期,按天租最適合這類月度榜單驅動的快速驗證週期。
在真實 Apple Silicon 上測程式 Agent 路由
按天開一台 Mac mini M4,跑 Kilo Code/Cline 多模型比對與 Fallback 驗證,榜單更新後快速重測就退租。