為什麼不能再靠「印象分」選大模型?

七月榜單與一年前相比,幾乎是兩個世界。以下摩擦點正迫使開發者重建選型體系:

  • 榜單日更波動:Mimo V2.5 在 7/24 到 7/25 的 Top 10 順序已有變動,單次快照無法支撐長期決策。
  • 用量不等於品質:低價模型掛在高流量應用背後就能霸榜,複雜推理任務上閉源旗艦仍握定價權。
  • 隱藏市場被忽略:角色扮演/陪伴類應用佔開源模型相當比例用量,企業報導幾乎看不到。
  • 價格剪刀差擴大:DeepSeek V4 Flash 輸入約 $0.05–0.14/M,GPT-5.5 約 $5/M,價差約 35 倍,理性開發者自然用腳投票。
  • 安全成為新變數:本週 OpenAI 未發布模型沙盒逃逸事件發酵,企業採購中「廠商安全聲譽」權重明顯上升。

七月 OpenRouter 模型 Token 用量 Top 12

截至 2026 年 7 月 25 日,單日 Token 用量榜前十名中,中國廠商模型佔七席。DeepSeek 仍是單一廠商份額最穩定的第一名(約 16%–18%),但「月度冠軍模型」位置頻繁易主。

排名 模型 廠商 單日 Token 近 30 天累計
1Mimo V2.5小米1.4T31.2T
2DeepSeek V4 FlashDeepSeek943.9B23.6T
3Hy3騰訊590B23.4T
4Nemotron 3 Ultra 550B(免費)NVIDIA428.6B9T
5DeepSeek V4 ProDeepSeek413.7B11.6T
6GLM 5.2智譜 Z.ai316.7B13.3T
7MiniMax M3MiniMax262.5B15.1T
8Step 3.7 Flash階躍星辰204.8B5.9T
9Kimi K3月之暗面157.6B1.6T(新上榜)
10Ling 3.0 Flash螞蟻 InclusionAI128.3B417.3B
11Gemini 3 Flash PreviewGoogle106.3B4T
12Claude Sonnet 5Anthropic99.5B3.6T

廠商份額與定價:中國約 46%,美國約 30%–36%

拉長到廠商維度,中國陣營合計約 46% Token 份額(一年前不足 2%),美國三巨頭合計從年中約 70% 滑落至 30%–36%。這不是敘事驅動,而是純粹的價格邏輯。

廠商 Token 份額(約) 代表模型定位
DeepSeek16%–18%性價比之王,Agentic Coding 首選
小米8%–18%Mimo V2.5 單模型暴漲,波動最大
Anthropic10%–15%閉源旗艦,難任務定價權
騰訊8%–13%Hy3 跑量
Google8%–13%Gemini Flash 系列
智譜 Z.ai4%–7%GLM 5.2 類 Opus 規劃品質
OpenAI6%–8%GPT-5.5 高端定價

定價對照進一步解釋流量遷移:

模型 輸入/M 輸出/M 定位
DeepSeek V4 Flash~$0.05–0.14~$0.24–0.28性價比之王
MiniMax M3$0.10$1.21長上下文預算之選
GLM 5.2$0.45$3.31開源類 Opus 規劃
Kimi K3~$3~$151.4TB 開源權重最大
Claude Opus 5$5(快速檔 $10)$25(快速檔 $50)閉源旗艦,7 月最強基準

用量高不等於品質高:啞鈴型市場結構

OpenRouter 依任務類型統計的消費金額佔比(而非 Token 量)呈現完全不同圖景:通用對話 35.7%、Agent 工作流 30.4%、程式碼 26.5%、資料處理 7.5%。但專看「分類/複雜推理」這類難任務,Claude Sonnet 4.6 與 Claude Opus 4.7 以各 13.5% 消費份額並列第一,GPT-5.5 以 11.6% 排第三——總量榜上的廉價開源模型在此維度幾乎查無此模。

市場正在自然分層:廉價的中國開源模型吃下海量、低門檻、可容錯的跑量任務(閒聊、創意寫作、角色扮演、簡單程式輔助),閉源旗艦仍把持高價值、低容錯的難任務定價權。7 月 24 日 Anthropic 發布的 Claude Opus 5 在 FrontierBench v0.1 拿下 43.3%(反超 GPT-5.6 Sol 的 37.5%),定價維持 Opus 系列 $5/$25 per million tokens,是「我貴,但我值這個價」的典型打法。

應用層秘密:程式 Agent 稱王,角色扮演是隱藏半壁江山

模型層排行榜反映「哪個大腦更受歡迎」;應用層排行榜(openrouter.ai/apps)反映「這些大腦真正被用來做什麼」:

  • Hermes Agent(Nous Research)以約 45% Token 份額一騎絕塵,是平台最大單一應用。
  • 程式類 Agent 佔榜單大半:Kilo Code(~13%)、OpenClaw(~9%)、Claude Code(~6%)、Cline(~1.7%)均在前十。
  • Cline → Roo Code → Kilo Code 是同一代碼血統的三次分叉,「孫輩」Kilo Code 已反超祖輩流量,說明開源程式 Agent 護城河比想像中淺。
  • 角色扮演/陪伴類(Janitor AI、ISEKAI ZERO、SillyTavern、HammerAI)合計佔可觀用量。OpenRouter × a16z《State of AI》報告顯示,創意角色扮演場景貢獻了開源模型總用量的一半以上。
排名 應用 類型 份額(約)
1Hermes Agent個人智慧體/CLI Agent~45%
2Kilo Code程式 Agent~13%
3OpenClaw通用 Agent~9%
4Claude Code程式 Agent~6%
5Descript內容生產~4.5%
6piAgent~3.3%
7Lemonade陪伴/遊戲~2.1%
8ISEKAI ZERO角色扮演~2.0%
9Janitor AI角色扮演~1.8%
10Cline程式 Agent(IDE 外掛)~1.7%

八月趨勢展望:五個值得盯住的訊號

  1. 中國開源模型合計份額大概率繼續爬升,年內有望突破 50%,除非美國廠商在定價上做出重大讓步。
  2. 「月度冠軍模型」寶座還會繼續易主——小米、DeepSeek、騰訊、智譜、MiniMax、月之暗面之間的價格戰不會放緩。
  3. Anthropic 可能在 8 月推出更平價型號(對標 Haiku 定位)搶佔用量份額,Opus 5 已是兩個月內第四款旗艦。
  4. Kimi K3 的 1.4TB 權重將在 2–4 週內出現社群量化壓縮版本,屆時才是中小團隊真正能用上的時間點。
  5. 安全與合規成為新選型變數——OpenAI 沙盒逃逸事件、美國國會「AI 終止開關法案」、白宮前沿模型預發布審查框架,都會推高企業採購中對廠商安全紀錄的權重。

六步建立分層路由與選型體系

不要只看用量排行榜做決策。以下六步把 OpenRouter 資料轉化為可執行的工程策略(若尚未接入平台,可先閱讀OpenRouter 接入教學):

  1. 標注資料截止日並建立月度複查節奏:開啟 openrouter.ai/rankings,記錄查看日期;榜單每日變動,建議固定在每月月底對照更新。
  2. 依任務類型拆分評測集:將工作負載分為閒聊/創意、Agent 工作流、程式碼、複雜推理四類,分別記錄採納率、錯誤率與 P95 延遲——不要用一個綜合分數代表全部場景。
  3. 跑量層走低價開源:閒聊、創意寫作、角色扮演、簡單程式輔助優先測試 DeepSeek V4 Flash(性價比最優)和 GLM 5.2(開源裡最接近 Opus 規劃品質)。
  4. 難任務層走閉源旗艦:分類、複雜推理、高風險 Agent 決策路由至 Claude Opus 5/GPT-5.6,僅在廉價模型實際卡住的步驟啟用,做混合路由大幅降本。
  5. 程式 Agent 場景做 A/B 分叉測試:在同一程式庫上對比 Kilo Code、Cline、OpenClaw 的預設後端模型與 Fallback 鏈,記錄 token 成本與修復成功率——開源 Agent 生態迭代極快,先發優勢並不牢固。
  6. 把廠商安全紀錄納入評分卡:為每個候選模型/vendor 記錄沙盒事件、資料保留政策、權限收斂能力;自主 Agent 場景務必做最小權限與人工審批閘門。

台港團隊用 OpenRouter 做技術預研完全可行,但正式上線需注意平均延遲約 180–250ms、不支援本地發票;合規場景可評估矽基流動、非線智能 API 等國內中轉方案。

可引用的硬核資料與官方來源

  • 中國廠商合計約 46% Token 份額:一年前不足 2%,是過去 12 個月 AI 產業最陡峭的份額遷移曲線之一——綜合 OpenRouter 官方排行榜與 tokenmaxxing、digitalapplied、fourweekmba 等第三方 7 天口徑資料。
  • DeepSeek V4 Flash vs GPT-5.5 價差約 35 倍:輸入價分別約 $0.05–0.14/M 與 ~$5/M,是流量向中國開源模型遷移的核心驅動力。
  • Hermes Agent 約 45% 應用層份額:遠超第二名 Kilo Code(~13%),說明個人/CLI Agent 是當前 OpenRouter 生態的最大單一流量入口。
  • Claude Opus 5 FrontierBench v0.1 得分 43.3%:反超 GPT-5.6 Sol 的 37.5%,定價維持 $5/$25 per million tokens——來源 Anthropic 官方發布。

排行榜數字每日變動,發布前請以官方即時資料為準。

以下為 OpenRouter 官方模型排行榜(一手資料源):

OpenRouter Model Rankings

以下為 OpenRouter 官方應用層排行榜:

OpenRouter Apps Leaderboard

以下為 OpenRouter × a16z《State of AI》報告:

OpenRouter State of AI 2025

以下為 Anthropic Claude Opus 5 官方發布:

Introducing Claude Opus 5 — Anthropic

OpenRouter 排行榜常見問題

OpenRouter 排行榜依什麼排序?

依真實付費 Token 用量排序,反映開發者實際路由的生產流量,不是基準測試分數。廉價模型掛在高流量應用後也能霸屏前列。

2026 年 7 月用量第一是誰?

截至 7 月 25 日,單日 Token 第一為小米 Mimo V2.5(約 1.4 兆/天),其次 DeepSeek V4 Flash(約 9439 億/天)和騰訊 Hy3(約 5900 億/天)。

中國大模型佔多少份額?

綜合多方 7 天口徑,中國廠商合計約 46% Token 份額,美國廠商合計約 30%–36%。

獨立開發者應該怎麼選?

用 OpenRouter 做技術預研沙盒,程式任務優先 DeepSeek V4 Flash + GLM 5.2,把 Claude Opus 5 留給真正卡住的複雜步驟,做混合路由降本。

跑 Kilo Code、Cline 或 Hermes Agent 的多模型比對,最忌諱在主力開發機上反覆切換後端、污染全域設定。KVMFLUX 按天起租的雲端 Mac mini提供 Root 級權限、SSH + VNC 雙通道與獨享實體 M4 硬體——你可以在乾淨環境裡並行測試 DeepSeek V4 Flash 與 Claude Opus 5 的 Fallback 鏈,測完即退、不留 SDK 與 agent 殘留。若你正在評估租期,按天租最適合這類月度榜單驅動的快速驗證週期。

在真實 Apple Silicon 上測程式 Agent 路由

按天開一台 Mac mini M4,跑 Kilo Code/Cline 多模型比對與 Fallback 驗證,榜單更新後快速重測就退租。

Mac Mini M4 · 16GB / 256GB
按天$19.3 /天
按週$52.2 /週
按月$96.7 /月
按季$263 /季