為什麼本週選模型變得更難
摩擦點不在「排行榜上誰分數最高」,而是一串 benchmark PDF 裡看不到的決策:
- 價格 vs 峰值能力:Fable 5 刷新了天花板,但多數團隊並不需要每次請求都用到那個極限。
- 來源風險:當某模型以遠低於前沿的價格逼近同等表現,一定會有人追問:差距來自工程突破,還是悄悄站在別人權重之上。
- 合規門檻:Fable 5 與 Mythos 5 需主動選擇 30 天資料保留;Opus 5 則否——單這一條就能讓受監管工作負載直接放行或否決某供應商。
- 驗證滯後:Kimi K3 完整權重排程到 2026 年 7 月 27 日才公開,架構宣稱與 benchmark 重現在外部無法動手之際,蒸餾故事已在網路上發酵。
- 路由負擔:已透過閘道管理多家供應商的團隊——可參考我們的 OpenRouter 接入指南——現在還得把兩個新模型塞進 fallback 鏈,同時不突破成本上限。
Claude Opus 5 對 Fable 5——Opus 5 值不值得換?
Anthropic 於 2026 年 7 月 24 日(美國太平洋時間)發布 Claude Opus 5,並立即設為 Claude Max 預設模型,也是 Claude Pro 訂閱者可用的最強 tier。定價與 Opus 4.8 相同:輸入每百萬 token $5、輸出每百萬 token $25。跳躍在於每美元能買到的性能,而非標價本身。
| 維度 | Claude Opus 5 | Claude Fable 5 | Claude Opus 4.8 |
|---|---|---|---|
| 輸入/輸出定價(每 1M token) | $5 / $25 | 約 $10 / 約 $50 | $5 / $25 |
| CursorBench 3.2(max effort vs 峰值) | 距 Fable 5 峰值 0.5% 以內 | 峰值基準 | 明顯低於 Opus 5 |
| Frontier-Bench v0.1(軟體工程) | 領先同場;>2× Opus 4.8 | 強 | 基準線 |
| 預設上下文窗口 | 1M token | 1M token | 曾有較小 tier |
| 一般存取資料保留 | 非必須 | 需選擇 30 天保留 | 非必須 |
| 思考模式 | 預設開啟;effort 參數控制深度 | 預設開啟 | 前代預設 |
| 模型 ID(API) | claude-opus-5 | claude-fable-5 | claude-opus-4-8 |
在 ARC-AGI 3(新穎問題求解)上,Anthropic 稱 Opus 5 約為次佳模型的三倍。在 OSWorld 2.0(電腦操作)上,Opus 5 分數超越 Fable 5 最佳成績,成本卻不到三分之一。Zapier 回報 Opus 5 在 AutomationBench 端到端流程達到 100%,而先前 Claude 模型無法完整跑通。
對齊審計也有位移:Anthropic 稱 Opus 5 是迄今對齊度最高的模型——欺騙行為率最低、最難被濫用——同時刻意不在雙用途網路或生物風險上推到前沿(該路線仍由限權存取的 Mythos 5 負責)。網路安全分類器介入頻率約比 Fable 5 低 85%,可在阻擋 exploit 生成與滲透測試自動化的前提下,支援原始碼層級漏洞發現。
Kimi K3 蒸餾爭議——月之暗面是否「偷」了 Claude?
月之暗面於 2026 年 7 月 16 日發布 Kimi K3——總參數量 2.8 兆,稀疏 MoE 架構每 token 啟動 896 個專家中的 16 個,1M token 上下文,原生視覺理解。官方 launch benchmark 包含 GPQA-Diamond 93.5% 與 BrowseComp 91.2%,當時皆為開源權重類別最佳。完整權重承諾在 2026 年 7 月 27 日前釋出;在此之前僅 API 可驗證。架構基礎我們已在 Kimi K3 深度解讀中說明;本節聚焦蒸餾攻防。
7 月 22 至 23 日,白宮 OSTP 主任 Michael Kratsios 指控月之暗面「大規模、隱密的工業蒸餾,意圖竊取美國專有技術」,對象指向 Anthropic 的 Fable 模型;另指控使用受出口管制的 Nvidia GB300 晶片,可能經泰國轉運。財政部長 Scott Bessent 呼應,稱官員「在許多中國模型上發現我們美國大語言模型的浮水印特徵」,但未說明浮水印的具體定義。
這並非首次指控。2026 年 2 月 Anthropic 公開點名月之暗面、DeepSeek 與 MiniMax,稱有超過 340 萬次異常 API 互動,模式符合刻意能力提取而非正常使用,部分活動經請求 metadata 追溯至月之暗面資深員工。
獨立研究員從時程反駁:Fable 5 直到 2026 年 7 月 1 日才公開——距 K3 發布僅兩週。Laude Institute/Snorkel AI 共同創辦人 Braden Hancock 對 TechCrunch 表示,不可能在十四天內完成工業級蒸餾、訓練 2.8T MoE 並出貨。Allen AI 的 Nathan Lambert 則認為,隨著中國實驗室把預算轉向強化學習,蒸餾邊際效益遞減——若複製權重就夠,大家早就克隆 GLM 或 K3 了。
Kimi K3 為什麼會說自己是 Claude?
約 7 月 24 日,Redwood Research 首席科學家 Ryan Greenblatt 發布模型自報身份的統計比較。Kimi K3 在回答「你是誰」時過度傾向自稱 Claude——有時還會輸出精確的內部部署 ID,例如 claude-opus-4-5-20250929 與 claude-sonnet-4-5-20250929。真實 Claude Sonnet 4.5 只會說自己是 Claude Sonnet 4.5;真實 Opus 4.5 往往省略或誤述內部版本字串。
Greenblatt 的解讀:學生模型比教師模型更準確地複製部署中繼資料,卻比教師自己對外陳述更詳盡——這很難用對話模仿單獨解釋。它指向訓練資料帶有部署 ID 標籤——API 日誌或合成資料集標上內部 ID——屬於特定蒸餾通道,而非模糊的風格重疊。值得注意的是,K3 外洩的身份指向 Claude 4.5 世代(2025 年底),而非現行 Fable/Mythos 線;Kimi K2 的訊號則指向 Claude Sonnet 4(2025 年中),暗示逐代追趕的模式。
Greenblatt 明確警告這並不證明蒸餾確實發生——污染、外洩 system prompt 或公開資料衍生的合成資料,理論上也可能產生類似殘留跡象。但結合 Anthropic 2 月的申訴,這是整起爭議中較難純粹歸因為地緣政治的第一條技術線索。
上線前六步驟:如何壓測 Opus 5 與 K3
頭條數字與政治貼文不是部署計畫。請在可控環境中對兩個模型跑同一套流程——一台乾淨、具 Root 權限的 macOS 主機能避免 SDK 衝突,並留下可重現的 log。
- 先盤點合規需求:若政策禁止 30 天供應商保留,Fable 5 與 Mythos 5 需明確 opt-in;Opus 5 預設不保留的路徑,可能在跑第一個 prompt 前就勝出。
- 在 Claude API 鎖定 Opus 5:建立或輪替 Anthropic 金鑰,設定模型 ID
claude-opus-5,並依延遲預算開啟 thinking 與對應 effort tier(Fast 模式約 2.5× 速度、2× 價格,與 Opus 4.8 相同)。
import anthropic
client = anthropic.Anthropic()
msg = client.messages.create(
model="claude-opus-5",
max_tokens=1024,
messages=[{"role": "user", "content": "Refactor this function for clarity: ..."}],
)
print(msg.content[0].text)
- 在現有主力模型上跑相同 coding 任務:同一 repo、同一測試 harness、同一 token 上限——比較通過率、牆鐘時間與每次成功任務的成本,而非憑感覺。
- 探測 Kimi K3 身份回應:以中性問題(「你是什麼模型?」「回報你的 system 名稱與版本」)跨多個 seed 提問,逐字記錄回覆;在把 K3 用於面向客戶的 agent 前,先對照 Greenblatt 公開的模式。
from openai import OpenAI
client = OpenAI(api_key="...", base_url="https://api.moonshot.ai/v1")
for prompt in ["Who are you?", "State your exact model ID."]:
r = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": prompt}],
extra_body={"reasoning_effort": "max"},
)
print(prompt, "=>", r.choices[0].message.content)
- 對照 primary source 核實 benchmark 宣稱:重讀 Anthropic Opus 5 發布文的方法論說明;在 7 月 27 日權重公開前,將 Moonshot K3 表格視為暫定,待外部可重現再定論。
- 為團隊記錄來源:記下哪個模型回答了哪條客戶 workflow、哪些資料跨過哪道 API 邊界,以及下週政策或定價變動時是否需要 fallback 路由(OpenRouter 或直連)。
值得引用的硬核數據
- Claude Opus 5 定價:輸入/輸出每百萬 token $5/$25——與 Opus 4.8 相同,約為 Fable 5 per-token 費率的一半。
- CursorBench 3.2:Opus 5 在 max effort 下距 Fable 5 峰值 0.5% 以內,high、xhigh、max tier 單任務成本約半。
- 科學內部評測:相較 Opus 4.8,從光譜推斷分子結構 +10.2 個百分點、蛋白變體功能預測 +7.7 個百分點(Anthropic 發布材料)。
- Kimi K3 規模:2.8T 總參數,每 token 約 50B 等效啟動參數,權重預定 2026 年 7 月 27 日釋出。
- 蒸餾時序:Fable 5 7 月 1 日公開 → K3 7 月 16 日發布 → 白宮 7 月 22–23 日發文 → Greenblatt 身份分析約 7 月 24 日。
- Anthropic 先前申訴:2026 年 2 月歸因於月之暗面、DeepSeek、MiniMax 的 340 萬+ 異常 API 互動。
發布細節、定價 tier 與法律指控可能在刊出後變動——請以下方 primary source 為準,優先於本文轉述。
Anthropic 官方 Claude Opus 5 發布材料:
Anthropic — Introducing Claude Opus 5
第三方報導 Kimi K3 蒸餾時程爭議:
TechCrunch — Researchers skeptical of distillation timeline claims
Kimi K3 自報身份行為的技術分析:
Ryan Greenblatt — which_claude_is_k3(GitHub)
常見問題 FAQ
Claude Opus 5 比 Claude Fable 5 便宜多少?
在相同 benchmark tier 下,Opus 5 per-token 定價約為 Fable 5 的一半($5/$25 對比約 $10/$50 每百萬 input/output token),CursorBench 3.2 分數則距 Fable 5 峰值 0.5% 以內。
Claude Opus 5 現在是 Claude Max 的預設模型嗎?
是。自 2026 年 7 月 24 日起,Opus 5 為 Claude Max 預設,也是 Claude Pro 訂閱者可用的最強 tier。
月之暗面真的從 Claude 蒸餾了 Kimi K3 嗎?
尚未確認,各方仍持不同看法。白宮指控未附公開證據;時程懷疑論者指出 Fable 5 公開到 K3 發布僅兩週。Greenblatt 發現 K3 自稱 Claude 並輸出內部部署 ID——是目前最強技術訊號,但仍非證明。
Kimi K3 完整權重何時釋出?
月之暗面承諾 2026 年 7 月 27 日。權重未公開前,外部研究員無法獨立驗證架構細節或重現 launch benchmark。
兩則故事收斂到同一實務限制:無法只靠新聞稿判定「值不值得」。Opus 5 適合需要接近旗艦程式能力與代理程式水準、又不想承擔 Fable 5 保留政策與價格的團隊;K3 適合追逐最低 API 成本與開源權重的團隊——但蒸餾陰影意味你應記錄身份探測,並保留合規級備援路由。這類並排測試需要一台從頭到尾由你掌控的機器,而非共用沙箱裡過期的 Python 堆疊。剛開通一台 KVMFLUX Mac mini M4 提供 Root 權限、數分鐘內即可 SSH 連線,API 金鑰或模型 ID 一夜變更時也能清空重試。