7 月 31 日正式版上線前,必須先釐清的五項摩擦
標題跑分很亮眼,但在簽約與路由決策前,可重現性與營運缺口比數字更重要:
- 參數凍結:V4-Flash-0731 維持 284B 總量、13B 啟動。CSA+HCA 混合注意力、mHC、Muon 優化器骨架與 V4-Pro 預覽版相同,提升僅來自 SFT/RL 後訓練。
- Harness 未公開:7 月 31 日首次提及後框架本體仍未釋出。公布的 Agent 基準均在 Harness minimal mode 下執行,廠商自身亦警告 harness 敏感度。
- 僅 API 更新:行動 App 與網頁聊天未切換至 V4 Flash。正式流量須在
deepseek-chat端點明確指定deepseek-v4-flash-0731。 - 初期營運雜訊:上線後 API 使用者回報快取命中不一致與安全分類器逾時。8 月 10–20 日 V4-Pro GA 傳言,以及融資相關傳聞(梁文鋒被社群暱稱「梁白開」「梁聖」等)均未經證實。
- 價格對效能的「斬殺線」:中國開發者社群以「斬殺線」形容西方旗艦模型在大流量下失去經濟性的價格帶。Flash 的 $0.14/$0.28 每百萬 token 落在此線之下,亦與 OpenRouter 7 月排行榜上 DeepSeek 日處理約 9439 億 token(第 2 名)的用量相互呼應。
V4-Flash-0731 官方規格與發表數據
| 項目 | DeepSeek V4-Flash-0731 |
|---|---|
| 上線日期 | 2026 年 7 月 31 日(正式 API) |
| 總 / 啟動參數 | 284B / 13B(與 V4-Pro 預覽版相同) |
| 效能來源 | 僅後訓練(SFT + RL) |
| 架構 | CSA + HCA 混合注意力、mHC、Muon |
| 上下文 | 100 萬 token(V4-Pro 相對 V3.2:FLOPs 降 27%、KV 快取降 10%,廠商宣稱) |
| 授權 | MIT(Hugging Face 開放權重) |
| API 輸入 / 輸出(每百萬 token) | $0.14 / $0.28(快取命中輸入 $0.0028) |
| Artificial Analysis 指數 / 每任務成本 | 50 / $0.03(獨立第三方) |
| Terminal Bench 2.0 | 82.7(V4-Pro 預覽 67.9,廠商 + Harness minimal) |
| Agent / 程式基準 | 9 項全部超越 V4-Pro 預覽(廠商執行) |
| Harness | 7 月 31 日首次提及,未公開 |
| App / 網頁 | 未更新(僅 API) |
標示非「獨立第三方」的列,數據來自 DeepSeek 發表材料或未公開 Harness minimal mode 的廠商執行值。
V4 Flash vs Kimi K3、Qwen3.8-Max 與封閉旗艦
同一週內 Kimi K3 權重釋出(7 月 27 日)與 Qwen3.8-Max GA(8 月 3 日)接連登場,國產萬億 MoE 定價戰進一步白熱化:
| 模型 | 總 / 啟動 | API 輸入 / 輸出(每百萬 token) | AA 指數 / $/任務 | 權重 | 獨立基準 |
|---|---|---|---|---|---|
| V4-Flash-0731 | 284B / 13B | $0.14 / $0.28(快取 $0.0028) | 50 / $0.03 | MIT 已開源 | AA 指數 50 |
| V4-Pro 預覽 | 284B / 13B | $0.435 / $0.87(快取 $0.003625) | 低於 Flash | 預覽版 | Terminal Bench 67.9 |
| Kimi K3 | 2.8T / 約 104B | $3 / $15(快取 $0.30) | 57 / $0.86 | 7 月 27 日釋出 | AA 57 |
| Qwen3.8-Max | 2.4T / 95B | $2 / $6 | AA 未公布 | 承諾釋出、HF 未到 | Arena 初步第 5 |
| GPT-5.6 Sol | 未公開 | 綜合約 $1.40 | 約 59 / $1.86 | 閉源 | 較 Flash 約高 9 分(AA) |
| Claude Fable 5 | 未公開 | 約 $10 / $50 | 約 59 / $3.15 | 閉源 | 較 Flash 約高 9 分(AA) |
「逼近 Opus 4.8」的說法出自廠商主導基準語境。獨立 Artificial Analysis 上 Flash 為 50 分,GPT-5.6 Sol 與 Claude Fable 5 各約高 9 分,但每任務成本分別為 $1.86 與 $3.15,差距達數十倍。多數團隊的務實策略是:大量流量走 Flash,僅在需要絕對效能的最後一哩才路由至旗艦閉源模型。
零參數增量下的架構與 Harness 解讀
DeepSeek 7 月 31 日的敘事是「同樣 284B/13B,更強的 Agent」。技術重點如下:
- CSA + HCA:Compressed Sparse Attention 與 Hierarchical Context Attention 組合,宣稱在 100 萬 token 下相對 V3.2 降低 KV 快取負擔(FLOPs 降 27%、KV 降 10%)。
- mHC + Muon:長工具鏈上的 RL 後訓練穩定化,據稱貢獻 Terminal Bench 82.7 等分數。
- Harness minimal mode 侷限:公布的 9 項 Agent/程式基準均在此模式下測量。框架未公開前,與自建 harness 的落差必須列為前提。
- V4-Pro 正式版未到:4 月 24 日預覽上線至今已逾三個月,Flash 率先以「正式 API」姿態推出。Pro 預覽使用者面臨成本與分數雙面向 Flash 傾斜的壓力。
廠商表格中「逼近 Opus 4.8」並非正式環境保證。快取異常與安全分類器逾時,是比表格數字更應優先在自家工作負載中重現的訊號。
正式環境導入前:六步評估 V4 Flash
僅看基準表無法完成路由設計。建議在具 root 權限的乾淨 macOS 主機上,從 API 並行測試起步。
- 固定 API 金鑰與模型 ID:在 DeepSeek 控制台取得金鑰,確認回應來自
deepseek-v4-flash-0731。舊版deepseek-chat/deepseek-reasoner已於 7 月 24 日標記棄用。 - 以相同 harness 建立基線:同一 repo、同一測試集、同一 token 上限,與 Kimi K3 或 Qwen3.8-Max 並行。廠商表格無法取代自家樣本。
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DEEPSEEK_API_KEY"],
base_url="https://api.deepseek.com",
)
resp = client.chat.completions.create(
model="deepseek-v4-flash-0731",
messages=[{"role": "user", "content": "重構此函式,保持行為不變:..."}],
)
print(resp.choices[0].message.content)
- 量測快取命中率:系統提示與 RAG 上下文重複使用時,輸入 $0.0028 與 $0.14 每百萬 token 的差異直接影響帳單。初期快取不一致回報須以日誌追蹤。
- 對照 AA 任務單價:選 20–50 個代表性任務,計算每次成功成本,與 Kimi K3($0.86/任務)、GPT-5.6 Sol($1.86/任務)比較。
- 多步 Agent 在隔離伺服器執行:工具呼叫鏈建議在可 wipe 的 Mac 上夜間批次跑,避免共享 CI 中過期 SDK 污染對照結果;長上下文任務亦須留意 API 頻寬與 token 帳單。
- 監控 Harness 公開與 V4-Pro GA:定期查閱 DeepSeek 官方文件與 Hugging Face。8 月 10–20 日 GA 傳言仍屬未證實,框架公開後應重跑基準。
時間線與可引用的硬核數據、來源
- 2026 年 4 月 24 日:V4-Pro 預覽首次公開。
- 7 月 24 日:
deepseek-chat/deepseek-reasoner棄用,遷移至 V4 管線。 - 7 月 27 日:Kimi K3 權重登陸 Hugging Face。
- 7 月 31 日:V4-Flash-0731 正式 API、Harness 首次提及(未公開),Agent 基準 9/9 超越 Pro 預覽。
- 8 月 3 日:Qwen3.8-Max GA(API $2/$6)。
- 規模:284B 總量、13B 啟動、100 萬 token、MIT 授權。
- 定價:輸入 $0.14 / 輸出 $0.28 每百萬 token,快取命中輸入 $0.0028;Pro 預覽 $0.435 / $0.87(快取 $0.003625);Kimi K3 $3 / $0.30 / $15。
- Artificial Analysis:Flash 指數 50、$0.03/任務;K3 為 57、$0.86;GPT-5.6 Sol 與 Claude Fable 5 各約高 9 分,$1.86 與 $3.15/任務。
- Terminal Bench 2.0:Flash 82.7 vs Pro 預覽 67.9。
費率、基準與公開時程可能更新,以下一級來源優先於本文轉述。
DeepSeek 官方:
API 文件:
獨立基準:
Artificial Analysis — Intelligence Index 與 $/任務
訓練權重:
常見問題 FAQ
V4 Flash 有增加參數嗎?
沒有。284B/13B 不變,效能提升完全來自後訓練。
Harness 現在能用嗎?
7 月 31 日首次提及後仍未公開。公布的 Agent 基準為 minimal mode,分數對 harness 設定高度敏感。
App 何時會換成 V4 Flash?
目前僅 API 更新。網頁與行動端仍為舊模型,正式環境須在 API 明確指定模型 ID。
與 Kimi K3 該怎麼選?
成本優先選 Flash($0.03/任務)。指數與開放權重自架選 K3(57,7 月 27 日釋出)。多數團隊以角色分工並用較務實。
8 月 V4-Pro GA 傳言可信嗎?
8 月 10–20 日 GA 傳言未經證實,融資相關說法亦未核實。建議待 Harness 公開後再評估。
V4-Flash-0731 在廠商表格中逼近 Opus 4.8,在 Artificial Analysis 上每任務僅幾美分。然而 Harness 未公開、快取異常有回報、V4-Pro 正式版仍缺席。與 Kimi K3 或 Qwen3.8-Max 的並行驗證,需要可 wipe 的真實 Mac,而非共享沙箱。KVMFLUX 按天租用的 Mac mini M4 提供 root 與數分鐘內 SSH,模型 ID 或路由一夜變更時可乾淨重來,在權重與 GPU 叢集就緒前是最划算的 API 對照場域。