7 月 31 日正式版上線前,必須先釐清的五項摩擦

標題跑分很亮眼,但在簽約與路由決策前,可重現性與營運缺口比數字更重要:

  • 參數凍結:V4-Flash-0731 維持 284B 總量、13B 啟動。CSA+HCA 混合注意力、mHC、Muon 優化器骨架與 V4-Pro 預覽版相同,提升僅來自 SFT/RL 後訓練。
  • Harness 未公開:7 月 31 日首次提及後框架本體仍未釋出。公布的 Agent 基準均在 Harness minimal mode 下執行,廠商自身亦警告 harness 敏感度。
  • 僅 API 更新:行動 App 與網頁聊天未切換至 V4 Flash。正式流量須在 deepseek-chat 端點明確指定 deepseek-v4-flash-0731
  • 初期營運雜訊:上線後 API 使用者回報快取命中不一致與安全分類器逾時。8 月 10–20 日 V4-Pro GA 傳言,以及融資相關傳聞(梁文鋒被社群暱稱「梁白開」「梁聖」等)均未經證實。
  • 價格對效能的「斬殺線」:中國開發者社群以「斬殺線」形容西方旗艦模型在大流量下失去經濟性的價格帶。Flash 的 $0.14/$0.28 每百萬 token 落在此線之下,亦與 OpenRouter 7 月排行榜上 DeepSeek 日處理約 9439 億 token(第 2 名)的用量相互呼應。

V4-Flash-0731 官方規格與發表數據

項目 DeepSeek V4-Flash-0731
上線日期2026 年 7 月 31 日(正式 API)
總 / 啟動參數284B / 13B(與 V4-Pro 預覽版相同)
效能來源僅後訓練(SFT + RL)
架構CSA + HCA 混合注意力、mHC、Muon
上下文100 萬 token(V4-Pro 相對 V3.2:FLOPs 降 27%、KV 快取降 10%,廠商宣稱)
授權MIT(Hugging Face 開放權重)
API 輸入 / 輸出(每百萬 token)$0.14 / $0.28(快取命中輸入 $0.0028)
Artificial Analysis 指數 / 每任務成本50 / $0.03(獨立第三方)
Terminal Bench 2.082.7(V4-Pro 預覽 67.9,廠商 + Harness minimal)
Agent / 程式基準9 項全部超越 V4-Pro 預覽(廠商執行)
Harness7 月 31 日首次提及,未公開
App / 網頁未更新(僅 API)

標示非「獨立第三方」的列,數據來自 DeepSeek 發表材料或未公開 Harness minimal mode 的廠商執行值。

V4 Flash vs Kimi K3、Qwen3.8-Max 與封閉旗艦

同一週內 Kimi K3 權重釋出(7 月 27 日)與 Qwen3.8-Max GA(8 月 3 日)接連登場,國產萬億 MoE 定價戰進一步白熱化:

模型 總 / 啟動 API 輸入 / 輸出(每百萬 token) AA 指數 / $/任務 權重 獨立基準
V4-Flash-0731284B / 13B$0.14 / $0.28(快取 $0.0028)50 / $0.03MIT 已開源AA 指數 50
V4-Pro 預覽284B / 13B$0.435 / $0.87(快取 $0.003625)低於 Flash預覽版Terminal Bench 67.9
Kimi K32.8T / 約 104B$3 / $15(快取 $0.30)57 / $0.867 月 27 日釋出AA 57
Qwen3.8-Max2.4T / 95B$2 / $6AA 未公布承諾釋出、HF 未到Arena 初步第 5
GPT-5.6 Sol未公開綜合約 $1.40約 59 / $1.86閉源較 Flash 約高 9 分(AA)
Claude Fable 5未公開約 $10 / $50約 59 / $3.15閉源較 Flash 約高 9 分(AA)

「逼近 Opus 4.8」的說法出自廠商主導基準語境。獨立 Artificial Analysis 上 Flash 為 50 分,GPT-5.6 Sol 與 Claude Fable 5 各約高 9 分,但每任務成本分別為 $1.86 與 $3.15,差距達數十倍。多數團隊的務實策略是:大量流量走 Flash,僅在需要絕對效能的最後一哩才路由至旗艦閉源模型。

零參數增量下的架構與 Harness 解讀

DeepSeek 7 月 31 日的敘事是「同樣 284B/13B,更強的 Agent」。技術重點如下:

  • CSA + HCA:Compressed Sparse Attention 與 Hierarchical Context Attention 組合,宣稱在 100 萬 token 下相對 V3.2 降低 KV 快取負擔(FLOPs 降 27%、KV 降 10%)。
  • mHC + Muon:長工具鏈上的 RL 後訓練穩定化,據稱貢獻 Terminal Bench 82.7 等分數。
  • Harness minimal mode 侷限:公布的 9 項 Agent/程式基準均在此模式下測量。框架未公開前,與自建 harness 的落差必須列為前提。
  • V4-Pro 正式版未到:4 月 24 日預覽上線至今已逾三個月,Flash 率先以「正式 API」姿態推出。Pro 預覽使用者面臨成本與分數雙面向 Flash 傾斜的壓力。

廠商表格中「逼近 Opus 4.8」並非正式環境保證。快取異常與安全分類器逾時,是比表格數字更應優先在自家工作負載中重現的訊號。

正式環境導入前:六步評估 V4 Flash

僅看基準表無法完成路由設計。建議在具 root 權限的乾淨 macOS 主機上,從 API 並行測試起步。

  1. 固定 API 金鑰與模型 ID:在 DeepSeek 控制台取得金鑰,確認回應來自 deepseek-v4-flash-0731。舊版 deepseek-chat / deepseek-reasoner 已於 7 月 24 日標記棄用。
  2. 以相同 harness 建立基線:同一 repo、同一測試集、同一 token 上限,與 Kimi K3 或 Qwen3.8-Max 並行。廠商表格無法取代自家樣本。
v4_flash_smoke.py
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["DEEPSEEK_API_KEY"],
    base_url="https://api.deepseek.com",
)
resp = client.chat.completions.create(
    model="deepseek-v4-flash-0731",
    messages=[{"role": "user", "content": "重構此函式,保持行為不變:..."}],
)
print(resp.choices[0].message.content)
  1. 量測快取命中率:系統提示與 RAG 上下文重複使用時,輸入 $0.0028 與 $0.14 每百萬 token 的差異直接影響帳單。初期快取不一致回報須以日誌追蹤。
  2. 對照 AA 任務單價:選 20–50 個代表性任務,計算每次成功成本,與 Kimi K3($0.86/任務)、GPT-5.6 Sol($1.86/任務)比較。
  3. 多步 Agent 在隔離伺服器執行:工具呼叫鏈建議在可 wipe 的 Mac 上夜間批次跑,避免共享 CI 中過期 SDK 污染對照結果;長上下文任務亦須留意 API 頻寬與 token 帳單。
  4. 監控 Harness 公開與 V4-Pro GA:定期查閱 DeepSeek 官方文件與 Hugging Face。8 月 10–20 日 GA 傳言仍屬未證實,框架公開後應重跑基準。

時間線與可引用的硬核數據、來源

  • 2026 年 4 月 24 日:V4-Pro 預覽首次公開。
  • 7 月 24 日:deepseek-chat / deepseek-reasoner 棄用,遷移至 V4 管線。
  • 7 月 27 日:Kimi K3 權重登陸 Hugging Face。
  • 7 月 31 日:V4-Flash-0731 正式 API、Harness 首次提及(未公開),Agent 基準 9/9 超越 Pro 預覽。
  • 8 月 3 日:Qwen3.8-Max GA(API $2/$6)。
  • 規模:284B 總量、13B 啟動、100 萬 token、MIT 授權。
  • 定價:輸入 $0.14 / 輸出 $0.28 每百萬 token,快取命中輸入 $0.0028;Pro 預覽 $0.435 / $0.87(快取 $0.003625);Kimi K3 $3 / $0.30 / $15。
  • Artificial Analysis:Flash 指數 50、$0.03/任務;K3 為 57、$0.86;GPT-5.6 Sol 與 Claude Fable 5 各約高 9 分,$1.86 與 $3.15/任務。
  • Terminal Bench 2.0:Flash 82.7 vs Pro 預覽 67.9。

費率、基準與公開時程可能更新,以下一級來源優先於本文轉述。

DeepSeek 官方:

DeepSeek — 官方網站

API 文件:

DeepSeek API — 官方文件

獨立基準:

Artificial Analysis — Intelligence Index 與 $/任務

訓練權重:

Hugging Face — deepseek-ai 組織

常見問題 FAQ

V4 Flash 有增加參數嗎?

沒有。284B/13B 不變,效能提升完全來自後訓練。

Harness 現在能用嗎?

7 月 31 日首次提及後仍未公開。公布的 Agent 基準為 minimal mode,分數對 harness 設定高度敏感。

App 何時會換成 V4 Flash?

目前僅 API 更新。網頁與行動端仍為舊模型,正式環境須在 API 明確指定模型 ID。

與 Kimi K3 該怎麼選?

成本優先選 Flash($0.03/任務)。指數與開放權重自架選 K3(57,7 月 27 日釋出)。多數團隊以角色分工並用較務實。

8 月 V4-Pro GA 傳言可信嗎?

8 月 10–20 日 GA 傳言未經證實,融資相關說法亦未核實。建議待 Harness 公開後再評估。

V4-Flash-0731 在廠商表格中逼近 Opus 4.8,在 Artificial Analysis 上每任務僅幾美分。然而 Harness 未公開、快取異常有回報、V4-Pro 正式版仍缺席。與 Kimi K3 或 Qwen3.8-Max 的並行驗證,需要可 wipe 的真實 Mac,而非共享沙箱。KVMFLUX 按天租用的 Mac mini M4 提供 root 與數分鐘內 SSH,模型 ID 或路由一夜變更時可乾淨重來,在權重與 GPU 叢集就緒前是最划算的 API 對照場域。

在隔離 Mac 上驗證 V4 Flash Agent

與 Kimi K3、Qwen3.8-Max API 並行對照 — Apple Silicon、root + SSH,SDK 不互相污染。

Mac Mini M4 · 16GB / 256GB
按天$19.3 /天
按週$52.2 /週
按月$96.7 /mo
按季$263 /季