跑分好看不等于没水分:选型前的四重摩擦

DeepSeek V4-Flash-0731 数字抢眼,但采购与架构决策不能只看 changelog:

  • Agent 跑分依赖 Harness:Terminal Bench 2.0 82.7 分(反超 V4-Pro 预览版 67.9)全部基于 DeepSeek 自研且尚未公开发布的 Harness「极简模式」测得,官方主动提示「跑分对 harness 选择非常敏感」。
  • 仅 API 更新:7月31日公测仅限 API,App 和网页端暂未同步;消费端用户感知与开发者 API 体验存在断层。
  • 可用性反馈参差:据21世纪经济报道援引海外开发者社区,正式版存在输入缓存命中率偏低、安全分类器偶发超时等问题,与「跑分暴涨」叙事形成反差。
  • 旗舰与框架仍悬空:V4-Pro 官方版与 Harness 无确切日期;中文媒体流传的「8月10–20日 GA」为未署名消息,DeepSeek 原话仅为「尽快发布」。
  • Agent 长程任务需隔离环境:多步工具调用、overnight coding 对照需在可 wipe、可 root 的机器上反复跑——共享 CI 堆着的旧 SDK 无法复现 vendor showcase。

时间线:从4月预览到7月「官方版」

  • 2026年4月24日:DeepSeek-V4预览版首次发布并开源,V4-Pro(1.6T总参数/49B激活)与 V4-Flash(284B/13B)均支持100万token上下文,MIT协议。
  • 2026年7月24日:旧接口模型名 deepseek-chatdeepseek-reasoner 正式停用,全部流量切换到 V4 系列命名。
  • 2026年7月27日:月之暗面 Kimi K3(2.8T)开源权重上线 Hugging Face,给 DeepSeek 制造竞争压力。
  • 2026年7月31日:DeepSeek-V4-Flash-0731 正式版进入 API 公测,开源权重同步 Hugging Face;changelog 首次点名自研 Agent 框架「Harness」,称即将随 V4 正式版发布。
  • 截至2026年8月5日:V4-Pro 官方版仍是「尽快发布」;有媒体援引未署名消息称内部测试已在7月28日那周启动——未经 DeepSeek 官方证实,仅供参考

核心数据一览:定价与规格对照

模型 状态 总参数 / 激活 上下文 输入(缓存未命中/命中,$/百万token) 输出($/百万token) 协议
DeepSeek-V4-Flash-0731官方正式版(07-31)284B / 13B1M$0.14 / $0.0028$0.28MIT
DeepSeek-V4-Pro预览版(官方版未发布)1.6T / 49B1M$0.435 / $0.003625$0.87MIT
Kimi K3权重开源(07-27)2.8T / 约104B(社区估算)~1.05M$3.00 / $0.30$15.00Modified MIT
GLM-5.2开源(2026年6月)~744B / ~40B1M未在本文核实未在本文核实MIT
Qwen3.8-MaxAPI GA(08-02),权重待放出2.4T / 95B1M$2.00 / ~$0.17–0.25$6.00承诺开源

以上定价均为厂商自报公开数据。DeepSeek 已预告未来将对 API 启用「高峰时段2倍加价」(北京时间9–12点、14–18点),截至发稿未公布具体生效日期。

架构没变,后训练变强:CSA+HCA、mHC 与 Harness

V4-Flash-0731 在参数规模、模型结构上与4月预览版完全相同,性能提升「完全来自重新进行的后训练」。284B/13B 的 Flash 在多项 Agent 基准上反而超过了 1.6T/49B 的 V4-Pro 预览版——2026年下半年大模型竞争,后训练质量的重要性正在逼近甚至超过单纯堆参数。

  • 混合注意力(DSA):压缩稀疏注意力(CSA)与高度压缩注意力(HCA)叠加,降低长上下文计算与显存开销。
  • 流形约束超连接(mHC):对传统残差连接结构改进。
  • Muon 优化器:替换传统优化器,提升训练收敛速度与稳定性。
  • 效率指标(厂商自报):100万 token 上下文下,V4-Pro 单 token 推理 FLOPs 仅为 V3.2 的 27%,KV Cache 仅为 10%——尚未见独立第三方复现。
  • DeepSeek Harness:7月31日 changelog 首次正式出现,对标 Claude Code,用于文件读写、工具调用与端到端工程任务;此前 DeepSeek 模型主要依赖 Claude Code、OpenCode 等第三方 Agent 工具。

横向对比:中国开源大模型的「六边形混战」

模型 实验室 总参数 Artificial Analysis Intelligence Index 单任务平均成本(AA)
DeepSeek-V4-Flash-0731DeepSeek284B50$0.03
Kimi K3月之暗面2.8T57$0.86
GLM-5.2智谱/Z.ai~744B比 V4-Flash 高约1分未核实
GPT-5.6 SolOpenAI未公开比 V4-Flash 高9分以上$1.86
Claude Fable 5Anthropic未公开比 V4-Flash 高9分以上$3.15

Intelligence Index 与单任务成本引自 Artificial Analysis(第三方独立评测);DeepSeek 官方 Agent 跑分为厂商自报,评测方法与权重不完全一致,分开列出。反差在于:V4-Flash 智能分不是最高,但单任务成本仅为 Kimi K3 的约 1/29、GPT-5.6 Sol 的约 1/62、Claude Fable 5 的约 1/105——DeepSeek 打的是「够用的智能 + 极致的价格」,这也解释预览版为何在 OpenRouter 连续七周调用量第一

从旧模型名迁移到 V4:6 步评估与接入指南

在 Harness 公开与 V4-Pro 官方版落地之前,务实路径是 API 先行、自建样本对照并行。

  1. 停用旧模型名:若仍调用 deepseek-chatdeepseek-reasoner,7月24日起已正式停用,须切换到 deepseek-v4-flashdeepseek-v4-pro(预览)。
  2. 获取 API Key 并核对端点:登录 DeepSeek 开放平台,确认 OpenAI 兼容与 Anthropic 兼容端点是否覆盖你的 Agent 框架。
v4_flash_smoke.py
from openai import OpenAI
client = OpenAI(
    api_key="YOUR_KEY",
    base_url="https://api.deepseek.com",
)
resp = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[{"role": "user", "content": "重构此函数,保持行为不变:..."}],
    temperature=1.0,
    top_p=0.95,
)
print(resp.choices[0].message.content)
  1. 用真实业务样本 A/B:选 20–50 个代表性任务,与 Kimi K3、Qwen3.8-Max API 盲审打分,不只看 DeepSeek 发布表。
  2. 监控缓存命中率:正式版有社区反馈缓存命中率偏低——长上下文 Agent 优先测 cache 策略,对照账单变化。
  3. 区分 Harness 跑分与通用能力:Terminal Bench 82.7 等数字基于未公开 Harness minimal mode;在 Claude Code、Cursor 等框架上独立复现前勿当作通用能力。
  4. 在隔离 Mac 上跑长程 Agent:多步工具调用、overnight coding 在可 wipe 的 Mac 上反复跑,避免共享 CI 环境污染对照结果。

V4-Flash 开源权重可在 Hugging Face 下载,但完整 Agent 流水线对照更现实的路径是 API + 隔离开发机,而非在共享沙箱里堆状态。

「斩杀线」与行业背景:从「梁白开」到「梁圣」

在 V4 正式版发布之前,因 Pro 版本迟迟没有兑现「7月中旬全量上线」预期,中文 AI 社区一度把梁文锋戏称为「梁白开」。V4-Flash-0731 上线后表现超出预期,「梁圣」称号又还了回去——戏谑昵称反转本身就是观察社区情绪的风向标。

更值得关注的是「斩杀线」说法:DeepSeek 凭借「够用的性能 + 极端低价」给同行设下门槛——友商模型若性能没有明显超过 DeepSeek,又拿不出更低价格,就会在市场上失去存在感。这也解释近期 GPT-5.6 Luna 一次性降价 80% 等密集调价。7月31日当天英伟达、博通、AMD 等算力股未明显波动——市场似乎已习惯「DeepSeek 式效率突破」,不再简单把「更少算力做到同等效果」等同于利空算力股。

企业融资与 IPO 传闻(约74亿美元融资、487亿美元估值等)目前主要来自财经媒体「据报道」「消息人士称」,尚无 DeepSeek 官方或监管备案直接确认,本文作为背景呈现,不作为已核实事实。

可引用的硬核数据与来源

  • 规模:V4-Flash 284B 总参数 / 13B 激活,上下文 1M token,MIT 开源权重。
  • 定价:输入 $0.14(缓存未命中)/ $0.0028(命中),输出 $0.28 每百万 token。
  • Terminal Bench 2.0(厂商+Harness):V4-Flash-0731 82.7 vs V4-Pro 预览 67.9。
  • Artificial Analysis:Intelligence Index 50,单任务成本 $0.03。
  • 效率(厂商自报):百万 token 下 V4-Pro FLOPs 为 V3.2 的 27%,KV Cache 为 10%。

定价、跑分及 V4-Pro/Harness 上线状态可能随后更新——请以官方链接为准。本文数据截至 2026年8月5日。

DeepSeek 官方文档与模型卡:

DeepSeek API 文档与更新日志

Hugging Face — DeepSeek-V4-Flash 模型卡

第三方独立评测:

Artificial Analysis — 模型 Intelligence Index 与任务成本

中文媒体报道(转引与社区讨论):

21世纪经济报道 — DeepSeek 重磅更新报道

常见问题

DeepSeek V4和之前的V3.2相比,最大的区别是什么?

原生支持100万token上下文,长上下文计算与显存开销大幅降低(官方:V4-Pro 百万 token 下 FLOPs 为 V3.2 的 27%,KV Cache 为 10%)。V4 系列在 Agent 能力上做了专项优化,适配 Claude Code、OpenCode 等主流 Agent 工具。

日常使用应该选 V4 Flash 还是 V4 Pro?

普通对话、简单任务或大规模低成本调用(批量处理、Agent 流水线),V4-Flash-0731 性价比更高且 Agent 跑分已反超 V4-Pro 预览版。更深世界知识或复杂推理且预算不敏感,可先用 V4-Pro 预览版,等官方版上线后再评估。

现在能用上 V4 Pro 官方版吗?

截至发稿(2026年8月5日)还不能。官方版只有 V4-Flash-0731,且仅限 API。App 和网页端仍是旧版本。网上流传的「8月10–20日」为未经证实的传言。

DeepSeek 公布的跑分能直接相信吗?

SWE-bench Verified 等广泛采用的第三方基准可信度较高;Terminal Bench 2.0 等 Agent 跑分基于未公开 Harness,官方也提示对框架选择高度敏感——建议等社区用 Claude Code、Cursor 等独立复现后再下结论。

这次更新对普通开发者有什么实际影响?

若用 OpenAI ChatCompletions 或 Anthropic 格式接入 DeepSeek,deepseek-v4-flash 会自动指向新官方版本。若仍用已停用的 deepseek-chat/deepseek-reasoner,须尽快切换命名。

V4-Flash-0731 把「够用的智能 + 几十分之一的价格」推到台前——数字漂亮,但 Harness 未公开、旗舰 Pro 仍悬空、缓存与分类器反馈参差,每一项都是真实摩擦。API 冒烟、Kimi K3 盲审对照、长程 Agent 验证,需要在可 wipe、可 root 的干净 Mac 上反复跑。KVMFLUX 按天起租的 Mac mini M4 提供真实 Apple Silicon 与分钟级 SSH,模型政策一夜变更时可以 wipe 重来,先把 V4 接进 Agent 流水线再谈等 Harness 公开。

在真实 Mac 上跑通 V4 Agent 对照

独享物理 Mac mini M4,root 权限 + SSH 直连,多模型 API 冒烟不折腾。

Mac Mini M4 · 16GB / 256GB
日租$19.3 /天
周租$52.2 /周
月租$96.7 /月
季租$263 /季