跑分亮眼但透明度滞后:选型前的三重摩擦

Qwen3.8-Max 的数字足够抢眼,但采购决策不能只看发布幻灯片:

  • 开源标签超前:qwen.ai 在 GA 当天即标注「Open-Source」,但 Hugging Face / ModelScope 无仓库、无许可证、无确切日期,只有「下周」承诺——与 7 月 27 日已兑现开源的 Kimi K3 形成鲜明对比。
  • 跑分口径自建:PaperBench、QwenSWEBench、RecreationBench 等多为阿里内部基准,Artificial Analysis、Arena 官方团队尚未对 GA 版给出独立复现;Arena 1496 分标注为 Preliminary。
  • 预览期透明度缺口:7 月 19 日预览版未公布激活参数、禁止自动化生产调用,多家独立评测机构建议「先在自己场景测试,勿迁移生产」——GA 才补充披露 950 亿激活参数。
  • Agent 长程任务难在环境:16 天无人工介入编码、500 步芯片设计优化等案例需在可 wipe、可 root 的隔离环境反复验证,共享沙箱堆着的旧 SDK 无法复现。

核心数据一览:Qwen3.8-Max 官方公布参数

项目 Qwen3.8-Max
发布日期2026 年 8 月 3 日(GA)
总参数 / 激活参数2.4 万亿 / 950 亿
架构基于 Qwen3.5 稀疏 MoE + 混合注意力
上下文窗口100 万 token(思考模式约 98.3 万,输出上限 13.1 万)
输入模态文本 / 图像 / 视频
API 定价(每百万 token)输入 $2,输出 $6(隐式缓存命中 $0.25)
Arena 文本竞技场(8 月 1 日快照)第 5 名,1496 分(初步);前 4 与 6–8 名均为 Anthropic
Arena 视觉竞技场第 2 名,仅次于 Claude Fable 5
PaperBench(阿里自测)93.0(较上代 +28.2)
SWE-bench Pro(阿里自测)67.7(落后 Fable 5 的 80.0)
权重开源状态承诺「下周」,截至发稿未上线

表中带「阿里自测」的数据来自官方发布材料,尚无中立平台对 GA 版的正式复现结果。

Qwen3.8-Max vs Kimi K3 vs DeepSeek V4 vs Claude

把 Qwen3.8-Max 放进 2026 年 7 月国产万亿 MoE 混战,横向对照更清晰:

模型 总参数 / 激活 上下文 定价(输入/输出,$/百万 token) 权重状态 独立第三方评测
Qwen3.8-Max2.4T / 950 亿100 万$2 / $6未开源(承诺中)暂无
Kimi K32.8T / 约 500 亿约 104.8 万$3 / $15已开源(7 月 27 日)Artificial Analysis 约 57.11
DeepSeek V4-Flash较 V4-Pro 未增100 万未完整公开已开源9 项 Agent/代码基准超 V4-Pro
Claude Opus 5未公开100 万$5 / $25闭源Arena 前列
Claude Fable 5未公开100 万$10 / $50闭源Arena 文本第 1

唯一可比的独立盲测(269 个文件的真实架构任务):Kimi K3 83 分、Qwen3.8-Max 预览版 80 分——差距很小,属互有胜负而非全面碾压。Kimi 与 DeepSeek 已公开激活参数量;阿里直到 GA 才披露 950 亿,预览期透明度不足曾被独立机构点名。定价战背景可参考本站 GPT-5.6 降价解读

2.4 万亿背后:MoE 效率、推理档位与 Agent 生态

Qwen3.8-Max 延续 Qwen3.5 稀疏 MoE 路线:总参数 2.4 万亿,每 token 仅激活 950 亿——推理成本跟踪激活量而非总量,因此 API 定价可压到 $2/$6,明显低于 Claude Opus 5($5/$25)与 Fable 5($10/$50)。

  • reasoning_effort 三档:low / medium / xhigh(默认 xhigh),通过 enable_thinking 或 Anthropic 兼容接口的 reasoning.effort 调节速度与深度。
  • 长程自主任务:案例包括 16 天无人工介入编码、500+ 步芯片设计优化、自建 RecreationBench(黑盒环境下仅凭交互与视觉反馈还原应用)——均为阿里自建评测,部分过程见 GitHub qwen-code-dev-bot/oh-my-cli,非完整第三方审计。
  • 生态卡位:同步上线「千问办公」Agent 产品,API 兼容 OpenAI 与 Anthropic 协议,可接入 Claude Code、Codex、Qoder CLI、Qwen Code、OpenClaw 等工具链。
  • 消费端渗透:经压缩的 Qwen 模型已成为 Apple Intelligence 中国版核心引擎,在 iPhone 15 及以上机型本地运行——千问商业化半径已延伸至数亿部 iPhone 系统级 AI。

从 API 冒烟到生产决策:6 步评估 Qwen3.8-Max

在权重落地与独立评测补齐之前,务实路径是 API 先行、自建样本对照并行。

  1. 确认接口与协议:通过 QwenCloud / 阿里云 Model Studio 获取 Key,核对 OpenAI 兼容与 Anthropic 兼容端点是否覆盖你的 Agent 框架。
  2. 核对权重与许可证状态:每日检查 Hugging Face / ModelScope 是否上线 Qwen3.8-Max 与 Qwen3.8-27B 仓库及许可证条款,勿仅凭官网「Open-Source」标签做架构决策。
qwen_api_smoke.py
from openai import OpenAI
client = OpenAI(
    api_key="YOUR_KEY",
    base_url="https://dashscope.aliyuncs.com/compatible-mode/v1",
)
resp = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[{"role": "user", "content": "重构此函数,保持行为不变:..."}],
    extra_body={"enable_thinking": True},
)
print(resp.choices[0].message.content)
  1. 用真实业务样本 A/B:选 20–50 个代表性任务,与 Kimi K3、DeepSeek V4-Flash API 盲审打分,不只看阿里发布表。
  2. 压降 token 账单:测试隐式缓存命中率;按任务复杂度下调 reasoning_effort,长上下文 Agent 优先测 cache 策略。
  3. 审查跑分脚注与竞品质疑:阿里对比表脚注称「Fable 5 可能涉及 fallback」——同时审视自家 QwenSWEBench 方法论是否可第三方复现。
  4. 在隔离环境跑长程 Agent:多步工具调用、overnight coding 任务在可 wipe 的 Mac 上反复跑,避免共享 CI 环境污染对照结果。

2.4 万亿完整权重需多节点数据中心级硬件;绝大多数团队应走 API 或等待 Qwen3.8-27B 开源后再谈本地部署。Agent 对照测试可在单台开发机上完成。

时间线与 2026 万亿参数竞赛背景

  • 7 月 16 日:月之暗面发布 Kimi K3(2.8T,896 专家激活 16 个),主打独立评测与透明技术报告。
  • 7 月 19 日:Qwen3.8-Max 预览版开放,价格为正式价 10%,未公布激活参数与跑分。
  • 7 月 27 日:Kimi K3 权重按承诺登陆 Hugging Face。
  • 7 月 31 日:DeepSeek V4-Flash 正式版在不增参数前提下大幅超越 V4-Pro 预览版 Agent/代码基准。
  • 8 月 3 日:Qwen3.8-Max GA + 千问办公上线;阿里港股涨约 7%、美股涨约 4.5%。
  • 预计 8 月 10 日前后:Qwen3.8-Max 与 Qwen3.8-27B 权重计划开源,具体日以官方为准。

2026 年是万亿参数「扩产年」,但 DeepSeek V4-Flash 证明不靠堆参数也能提升 Agent 能力——参数竞赛叙事正被架构效率竞赛取代。阿里首次承诺开源 Max 级权重,与 Kimi、DeepSeek 构成国产头部集体转向开放权重的格局。同期美国白宫因 Agent 越狱事件召集 OpenAI、Anthropic、Google、Meta 商讨网络安全测试框架——中美 AI 监管节奏形成鲜明对照。

可引用的硬核数据与来源

  • 规模:总参数 2.4T,激活 950B,上下文 1M token,多模态输入文本/图像/视频。
  • Arena(8 月 1 日快照):文本竞技场第 5(1496,初步),视觉第 2;前 8 文本席位中唯一非 Anthropic。
  • 阿里自测:PaperBench 93.0、OSWorld-Verified 86.1、SWE-bench Pro 67.7、HLE 43.6。
  • API 定价:输入 $2 / 输出 $6 每百万 token;国内口径输入 12 元 / 输出 36 元每百万 token。
  • 资本市场:发布日阿里港股约 +7%、美股约 +4.5%。

发版细节、开源时间与跑分可能随后更新——请以官方链接为准。

阿里巴巴 Qwen 官方与云产品:

Qwen — 官方站点

Alibaba Cloud — 官方云产品

Arena 公开排行榜(2026 年 8 月 1 日快照):

Arena.ai — 文本与视觉竞技场

Apple Intelligence 中国版相关报道:

TechCrunch — Apple Intelligence China coverage

常见问题

Qwen3.8-Max 现在能直接用吗?开源了没有?

API 已可通过 QwenCloud 调用,兼容 OpenAI 与 Anthropic 协议。权重尚未开源,Hugging Face / ModelScope 仓库与许可证预计 8 月 10 日前后公布,以官方公告为准。

Qwen3.8-Max 和 Kimi K3 到底谁更强?

无权威统一评测。独立盲测中 Kimi K3 83 分、Qwen 预览版 80 分,同档位互有胜负。K3 优势是已开源与第三方数据;Qwen 优势是更低 API 价与更全面多模态。

2.4 万亿参数是不是普通开发者用不起?

MoE 下 2.4T 为总量,激活 950 亿,API 成本接近千亿级。本地部署完整版需数据中心级硬件;更现实是等 Qwen3.8-27B 或走 API。

阿里公布的跑分能信吗?

可作参考不能当定论。数据来自阿里自建框架与自定义基准,Arena 排名为初步。建议等独立复现或在业务场景 A/B 测试。

对普通用户有什么实际影响?

除开发者拿到更便宜旗舰 API 外,国内 iPhone 用户已在 Apple Intelligence 系统功能中间接使用经压缩的 Qwen 模型,无需主动选择厂商。

Qwen3.8-Max 把「Arena 前五」「下周开源」「$2/$6 定价」三件事同时推到台前——数字很漂亮,但权重未落地、跑分未独立复现、预览期透明度缺口,每一项都是真实摩擦。API 冒烟、Kimi K3 盲审对照、长程 Agent 验证,需要在可 wipe、可 root 的干净 Mac 上反复跑——共享沙箱做不到。KVMFLUX 按天起租的 Mac mini M4 提供真实 Apple Silicon 与分钟级 SSH,模型政策一夜变更时可以 wipe 重来,先把 Qwen 接进 Agent 流水线再谈等权重开源。

在真实 Mac 上跑通 Qwen Agent 对照

独享物理 Mac mini M4,root 权限 + SSH 直连,多模型 API 冒烟不折腾。

Mac Mini M4 · 16GB / 256GB
日租$19.3 /天
周租$52.2 /周
月租$96.7 /月
季租$263 /季