跑分亮眼但透明度滞后:选型前的三重摩擦
Qwen3.8-Max 的数字足够抢眼,但采购决策不能只看发布幻灯片:
- 开源标签超前:qwen.ai 在 GA 当天即标注「Open-Source」,但 Hugging Face / ModelScope 无仓库、无许可证、无确切日期,只有「下周」承诺——与 7 月 27 日已兑现开源的 Kimi K3 形成鲜明对比。
- 跑分口径自建:PaperBench、QwenSWEBench、RecreationBench 等多为阿里内部基准,Artificial Analysis、Arena 官方团队尚未对 GA 版给出独立复现;Arena 1496 分标注为 Preliminary。
- 预览期透明度缺口:7 月 19 日预览版未公布激活参数、禁止自动化生产调用,多家独立评测机构建议「先在自己场景测试,勿迁移生产」——GA 才补充披露 950 亿激活参数。
- Agent 长程任务难在环境:16 天无人工介入编码、500 步芯片设计优化等案例需在可 wipe、可 root 的隔离环境反复验证,共享沙箱堆着的旧 SDK 无法复现。
核心数据一览:Qwen3.8-Max 官方公布参数
| 项目 | Qwen3.8-Max |
|---|---|
| 发布日期 | 2026 年 8 月 3 日(GA) |
| 总参数 / 激活参数 | 2.4 万亿 / 950 亿 |
| 架构 | 基于 Qwen3.5 稀疏 MoE + 混合注意力 |
| 上下文窗口 | 100 万 token(思考模式约 98.3 万,输出上限 13.1 万) |
| 输入模态 | 文本 / 图像 / 视频 |
| API 定价(每百万 token) | 输入 $2,输出 $6(隐式缓存命中 $0.25) |
| Arena 文本竞技场(8 月 1 日快照) | 第 5 名,1496 分(初步);前 4 与 6–8 名均为 Anthropic |
| Arena 视觉竞技场 | 第 2 名,仅次于 Claude Fable 5 |
| PaperBench(阿里自测) | 93.0(较上代 +28.2) |
| SWE-bench Pro(阿里自测) | 67.7(落后 Fable 5 的 80.0) |
| 权重开源状态 | 承诺「下周」,截至发稿未上线 |
表中带「阿里自测」的数据来自官方发布材料,尚无中立平台对 GA 版的正式复现结果。
Qwen3.8-Max vs Kimi K3 vs DeepSeek V4 vs Claude
把 Qwen3.8-Max 放进 2026 年 7 月国产万亿 MoE 混战,横向对照更清晰:
| 模型 | 总参数 / 激活 | 上下文 | 定价(输入/输出,$/百万 token) | 权重状态 | 独立第三方评测 |
|---|---|---|---|---|---|
| Qwen3.8-Max | 2.4T / 950 亿 | 100 万 | $2 / $6 | 未开源(承诺中) | 暂无 |
| Kimi K3 | 2.8T / 约 500 亿 | 约 104.8 万 | $3 / $15 | 已开源(7 月 27 日) | Artificial Analysis 约 57.11 |
| DeepSeek V4-Flash | 较 V4-Pro 未增 | 100 万 | 未完整公开 | 已开源 | 9 项 Agent/代码基准超 V4-Pro |
| Claude Opus 5 | 未公开 | 100 万 | $5 / $25 | 闭源 | Arena 前列 |
| Claude Fable 5 | 未公开 | 100 万 | $10 / $50 | 闭源 | Arena 文本第 1 |
唯一可比的独立盲测(269 个文件的真实架构任务):Kimi K3 83 分、Qwen3.8-Max 预览版 80 分——差距很小,属互有胜负而非全面碾压。Kimi 与 DeepSeek 已公开激活参数量;阿里直到 GA 才披露 950 亿,预览期透明度不足曾被独立机构点名。定价战背景可参考本站 GPT-5.6 降价解读。
2.4 万亿背后:MoE 效率、推理档位与 Agent 生态
Qwen3.8-Max 延续 Qwen3.5 稀疏 MoE 路线:总参数 2.4 万亿,每 token 仅激活 950 亿——推理成本跟踪激活量而非总量,因此 API 定价可压到 $2/$6,明显低于 Claude Opus 5($5/$25)与 Fable 5($10/$50)。
- reasoning_effort 三档:low / medium / xhigh(默认 xhigh),通过
enable_thinking或 Anthropic 兼容接口的reasoning.effort调节速度与深度。 - 长程自主任务:案例包括 16 天无人工介入编码、500+ 步芯片设计优化、自建 RecreationBench(黑盒环境下仅凭交互与视觉反馈还原应用)——均为阿里自建评测,部分过程见 GitHub
qwen-code-dev-bot/oh-my-cli,非完整第三方审计。 - 生态卡位:同步上线「千问办公」Agent 产品,API 兼容 OpenAI 与 Anthropic 协议,可接入 Claude Code、Codex、Qoder CLI、Qwen Code、OpenClaw 等工具链。
- 消费端渗透:经压缩的 Qwen 模型已成为 Apple Intelligence 中国版核心引擎,在 iPhone 15 及以上机型本地运行——千问商业化半径已延伸至数亿部 iPhone 系统级 AI。
从 API 冒烟到生产决策:6 步评估 Qwen3.8-Max
在权重落地与独立评测补齐之前,务实路径是 API 先行、自建样本对照并行。
- 确认接口与协议:通过 QwenCloud / 阿里云 Model Studio 获取 Key,核对 OpenAI 兼容与 Anthropic 兼容端点是否覆盖你的 Agent 框架。
- 核对权重与许可证状态:每日检查 Hugging Face / ModelScope 是否上线 Qwen3.8-Max 与 Qwen3.8-27B 仓库及许可证条款,勿仅凭官网「Open-Source」标签做架构决策。
from openai import OpenAI
client = OpenAI(
api_key="YOUR_KEY",
base_url="https://dashscope.aliyuncs.com/compatible-mode/v1",
)
resp = client.chat.completions.create(
model="qwen3.8-max",
messages=[{"role": "user", "content": "重构此函数,保持行为不变:..."}],
extra_body={"enable_thinking": True},
)
print(resp.choices[0].message.content)
- 用真实业务样本 A/B:选 20–50 个代表性任务,与 Kimi K3、DeepSeek V4-Flash API 盲审打分,不只看阿里发布表。
- 压降 token 账单:测试隐式缓存命中率;按任务复杂度下调 reasoning_effort,长上下文 Agent 优先测 cache 策略。
- 审查跑分脚注与竞品质疑:阿里对比表脚注称「Fable 5 可能涉及 fallback」——同时审视自家 QwenSWEBench 方法论是否可第三方复现。
- 在隔离环境跑长程 Agent:多步工具调用、overnight coding 任务在可 wipe 的 Mac 上反复跑,避免共享 CI 环境污染对照结果。
2.4 万亿完整权重需多节点数据中心级硬件;绝大多数团队应走 API 或等待 Qwen3.8-27B 开源后再谈本地部署。Agent 对照测试可在单台开发机上完成。
时间线与 2026 万亿参数竞赛背景
- 7 月 16 日:月之暗面发布 Kimi K3(2.8T,896 专家激活 16 个),主打独立评测与透明技术报告。
- 7 月 19 日:Qwen3.8-Max 预览版开放,价格为正式价 10%,未公布激活参数与跑分。
- 7 月 27 日:Kimi K3 权重按承诺登陆 Hugging Face。
- 7 月 31 日:DeepSeek V4-Flash 正式版在不增参数前提下大幅超越 V4-Pro 预览版 Agent/代码基准。
- 8 月 3 日:Qwen3.8-Max GA + 千问办公上线;阿里港股涨约 7%、美股涨约 4.5%。
- 预计 8 月 10 日前后:Qwen3.8-Max 与 Qwen3.8-27B 权重计划开源,具体日以官方为准。
2026 年是万亿参数「扩产年」,但 DeepSeek V4-Flash 证明不靠堆参数也能提升 Agent 能力——参数竞赛叙事正被架构效率竞赛取代。阿里首次承诺开源 Max 级权重,与 Kimi、DeepSeek 构成国产头部集体转向开放权重的格局。同期美国白宫因 Agent 越狱事件召集 OpenAI、Anthropic、Google、Meta 商讨网络安全测试框架——中美 AI 监管节奏形成鲜明对照。
可引用的硬核数据与来源
- 规模:总参数 2.4T,激活 950B,上下文 1M token,多模态输入文本/图像/视频。
- Arena(8 月 1 日快照):文本竞技场第 5(1496,初步),视觉第 2;前 8 文本席位中唯一非 Anthropic。
- 阿里自测:PaperBench 93.0、OSWorld-Verified 86.1、SWE-bench Pro 67.7、HLE 43.6。
- API 定价:输入 $2 / 输出 $6 每百万 token;国内口径输入 12 元 / 输出 36 元每百万 token。
- 资本市场:发布日阿里港股约 +7%、美股约 +4.5%。
发版细节、开源时间与跑分可能随后更新——请以官方链接为准。
阿里巴巴 Qwen 官方与云产品:
Arena 公开排行榜(2026 年 8 月 1 日快照):
Apple Intelligence 中国版相关报道:
TechCrunch — Apple Intelligence China coverage
常见问题
Qwen3.8-Max 现在能直接用吗?开源了没有?
API 已可通过 QwenCloud 调用,兼容 OpenAI 与 Anthropic 协议。权重尚未开源,Hugging Face / ModelScope 仓库与许可证预计 8 月 10 日前后公布,以官方公告为准。
Qwen3.8-Max 和 Kimi K3 到底谁更强?
无权威统一评测。独立盲测中 Kimi K3 83 分、Qwen 预览版 80 分,同档位互有胜负。K3 优势是已开源与第三方数据;Qwen 优势是更低 API 价与更全面多模态。
2.4 万亿参数是不是普通开发者用不起?
MoE 下 2.4T 为总量,激活 950 亿,API 成本接近千亿级。本地部署完整版需数据中心级硬件;更现实是等 Qwen3.8-27B 或走 API。
阿里公布的跑分能信吗?
可作参考不能当定论。数据来自阿里自建框架与自定义基准,Arena 排名为初步。建议等独立复现或在业务场景 A/B 测试。
对普通用户有什么实际影响?
除开发者拿到更便宜旗舰 API 外,国内 iPhone 用户已在 Apple Intelligence 系统功能中间接使用经压缩的 Qwen 模型,无需主动选择厂商。
Qwen3.8-Max 把「Arena 前五」「下周开源」「$2/$6 定价」三件事同时推到台前——数字很漂亮,但权重未落地、跑分未独立复现、预览期透明度缺口,每一项都是真实摩擦。API 冒烟、Kimi K3 盲审对照、长程 Agent 验证,需要在可 wipe、可 root 的干净 Mac 上反复跑——共享沙箱做不到。KVMFLUX 按天起租的 Mac mini M4 提供真实 Apple Silicon 与分钟级 SSH,模型政策一夜变更时可以 wipe 重来,先把 Qwen 接进 Agent 流水线再谈等权重开源。