权重终于落地,但团队仍面临三重摩擦
7 月 16 日发布、7 月 27 日才放出完整权重——这 11 天空窗里,外界只能看 Moonshot 自家表格,无法独立复现。权重公开后,新的瓶颈立刻浮现:
- 部署门槛:1.56TB 权重 + 64 卡超节点,绝大多数团队根本跑不动全量推理,只能走 API 或量化蒸馏小模型。
- 许可证陷阱:open weight ≠ open source。MaaS 年收入超 $20M 需额外协议;MAU 超 1 亿或月收入 $20M 须在产品中展示 Kimi K3——商业化前必须过法务。
- 合规与溯源:白宫 7 月 22–23 日指控蒸馏 Anthropic 模型,Greenblatt 发现 K3 会自称 Claude。权重公开后审查才开始,采购决策不能只看跑分。
- 路由复杂度:已在用 OpenRouter 统一网关 的团队,还要把 kimi-k3 塞进 Fallback 链,并对照 Opus 5 / GLM-5.2 的单任务成本。
- 评测口径不一:SWE-bench、Artificial Analysis、Moonshot 自家表格用的 effort 级别与成本假设不同,横向对比容易踩坑。
Kimi K3 和闭源前沿比怎么样?SWE-bench 与单任务成本
第三方基准给出了比发布幻灯片更可比的对照。Vals AI 的 SWE-bench Verified 与 Artificial Analysis 的综合排名,是目前外部研究者最常引用的两组数字。
| 模型 | SWE-bench Verified(Vals AI) | Artificial Analysis 综合分 | 单任务成本(Artificial Analysis) | 权重状态 |
|---|---|---|---|---|
| Claude Opus 5 | 97% | 闭源前沿 | — | 闭源 API |
| GPT-5.6 Sol | 96.2% | 闭源前沿 | — | 闭源 API |
| Claude Fable 5 | 95% | 闭源旗舰 | 约 $2.4 / task | 闭源 API |
| Kimi K3(max effort) | 93.4% | 约 57,总榜 #3、开源 #1 | 约 $0.95 / task | open weight(1.56TB) |
| GLM-5.2 | — | 约 51 | 约 $0.47 / task | open weight |
K3 在 SWE-bench 上距 Opus 5 约 3.6 个百分点,单任务成本约为 Fable 5 的 40%,Artificial Analysis 总榜第三、开源权重第一。GLM-5.2 成本更低但综合分明显落后——选型要在「能力天花板」与「单次任务账单」之间做 trade-off。架构背景可参考本站先前的 Kimi K3 深度解读。
架构与推理栈:KDA、Stable LatentMoE 与 FlashKDA 提速
技术报告披露了四项核心架构创新,以及三项同步开源的基础设施组件。
- KDA(Kernel Delta Attention):长上下文注意力的高效变体,支撑 100 万 token 窗口。
- AttnRes:注意力残差结构,稳定深层训练。
- Per-Head Muon:逐头 Muon 优化器,改善 MoE 路由收敛。
- Stable LatentMoE:896 专家 / 16 激活的稀疏 MoE,总参数 2.8T、激活约 1040 亿(104B)。
| 组件 | 类型 | 关键指标 | 说明 |
|---|---|---|---|
| MoonEP | Expert Parallel 通信库 | MoE 跨卡专家并行 | 7 月 27 日随权重一并开源 |
| FlashKDA | KDA 内核加速 | H20 上 1.72–2.22× 吞吐 | 相对 baseline 注意力实现 |
| AgentEnv | Agent 训练 / 评测环境 | checkpoint 约 133ms | 面向工具调用与多步 Agent 场景 |
权重托管在 Hugging Face moonshotai 组织下,总体积约 1.56TB——这是目前公开可下载的最大规模 open weight 模型之一。
从 Hugging Face 到生产:6 步接入 Kimi K3
大多数团队不会自部署全量 2.8T,而是 API 先行、权重审查并行。以下步骤覆盖两条路径。
- 核对许可证边界:确认你的产品是否触发 MaaS $20M / MAU 1 亿 / 月收入 $20M 条款;触发则联系 Moonshot 签补充协议,并在界面展示 Kimi K3 标识。
- 下载权重或走 API:全量自部署需 64 卡 + 超节点;轻量验证可直接调 Moonshot API,模型 ID
kimi-k3,端点api.moonshot.ai/v1。
from openai import OpenAI
client = OpenAI(api_key="YOUR_KEY", base_url="https://api.moonshot.ai/v1")
resp = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "重构这个函数,保持行为不变:..."}],
extra_body={"reasoning_effort": "max"},
)
print(resp.choices[0].message.content)
- 算清 token 账单:缓存命中输入 $0.30 / 百万 tokens,未命中 $3 / 百万 tokens,输出 $15 / 百万 tokens——长上下文 Agent 任务优先测 cache 命中率。
- 跑 SWE-bench 子集对照:用团队真实 issue-fix 任务复现 Vals AI 口径,别只信发布幻灯片;与 Opus 5 / Fable 5 比单次成功成本而非绝对通过率。
- 审查蒸馏争议线索:多 seed 问「你是谁」「报出精确模型 ID」,对照 Greenblatt 身份探测结果,再决定是否用于面向客户的 Agent。
- 写入 Fallback 链:在 OpenRouter 或自建网关里把 kimi-k3 设为 coding 主力、GLM-5.2 为低成本备选、Opus 5 为合规兜底,并记录 provenance。
自部署 64 卡超节点是 Moonshot 官方给出的全量推理门槛,不是「租几台云 GPU 就能跑」的规格。权重审查、量化实验与 API 对照可以在单台开发机上完成——这正是大多数团队的实际路径。
时间线与中美 AI 争端背景
K3 开源不是孤立事件,它落在美国对华 AI 监管升级的窗口里:
- 7 月 1 日:Claude Fable 5 公开可用,成为当时闭源软件工程能力参考线。
- 7 月 16 日:月之暗面发布 Kimi K3 预览,承诺 7 月 27 日放出完整权重。
- 7 月 22–23 日:白宫 OSTP 主任 Michael Kratsios 指控 Moonshot「产业级蒸馏」Anthropic 模型;财政部长 Scott Bessent 附和「在美国模型上发现水印」。
- 7 月 24 日:Anthropic 发布 Claude Opus 5;Ryan Greenblatt 公开 K3 自称 Claude 的统计分析。
- 7 月 27 日:完整权重 + 技术报告 + MoonEP / FlashKDA / AgentEnv 开源——外部审查正式起跑。
权重公开后,争论焦点从「能不能在两周内蒸馏出 2.8T MoE」转向「权重里是否留痕、架构是否独立创新」。Anthropic 2026 年 2 月曾点名 Moonshot 等平台存在超过 340 万次异常 API 交互——这条历史指控与本次开源审查交织在一起,采购决策需要工程与法务双线并行。
可引用的硬核数据
- 模型规模:总参数 2.8T,每 token 激活约 1040 亿(896 专家中激活 16 个),上下文 100 万 token,Hugging Face 权重约 1.56TB。
- SWE-bench Verified(Vals AI):Opus 5 97% → GPT-5.6 Sol 96.2% → Fable 5 95% → K3 93.4%。
- Artificial Analysis:K3 max effort 综合分约 57,总榜 #3、开源权重 #1;单任务成本约 $0.95(Fable 5 约 $2.4,GLM-5.2 约 $0.47)。
- FlashKDA 加速:在 H20 GPU 上相对 baseline 实现 1.72–2.22× 吞吐提升。
- AgentEnv checkpoint:约 133ms 级 checkpoint 延迟,面向 Agent 训练与评测。
- API 定价:缓存命中 $0.30 / 未命中 $3 / 输出 $15,均为每百万 tokens。
发版细节、基准方法论与许可证条款可能随后更新——请以以下 primary source 为准。
月之暗面 Kimi K3 官方发布:
完整权重与技术报告(Hugging Face):
SWE-bench Verified 第三方评测:
Vals AI — SWE-bench Verified 排行榜
综合排名与单任务成本:
常见问题
Kimi K3 是 open source 还是 open weight?
open weight,不是完整 open source。权重与推理栈可下载,但 MaaS 年收入超 $20M 需签补充协议;MAU 超 1 亿或月收入 $20M 须展示 Kimi K3 标识。
自部署 Kimi K3 需要多少 GPU?
完整权重约 1.56TB,至少需要 64 卡规模并配合超节点。绝大多数团队应优先走 api.moonshot.ai/v1 的 kimi-k3 API。
Kimi K3 在 SWE-bench Verified 上排第几?
Vals AI 数据:Opus 5 97%、GPT-5.6 Sol 96.2%、Fable 5 95%、K3 93.4%。开源权重中领先,略低于当前闭源前沿。
Kimi K3 API 怎么定价?
端点 api.moonshot.ai/v1,模型 kimi-k3。缓存命中输入 $0.30 / 百万 tokens,未命中 $3 / 百万 tokens,输出 $15 / 百万 tokens。
K3 开源和白宫蒸馏指控有什么关系?
7 月 22–23 日白宫指控蒸馏 Anthropic 模型;Greenblatt 发现 K3 自称 Claude。7 月 27 日权重公开后外部才可独立审查,但指控截至本文发布尚无终局裁决。
Kimi K3 这次开源把「能力、成本、可审计性」三件事同时推到了台前:93.4% 的 SWE-bench、$0.95 的单任务成本、1.56TB 可下载权重——数字很漂亮,但 64 卡超节点、许可证合规、蒸馏争议审查,每一项都是真实摩擦。API 冒烟、identity 探测、Fallback 链配置,需要在可 wipe、可 root 的干净环境里反复跑——共享沙箱里堆着的旧 SDK 做不到。KVMFLUX 按天起租的 Mac mini M4 提供真实 Apple Silicon 与分钟级 SSH,模型 ID 或政策一夜变更时可以 wipe 重来,先把 K3 接进你的 Agent 流水线再谈全量自部署。