权重终于落地,但团队仍面临三重摩擦

7 月 16 日发布、7 月 27 日才放出完整权重——这 11 天空窗里,外界只能看 Moonshot 自家表格,无法独立复现。权重公开后,新的瓶颈立刻浮现:

  • 部署门槛:1.56TB 权重 + 64 卡超节点,绝大多数团队根本跑不动全量推理,只能走 API 或量化蒸馏小模型。
  • 许可证陷阱:open weight ≠ open source。MaaS 年收入超 $20M 需额外协议;MAU 超 1 亿或月收入 $20M 须在产品中展示 Kimi K3——商业化前必须过法务。
  • 合规与溯源:白宫 7 月 22–23 日指控蒸馏 Anthropic 模型,Greenblatt 发现 K3 会自称 Claude。权重公开后审查才开始,采购决策不能只看跑分。
  • 路由复杂度:已在用 OpenRouter 统一网关 的团队,还要把 kimi-k3 塞进 Fallback 链,并对照 Opus 5 / GLM-5.2 的单任务成本。
  • 评测口径不一:SWE-bench、Artificial Analysis、Moonshot 自家表格用的 effort 级别与成本假设不同,横向对比容易踩坑。

Kimi K3 和闭源前沿比怎么样?SWE-bench 与单任务成本

第三方基准给出了比发布幻灯片更可比的对照。Vals AI 的 SWE-bench Verified 与 Artificial Analysis 的综合排名,是目前外部研究者最常引用的两组数字。

模型 SWE-bench Verified(Vals AI) Artificial Analysis 综合分 单任务成本(Artificial Analysis) 权重状态
Claude Opus 597%闭源前沿闭源 API
GPT-5.6 Sol96.2%闭源前沿闭源 API
Claude Fable 595%闭源旗舰约 $2.4 / task闭源 API
Kimi K3(max effort)93.4%约 57,总榜 #3、开源 #1约 $0.95 / taskopen weight(1.56TB)
GLM-5.2约 51约 $0.47 / taskopen weight

K3 在 SWE-bench 上距 Opus 5 约 3.6 个百分点,单任务成本约为 Fable 5 的 40%,Artificial Analysis 总榜第三、开源权重第一。GLM-5.2 成本更低但综合分明显落后——选型要在「能力天花板」与「单次任务账单」之间做 trade-off。架构背景可参考本站先前的 Kimi K3 深度解读

架构与推理栈:KDA、Stable LatentMoE 与 FlashKDA 提速

技术报告披露了四项核心架构创新,以及三项同步开源的基础设施组件。

  • KDA(Kernel Delta Attention):长上下文注意力的高效变体,支撑 100 万 token 窗口。
  • AttnRes:注意力残差结构,稳定深层训练。
  • Per-Head Muon:逐头 Muon 优化器,改善 MoE 路由收敛。
  • Stable LatentMoE:896 专家 / 16 激活的稀疏 MoE,总参数 2.8T、激活约 1040 亿(104B)。
组件 类型 关键指标 说明
MoonEPExpert Parallel 通信库MoE 跨卡专家并行7 月 27 日随权重一并开源
FlashKDAKDA 内核加速H20 上 1.72–2.22× 吞吐相对 baseline 注意力实现
AgentEnvAgent 训练 / 评测环境checkpoint 约 133ms面向工具调用与多步 Agent 场景

权重托管在 Hugging Face moonshotai 组织下,总体积约 1.56TB——这是目前公开可下载的最大规模 open weight 模型之一。

从 Hugging Face 到生产:6 步接入 Kimi K3

大多数团队不会自部署全量 2.8T,而是 API 先行、权重审查并行。以下步骤覆盖两条路径。

  1. 核对许可证边界:确认你的产品是否触发 MaaS $20M / MAU 1 亿 / 月收入 $20M 条款;触发则联系 Moonshot 签补充协议,并在界面展示 Kimi K3 标识。
  2. 下载权重或走 API:全量自部署需 64 卡 + 超节点;轻量验证可直接调 Moonshot API,模型 ID kimi-k3,端点 api.moonshot.ai/v1
k3_api_smoke.py
from openai import OpenAI
client = OpenAI(api_key="YOUR_KEY", base_url="https://api.moonshot.ai/v1")
resp = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "重构这个函数,保持行为不变:..."}],
    extra_body={"reasoning_effort": "max"},
)
print(resp.choices[0].message.content)
  1. 算清 token 账单:缓存命中输入 $0.30 / 百万 tokens,未命中 $3 / 百万 tokens,输出 $15 / 百万 tokens——长上下文 Agent 任务优先测 cache 命中率。
  2. 跑 SWE-bench 子集对照:用团队真实 issue-fix 任务复现 Vals AI 口径,别只信发布幻灯片;与 Opus 5 / Fable 5 比单次成功成本而非绝对通过率。
  3. 审查蒸馏争议线索:多 seed 问「你是谁」「报出精确模型 ID」,对照 Greenblatt 身份探测结果,再决定是否用于面向客户的 Agent。
  4. 写入 Fallback 链:在 OpenRouter 或自建网关里把 kimi-k3 设为 coding 主力、GLM-5.2 为低成本备选、Opus 5 为合规兜底,并记录 provenance。

自部署 64 卡超节点是 Moonshot 官方给出的全量推理门槛,不是「租几台云 GPU 就能跑」的规格。权重审查、量化实验与 API 对照可以在单台开发机上完成——这正是大多数团队的实际路径。

时间线与中美 AI 争端背景

K3 开源不是孤立事件,它落在美国对华 AI 监管升级的窗口里:

  • 7 月 1 日:Claude Fable 5 公开可用,成为当时闭源软件工程能力参考线。
  • 7 月 16 日:月之暗面发布 Kimi K3 预览,承诺 7 月 27 日放出完整权重。
  • 7 月 22–23 日:白宫 OSTP 主任 Michael Kratsios 指控 Moonshot「产业级蒸馏」Anthropic 模型;财政部长 Scott Bessent 附和「在美国模型上发现水印」。
  • 7 月 24 日:Anthropic 发布 Claude Opus 5;Ryan Greenblatt 公开 K3 自称 Claude 的统计分析。
  • 7 月 27 日:完整权重 + 技术报告 + MoonEP / FlashKDA / AgentEnv 开源——外部审查正式起跑。

权重公开后,争论焦点从「能不能在两周内蒸馏出 2.8T MoE」转向「权重里是否留痕、架构是否独立创新」。Anthropic 2026 年 2 月曾点名 Moonshot 等平台存在超过 340 万次异常 API 交互——这条历史指控与本次开源审查交织在一起,采购决策需要工程与法务双线并行。

可引用的硬核数据

  • 模型规模:总参数 2.8T,每 token 激活约 1040 亿(896 专家中激活 16 个),上下文 100 万 token,Hugging Face 权重约 1.56TB。
  • SWE-bench Verified(Vals AI):Opus 5 97% → GPT-5.6 Sol 96.2% → Fable 5 95% → K3 93.4%
  • Artificial Analysis:K3 max effort 综合分约 57,总榜 #3、开源权重 #1;单任务成本约 $0.95(Fable 5 约 $2.4,GLM-5.2 约 $0.47)。
  • FlashKDA 加速:在 H20 GPU 上相对 baseline 实现 1.72–2.22× 吞吐提升。
  • AgentEnv checkpoint:约 133ms 级 checkpoint 延迟,面向 Agent 训练与评测。
  • API 定价:缓存命中 $0.30 / 未命中 $3 / 输出 $15,均为每百万 tokens。

发版细节、基准方法论与许可证条款可能随后更新——请以以下 primary source 为准。

月之暗面 Kimi K3 官方发布:

Kimi — 官方站点

完整权重与技术报告(Hugging Face):

Hugging Face — moonshotai 组织

SWE-bench Verified 第三方评测:

Vals AI — SWE-bench Verified 排行榜

综合排名与单任务成本:

Artificial Analysis — 模型综合评测

常见问题

Kimi K3 是 open source 还是 open weight?

open weight,不是完整 open source。权重与推理栈可下载,但 MaaS 年收入超 $20M 需签补充协议;MAU 超 1 亿或月收入 $20M 须展示 Kimi K3 标识。

自部署 Kimi K3 需要多少 GPU?

完整权重约 1.56TB,至少需要 64 卡规模并配合超节点。绝大多数团队应优先走 api.moonshot.ai/v1 的 kimi-k3 API。

Kimi K3 在 SWE-bench Verified 上排第几?

Vals AI 数据:Opus 5 97%、GPT-5.6 Sol 96.2%、Fable 5 95%、K3 93.4%。开源权重中领先,略低于当前闭源前沿。

Kimi K3 API 怎么定价?

端点 api.moonshot.ai/v1,模型 kimi-k3。缓存命中输入 $0.30 / 百万 tokens,未命中 $3 / 百万 tokens,输出 $15 / 百万 tokens。

K3 开源和白宫蒸馏指控有什么关系?

7 月 22–23 日白宫指控蒸馏 Anthropic 模型;Greenblatt 发现 K3 自称 Claude。7 月 27 日权重公开后外部才可独立审查,但指控截至本文发布尚无终局裁决。

Kimi K3 这次开源把「能力、成本、可审计性」三件事同时推到了台前:93.4% 的 SWE-bench、$0.95 的单任务成本、1.56TB 可下载权重——数字很漂亮,但 64 卡超节点、许可证合规、蒸馏争议审查,每一项都是真实摩擦。API 冒烟、identity 探测、Fallback 链配置,需要在可 wipe、可 root 的干净环境里反复跑——共享沙箱里堆着的旧 SDK 做不到。KVMFLUX 按天起租的 Mac mini M4 提供真实 Apple Silicon 与分钟级 SSH,模型 ID 或政策一夜变更时可以 wipe 重来,先把 K3 接进你的 Agent 流水线再谈全量自部署。

在真实 Mac 上跑通 Kimi K3 API

独享物理 Mac mini M4,root 权限 + SSH 直连,Agent 调用与对照测试不折腾。

Mac Mini M4 · 16GB / 256GB
日租$19.3 /天
周租$52.2 /周
月租$96.7 /月
季租$263 /季