Kimi K3 到底是什么
Kimi K3 是月之暗面的新旗舰模型:一个基于 Kimi Delta Attention(KDA) 混合线性注意力机制构建的稀疏混合专家(MoE)系统,配合 Attention Residuals(注意力残差) 与官方称为 Stable LatentMoE 的路由方案。每个 token 只会激活 896 个专家中的 16 个——这个细节比"2.8 万亿参数"这个数字本身更关键:它意味着这是一个可路由、可拆解的稀疏系统,而不是需要整体当作一块 2.8 万亿参数的巨石来评估。
| 规格 | Kimi K3 |
|---|---|
| 总参数量 | 2.8 万亿 |
| 单 token 激活专家数 | 896 选 16 |
| 上下文窗口 | 1,048,576 token(输入+输出合计) |
| 模态支持 | 文本 + 图像输入,文本输出 |
| 推理模式 | 始终开启思考;发布时仅支持 reasoning_effort: "max" |
| 权重开源 | 承诺 2026 年 7 月 27 日前发布,发布当天尚未可下载 |
支撑这些数字的训练体系里还有四个值得留意的小创新,后续读技术报告时会用到:用 Quantile Balancing(分位数均衡)替代启发式辅助损失来分配专家负载,用 Per-Head Muon 对每个注意力头独立做优化器更新,再配上 Sigmoid Tanh Unit(SiTU) 与 Gated MLA 分别控制激活与注意力选择性。这些不影响你调用 API 的方式,但解释了月之暗面为什么能在这个规模上把训练稳定下来。
关键前提:「开源」不等于「现在就能下」
月之暗面明确表示 Kimi K3 是开源权重模型,但同样明确的是——发布当天,权重并没有出现在 Hugging Face 上。官方承诺完整权重会在 2026 年 7 月 27 日前发布,同步放出的还有技术报告和面向 vLLM 的 Kimi Delta Attention 实现。在这之前,API 和官方产品(kimi.com、Kimi Work、Kimi Code)是唯一能实际用上 K3 的方式。
就算权重按期放出,2.8 万亿参数的稀疏 MoE 也不是笔记本能跑的项目。第三方分析给出的推荐部署方案是 64 卡以上加速卡组成的超级节点,权重用 MXFP4、激活用 MXFP8。对大多数团队来说,未来几个月里 API 大概率仍然是唯一现实的路径,而不只是等到 7 月 27 日那一天。
Kimi K3 放在整个市场里处于什么位置
发布第一周内出现的跨实验室跑分对比,都应该当作阶段性结论看待——各家实验室用的评测框架不同,第三方数字也常常会被后续修正。今天能够核实的是结构性对比:上下文长度、开源姿态和定价。
| 模型 | 上下文窗口 | 权重 | API 定价(每百万 token) |
|---|---|---|---|
| Kimi K3(月之暗面) | 1,048,576 token | 开源,7月27日前发布 | 输入 $3.00 / 缓存命中 $0.30 / 输出 $15.00 |
| Kimi K2.6(月之暗面上一代) | 256K token | 已开源 | 低于 K3,定价已被 K3 取代 |
| 闭源前沿模型(Claude / GPT 系) | 发布时通常为 200K–256K token | 闭源,仅 API | 因厂商和档位而异 |
结论:目前最实在的优势是超长上下文和长上下文场景下的单 token 成本,而不是"全面碾压所有跑分"这种说法。已经有第三方评测站点把 K3 排到了自家 Frontend-Code 榜单的第一位——值得关注,但在更多评测结果出来之前,还不宜当作普适排名来引用。
6 步在一台干净的机器上把 Kimi K3 跑起来
形成自己判断最快的方式,就是在一台完全由你自己掌控的环境里调用 API——没有上一个项目遗留的 Python 版本冲突,没有装了一半的 SDK。下面是从零到跑通一次工具调用测试的 6 个步骤。
- 拿到 API Key:在 Kimi 开放平台注册账号,生成一个可调用
kimi-k3模型的密钥。 - 准备一台干净的机器:SSH 登录一台刚开好的 macOS 主机(用一台按天起租的 Mac mini M4 很合适——有 Root 权限,也没有预装东西会跟你的实验冲突),建一个 Python 虚拟环境。
python3 -m venv ~/kimi-lab && source ~/kimi-lab/bin/activate
pip install --upgrade openai
- 把兼容 OpenAI 的客户端指向月之暗面的接口:Kimi K3 兼容 OpenAI Chat Completions 协议,现成的 SDK 只需要改一下 base_url。
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["MOONSHOT_API_KEY"],
base_url="https://api.moonshot.cn/v1",
)
- 发出第一次带最大推理强度的请求:K3 始终开启思考,发布时只支持
max这一档。
resp = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "用3条要点总结一下KDA注意力机制。"}],
extra_body={"reasoning_effort": "max"},
)
print(resp.choices[0].message.content)
- 测试工具调用:K3 支持 function calling 和严格 JSON Schema 输出,如果你要做的是智能体而不是聊天机器人,这一步很关键。
tools = [{
"type": "function",
"function": {
"name": "get_rental_quote",
"parameters": {"type": "object", "properties": {"sku": {"type": "string"}}},
},
}]
resp = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "帮我查一下 m4-16-256 的按天价格。"}],
tools=tools,
extra_body={"reasoning_effort": "max"},
)
- 试试原生长驻客户端:如果目标是无人值守的智能体而不是一次性调用,可以装 Kimi Code(终端 CLI,用
/model命令选模型),或者跑 Kimi Work 桌面客户端——月之暗面提供了 Apple Silicon 原生构建版本,直接跑在你前 5 步用的那台租来的 Mac 上,中间没有 Rosetta 转译这一层。
要让 Kimi Code 会话作为后台服务长期存活,本质上和让 CI Runner 长期存活是同一个问题:你需要仅密钥登录的 SSH、一个退出登录也不会挂掉的进程,以及一台你敢随时清空重装的机器。我们在 Xcode CI Runner 搭建指南里详细写过这套基于 launchd 的方案——那些 SSH 加固和服务注册步骤,同样适用于一个长期挂着的 Kimi Code 智能体,不只是 Xcode 构建任务。
值得引用的硬核数据
- 总参数量 2.8 万亿,每个 token 只激活 896 个专家中的 16 个——正是这个稀疏比例把推理成本控制住了。
- 上下文窗口 1,048,576 token,输入输出合并计算,整个窗口内定价统一,不按长度分档。
- 全球版 API 定价:缓存未命中输入每百万 token $3.00,缓存命中每百万 token $0.30,输出每百万 token $15.00。
- 完整权重发布日期:2026 年 7 月 27 日前,同步放出技术报告和面向 vLLM 的 Kimi Delta Attention 实现。
发布窗口期的这类细节变化很快——定价档位、限流规则、具体的权重发布日期都可能在这之前或之后调整。请以下面链接里的官方信息为准,而不是本文的转述。
Northflank —— Kimi K3 跑分、定价与自托管方案分析
IoT Digital Twin PLM —— Kimi K3 架构与基准测试拆解
常见问题 FAQ
Kimi K3 免费吗?
Kimi App 内的对话在标准限流范围内免费使用。API 按量计费:发布时缓存未命中输入每百万 token $3.00,缓存命中 $0.30,输出每百万 token $15.00。
现在能自己部署 Kimi K3 吗?
还不行。月之暗面承诺完整权重会在 2026 年 7 月 27 日前发布。而且就算权重到位,真要跑起一个 2.8 万亿参数的稀疏模型,现实里也需要多卡超级节点,不是一台单机能扛住的。
相比上一代 Kimi 模型,K3 到底变了什么?
最直观的两个跳跃是上下文窗口(从 256K 提升到超过 100 万 token)和整体规模(2.8 万亿参数 + 新的 Stable LatentMoE 路由方案),再加上一个专为长上下文解码控制成本设计的混合线性注意力机制 Kimi Delta Attention。
测试 API 需要自己有 GPU 吗?
不需要。调用托管 API 只需要一台能发 HTTPS 请求的机器——包括一台租来的 Mac 在内都够用。只有等 7 月 27 日权重发布后自己部署,GPU 才会变成必需品。
上面这 6 个步骤都不需要什么特殊装备——一个 SSH 会话加一个 Python 虚拟环境就够开始了。真正需要的是一台你不用担心被测试依赖、写到一半的智能体脚本、以及一个忘了关掉的 Kimi Code 进程搞脏的机器。共用的笔记本很快就会堆满这些痕迹;而一台可以随时清空、按天重新租用的真实 Apple Silicon 主机则完全没有这个负担。这也是为什么测试新模型发布时,用按天短租的 Mac而不是主力机,会是更划算的选择。