Kimi K3 到底是什么

Kimi K3 是月之暗面的新旗舰模型:一个基于 Kimi Delta Attention(KDA) 混合线性注意力机制构建的稀疏混合专家(MoE)系统,配合 Attention Residuals(注意力残差) 与官方称为 Stable LatentMoE 的路由方案。每个 token 只会激活 896 个专家中的 16 个——这个细节比"2.8 万亿参数"这个数字本身更关键:它意味着这是一个可路由、可拆解的稀疏系统,而不是需要整体当作一块 2.8 万亿参数的巨石来评估。

规格 Kimi K3
总参数量2.8 万亿
单 token 激活专家数896 选 16
上下文窗口1,048,576 token(输入+输出合计)
模态支持文本 + 图像输入,文本输出
推理模式始终开启思考;发布时仅支持 reasoning_effort: "max"
权重开源承诺 2026 年 7 月 27 日前发布,发布当天尚未可下载

支撑这些数字的训练体系里还有四个值得留意的小创新,后续读技术报告时会用到:用 Quantile Balancing(分位数均衡)替代启发式辅助损失来分配专家负载,用 Per-Head Muon 对每个注意力头独立做优化器更新,再配上 Sigmoid Tanh Unit(SiTU)Gated MLA 分别控制激活与注意力选择性。这些不影响你调用 API 的方式,但解释了月之暗面为什么能在这个规模上把训练稳定下来。

关键前提:「开源」不等于「现在就能下」

月之暗面明确表示 Kimi K3 是开源权重模型,但同样明确的是——发布当天,权重并没有出现在 Hugging Face 上。官方承诺完整权重会在 2026 年 7 月 27 日前发布,同步放出的还有技术报告和面向 vLLM 的 Kimi Delta Attention 实现。在这之前,API 和官方产品(kimi.com、Kimi Work、Kimi Code)是唯一能实际用上 K3 的方式。

就算权重按期放出,2.8 万亿参数的稀疏 MoE 也不是笔记本能跑的项目。第三方分析给出的推荐部署方案是 64 卡以上加速卡组成的超级节点,权重用 MXFP4、激活用 MXFP8。对大多数团队来说,未来几个月里 API 大概率仍然是唯一现实的路径,而不只是等到 7 月 27 日那一天。

Kimi K3 放在整个市场里处于什么位置

发布第一周内出现的跨实验室跑分对比,都应该当作阶段性结论看待——各家实验室用的评测框架不同,第三方数字也常常会被后续修正。今天能够核实的是结构性对比:上下文长度、开源姿态和定价。

模型 上下文窗口 权重 API 定价(每百万 token)
Kimi K3(月之暗面)1,048,576 token开源,7月27日前发布输入 $3.00 / 缓存命中 $0.30 / 输出 $15.00
Kimi K2.6(月之暗面上一代)256K token已开源低于 K3,定价已被 K3 取代
闭源前沿模型(Claude / GPT 系)发布时通常为 200K–256K token闭源,仅 API因厂商和档位而异

结论:目前最实在的优势是超长上下文和长上下文场景下的单 token 成本,而不是"全面碾压所有跑分"这种说法。已经有第三方评测站点把 K3 排到了自家 Frontend-Code 榜单的第一位——值得关注,但在更多评测结果出来之前,还不宜当作普适排名来引用。

6 步在一台干净的机器上把 Kimi K3 跑起来

形成自己判断最快的方式,就是在一台完全由你自己掌控的环境里调用 API——没有上一个项目遗留的 Python 版本冲突,没有装了一半的 SDK。下面是从零到跑通一次工具调用测试的 6 个步骤。

  1. 拿到 API Key:在 Kimi 开放平台注册账号,生成一个可调用 kimi-k3 模型的密钥。
  2. 准备一台干净的机器:SSH 登录一台刚开好的 macOS 主机(用一台按天起租的 Mac mini M4 很合适——有 Root 权限,也没有预装东西会跟你的实验冲突),建一个 Python 虚拟环境。
on the mac
python3 -m venv ~/kimi-lab && source ~/kimi-lab/bin/activate
pip install --upgrade openai
  1. 把兼容 OpenAI 的客户端指向月之暗面的接口:Kimi K3 兼容 OpenAI Chat Completions 协议,现成的 SDK 只需要改一下 base_url。
kimi_test.py
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["MOONSHOT_API_KEY"],
    base_url="https://api.moonshot.cn/v1",
)
  1. 发出第一次带最大推理强度的请求:K3 始终开启思考,发布时只支持 max 这一档。
kimi_test.py
resp = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "用3条要点总结一下KDA注意力机制。"}],
    extra_body={"reasoning_effort": "max"},
)
print(resp.choices[0].message.content)
  1. 测试工具调用:K3 支持 function calling 和严格 JSON Schema 输出,如果你要做的是智能体而不是聊天机器人,这一步很关键。
kimi_test.py
tools = [{
    "type": "function",
    "function": {
        "name": "get_rental_quote",
        "parameters": {"type": "object", "properties": {"sku": {"type": "string"}}},
    },
}]
resp = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "帮我查一下 m4-16-256 的按天价格。"}],
    tools=tools,
    extra_body={"reasoning_effort": "max"},
)
  1. 试试原生长驻客户端:如果目标是无人值守的智能体而不是一次性调用,可以装 Kimi Code(终端 CLI,用 /model 命令选模型),或者跑 Kimi Work 桌面客户端——月之暗面提供了 Apple Silicon 原生构建版本,直接跑在你前 5 步用的那台租来的 Mac 上,中间没有 Rosetta 转译这一层。

要让 Kimi Code 会话作为后台服务长期存活,本质上和让 CI Runner 长期存活是同一个问题:你需要仅密钥登录的 SSH、一个退出登录也不会挂掉的进程,以及一台你敢随时清空重装的机器。我们在 Xcode CI Runner 搭建指南里详细写过这套基于 launchd 的方案——那些 SSH 加固和服务注册步骤,同样适用于一个长期挂着的 Kimi Code 智能体,不只是 Xcode 构建任务。

值得引用的硬核数据

  • 总参数量 2.8 万亿,每个 token 只激活 896 个专家中的 16 个——正是这个稀疏比例把推理成本控制住了。
  • 上下文窗口 1,048,576 token,输入输出合并计算,整个窗口内定价统一,不按长度分档。
  • 全球版 API 定价:缓存未命中输入每百万 token $3.00,缓存命中每百万 token $0.30,输出每百万 token $15.00。
  • 完整权重发布日期:2026 年 7 月 27 日前,同步放出技术报告和面向 vLLM 的 Kimi Delta Attention 实现。

发布窗口期的这类细节变化很快——定价档位、限流规则、具体的权重发布日期都可能在这之前或之后调整。请以下面链接里的官方信息为准,而不是本文的转述。

月之暗面官方 —— Kimi K3 发布博客

Kimi 开放平台 —— K3 快速接入文档

Northflank —— Kimi K3 跑分、定价与自托管方案分析

IoT Digital Twin PLM —— Kimi K3 架构与基准测试拆解

常见问题 FAQ

Kimi K3 免费吗?

Kimi App 内的对话在标准限流范围内免费使用。API 按量计费:发布时缓存未命中输入每百万 token $3.00,缓存命中 $0.30,输出每百万 token $15.00。

现在能自己部署 Kimi K3 吗?

还不行。月之暗面承诺完整权重会在 2026 年 7 月 27 日前发布。而且就算权重到位,真要跑起一个 2.8 万亿参数的稀疏模型,现实里也需要多卡超级节点,不是一台单机能扛住的。

相比上一代 Kimi 模型,K3 到底变了什么?

最直观的两个跳跃是上下文窗口(从 256K 提升到超过 100 万 token)和整体规模(2.8 万亿参数 + 新的 Stable LatentMoE 路由方案),再加上一个专为长上下文解码控制成本设计的混合线性注意力机制 Kimi Delta Attention。

测试 API 需要自己有 GPU 吗?

不需要。调用托管 API 只需要一台能发 HTTPS 请求的机器——包括一台租来的 Mac 在内都够用。只有等 7 月 27 日权重发布后自己部署,GPU 才会变成必需品。

上面这 6 个步骤都不需要什么特殊装备——一个 SSH 会话加一个 Python 虚拟环境就够开始了。真正需要的是一台你不用担心被测试依赖、写到一半的智能体脚本、以及一个忘了关掉的 Kimi Code 进程搞脏的机器。共用的笔记本很快就会堆满这些痕迹;而一台可以随时清空、按天重新租用的真实 Apple Silicon 主机则完全没有这个负担。这也是为什么测试新模型发布时,用按天短租的 Mac而不是主力机,会是更划算的选择。

用真实 Apple Silicon 试一遍

按天开一台 Mac mini M4,接入 Kimi API 或者把 Kimi Code 当后台智能体跑起来,用完就退租——不会在你的主力机上留下一堆残留依赖。

Mac Mini M4 · 16GB / 256GB
按天$19.3 /天
按周$52.2 /周
按月$96.7 /月
按季$263 /季