Kimi K3 到底是什麼
Kimi K3 是月之暗面的新旗艦模型:一個基於 Kimi Delta Attention(KDA)混合線性注意力機制打造的稀疏混合專家(MoE)系統,搭配 Attention Residuals(注意力殘差)與官方稱為 Stable LatentMoE 的路由方案。每個 token 只會啟動 896 個專家裡的 16 個——這個細節比「2.8 兆參數」這個數字本身更重要:代表這是一套可路由、可拆解的稀疏系統,不必當成一整塊 2.8 兆參數的巨石來評估。
| 規格 | Kimi K3 |
|---|---|
| 總參數量 | 2.8 兆 |
| 單 token 啟動專家數 | 896 選 16 |
| 上下文窗口 | 1,048,576 token(輸入+輸出合計) |
| 模態支援 | 文字+圖片輸入,文字輸出 |
| 推理模式 | 始終開啟思考;發布時僅支援 reasoning_effort: "max" |
| 權重開源 | 承諾 2026 年 7 月 27 日前發布,發布當天尚未可下載 |
支撐這些數字的訓練體系裡還有四個值得留意的小創新,之後讀技術報告時用得上:用 Quantile Balancing(分位數平衡)取代啟發式輔助損失來分配專家負載,用 Per-Head Muon 對每個注意力頭獨立做最佳化更新,再搭配 Sigmoid Tanh Unit(SiTU)與 Gated MLA 分別控制啟動與注意力選擇性。這些不會影響你呼叫 API 的方式,但說明了月之暗面為何能在這個規模上把訓練穩定下來。
關鍵前提:「開源」不等於「現在就能下載」
月之暗面明確表示 Kimi K3 是開源權重模型,但同樣明確的是——發布當天,權重並未出現在 Hugging Face 上。官方承諾完整權重會在 2026 年 7 月 27 日前發布,同步釋出的還有技術報告以及面向 vLLM 的 Kimi Delta Attention 實作。在那之前,API 與官方產品(kimi.com、Kimi Work、Kimi Code)是唯一能真正用上 K3 的途徑。
就算權重如期釋出,2.8 兆參數的稀疏 MoE 也不是一台筆電能扛住的專案。第三方分析給出的建議部署方案是 64 卡以上加速卡組成的超級節點,權重用 MXFP4、啟動值用 MXFP8。對多數團隊來說,未來幾個月 API 大概率仍是唯一實際可行的路徑,不只是等到 7 月 27 日那一天而已。
Kimi K3 放在整個市場裡處於什麼位置
發布第一週內出現的跨實驗室跑分比較,都該視為階段性結論——各家實驗室用的評測框架不同,第三方數字也經常會被後續修正。目前能核實的是結構性比較:上下文長度、開源姿態與定價。
| 模型 | 上下文窗口 | 權重 | API 定價(每百萬 token) |
|---|---|---|---|
| Kimi K3(月之暗面) | 1,048,576 token | 開源,7月27日前發布 | 輸入 $3.00/快取命中 $0.30/輸出 $15.00 |
| Kimi K2.6(月之暗面上一代) | 256K token | 已開源 | 低於 K3,定價已被 K3 取代 |
| 閉源前沿模型(Claude/GPT 系) | 發布時通常為 200K–256K token | 閉源,僅提供 API | 依廠商與方案而異 |
結論:目前最實在的優勢是超長上下文與長上下文情境下的單 token 成本,而不是「全面輾壓所有跑分」這種說法。已經有第三方評測站把 K3 排到自家 Frontend-Code 榜單的第一名——值得關注,但在更多評測結果出爐前,還不宜當成普遍排名來引用。
6 步在一台乾淨的機器上把 Kimi K3 跑起來
建立自己判斷最快的方式,就是在一個完全由你掌控的環境裡呼叫 API——沒有前一個專案殘留的 Python 版本衝突,也沒有裝到一半的 SDK。以下是從零到跑通一次工具呼叫測試的 6 個步驟。
- 取得 API 金鑰:到 Kimi 開放平台註冊帳號,產生一組可呼叫
kimi-k3模型的金鑰。 - 準備一台乾淨的機器:SSH 登入一台剛開通的 macOS 主機(用一台按天起租的 Mac mini M4 很合適——有 Root 權限,也沒有預裝任何東西會跟你的實驗衝突),建立一個 Python 虛擬環境。
python3 -m venv ~/kimi-lab && source ~/kimi-lab/bin/activate
pip install --upgrade openai
- 把相容 OpenAI 的客戶端指向月之暗面的接口:Kimi K3 相容 OpenAI Chat Completions 協定,現成的 SDK 只需要改一下 base_url。
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["MOONSHOT_API_KEY"],
base_url="https://api.moonshot.cn/v1",
)
- 發出第一次帶最大推理強度的請求:K3 始終開啟思考,發布時僅支援
max這一檔。
resp = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "用3條要點總結一下KDA注意力機制。"}],
extra_body={"reasoning_effort": "max"},
)
print(resp.choices[0].message.content)
- 測試工具呼叫:K3 支援 function calling 與嚴格 JSON Schema 輸出,如果你要打造的是代理程式而不是聊天機器人,這一步很關鍵。
tools = [{
"type": "function",
"function": {
"name": "get_rental_quote",
"parameters": {"type": "object", "properties": {"sku": {"type": "string"}}},
},
}]
resp = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "幫我查一下 m4-16-256 的按天價格。"}],
tools=tools,
extra_body={"reasoning_effort": "max"},
)
- 試試原生長駐客戶端:如果目標是無人值守的代理程式而非一次性呼叫,可以裝 Kimi Code(終端機 CLI,用
/model指令選模型),或跑 Kimi Work 桌面客戶端——月之暗面提供了 Apple Silicon 原生版本,直接跑在你前 5 步用的那台租來的 Mac 上,中間沒有 Rosetta 轉譯這一層。
要讓 Kimi Code 工作階段作為背景服務長期存活,本質上跟讓 CI Runner 長期存活是同一個問題:你需要僅金鑰登入的 SSH、一個登出後也不會掛掉的程序,以及一台你敢隨時清空重裝的機器。我們在 Xcode CI Runner 建置指南裡詳細寫過這套基於 launchd 的方案——那些 SSH 強化與服務註冊步驟,同樣適用於一個長期掛著的 Kimi Code 代理程式,不只是 Xcode 建置任務。
值得引用的硬核數據
- 總參數量 2.8 兆,每個 token 只啟動 896 個專家裡的 16 個——正是這個稀疏比例把推理成本控制住了。
- 上下文窗口 1,048,576 token,輸入輸出合併計算,整個窗口內定價統一,不按長度分級。
- 全球版 API 定價:快取未命中輸入每百萬 token $3.00,快取命中每百萬 token $0.30,輸出每百萬 token $15.00。
- 完整權重發布日期:2026 年 7 月 27 日前,同步釋出技術報告與面向 vLLM 的 Kimi Delta Attention 實作。
發布窗口期的這類細節變化很快——定價級距、限流規則、具體的權重發布日期都可能在此之前或之後調整。請以下面連結裡的官方資訊為準,而不是本文的轉述。
Northflank —— Kimi K3 跑分、定價與自架方案分析
IoT Digital Twin PLM —— Kimi K3 架構與基準測試拆解
常見問題 FAQ
Kimi K3 是免費的嗎?
Kimi App 內的對話在標準限流範圍內免費使用。API 按量計費:發布時快取未命中輸入每百萬 token $3.00,快取命中 $0.30,輸出每百萬 token $15.00。
現在能自己部署 Kimi K3 嗎?
還不行。月之暗面承諾完整權重會在 2026 年 7 月 27 日前發布。而且就算權重到位,真要跑起一個 2.8 兆參數的稀疏模型,現實裡也需要多卡超級節點,不是一台單機扛得住的。
相較上一代 Kimi 模型,K3 到底變了什麼?
最直觀的兩個跳躍是上下文窗口(從 256K 提升到超過 100 萬 token)與整體規模(2.8 兆參數+新的 Stable LatentMoE 路由方案),再加上一個專為長上下文解碼控制成本設計的混合線性注意力機制 Kimi Delta Attention。
測試 API 需要自己準備 GPU 嗎?
不需要。呼叫託管 API 只需要一台能發 HTTPS 請求的機器——包括一台租來的 Mac 都夠用。只有等 7 月 27 日權重釋出後自己部署,GPU 才會變成必需品。
上面這 6 個步驟都不需要什麼特殊裝備——一個 SSH 工作階段加一個 Python 虛擬環境就夠開始了。真正需要的是一台你不必擔心被測試依賴、寫到一半的代理程式腳本、以及一個忘了關掉的 Kimi Code 程序弄髒的機器。共用的筆電很快就會堆滿這些痕跡;而一台可以隨時清空、按天重新租用的真實 Apple Silicon 主機完全沒有這個負擔。這也是為什麼測試新模型發布時,用按天短租的 Mac而非主力機,會是更划算的選擇。
用真實 Apple Silicon 實測一遍
按天開一台 Mac mini M4,接上 Kimi API 或把 Kimi Code 當背景代理程式跑起來,用完就退租——不會在你的主力機上留下一堆殘留依賴。