Kimi K3 到底是什麼

Kimi K3 是月之暗面的新旗艦模型:一個基於 Kimi Delta Attention(KDA)混合線性注意力機制打造的稀疏混合專家(MoE)系統,搭配 Attention Residuals(注意力殘差)與官方稱為 Stable LatentMoE 的路由方案。每個 token 只會啟動 896 個專家裡的 16 個——這個細節比「2.8 兆參數」這個數字本身更重要:代表這是一套可路由、可拆解的稀疏系統,不必當成一整塊 2.8 兆參數的巨石來評估。

規格 Kimi K3
總參數量2.8 兆
單 token 啟動專家數896 選 16
上下文窗口1,048,576 token(輸入+輸出合計)
模態支援文字+圖片輸入,文字輸出
推理模式始終開啟思考;發布時僅支援 reasoning_effort: "max"
權重開源承諾 2026 年 7 月 27 日前發布,發布當天尚未可下載

支撐這些數字的訓練體系裡還有四個值得留意的小創新,之後讀技術報告時用得上:用 Quantile Balancing(分位數平衡)取代啟發式輔助損失來分配專家負載,用 Per-Head Muon 對每個注意力頭獨立做最佳化更新,再搭配 Sigmoid Tanh Unit(SiTU)Gated MLA 分別控制啟動與注意力選擇性。這些不會影響你呼叫 API 的方式,但說明了月之暗面為何能在這個規模上把訓練穩定下來。

關鍵前提:「開源」不等於「現在就能下載」

月之暗面明確表示 Kimi K3 是開源權重模型,但同樣明確的是——發布當天,權重並未出現在 Hugging Face 上。官方承諾完整權重會在 2026 年 7 月 27 日前發布,同步釋出的還有技術報告以及面向 vLLM 的 Kimi Delta Attention 實作。在那之前,API 與官方產品(kimi.com、Kimi Work、Kimi Code)是唯一能真正用上 K3 的途徑。

就算權重如期釋出,2.8 兆參數的稀疏 MoE 也不是一台筆電能扛住的專案。第三方分析給出的建議部署方案是 64 卡以上加速卡組成的超級節點,權重用 MXFP4、啟動值用 MXFP8。對多數團隊來說,未來幾個月 API 大概率仍是唯一實際可行的路徑,不只是等到 7 月 27 日那一天而已。

Kimi K3 放在整個市場裡處於什麼位置

發布第一週內出現的跨實驗室跑分比較,都該視為階段性結論——各家實驗室用的評測框架不同,第三方數字也經常會被後續修正。目前能核實的是結構性比較:上下文長度、開源姿態與定價。

模型 上下文窗口 權重 API 定價(每百萬 token)
Kimi K3(月之暗面)1,048,576 token開源,7月27日前發布輸入 $3.00/快取命中 $0.30/輸出 $15.00
Kimi K2.6(月之暗面上一代)256K token已開源低於 K3,定價已被 K3 取代
閉源前沿模型(Claude/GPT 系)發布時通常為 200K–256K token閉源,僅提供 API依廠商與方案而異

結論:目前最實在的優勢是超長上下文與長上下文情境下的單 token 成本,而不是「全面輾壓所有跑分」這種說法。已經有第三方評測站把 K3 排到自家 Frontend-Code 榜單的第一名——值得關注,但在更多評測結果出爐前,還不宜當成普遍排名來引用。

6 步在一台乾淨的機器上把 Kimi K3 跑起來

建立自己判斷最快的方式,就是在一個完全由你掌控的環境裡呼叫 API——沒有前一個專案殘留的 Python 版本衝突,也沒有裝到一半的 SDK。以下是從零到跑通一次工具呼叫測試的 6 個步驟。

  1. 取得 API 金鑰:到 Kimi 開放平台註冊帳號,產生一組可呼叫 kimi-k3 模型的金鑰。
  2. 準備一台乾淨的機器:SSH 登入一台剛開通的 macOS 主機(用一台按天起租的 Mac mini M4 很合適——有 Root 權限,也沒有預裝任何東西會跟你的實驗衝突),建立一個 Python 虛擬環境。
on the mac
python3 -m venv ~/kimi-lab && source ~/kimi-lab/bin/activate
pip install --upgrade openai
  1. 把相容 OpenAI 的客戶端指向月之暗面的接口:Kimi K3 相容 OpenAI Chat Completions 協定,現成的 SDK 只需要改一下 base_url。
kimi_test.py
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["MOONSHOT_API_KEY"],
    base_url="https://api.moonshot.cn/v1",
)
  1. 發出第一次帶最大推理強度的請求:K3 始終開啟思考,發布時僅支援 max 這一檔。
kimi_test.py
resp = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "用3條要點總結一下KDA注意力機制。"}],
    extra_body={"reasoning_effort": "max"},
)
print(resp.choices[0].message.content)
  1. 測試工具呼叫:K3 支援 function calling 與嚴格 JSON Schema 輸出,如果你要打造的是代理程式而不是聊天機器人,這一步很關鍵。
kimi_test.py
tools = [{
    "type": "function",
    "function": {
        "name": "get_rental_quote",
        "parameters": {"type": "object", "properties": {"sku": {"type": "string"}}},
    },
}]
resp = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "幫我查一下 m4-16-256 的按天價格。"}],
    tools=tools,
    extra_body={"reasoning_effort": "max"},
)
  1. 試試原生長駐客戶端:如果目標是無人值守的代理程式而非一次性呼叫,可以裝 Kimi Code(終端機 CLI,用 /model 指令選模型),或跑 Kimi Work 桌面客戶端——月之暗面提供了 Apple Silicon 原生版本,直接跑在你前 5 步用的那台租來的 Mac 上,中間沒有 Rosetta 轉譯這一層。

要讓 Kimi Code 工作階段作為背景服務長期存活,本質上跟讓 CI Runner 長期存活是同一個問題:你需要僅金鑰登入的 SSH、一個登出後也不會掛掉的程序,以及一台你敢隨時清空重裝的機器。我們在 Xcode CI Runner 建置指南裡詳細寫過這套基於 launchd 的方案——那些 SSH 強化與服務註冊步驟,同樣適用於一個長期掛著的 Kimi Code 代理程式,不只是 Xcode 建置任務。

值得引用的硬核數據

  • 總參數量 2.8 兆,每個 token 只啟動 896 個專家裡的 16 個——正是這個稀疏比例把推理成本控制住了。
  • 上下文窗口 1,048,576 token,輸入輸出合併計算,整個窗口內定價統一,不按長度分級。
  • 全球版 API 定價:快取未命中輸入每百萬 token $3.00,快取命中每百萬 token $0.30,輸出每百萬 token $15.00。
  • 完整權重發布日期:2026 年 7 月 27 日前,同步釋出技術報告與面向 vLLM 的 Kimi Delta Attention 實作。

發布窗口期的這類細節變化很快——定價級距、限流規則、具體的權重發布日期都可能在此之前或之後調整。請以下面連結裡的官方資訊為準,而不是本文的轉述。

月之暗面官方 —— Kimi K3 發布部落格

Kimi 開放平台 —— K3 快速接入文件

Northflank —— Kimi K3 跑分、定價與自架方案分析

IoT Digital Twin PLM —— Kimi K3 架構與基準測試拆解

常見問題 FAQ

Kimi K3 是免費的嗎?

Kimi App 內的對話在標準限流範圍內免費使用。API 按量計費:發布時快取未命中輸入每百萬 token $3.00,快取命中 $0.30,輸出每百萬 token $15.00。

現在能自己部署 Kimi K3 嗎?

還不行。月之暗面承諾完整權重會在 2026 年 7 月 27 日前發布。而且就算權重到位,真要跑起一個 2.8 兆參數的稀疏模型,現實裡也需要多卡超級節點,不是一台單機扛得住的。

相較上一代 Kimi 模型,K3 到底變了什麼?

最直觀的兩個跳躍是上下文窗口(從 256K 提升到超過 100 萬 token)與整體規模(2.8 兆參數+新的 Stable LatentMoE 路由方案),再加上一個專為長上下文解碼控制成本設計的混合線性注意力機制 Kimi Delta Attention。

測試 API 需要自己準備 GPU 嗎?

不需要。呼叫託管 API 只需要一台能發 HTTPS 請求的機器——包括一台租來的 Mac 都夠用。只有等 7 月 27 日權重釋出後自己部署,GPU 才會變成必需品。

上面這 6 個步驟都不需要什麼特殊裝備——一個 SSH 工作階段加一個 Python 虛擬環境就夠開始了。真正需要的是一台你不必擔心被測試依賴、寫到一半的代理程式腳本、以及一個忘了關掉的 Kimi Code 程序弄髒的機器。共用的筆電很快就會堆滿這些痕跡;而一台可以隨時清空、按天重新租用的真實 Apple Silicon 主機完全沒有這個負擔。這也是為什麼測試新模型發布時,用按天短租的 Mac而非主力機,會是更划算的選擇。

用真實 Apple Silicon 實測一遍

按天開一台 Mac mini M4,接上 Kimi API 或把 Kimi Code 當背景代理程式跑起來,用完就退租——不會在你的主力機上留下一堆殘留依賴。

Mac Mini M4 · 16GB / 256GB
按天$19.3 /天
按週$52.2 /週
按月$96.7 /月
按季$263 /季