Kimi K3는 정확히 무엇인가
Kimi K3는 Moonshot AI의 새로운 플래그십 모델로, 하이브리드 선형 어텐션 메커니즘인 Kimi Delta Attention(KDA)을 기반으로 한 스파스 Mixture-of-Experts 시스템입니다. Attention Residuals와 공식 명칭 Stable LatentMoE인 라우팅 방식을 함께 사용합니다. 토큰 하나당 896개 전문가 중 16개만 활성화되는데, 이 점이 "2.8조 파라미터"라는 숫자 자체보다 중요합니다. 전체를 하나의 거대한 덩어리로 평가할 게 아니라 라우팅 가능한 스파스 시스템으로 봐야 한다는 뜻입니다.
| 항목 | Kimi K3 |
|---|---|
| 총 파라미터 수 | 2.8조 |
| 토큰당 활성 전문가 수 | 896개 중 16개 |
| 컨텍스트 윈도우 | 1,048,576 토큰(입력+출력 합산) |
| 지원 모달리티 | 텍스트+이미지 입력, 텍스트 출력 |
| 추론 모드 | 항상 사고 모드 켜짐, 출시 시점엔 reasoning_effort: "max"만 지원 |
| 가중치 공개 | 2026년 7월 27일까지 공개 예정, 발표 당일엔 아직 미공개 |
이 숫자들을 뒷받침하는 학습 스택에는 나중에 기술 리포트를 읽을 때 알아두면 좋은 네 가지 작은 혁신이 담겨 있습니다. 휴리스틱 보조 손실 대신 전문가 부하 배분을 담당하는 Quantile Balancing, 어텐션 헤드별로 독립적인 옵티마이저 업데이트를 수행하는 Per-Head Muon, 그리고 활성화 제어와 어텐션 선택성을 각각 담당하는 Sigmoid Tanh Unit(SiTU)와 Gated MLA입니다. API 호출 방식 자체에는 영향이 없지만, Moonshot이 이 규모에서 학습을 안정적으로 진행할 수 있었던 이유를 설명해줍니다.
핵심 전제: "오픈"이 곧 "지금 바로 다운로드 가능"은 아니다
Moonshot은 Kimi K3가 오픈 웨이트 모델이라고 명시하면서도, 발표 시점에 Hugging Face에 체크포인트가 올라오지 않았다는 것 역시 명확히 밝혔습니다. 완전한 가중치는 기술 리포트, vLLM용 Kimi Delta Attention 구현과 함께 2026년 7월 27일까지 공개될 예정입니다. 그때까지는 API와 제공 중인 앱(kimi.com, Kimi Work, Kimi Code)이 K3를 실제로 사용할 수 있는 유일한 방법입니다.
가중치가 예정대로 공개되더라도, 2.8조 파라미터 스파스 MoE를 노트북에서 돌리는 건 현실적이지 않습니다. 서드파티 분석에 따르면 권장 배포 구성은 가속기 64개 이상의 슈퍼노드이며, 가중치는 MXFP4, 활성값은 MXFP8을 사용합니다. 대부분의 팀에게는 7월 27일 이후로도 몇 달간은 API가 현실적으로 유일한 선택지일 가능성이 큽니다.
Kimi K3는 시장에서 어디쯤 위치하는가
발표 첫 주에 나오는 랩 간 벤치마크 비교는 잠정적인 결과로 봐야 합니다. 각 랩마다 평가 하네스가 다르고, 서드파티 수치도 나중에 수정되는 경우가 많습니다. 오늘 시점에서 확인 가능한 건 컨텍스트 길이, 라이선스 방식, 가격이라는 구조적 비교입니다.
| 모델 | 컨텍스트 윈도우 | 가중치 | API 가격(100만 토큰당) |
|---|---|---|---|
| Kimi K3(Moonshot) | 1,048,576 토큰 | 오픈, 7월 27일까지 공개 예정 | 입력 $3.00 / 캐시 히트 $0.30 / 출력 $15.00 |
| Kimi K2.6(Moonshot 이전 세대) | 256K 토큰 | 오픈 | K3보다 낮음, 가격은 K3로 대체됨 |
| 클로즈드 최상위 모델(Claude / GPT 계열) | 발표 당시 대체로 200K~256K 토큰 | 클로즈드, API로만 제공 | 공급사·요금제에 따라 다름 |
결론: 지금 확실한 강점은 컨텍스트 길이와 긴 컨텍스트 상황에서의 토큰당 비용이지, "모든 벤치마크를 휩쓸었다"는 이야기가 아닙니다. 이미 한 독립 트래커가 자체 Frontend-Code 리더보드 1위에 K3를 올렸지만, 이는 주목할 만한 신호일 뿐 더 많은 평가 결과가 쌓이기 전까지 일반적인 순위로 인용하기는 이릅니다.
깨끗한 환경에서 Kimi K3를 테스트하는 6단계
가장 빠르게 스스로 판단을 내리는 방법은 완전히 자신이 통제하는 환경에서 API를 호출해보는 것입니다. 이전 프로젝트에서 남은 Python 버전 충돌도, 절반만 설치된 SDK도 없이 말이죠. 아래는 처음부터 도구 호출 테스트가 동작하기까지의 6단계입니다.
- API 키 발급: Kimi API 플랫폼에 가입하고
kimi-k3모델을 호출할 수 있는 키를 발급받습니다. - 깨끗한 머신 준비: 새로 프로비저닝된 macOS 머신에 SSH로 접속합니다(막 대여한 Mac mini M4가 적합합니다. Root 권한이 있고 실험과 충돌할 만한 게 아무것도 설치되어 있지 않습니다). Python 가상 환경을 만듭니다.
python3 -m venv ~/kimi-lab && source ~/kimi-lab/bin/activate
pip install --upgrade openai
- OpenAI 호환 클라이언트를 Moonshot 엔드포인트로 연결: Kimi K3는 OpenAI Chat Completions 스키마를 지원하므로, 기존 SDK는 base_url만 바꾸면 그대로 동작합니다.
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["MOONSHOT_API_KEY"],
base_url="https://api.moonshot.cn/v1",
)
- 최대 추론 강도로 첫 요청 보내기: K3는 항상 사고 모드가 켜져 있으며, 출시 시점엔
max만 지원됩니다.
resp = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "KDA 어텐션 메커니즘을 3가지 요점으로 요약해줘."}],
extra_body={"reasoning_effort": "max"},
)
print(resp.choices[0].message.content)
- 툴 호출 테스트: K3는 function calling과 엄격한 JSON Schema 출력을 지원합니다. 챗봇이 아니라 에이전트를 만들 계획이라면 이 단계가 중요합니다.
tools = [{
"type": "function",
"function": {
"name": "get_rental_quote",
"parameters": {"type": "object", "properties": {"sku": {"type": "string"}}},
},
}]
resp = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "m4-16-256의 일일 요금을 알려줘."}],
tools=tools,
extra_body={"reasoning_effort": "max"},
)
- 네이티브 상시 실행 클라이언트도 시도: 일회성 호출이 아니라 무인 에이전트가 목표라면, Kimi Code(터미널 CLI,
/model명령으로 모델 선택)를 설치하거나 Kimi Work 데스크톱 앱을 실행해보세요. Moonshot은 Apple Silicon 네이티브 빌드를 제공하므로, 1~5단계에서 사용한 대여 Mac 위에서 Rosetta 변환 없이 그대로 동작합니다.
Kimi Code 세션을 백그라운드 서비스로 계속 살려두는 것은, CI 러너를 계속 살려두는 것과 본질적으로 같은 문제입니다. 키 인증만 허용하는 SSH, 로그아웃 후에도 살아남는 프로세스, 그리고 언제든 초기화하고 재구성해도 아깝지 않은 머신이 필요합니다. 이 launchd 기반 구성은 Xcode CI 러너 구축 가이드에서 자세히 다뤘습니다. 거기서 소개한 SSH 강화와 서비스 등록 단계는 Xcode 빌드뿐 아니라 장시간 실행되는 Kimi Code 에이전트에도 그대로 적용됩니다.
인용할 만한 핵심 수치
- 총 파라미터 2.8조, 토큰당 896개 전문가 중 16개만 활성화——이 희소 비율이 추론 비용을 억제합니다.
- 컨텍스트 윈도우 1,048,576 토큰, 입력과 출력을 합산한 값이며 전체 윈도우에 걸쳐 균일 요금으로 길이별 단계 요금이 없습니다.
- 글로벌 API 가격: 캐시 미스 입력 100만 토큰당 $3.00, 캐시 히트 $0.30, 출력 100만 토큰당 $15.00.
- 전체 가중치 공개일: 2026년 7월 27일까지, 기술 리포트와 vLLM용 Kimi Delta Attention 구현도 함께 공개 예정.
발표 직후의 이런 세부 사항은 빠르게 바뀝니다. 가격 체계, 레이트 리밋, 정확한 가중치 공개일 모두 앞뒤로 변경될 수 있습니다. 이 글의 요약이 아니라 아래 링크의 1차 정보를 기준으로 삼으세요.
Moonshot AI 공식 —— Kimi K3 발표 블로그
Northflank —— Kimi K3 벤치마크·가격·셀프 호스팅 분석
IoT Digital Twin PLM —— Kimi K3 아키텍처와 벤치마크 분석
자주 묻는 질문 FAQ
Kimi K3는 무료로 쓸 수 있나요?
Kimi 앱 내 채팅은 표준 레이트 리밋 내에서 무료로 사용할 수 있습니다. API는 종량제로, 출시 시점 기준 캐시 미스 입력은 100만 토큰당 $3.00, 캐시 히트는 $0.30, 출력은 100만 토큰당 $15.00입니다.
지금 Kimi K3를 셀프 호스팅할 수 있나요?
아직입니다. Moonshot은 완전한 가중치를 2026년 7월 27일까지 공개하겠다고 밝혔습니다. 가중치가 준비되더라도, 2.8조 파라미터 스파스 모델을 실제로 돌리려면 단일 워크스테이션이 아니라 다중 가속기 슈퍼노드급 구성이 현실적으로 필요합니다.
이전 세대 Kimi 모델과 비교해 K3는 무엇이 바뀌었나요?
가장 눈에 띄는 두 가지 도약은 컨텍스트 윈도우(256K에서 100만 토큰 이상으로)와 전체 규모(2.8조 파라미터와 새로운 Stable LatentMoE 라우팅 방식)입니다. 여기에 긴 컨텍스트 디코딩 비용을 억제하기 위해 설계된 하이브리드 선형 어텐션 메커니즘인 Kimi Delta Attention이 더해졌습니다.
API를 테스트하려면 GPU가 있는 내 컴퓨터가 필요한가요?
필요 없습니다. 호스팅된 API를 호출하는 데는 HTTPS 요청을 보낼 수 있는 머신이면 충분하며, 대여한 Mac으로도 충분합니다. GPU가 필요해지는 건 7월 27일 공개 이후 가중치를 직접 셀프 호스팅할 때부터입니다.
위의 6단계 모두 특별한 장비가 필요하지 않습니다. SSH 세션 하나와 Python 가상 환경 하나면 시작하기에 충분합니다. 정말 필요한 건 테스트용 의존성, 절반쯤 쓰다 만 에이전트 스크립트, 끄는 걸 잊은 Kimi Code 프로세스로 지저분해져도 신경 쓰지 않아도 되는 머신입니다. 공용 노트북은 이런 흔적이 빠르게 쌓이지만, 언제든 초기화하고 하루 단위로 다시 빌릴 수 있는 실제 Apple Silicon 머신은 그럴 걱정이 없습니다. 새 모델 발표를 검증할 때 메인 머신 대신 하루 단위로 대여하는 Mac을 쓰는 이유가 여기에 있습니다.
실제 Apple Silicon으로 테스트하기
Mac mini M4를 하루 단위로 대여해 Kimi API를 연결하거나 Kimi Code를 백그라운드 에이전트로 돌려보고, 끝나면 바로 해지하세요. 메인 머신에 의존성을 남기지 않습니다.