7월 27일 가중치 공개로 바뀐 것

API만 있던 단계에서는 아키텍처 주장의 독립 검증과 벤치마크 재현이 불가능했습니다. 가중치 공개 후에도 도입 판단에 놓치기 쉬운 마찰이 남아 있습니다.

  • 용어 혼동: 국내 언론의 「전면 오픈소스」와 Moonshot 공식의 open-weight는 동일하지 않습니다. OSI 기준 오픈소스에는 학습 데이터와 재현 가능한 파이프라인이 필요합니다.
  • 라이선스 이중 게이트: 커스텀 라이선스에 MaaS 누적 매출 $20M 초과 별도 계약 의무와 대규모 제품용 표기 요건이 포함됩니다. 법무 검토 없이 「자유롭게 쓸 수 있다」고 단정하면 위험합니다.
  • 하드웨어 현실: 약 1.56TB 가중치 파일을 다운로드할 수 있어도 64장 이상 GPU 슈퍼노드 없이 프로덕션 추론을 돌리는 것은 비현실적입니다.
  • 지정학적 노이즈: Kimi K3 증류 논쟁이 병행 확산되어 출처 검증과 성능 평가를 동시에 진행해야 합니다.
  • 라우팅 업데이트: 여러 공급자를 쓰는 팀은 OpenRouter 설정 가이드의 폴백 체인에 K3를 끼워 넣을 시점을 재설계해야 합니다.

Kimi K3 핵심 스펙 — API·자체 호스팅·경쟁 비교

가중치 공개 후에도 대부분의 팀에게 가장 현실적인 경로는 https://api.moonshot.ai/v1kimi-k3입니다. 자체 호스팅은 연구 기관이나 대규모 MaaS 사업자용 선택지로 두는 것이 맞습니다.

항목 Kimi K3(open-weight) Claude Fable 5(폐쇄) GLM-5.2(open-weight)
총 / 활성 파라미터2.8T / 약104B(896 중 16 전문가)비공개소규모 open-weight 티어
컨텍스트100만 토큰100만 토큰256K급
SWE-bench Verified(Vals AI)93.4%95%
AA Intelligence Index(max)약57(open-weight 1위)6051
가중치 다운로드2026-07-27 공개(약 1.56TB)불가공개됨
자체 호스팅 요건64+ GPU 슈퍼노드 권장API만중규모 클러스터
API 입력 단가(100만 토큰)$3.00(캐시 히트 $0.30)~$10더 낮은 가격대
라이선스 구분open-weight(OSI 오픈소스 아님)상업 API 계약open-weight

아키텍처 기초 — KDA(Kimi Delta Attention), AttnRes(Attention Residuals), Per-Head Muon — 는 이전 Kimi K3 해설에서 다뤘습니다. 이번 공개로 구체화된 것은 MoonEP(대규모 MoE 통신), FlashKDA(KDA 고속 커널), AgentEnv(Firecracker microVM 에이전트 RL 샌드박스) 3가지입니다.

open-weight와 OSI 오픈소스 — 라이선스 이중 게이트

Moonshot은 공식 자료에서 일관되게 open-weight라 표기하며 open source라는 표현은 쓰지 않습니다. 공개 대상은 학습된 가중치, 기술 보고서, 추론·학습 지원 Infra입니다. 학습 데이터와 전체 학습 코드는 비공개입니다.

커스텀 라이선스 상업 게이트: (1) K3 기반 MaaS 사업의 직전 12개월 누적 매출이 $20M을 초과하면 Moonshot과 별도 상업 계약 필요. (2) 월간 활성 1억 초과 또는 월 매출 $20M 초과 제품은 UI에 「Kimi K3」 prominent 표기 의무. 대부분의 스타트업과 중견 기업에는 해당하지 않지만 Moonshot API와 직접 경쟁하는 추론 사업자는 법무 확인이 필수입니다.

Kimi K3 평가·연동 6단계

헤드라인 숫자만으로는 도입 계획이 되지 않습니다. root 접근이 있는 깨끗한 macOS 환경 — SDK 충돌을 피하고 재현 가능한 로그를 얻는 — 에서 API 평가부터 시작하세요.

  1. 라이선스 범위 확인: MaaS 매출 $20M 게이트와 대규모 표기 요건 해당 여부를 법무와 확인. 해당하지 않더라도 open-weight이며 OSI 오픈소스가 아님을 내부 문서에 명시.
  2. Moonshot API 키 발급: Kimi API Platform에서 kimi-k3 스코프 키 생성. 프로덕션과 검증 키 분리.
on the mac
python3 -m venv ~/k3-lab && source ~/k3-lab/bin/activate
pip install --upgrade openai
  1. OpenAI 호환 클라이언트를 Moonshot 엔드포인트로: base URL을 https://api.moonshot.ai/v1, 모델 ID를 kimi-k3로 설정.
k3_smoke_test.py
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["MOONSHOT_API_KEY"],
    base_url="https://api.moonshot.ai/v1",
)
resp = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "Refactor this function for clarity."}],
    extra_body={"reasoning_effort": "max"},
)
print(resp.choices[0].message.content)
  1. 코딩 태스크로 베이스라인 비교: 동일 저장소·동일 테스트 하네스에서 기존 모델과 K3 병행. SWE-bench 93.4%는 독립 평가값 — 자사 워크로드 재현이 최종 판단 재료.
  2. 툴 호출과 장문 컨텍스트 검증: function calling과 100만 토큰급 프롬프트로 에이전트 용도 실용성 확인. Mooncake 분리 추론에서 캐시 히트율 90% 이상 워크로드는 실효 입력 단가가 $0.30 근처로 수렴.
  3. 출처와 데이터 흐름 문서화: 어떤 프롬프트가 Moonshot API를 경유했는지, 고객 데이터 국외 이전 여부, 증류 논쟁 하에서의 폴백 경로(OpenRouter 또는 직접 API) 기록.

인용할 만한 숫자와 출처

  • 모델 규모: 총 파라미터 2.8T, 896 전문가 중 16 활성(약104B active), 100만 토큰 컨텍스트, MXFP4 가중치 + MXFP8 활성.
  • SWE-bench Verified: Kimi K3 93.4%(Vals AI 독립 평가, 2026년 7월 기준). Claude Opus 5 97%, GPT-5.6 Sol 96.2%.
  • Artificial Analysis Intelligence Index: K3(max) 약57 — 전체 3위, open-weight 1위. Claude Fable 5 60, GPT-5.6 Sol 59.
  • 공개 Infra: MoonEP(MoE 통신), FlashKDA(H20에서 prefill 1.72–2.22× 가속), AgentEnv(checkpoint 133ms / 복원 49ms, Moonshot 공표).
  • 자체 호스팅 요건: 64장 이상 가속기 슈퍼노드 권장 — 소비자급 하드웨어로는 비현실적.
  • 타임라인: 7월 16일 API 선행 → 7월 27일 가중치 공개(API로부터 11일) → Hugging Face 트렌드 1위(공개 후 30분 이내).

출시 세부, 요금, 라이선스 조항은 게시 후 변경될 수 있습니다 — 1차 출처를 본 글보다 권위 있는 정보로 취급하세요.

Moonshot AI 공식 Kimi K3 출시 자료:

Moonshot AI — Kimi K3 launch post

Kimi API Platform K3 퀵스타트:

Kimi API Platform — K3 quickstart docs

Kimi K3 벤치마크와 자체 호스팅 분석(제3자):

Northflank — Kimi K3 benchmarks, pricing and self-hosting analysis

FAQ

Kimi K3는 오픈소스 모델인가요?

OSI의 엄격한 정의에서는 오픈소스가 아닙니다. Moonshot은 open-weight라 부르며, 학습된 가중치·기술 보고서·일부 Infra는 공개하지만 학습 데이터와 전체 학습 코드는 비공개입니다.

Kimi K3를 상업적으로 사용할 수 있나요?

대부분의 상업 시나리오에서는 문제없습니다. K3 기반 MaaS 직전 12개월 누적 매출 $20M 초과 시 Moonshot과 별도 계약이 필요합니다. 월간 활성 1억 초과 또는 월 매출 $20M 초과 제품은 UI 표기 의무가 있습니다.

자체 호스팅에 GPU가 몇 장 필요한가요?

Moonshot은 64장 이상 가속기 슈퍼노드 구성을 권장합니다. 개인 개발자와 대부분의 기업에는 api.moonshot.aikimi-k3 API가 현실적인 경로입니다.

Kimi K3 성능은 경쟁 대비 어떤가요?

SWE-bench Verified 93.4%, AA 지수 약57로 open-weight 1위. Claude Opus 5나 GPT-5.6 Sol에는 미치지 않지만 공개 가중치 모델 중 최상위 클래스입니다. 비용 면에서는 GLM-5.2보다 높아 역량 천장은 높지만 가성비 최우선 선택은 아닙니다.

가중치 공개는 「누구나 노트북에서 돌릴 수 있다」는 뜻이 아닙니다. 2.8T 스파스 MoE 자체 호스팅은 64+ GPU의 영역이며, 대부분의 팀에게 api.moonshot.ai API 평가가 첫걸음입니다. 그 평가에는 낡은 Python 스택의 공유 샌드박스가 아니라 끝에서 끝까지 통제하는 머신이 필요합니다 — 에이전트 스크립트, Kimi Code 세션, API 키 로테이션을 걱정 없이 시험할 환경. 새로 프로비저닝된 KVMFLUX Mac mini M4는 root 접근, 몇 분 내 SSH, 초기화 후 재시도 가능한 깨끗한 Apple Silicon 박스를 일 단위로 확보할 수 있습니다.

깨끗한 Mac에서 Kimi K3 API 평가

Apple Silicon에서 Moonshot API와 에이전트 개발 — VM 오버헤드 없음, SDK 충돌 잔여물 없음.

Mac Mini M4 · 16GB / 256GB
일간$19.3 /일
주간$52.2 /주
월간$96.7 /월
분기$263 /분기