이번 주 모델 선택이 어려워진 이유
마찰의 본질은 '리더보드 몇 위인가'가 아닙니다. 벤치마크 PDF에 안 나오는 결정의 층입니다.
- 가격 vs 피크 역량: Fable 5가 새로운 천장을 세웠지만, 대부분의 팀은 모든 요청에서 그 천장의 모든 점수가 필요하지 않습니다.
- 출처 리스크: 최전선에 필적하는 성능을 훨씬 낮은 비용으로 제공하는 모델이 나오면, 그 격차가 엔지니어링인지 타사 가중치에 슬쩍 올라탄 것인지 누군가 반드시 묻습니다.
- 컴플라이언스 게이트: Fable 5와 Mythos 5는 30일 데이터 보존 옵트인이 필요합니다. Opus 5는 불필요 — 이것만으로 규제 대상 워크로드에서 채택 여부가 갈릴 수 있습니다.
- 검증 지연: Kimi K3의 전체 가중치는 2026년 7월 27일까지 공개 예정이라, 증류 이야기가 확산되는 동안 아키텍처 주장과 벤치마크 재현은 불가능했습니다.
- 라우팅 부담: 게이트웨이로 여러 공급자를 쓰는 팀 — OpenRouter 설정 가이드 참고 — 은 비용 상한을 넘지 않고 폴백 체인에 두 개의 새 모델을 끼워 넣어야 합니다.
Claude Opus 5 vs Fable 5 — Opus 5가 가치 있는가
Anthropic은 2026년 7월 24일(미국 태평양 시간) Claude Opus 5를 출시하고 즉시 Claude Max 기본 모델 및 Claude Pro 구독자용 최상위 모델로 지정했습니다. 가격은 Opus 4.8과 동일한 입력 100만 토큰당 $5, 출력 100만 토큰당 $25입니다. 변화는 표시 가격이 아니라 성능 대비 비용입니다.
| 항목 | Claude Opus 5 | Claude Fable 5 | Claude Opus 4.8 |
|---|---|---|---|
| 입출력 단가(100만 토큰당) | $5 / $25 | ~$10 / ~$50 | $5 / $25 |
| CursorBench 3.2(최대 effort vs 피크) | Fable 5 피크의 0.5% 이내 | 피크 기준 | Opus 5보다 훨씬 낮음 |
| Frontier-Bench v0.1(소프트웨어 공학) | 1위; Opus 4.8의 2배 이상 | 강력 | 베이스라인 |
| 기본 컨텍스트 윈도우 | 100만 토큰 | 100만 토큰 | 더 작은 티어 존재 |
| 일반 이용 시 데이터 보존 | 불필요 | 30일 옵트인 필수 | 불필요 |
| 사고 모드 | 기본 ON; effort 파라미터로 깊이 조절 | 기본 ON | 이전 세대 기본값 |
| 모델 ID(API) | claude-opus-5 | claude-fable-5 | claude-opus-4-8 |
ARC-AGI 3(새로운 문제 해결)에서 Anthropic은 Opus 5가 차순위 모델의 약 3배라고 보고합니다. OSWorld 2.0(컴퓨터 사용)에서 Opus 5는 Fable 5 최고 점수를 넘기면서 비용은 약 3분의 1입니다. Zapier는 Opus 5가 AutomationBench 엔드투엔드 워크플로에서 100%를 달성했고, 이전 Claude 모델은 완료하지 못했다고 보고했습니다.
정렬 감사도 전진했습니다. Anthropic은 Opus 5를 지금까지 가장 정렬된 모델 — 기만 행위율 최저, 악용 가장 어려움 — 으로 부르며, 이중 용도 사이버·생물 리스크 프론티어(Mythos 5 제한 접근 레인)는 의도적으로 밀어 올리지 않았습니다. 사이버 분류기 개입 빈도는 Fable 5 대비 약 85% 감소해 소스 수준 취약점 발견을 가능하게 하면서도 익스플로잇 생성과 침투 테스트 자동화는 계속 차단합니다.
Kimi K3 증류 논쟁 — Moonshot이 Claude를 훔쳤나
Moonshot AI는 2026년 7월 16일 Kimi K3를 출시했습니다 — 총 파라미터 2.8조, 896개 전문가 중 토큰당 16개 활성화하는 스파스 MoE, 100만 토큰 컨텍스트, 네이티브 비전. 출시 당시 공식 벤치마크에는 GPQA-Diamond 93.5%와 BrowseComp 91.2%가 포함되어 당시 오픈 웨이트 모델 중 카테고리 최고였습니다. 전체 가중치는 2026년 7월 27일까지 공개 예정이며, 그때까지는 API만 검증 가능했습니다. 아키텍처 기초는 이전 Kimi K3 해설에서 다뤘습니다. 이 절은 증류 논쟁에 집중합니다.
7월 22~23일, 백악관 OSTP 국장 Michael Kratsios는 Moonshot이 Anthropic Fable 모델에서 "대규모 은밀한 산업 증류로 미국 독점 기술을 훔쳤다"고 고발했고, 별도로 수출 제한 Nvidia GB300 칩을 태국 경유로 사용했을 가능성도 지적했습니다. 재무장관 Scott Bessent도 "많은 중국 모델에서 미국 대규모 언어 모델의 워터마크를 발견하고 있다"고 말했지만 '워터마크'의 구체적 의미는 밝히지 않았습니다.
이것은 첫 고발이 아닙니다. 2026년 2월 Anthropic은 Moonshot, DeepSeek, MiniMax를 공개적으로 지목하며 정상 이용이 아닌 의도적 역량 추출과 일치하는 340만 건 이상의 이상 API 상호작용을 주장했고, 일부는 요청 메타데이터로 Moonshot 고위 직원에게 추적되었다고 했습니다.
독립 연구자들은 타임라인에 이의를 제기했습니다. Fable 5가 공개된 것은 2026년 7월 1일 — K3 출시 겨우 2주 전입니다. Braden Hancock(Laude Institute / Snorkel AI 공동 창업자)은 TechCrunch에 14일 안에 산업 규모 증류, 2.8T MoE 학습, 출시까지 끝내는 것은 불가능하다고 말했습니다. Nathan Lambert(Allen Institute for AI)는 중국 랩이 강화 학습 지출로 전환하면서 증류 수확 체감이 온다고 주장 — 가중치 복사만으로 충분했다면 모두가 이미 GLM이나 K3를 복제했을 것이라고.
Kimi K3는 왜 Claude라고 말하나
7월 24일 전후 Redwood Research 수석 과학자 Ryan Greenblatt는 모델 자기소개 행동의 통계 비교를 공개했습니다. Kimi K3는 "당신은 누구입니까?"에 Claude라고 답하는 비율이 비정상적으로 높고, claude-opus-4-5-20250929와 claude-sonnet-4-5-20250929 같은 정확한 내부 배포 ID 문자열을 출력하기도 합니다. 실제 Claude Sonnet 4.5는 Claude Sonnet 4.5라고만 말하고, 실제 Opus 4.5는 내부 버전 문자열을 생략하거나 잘못 말하는 경우가 많습니다.
Greenblatt의 해석: 교사 모델보다 교사 배포 메타데이터를 더 정확히 재현하는 학생 모델은 대화 모방만으로 설명하기 매우 어렵습니다. 배포 메타데이터 라벨이 붙은 Claude 데이터 — API 로그나 내부 ID 태그 합성 세트 — 로 학습했음을 가리키는 특정 증류 채널이며, 모호한 문체 유사가 아닙니다. K3의 유출된 정체성은 현재 Fable/Mythos 라인이 아닌 Claude 4.5 세대(2025년 후반)를 가리키고, Kimi K2 신호는 Claude Sonnet 4(2025년 중반)를 가리켰 — 세대별 추격 패턴을 시사합니다.
Greenblatt는 이것이 증류 발생 증명이 아니라고 분명히 경고합니다 — 오염, 유출된 시스템 프롬프트, 공개 데이터 기반 합성 데이터도 이론상 유사 아티팩트를 만들 수 있습니다. 2026년 2월 Anthropic 제기와 합치면, 순수 지정학만으로는 넘기기 어려운 첫 기술적 실마리입니다.
프로덕션 전 Opus 5와 K3를 스트레스 테스트하는 6단계
헤드라인 숫자와 정치적 게시물은 배포 계획이 아닙니다. root 접근이 있는 깨끗한 macOS 환경 — SDK 충돌을 피하고 재현 가능한 로그를 얻는 — 에서 두 모델을 동일 조건으로 돌리세요.
- 컴플라이언스 요구사항을 먼저 정리: 정책이 30일 벤더 보존을 금지하면 Fable 5와 Mythos 5는 명시적 옵트인이 필요합니다. Opus 5의 기본 무보존 경로는 프롬프트 하나 보내기 전에 이미 승리할 수 있습니다.
- Claude API에서 Opus 5 고정: Anthropic 키를 생성하거나 로테이션하고 모델 ID
claude-opus-5설정. 지연 예산에 맞는 effort 티어로 사고 모드 활성화(Fast 모드는 약 2.5배 속도·2배 가격, Opus 4.8과 동일).
import anthropic
client = anthropic.Anthropic()
msg = client.messages.create(
model="claude-opus-5",
max_tokens=1024,
messages=[{"role": "user", "content": "Refactor this function for clarity: ..."}],
)
print(msg.content[0].text)
- 기존 모델에서 동일 코딩 작업 실행: 같은 저장소, 같은 테스트 하네스, 같은 토큰 상한 — 감이 아니라 통과율, 경과 시간, 성공 작업당 비용을 비교.
- Kimi K3 정체성 응답 프로브: 중립적 질문("What model are you?", "Report your system name and version")을 여러 시드로 실행. 그대로 로그하고 고객 대면 에이전트에 K3를 신뢰하기 전 Greenblatt 공개 패턴과 비교.
from openai import OpenAI
client = OpenAI(api_key="...", base_url="https://api.moonshot.ai/v1")
for prompt in ["Who are you?", "State your exact model ID."]:
r = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": prompt}],
extra_body={"reasoning_effort": "max"},
)
print(prompt, "=>", r.choices[0].message.content)
- 벤치마크 주장을 1차 출처와 대조: Anthropic Opus 5 출시 글에서 방법론 주석 재확인. Moonshot K3 표는 7월 27일 가중치 공개까지 잠정 취급.
- 팀을 위해 출처 문서화: 어떤 모델이 어떤 고객 워크플로에 응답했는지, 각 API 경계를 넘은 데이터, 다음 주 정책·가격 변동 시 폴백 경로(OpenRouter 또는 직접) 기록.
인용할 만한 숫자
- Claude Opus 5 가격: 입력 $5 / 출력 $25(100만 토큰당) — Opus 4.8과 동일, Fable 5 토큰 단가의 약 절반.
- CursorBench 3.2: Opus 5는 최대 effort에서 Fable 5 피크의 0.5% 이내, high/xhigh/max 각 티어에서 작업당 비용 절반.
- 과학 내부 평가: 분광학에서 분자 구조 추론 Opus 4.8 대비 +10.2%p, 단백질 변이 기능 예측 +7.7%p(Anthropic 출시 자료).
- Kimi K3 규모: 총 파라미터 2.8T, 토큰당 활성 약 500억 파라미터 상당, 가중치 공개 예정 2026년 7월 27일.
- 증류 타임라인: Fable 5 공개 7월 1일 → K3 출시 7월 16일 → 백악관 게시 7월 22~23일 → Greenblatt 정체성 분석 ~7월 24일.
- Anthropic 이전 제기: 2026년 2월 Moonshot·DeepSeek·MiniMax에 귀속된 340만 건 이상 플래그 이상 API 상호작용.
출시 세부, 가격 티어, 법적 고발은 게시 후 변경될 수 있습니다 — 1차 출처를 본 글보다 권위 있는 정보로 취급하세요.
Claude Opus 5 Anthropic 공식 출시 자료:
Anthropic — Introducing Claude Opus 5
Kimi K3 증류 타임라인 논쟁 서드파티 보도:
TechCrunch — Researchers skeptical of distillation timeline claims
Kimi K3 자기소개 행동 기술 분석:
Ryan Greenblatt — which_claude_is_k3 (GitHub)
FAQ
Claude Opus 5는 Claude Fable 5보다 얼마나 저렴한가요?
동일 벤치마크 티어에서 Opus 5 토큰 단가는 Fable 5의 약 절반(입력 $5/출력 $25 vs 대략 입력 $10/출력 $50, 100만 토큰당)이며 CursorBench 3.2에서 Fable 5 피크의 0.5% 이내입니다.
Claude Opus 5가 Claude Max의 기본 모델이 되었나요?
예. 2026년 7월 24일부터 Opus 5는 Claude Max 기본이며 Claude Pro 구독자용 최상위 티어입니다.
Moonshot AI가 정말 Kimi K3를 Claude에서 증류했나요?
미확인이며 논쟁 중입니다. 백악관 고발에는 공개 증거가 없습니다. 타임라인 회의론자는 Fable 5 공개부터 K3 출시까지 2주뿐이라고 지적합니다. K3가 Claude라고 자기소개하고 내부 배포 ID까지 출력하는 Greenblatt의 발견이 지금까지 가장 강한 기술 신호이지만 증명은 아닙니다.
Kimi K3 전체 가중치는 언제 공개되나요?
Moonshot은 2026년 7월 27일을 약속했습니다. 가중치가 공개되기 전까지 외부 연구자는 아키텍처 세부의 독립 검증이나 출시 벤치마크 재현이 불가능합니다.
두 이야기는 같은 실무적 한계로 수렴합니다. '가치 있는가'는 보도자료만으로는 결정할 수 없습니다. Opus 5는 Fable 5의 보존 정책이나 가격표 없이 거의 플래그십급 코딩·에이전트 성능이 필요한 팀에 보상합니다. K3는 최저 API 비용과 오픈 웨이트를 쫓는 팀에 보상합니다 — 다만 증류 구름 때문에 정체성 프로브를 로그하고 컴플라이언스급 폴백을 유지해야 합니다. 이런 나란한 테스트에는 낡은 Python 스택의 공유 샌드박스가 아니라 끝에서 끝까지 통제하는 머신이 필요합니다. 새로 프로비저닝된 KVMFLUX Mac mini M4는 root 접근, 몇 분 내 SSH, API 키나 모델 ID가 하룻밤에 바뀌어도 초기화 후 재시도할 수 있습니다.
같은 깨끗한 Mac에서 Opus 5와 K3 실행
한 대의 Apple Silicon에서 Claude와 Moonshot API 호출을 비교 — VM 오버헤드 없음, SDK 충돌 잔여물 없음.