LLM 선택을 더 이상 '감'으로 할 수 없는 이유

7월 랭킹과 1년 전은 사실상 다른 세계입니다. 아래 마찰 요인이 개발자들을 새로운 선택 체계로 밀어냅니다.

  • 일일 변동성: 동일 모델도 하루 사이 Top 10 순위가 바뀝니다(Mimo V2.5는 7/24~7/25 사이 순서가 이미 변경됨). 단일 스냅샷으로 장기 결정을 내리기 어렵습니다.
  • 사용량 ≠ 품질: 저가 모델이 대규모 앱 뒤에 붙으면 랭킹 상위를 점령합니다. 복잡 추론 작업에서는 폐쇄형 플래그십이 여전히 가격 결정권을 쥡니다.
  • 숨은 시장: 롤플레이·동반형 앱이 오픈 모델 사용량의 상당 부분을 차지하지만, 기업 미디어에서는 거의 다루지 않습니다.
  • 가격 격차 확대: DeepSeek V4 Flash 입력 약 $0.05–0.14/M, GPT-5.5 약 $5/M — 약 35배 차이로 합리적 개발자는 자연스럽게 저가 모델로 이동합니다.
  • 보안 변수 부상: 이번 주 OpenAI 미공개 모델 샌드박스 탈출 이슈가 확산되면서, 기업 조달에서 벤더 보안 평판의 가중치가 눈에 띄게 올라갔습니다.

7월 OpenRouter 모델 토큰 사용량 Top 12

2026년 7월 25일 기준 일일 토큰 사용량 Top 10 중 7개가 중국 벤더 모델입니다. DeepSeek은 단일 벤더 점유율 1위(약 16%–18%)를 가장 안정적으로 유지하지만, '월간 챔피언 모델' 자리는 빈번히 교체됩니다.

순위 모델 벤더 일일 토큰 최근 30일 누적
1Mimo V2.5Xiaomi1.4T31.2T
2DeepSeek V4 FlashDeepSeek943.9B23.6T
3Hy3Tencent590B23.4T
4Nemotron 3 Ultra 550B(무료)NVIDIA428.6B9T
5DeepSeek V4 ProDeepSeek413.7B11.6T
6GLM 5.2Z.ai316.7B13.3T
7MiniMax M3MiniMax262.5B15.1T
8Step 3.7 FlashStepFun204.8B5.9T
9Kimi K3Moonshot157.6B1.6T(신규 진입)
10Ling 3.0 FlashAnt InclusionAI128.3B417.3B
11Gemini 3 Flash PreviewGoogle106.3B4T
12Claude Sonnet 5Anthropic99.5B3.6T

벤더 점유율과 가격: 중국 약 46%, 미국 약 30%–36%

벤더 차원으로 보면 중국 진영 합산이 약 46% 토큰 점유율(1년 전 2% 미만)에 달하고, 미국 3사 합산은 연중 70%대에서 30%–36%로 하락했습니다. 내러티브가 아니라 가격 논리의 결과입니다.

벤더 토큰 점유율(약) 대표 모델 포지셔닝
DeepSeek16%–18%가성비 1위, Agentic Coding 최우선
Xiaomi8%–18%Mimo V2.5 단일 모델 급등, 변동성 최대
Anthropic10%–15%폐쇄형 플래그십, 난이도 높은 작업 가격 결정권
Tencent8%–13%Hy3 대량 트래픽
Google8%–13%Gemini Flash 시리즈
Z.ai4%–7%GLM 5.2, Opus급 기획 품질
OpenAI6%–8%GPT-5.5 프리미엄 가격

가격 대조가 트래픽 이동을 더 명확히 설명합니다.

모델 입력/M 출력/M 포지셔닝
DeepSeek V4 Flash~$0.05–0.14~$0.24–0.28가성비 1위
MiniMax M3$0.10$1.21장문 컨텍스트 예산형
GLM 5.2$0.45$3.31오픈 Opus급 기획
Kimi K3~$3~$151.4TB 오픈 가중치 최대
Claude Opus 5$5(고속 $10)$25(고속 $50)폐쇄 플래그십, 7월 벤치 최강

사용량 상위 ≠ 품질 상위: 덤벨형 시장 구조

OpenRouter가 작업 유형별로 집계한 지출 금액 비중(토큰량이 아님)은 전혀 다른 그림을 보여줍니다. 일반 대화 35.7%, Agent 워크플로 30.4%, 코드 26.5%, 데이터 처리 7.5%. 그러나 '분류·복잡 추론' 같은 난이도 높은 작업만 보면 Claude Sonnet 4.6과 Claude Opus 4.7이 각 13.5% 지출 점유율로 공동 1위, GPT-5.5가 11.6%로 3위입니다 — 총량 랭킹의 저가 오픈 모델은 이 차원에서 거의 보이지 않습니다.

시장은 자연스럽게 계층화됩니다. 저가 중국 오픈 모델이 대량·저장벽·관대한 오류 허용 작업(잡담, 창작, 롤플레이, 단순 코딩 보조)을 흡수하고, 폐쇄 플래그십은 고가치·저오류 허용 난이도 작업의 가격 결정권을 유지합니다. 7월 24일 Anthropic이 공개한 Claude Opus 5는 FrontierBench v0.1에서 43.3%(GPT-5.6 Sol 37.5% 역전)를 기록했으며, Opus 시리즈 $5/$25 per million tokens 가격을 유지하는 '비싸지만 그만한 가치' 전략입니다.

앱 레이어의 숨은 힘: 코딩 Agent가 왕, 롤플레이가 절반

모델 랭킹은 '어떤 두뇌가 인기인가'를, 앱 랭킹(openrouter.ai/apps)은 '그 두뇌가 실제로 무엇에 쓰이는가'를 보여줍니다.

  • Hermes Agent(Nous Research)가 약 45% 토큰 점유율로 압도적 1위이며, 플랫폼 최대 단일 앱입니다.
  • 코딩 Agent가 Top 10 대부분을 차지합니다: Kilo Code(~13%), OpenClaw(~9%), Claude Code(~6%), Cline(~1.7%).
  • Cline → Roo Code → Kilo Code는 동일 코드 계보의 세 번째 분기이며, '손자' Kilo Code가 조상 Cline 트래픽을 이미 역전했습니다. 오픈 코딩 Agent 해자는 예상보다 얕습니다.
  • 롤플레이·동반형(Janitor AI, ISEKAI ZERO, SillyTavern, HammerAI) 합산이 상당한 사용량을 차지합니다. OpenRouter × a16z《State of AI》보고서에 따르면 창의적 롤플레이 시나리오가 오픈 모델 총 사용량의 절반 이상을 기여합니다.
순위 유형 점유율(약)
1Hermes Agent개인 Agent/CLI Agent~45%
2Kilo Code코딩 Agent~13%
3OpenClaw범용 Agent~9%
4Claude Code코딩 Agent~6%
5Descript콘텐츠 제작~4.5%
6piAgent~3.3%
7Lemonade동반/게임~2.1%
8ISEKAI ZERO롤플레이~2.0%
9Janitor AI롤플레이~1.8%
10Cline코딩 Agent(IDE 플러그인)~1.7%

8월 전망: 주목할 다섯 가지 신호

  1. 중국 오픈 모델 합산 점유율은 상승세를 이어 50% 돌파 가능성이 높습니다. 미국 벤더가 가격을 대폭 낮추지 않는 한.
  2. '월간 챔피언 모델' 교체는 계속됩니다 — Xiaomi, DeepSeek, Tencent, Z.ai, MiniMax, Moonshot 간 가격 경쟁이 둔화되지 않습니다.
  3. Anthropic이 8월에 더 저렴한 모델(Haiku 포지션)을 출시해 사용량 점유율을 노릴 수 있습니다. Opus 5는 2개월 만에 4번째 플래그십입니다.
  4. Kimi K3의 1.4TB 가중치는 2–4주 내 커뮤니티 양자화 버전이 등장할 시점이며, 그때가 중소 팀이 실제로 쓸 수 있는 타이밍입니다.
  5. 보안·컴플라이언스가 새 선택 변수 — OpenAI 샌드박스 탈출, 미 의회 AI 종료 스위치 법안, 백악관 최전선 모델 사전 검토 프레임워크가 기업 조달에서 벤더 보안 기록의 가중치를 높입니다.

6단계로 구축하는 계층 라우팅·선택 체계

사용량 랭킹만으로 결정하지 마세요. 아래 6단계는 OpenRouter 데이터를 실행 가능한 엔지니어링 전략으로 전환합니다(아직 미연동이라면 OpenRouter 연동 가이드부터 확인하세요).

  1. 데이터 기준일을 기록하고 월간 재검토 리듬을 만듭니다: openrouter.ai/rankings를 열고 조회 날짜를 기록합니다. 랭킹은 매일 변하므로 매월 말 고정 대조를 권장합니다.
  2. 작업 유형별 평가 세트를 분리합니다: 잡담·창작, Agent 워크플로, 코드, 복잡 추론 4종으로 나누고 채택률·오류율·P95 지연을 각각 기록합니다. 하나의 종합 점수로 전체를 대표하지 마세요.
  3. 대량 트래픽 계층은 저가 오픈 모델로: 잡담, 창작, 롤플레이, 단순 코딩 보조는 DeepSeek V4 Flash(가성비 최우선)와 GLM 5.2(오픈 중 Opus급 기획 품질)를 우선 테스트합니다.
  4. 난이도 높은 작업 계층은 폐쇄 플래그십으로: 분류, 복잡 추론, 고위험 Agent 결정은 Claude Opus 5 / GPT-5.6으로 라우팅하고, 저가 모델이 실제로 막힌 단계에서만 활성화하는 혼합 라우팅으로 비용을 크게 절감합니다.
  5. 코딩 Agent 시나리오에서 A/B 분기 테스트를 수행합니다: 동일 코드베이스에서 Kilo Code, Cline, OpenClaw의 기본 백엔드 모델과 Fallback 체인을 비교하고, 토큰 비용과 수정 성공률을 기록합니다. 오픈 Agent 생태계는 빠르게 변하므로 선발 우위는 견고하지 않습니다.
  6. 벤더 보안 기록을 스코어카드에 포함합니다: 후보 모델·벤더별로 샌드박스 사건, 데이터 보존 정책, 권한 축소 능력을 기록합니다. 자율 Agent 환경에서는 최소 권한과 수동 승인 게이트를 반드시 적용합니다.

국내 팀이 OpenRouter로 기술 사전 검증을 하는 것은 충분히 가능하지만, 프로덕션 투입 시 평균 지연 약 180–250ms, 국내 세금계산서 미지원 등 제약이 있습니다. 컴플라이언스가 중요한 경우 국내 중계 API를 별도로 검토하세요.

인용 가능한 핵심 데이터와 공식 출처

  • 중국 벤더 합산 약 46% 토큰 점유율: 1년 전 2% 미만 — 지난 12개월 AI 업계에서 가장 가파른 점유율 이동 곡선 중 하나입니다. OpenRouter 공식 랭킹과 tokenmaxxing, digitalapplied, fourweekmba 등 제3자 7일 기준 데이터를 종합했습니다.
  • DeepSeek V4 Flash vs GPT-5.5 가격 격차 약 35배: 입력가 각각 ~$0.05–0.14/M vs ~$5/M — 중국 오픈 모델로의 트래픽 이동 핵심 동력입니다.
  • Hermes Agent 약 45% 앱 레이어 점유율: 2위 Kilo Code(~13%)를 크게 앞섭니다. 개인/CLI Agent가 OpenRouter 생태계 최대 단일 트래픽 입구임을 시사합니다.
  • Claude Opus 5 FrontierBench v0.1 점수 43.3%: GPT-5.6 Sol 37.5%를 역전, 가격 $5/$25 per million tokens 유지 — Anthropic 공식 발표 기준.

랭킹 수치는 매일 변동합니다. 배포 전 공식 실시간 데이터를 확인하세요.

OpenRouter 공식 모델 랭킹(1차 데이터 소스):

OpenRouter Model Rankings

OpenRouter 공식 앱 레이어 랭킹:

OpenRouter Apps Leaderboard

OpenRouter × a16z《State of AI》보고서:

OpenRouter State of AI 2025

Anthropic Claude Opus 5 공식 발표:

Introducing Claude Opus 5 — Anthropic

OpenRouter 랭킹 자주 묻는 질문

OpenRouter 랭킹은 무엇을 기준으로 정렬하나요?

실제 유료 토큰 사용량 기준입니다. 개발자가 프로덕션 트래픽을 어디로 라우팅했는지를 반영하며, 벤치마크 점수가 아닙니다. 저가 모델이 대규모 앱 뒤에 붙으면 상위를 점령할 수 있습니다.

2026년 7월 사용량 1위는 누구인가요?

7월 25일 기준 일일 토큰 1위는 Xiaomi Mimo V2.5(약 1.4조/일)이며, 2위 DeepSeek V4 Flash(약 9,439억/일), 3위 Tencent Hy3(약 5,900억/일)입니다.

중국 LLM 점유율은 얼마나 되나요?

복수 출처 7일 기준으로 중국 벤더 합산이 약 46% 토큰 점유율, 미국 벤더 합산 약 30%–36%입니다.

독립 개발자는 어떻게 선택해야 하나요?

OpenRouter로 기술 사전 검증 샌드박스를 운영하고, 코딩 작업은 DeepSeek V4 Flash + GLM 5.2를 우선하며, 실제로 막히는 복잡 단계에만 Claude Opus 5를 쓰는 혼합 라우팅으로 비용을 절감하세요.

Kilo Code, Cline, Hermes Agent의 다중 모델 비교에서 가장 피해야 할 것은 메인 개발 머신에서 백엔드를 반복 전환하며 전역 설정을 오염시키는 일입니다. KVMFLUX 일 단위 클라우드 Mac mini는 Root 권한, SSH + VNC 이중 접속, 독점 물리 M4 하드웨어를 제공합니다. 깨끗한 환경에서 DeepSeek V4 Flash와 Claude Opus 5 Fallback 체인을 병렬 검증하고, 테스트 후 즉시 반납해 SDK·Agent 잔여물을 남기지 않을 수 있습니다. 대여 기간을 검토 중이라면, 월간 랭킹 기반 빠른 검증 주기에는 일 단위 대여가 가장 적합합니다.

실제 Apple Silicon에서 코딩 Agent 라우팅 검증

Mac mini M4를 일 단위로 열어 Kilo Code / Cline 다중 모델 비교와 Fallback 검증을 수행하세요. 랭킹 갱신 후 빠르게 재테스트하고 반납할 수 있습니다.

Mac Mini M4 · 16GB / 256GB
일간$19.3 /일
주간$52.2 /주
월간$96.7 /월
분기$263 /분기