DeepSeek 1100% 인상 후 개발자 청구서는 얼마나 오르나

선정을 막는 것은 「비싸졌다」가 아니라 숫자 정의가 맞지 않는 점입니다.

  • 헤드라인은 청구서 전체가 아닙니다. 「11배」「1100% 초과」「350%」는 모두 맞지만 캐시 히트 입력, 출력, 캐시 미스 입력 등 다른 과금 항목에 대응합니다.
  • 피크와 오프피크가 약 2배 차이입니다. 베이징 시간 9–12시, 14–18시가 피크입니다. 인상 공지에 「유연한 워크로드 스케줄링」이 들어간 것은 연산 자원 부족의 가시화입니다.
  • 「공식 최저가」가 처음 깨졌습니다. 피크 구간에서 DeepSeek 공식 API가 일부 리셀러(GMI Cloud, Novita 등, 현재 고시는 공식 피크보다 낮음)를 웃돕니다.
  • 오픈은 무료 상용이 아닙니다. Qwen3.8-Max 웨이트는 받을 수 있으나 라이선스는 Apache 2.0이 아닙니다. 매출 문턱을 넘으면 별도 협상이 필요합니다.

앞서 DeepSeek V4 Flash 정식판 벤치와 저가 구조, Qwen3.8-Max 발표 당시 「다음 주 오픈」 예고를 다뤘습니다. 본편은 단품 재설명이 아니라 8월 중순 3랩 동시 전환만 봅니다.

8월 중순 중국 대규모 모델에서 일어난 일: 타임라인

7월 중순부터 8월 17일 0시(베이징 시간)까지 중국 3개 랩과 같은 창의 미국 움직임이 겹칩니다.

날짜 사건
7월 16일 Moonshot AI Kimi K3(2.8T 파라미터) 오픈. 이미 미국 안보 관심을 유발
8월 2–3일 Alibaba Qwen3.8-Max 예고 후 클라우드 API 공개
8월 10일 Meta 오픈 모델 Muse Glimmer(30B, Apache 2.0) 공개, 플래그십 Muse Spark 1.2 웨이트 「곧 공개」 예고
8월 12일 Alibaba가 ModelScope / Hugging Face에 Qwen3.8-2.4T-A95B 오픈 웨이트 공개. 당일 xAI Grok 4.6 발표
8월 13일 DeepSeek-V4-Pro GA, 8월 17일부터 API 인상 공지. Google은 인하한 Gemini 3.7 Flash 발표
8월 14일 지푸 GLM-5.3 발표, GLM-5.2의 7430억 파라미터 기반 유지
8월 17일 0시(베이징 시간) DeepSeek 신규 요금 발효

2주 더 거슬러 가면 7월 30일 OpenAI가 최저가 GPT-5.6 Luna를 80% 인하하고, 8월 6–7일 Luna를 무료 이용자 기본 모델로 두고 무제한 텍스트 대화를 열었습니다. 중국 업체가 인상과 오픈으로 더하는 같은 시간에 미국 업체는 무료와 인하로 더합니다. 같은 가격 게임의 두 면입니다. Luna 인하는 GPT-5.6 가격 인하 해설을 대조하면 됩니다.

DeepSeek / Qwen / GLM 핵심 데이터: 인상 후에도 싼가

DeepSeek 신규 요금은 8월 17일 0시부터, 베이징 시간 9–12시, 14–18시가 피크입니다. 아래 단위는 100만 토큰당 위안입니다.

과금 항목 인상 전 오프피크(신) 피크(신) 피크 상승률
V4-Flash 캐시 히트 입력 ¥0.02 ¥0.05 ¥0.10 약 400%
V4-Flash 캐시 미스 입력 ¥1.0 ¥1.5 ¥3.0 200%
V4-Flash 출력 ¥2.0 ¥4.5 ¥9.0 350%
V4-Pro 캐시 히트 입력 ¥0.025 ¥0.15 ¥0.30 약 1100%
V4-Pro 캐시 미스 입력 ¥3.0 ¥4.5 ¥9.0 200%
V4-Pro 출력 ¥6.0 ¥13.5 ¥27.0 350%

캐시 히트 상승률이 최대입니다(최대 약 12배 / 1100%+). 절대 금액은 여전히 작습니다. 헤비 호출에 더 큰 영향은 출력(350%)과 캐시 미스 입력입니다. 분석: 약 84M 토큰/월, 주로 오프피크, 절반 캐시 히트인 헤비 부하는 청구가 약 1.8배에 가깝고 제목의 11배가 아닙니다.

Qwen3.8-2.4T-A95B(Qwen3.8-Max 오픈 웨이트) 핵심 스펙:

항목 데이터
파라미터 규모 총 2.4T, 활성 95B(MoE, 전문가 512, 라우팅 10+공유 1)
컨텍스트 창 오픈 웨이트 네이티브 262144 토큰, 약 1.01M까지 확장. 클라우드 Max 기본 100만 토큰
공개 리듬 8월 2일 예고 → 8월 3일 API → 8월 12일 오픈 웨이트
API 요금(국제 사이트) 입력 $2 / M 토큰, 출력 $6 / M 토큰
라이선스 Apache 2.0 아님, 커스텀 Qwen3.8-Max License
의미 Alibaba 최초 Max급 플래그십 오픈. 이전 Qwen3.5 / 3.6 / 3.7 Max는 폐쇄 API

GLM-5.3은 GLM-5.2와 동일 기반, 후훈련만입니다. 아래는 지푸 공식 자체 측정이며 독립 제3자 재측정은 없습니다.

벤치마크 GLM-5.2 GLM-5.3 변화
Terminal-Bench 3.0 4.6% 28.3% +23.7
DeepSWE v1.1 46.2% 66.9% +20.7
Agents' Last Exam(CLI) 23.8% 28.5% +4.7
CyberGym 77.2% 84.5% +7.3
AutomationBench 26.2% 48.2% +22.0

GLM-5.3은 Terminal-Bench 3.0에서 GPT-5.6 Sol(34.6%)과 Claude Fable 5(33.7%)에 뒤집니다. 오픈 모델 1군이지 전면 1위가 아닙니다.

횡단 비교(입력/출력 모두 100만 토큰당. 위안-달러 약 ¥7.15/$1 추산):

모델 입력 출력 오픈 정도
DeepSeek V4-Pro(피크) ¥9.0(약 $1.26) ¥27.0(약 $3.78) 웨이트 미공개
DeepSeek V4-Pro(오프피크) ¥4.5(약 $0.63) ¥13.5(약 $1.89) 웨이트 미공개
Qwen3.8-Max(국제 사이트) $2 $6 오픈(커스텀 라이선스)
OpenAI GPT-5.6 Luna $0.20 $1.20 폐쇄
Claude Opus 5(Alibaba 공개 배수로 추산) 약 $5 약 $25 폐쇄

인상 후에도 DeepSeek V4-Pro 오프피크는 Claude Opus 5보다 분명히 싸지만 전장 최저가는 아닙니다. Alibaba 국제 Qwen3.8-Max와 OpenAI Luna가 DeepSeek 오프피크보다 쌉니다. 「중국산=최저가」 등식은 무너지고 가격 경쟁은 계층화됩니다.

세 가지 수법: 시간대별 인상, 커스텀 오픈, 후훈련 레시피

DeepSeek: 바닥가에서 시간대별 요금으로. 본질은 연산 자원 긴장의 가시화입니다. 「따라 올리기」로 오독하기 쉽지만 구조는 연산 청구 투명화에 가깝습니다. 시간대를 나누지 않은 일률 저가는 가격으로 규모를 사고 캐시 히트와 오프피크로 비용을 희석했습니다. 호출이 지수 증가하고 GPU 공급이 못 따라가면 이 모형은 버티지 못합니다. 공지의 「더 유연한 워크로드 스케줄링」은 피크 연산이 부족하니 직접 시간을 옮기라는 뜻입니다.

Alibaba: 오픈 웨이트로 생태계를 묶고, 커스텀 라이선스로 매출을 묶습니다. 2.4T 파라미터는 공개 다운로드되지만 기존 Apache 2.0과 다른 라이선스가 붙습니다. 최근 12개월 매출 5천만 달러를 넘는 모델 애즈 어 서비스 또는 AI 업무 어시스턴트 사업은 별도 상용 라이선스 협상이 필요합니다. 월간 활성 1억 초과 또는 월 매출 2천만 달러 초과 제품은 화면에 모델명을 뚜렷이 표시해야 합니다. 오픈으로 개발자 생태계와 해외 평판을 얻고, 현금 흐름을 만드는 대고객에서는 협상권을 남깁니다. Meta Muse Glimmer(완전 Apache 2.0, 부가 조항 없음)와는 「오픈」의 척도가 다릅니다.

널리 퍼진 소문을 바로잡습니다. Alibaba 라이선스가 미국, EU, 영국, 한국 다운로드를 금한다는 말은 허위입니다. 공개 본문에 지역 제한 조항이 없습니다.

지푸 GLM-5.3: 기반은 그대로, 후훈련 레시피만 바꿉니다. 기반은 GLM-5.2와 완전 동일(7430억 파라미터)이고 재사전학습이 없습니다. 강화학습 환경 규모만 키워 Terminal-Bench 3.0을 4.6%에서 28.3%로, 약 6배로 올렸습니다. 사전학습 Scaling Law 한계 수익이 둔화되면 「후훈련 강화학습 규모화」가 새 레버가 되고, 천억급 기반 재학습보다 문턱이 낮아 중소 업체도 「마감」으로 선두에 다가갈 여지가 있습니다.

공식 요금표와 라이선스 대조: 개발자 6단계

공개 정보는 바뀝니다. 공식 링크를 기준으로 합니다. 아래 6단계로 제목 숫자를 본인 청구와 컴플라이언스 결론으로 내립니다.

  1. 공식 요금표를 열고 피크/오프피크와 캐시 구간을 적습니다. 미디어 비율만 옮기지 마십시오. DeepSeek는 cache hit / miss와 output을 나눕니다. 실제 맞는 행만 베낍니다.
  2. 로컬 시계를 베이징 피크에 대응합니다. 피크는 베이징 시간 9–12, 14–18입니다. 이쪽 심야가 상대 피크일 수 있습니다.
  3. 최근 1주 로그로 캐시 히트율을 추정합니다. 고정 시스템 프롬프트가 긴 앱은 cache-hit 인상에 가장 민감합니다. 히트율이 낮으면 출력 350%와 미스 입력 200%가 청구 본체입니다.
  4. 「오픈」 라벨이 아니라 Qwen 라이선스 문턱을 읽습니다. 개인과 내부 사용은 거의 영향이 없습니다. MaaS / AI 업무 어시스턴트이고 최근 12개월 해당 사업 매출이 5천만 달러를 넘으면 별도 상용 라이선스가 필요합니다.
  5. GLM-5.3 점수는 「공식 자체 측정, 제3자 재측정 없음」으로 기록합니다. Terminal-Bench 3.0은 GPT-5.6 Sol과 Claude Fable 5에 뒤집니다. 전면 1위로 쓰지 마십시오.
  6. 웨이트를 내려받아 대조할 때는 wipe 가능한 환경을 씁니다. 2.4T급은 노트북이 감당하지 못합니다. Apple Silicon에서 양자화 소형 모델이나 Agent 워크플로만 대조하려면 전용·root 가능·측정 후 비울 수 있는 장비가 공유 개발기보다 깨끗합니다.
local shell · 베이징 피크 판정
TZ=Asia/Shanghai date '+%H:%M %Z'
python3 -c "from datetime import datetime; from zoneinfo import ZoneInfo
h=datetime.now(ZoneInfo('Asia/Shanghai')).hour
print('peak' if (9<=h<12 or 14<=h<18) else 'off-peak')"

리셀러 고시는 한동안 공식 피크보다 쌀 수 있습니다. 공급자, 한도, 공급 중단 위험을 가격표와 같은 줄에서 보십시오.

아직 독립 검증되지 않은 주장과 대조 출처

  • 인상폭 정의가 흐립니다. 1100%는 피크 구간 캐시 히트 입력(가장 무료에 가깝던 구간)입니다. 실제 청구 본체는 출력 350%입니다.
  • 「Zhenwu M890 국산 칩」 추론: 여러 중국어 경제 매체는 Qwen3.8-Max 일부 추론이 Alibaba 자체 Zhenwu M890과 「Pangu AL128」 슈퍼노드에서 돈다고 전합니다. Alibaba 공식 독립 기술 문서나 제3자 벤치 확인은 없으며 독립 검증되지 않았습니다.
  • GLM-5.3이 「Cursor 심각 취약점 발견」: VentureBeat 보도와 지푸 측 공개입니다. 기술 세부사항은 비공개이고 진위와 영향 범위는 제3자 보안 기관 확인이 필요합니다. 업체 일방 공개입니다.
  • 중국 상무부가 보복 수출 통제를 검토한다는 보도: 일부 보도에 있습니다. 현재 공식 확인이 없으며 추정/소문입니다. 배경 참고만 하십시오.

중국 경제 매체는 지난 한 달을 「주 3회 업데이트」로 읽고, 국산 오픈 밀집 공개가 세계 재가격을 압박했다고 봅니다. 지정학 층도 있습니다. Kimi K3 오픈은 이미 미국 안보 심사 관심을 불렀고, Alibaba가 이 창에 2.4T 플래그십을 낸 것을 「규제 강화 전에 국제 영향력을 선점」으로 읽는 분석이 있습니다. 추측이 섞이지만 오픈 물결의 시점을 이해할 때 빼놓을 수 없는 배경입니다.

공식 출처(가격, 웨이트, 벤치는 당시 페이지 본문 기준):

DeepSeek API Docs — Models & Pricing

Hugging Face — Qwen/Qwen3.8-2.4T-A95B

Z.ai — GLM-5.3: Frontier Coding with Emergent Cyber Capabilities

제3자 보도와 교차 확인:

CIO — DeepSeek raises some V4 prices by more than 10x

NVIDIA Technical Blog — Serve Qwen3.8-2.4T-A95B

Z.ai Docs — GLM-5.3

자주 묻는 질문

DeepSeek 인상 후 청구서가 반드시 크게 오르나요?

시나리오를 나눠야 합니다. 호출이 대부분 오프피크(베이징 시간 9–12시, 14–18시 이외)이고 캐시 히트율이 높은 헤비 부하라면 표면의 「350%」「1100%」보다 실효 상승이 작습니다(분석상 헤비 이용 청구 증가는 약 1.8배). 피크에 몰리고 히트율이 낮으면 헤드라인에 근접합니다.

Alibaba Qwen3.8-Max 오픈 웨이트를 개인 개발자가 무료 상용할 수 있나요?

개인 개발과 내부 사용은 거의 영향이 없습니다. 다만 사업이 모델 애즈 어 서비스 또는 AI 업무 어시스턴트이고 최근 12개월 해당 사업 매출이 5천만 달러를 넘으면 Alibaba와 별도 상용 라이선스가 필요합니다. 월간 활성 1억 초과 또는 월 매출 2천만 달러 초과 제품은 화면에 모델명을 뚜렷이 표시해야 합니다.

GLM-5.3과 GLM-5.2는 같은 모델인가요. 왜 갑자기 강해졌나요?

기반 모델은 완전히 동일합니다(7430억 파라미터). 지푸는 재학습하지 않았습니다. 점수 상승은 후훈련에서 강화학습 환경을 대폭 확대한 결과이며, 현 단계에서는 후훈련 규모화 자체가 독립된 성능 레버입니다. 더 큰 기반을 재사전학습할 필요는 없습니다.

Qwen3.8-Max 라이선스가 미국·EU 다운로드를 금하나요?

아닙니다. 온라인에 퍼진 허위입니다. 공개 라이선스 본문에 지역 제한이 없습니다. 제한은 특정 매출 규모를 넘는 상용 서비스에 대한 것이며 소재지와 무관합니다.

Meta Muse Glimmer 공개는 Llama 시대 오픈 정신의 복귀인가요?

지금은 「부분 회귀」에 불과합니다. Muse Glimmer는 300억 파라미터 증류 소형 모델이고, 본래 폐쇄 플래그십 Muse Spark 1.2는 미공개입니다. Zuckerberg는 웨이트 공개를 「예고」만 했습니다. 그 단계가 실현돼야 미국 업체가 플래그십급 폐쇄 모델을 오픈했다고 말할 수 있습니다. 현재는 의도이지 확정 사실이 아닙니다.

API 시간대별 인상, 2.4T급 웨이트 다운로드, 후훈련 레시피 대조는 같은 마찰에 부딪힙니다. 공유 개발기는 상태가 더럽고, 로컬 디스크는 부족하며, 대조 실험과 일상 컴파일을 장시간 켜 둔 한 대에 섞으면 안 됩니다. 양자화 모델이나 Agent 워크플로를 돌리려면 깨끗하고 전용 가능하며 실제 Apple Silicon이 필요할 때, KVMFLUX 일 단위 클라우드 Mac mini가 보통 더 수월합니다. 전용 물리 기기, Root, SSH + VNC. 기간은 일/주/월/분기 중 어디가 이득인지를 대조하면 됩니다.

오프피크에 오픈 웨이트를 대조하려면, 일 단위 실기 Mac

전용 물리 Mac mini M4, root + SSH. 양자화 모델이나 Agent 워크플로를 로컬에서 돌리고 일상 개발기와 디스크·상태를 다투지 않습니다.

Mac Mini M4 · 16GB / 256GB
일간$19.3 /일
주간$52.2 /주
월간$96.7 /월
분기$263 /분기