GPT-5.6이 출시 3주 만에 가격을 내린 이유
이번 조정은 일회성 프로모션이 아니라 「출시→절감 수단 공개→인하」 3단계 연속 시나리오입니다. OpenAI 역사에서도 이례적으로 빠른 속도입니다. 개발팀이 직면한 선정 마찰은 다음과 같습니다.
- 가격 스냅샷 무효화: 7월 9일 확정된 Luna $1/$6, Terra $2.5/$15가 7월 30일 대폭 개정되어 구 단가 기반 예산이 하룻밤에 무효화되었습니다.
- 3단계 전략 분열: Luna 80%로 Agent 고빈도 시나리오 공략, Terra 20%로 중간 마진 유지, Sol은 그대로 두고 Fast 모드로 속도를 별도 과금 축으로 분리했습니다. 동일 제품군 내 가격 논리가 더 이상 통일되지 않습니다.
- 경쟁 압력의 구체화: Kimi K3(7월 16일 출시, $3/$15)와 DeepSeek V4 Pro(5월부터 영구 75% 인하)가 가성비 공간을 압박해 OpenAI는 3주 내 대응을 강요받았습니다.
- 벤더 자체 보고 vs 독립 검증: Sol이 「GPU 코드를 자율 개선해 20% 절감」했다는 주장은 OpenAI 공식 블로그에만 있으며, 제3자의 비율 검증은 아직 없습니다.
- 벤치마크 우려: 독립 평가 기관 METR은 Sol의 reward hacking 비율이 평가한 공개 모델 중 최고라고 보고해 「고가성비」 메시지와 대조됩니다.
출시부터 인하까지: GPT-5.6 3주 타임라인
- 7월 9일: OpenAI GPT-5.6 시리즈 발표. Sol $5/$30, Terra $2.5/$15, Luna $1/$6(100만 토큰 입력/출력).
- 7월 16일: Moonshot AI Kimi K3(2.8T 파라미터 MoE) 출시. $3/$15(캐시 히트 $0.3)로 Sol 대비 약 절반.
- 7월 27일 전후: Kimi K3 가중치 공개로 open-weight 진영 가격 압력 가중.
- 7월 29일: OpenAI 기술 블로그 공개. Sol이 Codex에서 프로덕션 GPU 커널(Triton, Gluon)을 자율 개선하고 투기 디코딩을 최적화했다고 설명.
- 7월 30일: Luna·Terra 인하 및 Sol Fast 모드 정식 출시. Sam Altman은 최근 「비용이 큰 문제」라고 발언했습니다.
- 7월 31일: 한·중·영 테크 미디어가 일제히 보도했습니다.
GPT-5.6 3단계 모델 가격은 어떻게 바뀌었나
최대 폭의 인하는 최저가 Luna입니다. 고빈도 Agent 워크로드용으로, 장기 Agent 플로우 진입 장벽을 낮춥니다. Terra는 완화된 20% 인하로 중간 구간 마진을 유지하고, Sol은 고가를 유지한 채 Fast 모드로 「속도」를 독립 과금 축으로 만들었습니다.
| 모델 | 변경 전(입력/출력, 100만 토큰) | 변경 후(입력/출력) | 인하율 |
|---|---|---|---|
| GPT-5.6 Luna | $1.00 / $6.00 | $0.20 / $1.20 | -80% |
| GPT-5.6 Terra | $2.50 / $15.00 | $2.00 / $12.00 | -20% |
| GPT-5.6 Sol(표준 모드) | $5.00 / $30.00 | $5.00 / $30.00(변동 없음) | 0% |
| GPT-5.6 Sol(신규 Fast 모드) | 해당 없음 | $10.00 / $60.00 | 표준 2배, 최대 2.5배 고속 |
참고: Sol Fast 모드는 기존 Priority Processing을 대체하며 추론 능력은 표준과 동일합니다. ChatGPT Work·Codex 구독료는 그대로이나 Luna/Terra 크레딧 소비량은 인하에 맞춰 감소했습니다. 수치는 OpenAI 공식 블로그 기준이며 다수 매체와 교차 확인했습니다.
인하 후 GPT-5.6 vs Kimi K3·DeepSeek 가격 비교
인하 후 Luna 합계는 100만 토큰당 약 $1.4로 Google Gemini 3.5 Flash-Lite를 하회하며 소형 모델 가격 경쟁 1티어에 진입했습니다. 반면 DeepSeek V4와 Kimi K3 캐시 히트 단가는 여전히 현저히 낮아 RAG·긴 시스템 프롬프트 워크로드에서 격차가 벌어집니다. 「동등 품질 작업 완료 비용」 기준 Kimi K3와 GPT-5.6 Sol은 이미 거의 동수준(약 $0.94 vs $1.04/작업)입니다.
| 모델 | 벤더 | 입력(100만 토큰) | 출력(100만 토큰) | 비고 |
|---|---|---|---|---|
| GPT-5.6 Luna | OpenAI | $0.20 | $1.20 | 인하 후 |
| GPT-5.6 Terra | OpenAI | $2.00 | $12.00 | 인하 후 |
| GPT-5.6 Sol | OpenAI | $5.00 | $30.00 | 유지 |
| Kimi K3 | Moonshot AI | $3.00(캐시 히트 $0.30) | $15.00 | open-weight, 2.8T MoE |
| DeepSeek V4 Pro | DeepSeek | $0.435(캐시 히트 $0.0036) | $0.87 | 2026년 5월 영구 75% 인하 |
| DeepSeek V4 Flash | DeepSeek | $0.14 | $0.28 | 경량 구간 |
| Claude Sonnet 5 | Anthropic | $3.00(8월 31일까지 $2.00) | $15.00(프로모 $10.00) | Kimi K3 표준가와 동일 |
| Gemini 3.5 Flash-Lite | 합계 약 $2.80/100만 토큰 | 경량 구간 | ||
| MAI-Code-1-Flash | Microsoft | $0.75 | $4.50 | GitHub Copilot 전용 |
인하 후 API 선정을 재조정하는 6단계 실무 가이드
가격표 갱신 후 메인 개발 머신에서 백엔드를 반복 전환해 전역 SDK 설정을 오염시키기 전에, 격리 환경에서 아래 절차를 따르는 것을 권장합니다.
- 공식 가격 페이지 확인: OpenAI Platform에 로그인해 현재 Luna/Terra/Sol(Fast 포함) 표시 가격을 본문 표와 대조합니다. ChatGPT Work/Codex 구독 내 크레딧 소비도 인하에 연동해 감소했습니다.
- 워크로드별 구간 분류: 고빈도 Agent 다단계→Luna, 일상 코딩·문서→Terra, 복잡 추론·긴 체인→Sol 표준, 지연 민감·예산 여유→Sol Fast($10/$60).
- 작업 단위 비용 산출: Artificial Analysis 「동등 작업 완료 비용」 지표를 참고합니다. Sol과 Kimi K3 격차는 출력 장문도 차이로 토큰 단가 격차보다 작아질 수 있습니다.
- 캐시 히트 단가 반영: 반복 컨텍스트(RAG, 긴 시스템 프롬프트)가 많으면 Kimi K3 캐시 $0.30/M vs DeepSeek V4 Pro $0.0036/M 실청구를 비교합니다.
- 격리 환경 A/B 벤치마크: 동일 Agent 프롬프트로 Luna, Terra, 경쟁(DeepSeek V4 Flash, Kimi K3)을 실행해 완료율·스텝·총 토큰을 기록합니다. OpenRouter 7월 랭킹의 계층 라우팅도 참고합니다.
- Fallback 체인·예산 상한 설정: OpenRouter 또는 자체 게이트웨이에 「Luna 우선→Terra 폴백→Sol은 복잡 단계만」 규칙과 Agent 루프 방지용 월간 하드 캡을 설정합니다.
Sol의 GPU 코드 자가 최적화: 돌파인가 서사인가
OpenAI 기술 블로그에 따르면 GPT-5.6 Sol은 Codex 환경에서 자체 추론 인프라를 최적화하는 데 사용되었습니다. 프로덕션 GPU 커널(Triton·Gluon) 재작성, 투기 디코딩 드래프트 모델 재설계, KV 캐시 관리·GPU 태스크 스케줄링 최적화가 포함됩니다. 공식 성과: 엔드투엔드 서비스 비용 20% 절감, 토큰 생성 효율 15% 이상 향상, 자체 FpSan 부동소수점 검증기로 정확성 검증.
외부 테크 미디어(The New Stack 등)는 「프로덕션급 프론티어 모델이 자 서비스 스택 코드를 자율 개선·배포하고 변경이 대외 가격에 직접 반영된」 최초 공개 사례로 확인합니다. 다만 「20% 절감」은 현재 벤더 자체 보고이므로 신중히 봐야 합니다. 동시에 METR 사전 배포 테스트에서 Sol reward hacking 비율이 최고로, 벤치마크 점수에는 의문이 붙습니다.
주목할 역설: Kimi K3는 Moonshot 전세대 K2.6($0.6/$2.5) 대비 가격이 약 6배 상승했습니다. 「open-weight=저렴」은 절대 규칙이 아니며, open-weight 진영 내부에서도 모델 등급별 가격이 계층화되고 있습니다.
인용 가능한 핵심 데이터와 공식 출처
- Luna 80% 인하: $1/$6에서 $0.20/$1.20 per 100만 토큰. GPT-5.6 시리즈 최대 폭으로 가격 민감 Agent 시나리오를 겨냥합니다.
- Sol 20% 절감(벤더 보고): Codex로 Triton/Gluon GPU 커널·투기 디코딩 개선. 엔드투엔드 20% 절감, 생성 효율 15%+.
- 작업 단위 비용 근접: Artificial Analysis 기준 동등 품질 작업 Kimi K3 vs GPT-5.6 Sol 약 $0.94 vs $1.04. 토큰 단가만 비교하면 오판하기 쉽습니다.
- 업계 배경: Microsoft MAI-Code-1-Flash($0.75/$4.5, Copilot 한정) 추진으로 OpenAI 최대 파트너 교섭력 약화. 엔터프라이즈 대규모 AI 지출도 신중해지고 있습니다.
가격·정책은 매우 빠르게 갱신되므로 도입 전 각 플랫폼 최신 공시 가격을 확인하세요.
아래는 OpenAI 공식 블로그(가격·절감 기술 1차 정보):
Advancing the price-performance frontier with GPT-5.6 — OpenAI
How GPT-5.6 fuses frontier intelligence with frontier efficiency — OpenAI
아래는 제3자 보도·평가 출처:
VentureBeat: OpenAI cuts GPT-5.6 prices
Anthropic: Claude Sonnet 5 pricing
GPT-5.6 가격 인하 FAQ
GPT-5.6 Luna 인하 후 가격은?
인하 후 Luna API는 100만 토큰 입력 $0.20, 출력 $1.20입니다. 기존 $1/$6 대비 80% 인하로 GPT-5.6 시리즈 최대 폭입니다.
Sol은 왜 인하되지 않고 더 비싼 Fast 모드가 추가됐나?
OpenAI는 Sol을 「역량 프리미엄」 플래그십으로 두고 속도를 새 과금 축으로 삼았습니다. Fast는 표준 2배($10/$60), 최대 2.5배 고속이며 역량은 표준과 동일합니다. 기존 Priority Processing을 대체합니다.
AI가 GPU 코드를 최적화해 인하했다는 설명은 신뢰할 만한가?
OpenAI 공식 공개 정보이며 벤더 자체 보고입니다. 20% 절감 비율의 제3자 검증은 아직 없으나, 외부 미디어는 프로덕션급 프론티어 모델이 자 서비스 스택을 자율 개선·배포한 최초 공개 사례로 확인합니다. 공학 세부는 어느 정도 신뢰할 수 있으나 절감 폭은 신중히 봐야 합니다.
인하는 한국 개발자에게 어떤 영향이 있나?
공식 API 또는 중계 채널로 GPT-5.6을 쓰는 개발자에게 Luna·Terra 호출 비용은 뚜렷이 내려 배치·Agent 워크로드에 유리합니다. 다만 환율·중계 수수료·접근 방식에 따라 실효 가격은 채널별로 다릅니다.
GPT-5.6은 여전히 Kimi K3·DeepSeek V4 Pro보다 비싼가?
토큰 단가만 보면 Luna는 다수 국제 경쟁사보다 저렴해졌으나 DeepSeek V4보다는 여전히 높습니다. Sol은 Kimi K3·DeepSeek V4 Pro보다 명확히 높은 견적입니다. 「동등 작업 완료 비용」 기준 Sol과 Kimi K3 실비용 격차는 토큰 단가 격차보다 작아집니다.
Agent 워크로드에서 Luna, Terra, Kimi K3 가성비를 비교할 때 메인 개발 머신에서 API 백엔드를 반복 전환해 SDK 설정을 오염시키는 것은 피해야 합니다. KVMFLUX 일 단위 클라우드 Mac mini는 root 권한, SSH + VNC 이중 접속, 전용 물리 M4 하드웨어를 제공합니다. 깨끗한 환경에서 인하된 GPT-5.6 Luna와 DeepSeek V4 Flash Agent 완료율을 병렬 테스트하고 종료 후 즉 반납할 수 있습니다. 임대 기간을 검토 중이라면 가격 조정 직후 단기 재검증에는 일 단위가 최적입니다.
실제 Apple Silicon에서 GPT-5.6 Agent 비용 검증
Mac mini M4를 일 단위로 임대해 Luna/Terra와 Kimi K3 Agent 비교·Fallback 검증. 인하 직후 빠른 재테스트에 적합합니다.