7월 31일 출시에서 먼저 짚어야 할 다섯 가지 마찰
헤드라인 벤치마크는 강렬하지만, 계약과 라우팅을 결정하기 전에 재현성과 운영 공백을 먼저 확인해야 합니다.
- 파라미터 동결: V4-Flash-0731은 284B 총량·13B 활성 그대로입니다. CSA+HCA 하이브리드 어텐션, mHC, Muon 옵티마이저 골격은 V4-Pro 프리뷰와 같고, 상승분은 SFT/RL 포스트트레이닝뿐입니다.
- Harness 미공개: 7월 31일 첫 언급 이후 프레임워크 본체는 아직 없습니다. 공표 Agent 벤치는 Harness 최소 모드로 돌았으며, 벤더 스스로 하네스 민감도를 경고했습니다.
- API 전용 업데이트: 모바일 앱과 웹 채팅은 V4 Flash로 전환되지 않았습니다. 프로덕션 트래픽은
deepseek-chat엔드포인트에서deepseek-v4-flash-0731을 명시해야 합니다. - 초기 운영 노이즈: 런치 직후 캐시 히트 불일치와 안전 분류기 타임아웃이 사용자 제보로 나왔습니다. 8월 10~20일 V4-Pro GA 루머와 자금 조달 루머(양문봉이 「梁百开」「梁胜」 등으로 불리는 닉네임 변화 포함)는 모두 미확인입니다.
- 가격 대 성능 「斩杀线」: 중국 개발자 커뮤니티는 서양 프론티어 모델이 대량 트래픽에서 경제성을 잃는 가격대를 「斩杀线」이라 부릅니다. Flash의 $0.14/$0.28/M은 그 선 아래에 놓이며, OpenRouter 7월 랭킹의 일일 약 9439억 토큰(2위) 사용량과도 맞물립니다.
V4-Flash-0731 공식 스펙과 런치 수치
| 항목 | DeepSeek V4-Flash-0731 |
|---|---|
| 공개일 | 2026년 7월 31일(공식 API 베타) |
| 총 / 활성 파라미터 | 284B / 13B(V4-Pro 프리뷰와 동일) |
| 성능 원천 | 포스트트레이닝(SFT + RL)만 |
| 아키텍처 | CSA + HCA 하이브리드 어텐션, mHC, Muon |
| 컨텍스트 | 100만 토큰(V4-Pro는 V3.2 대비 FLOPs 27% 감·KV 캐시 10% 감 벤더 주장) |
| 라이선스 | MIT(Hugging Face open weights) |
| API 입력 / 출력(100만 토큰) | $0.14 / $0.28(캐시 히트 입력 $0.0028) |
| Artificial Analysis 지수 / 태스크 단가 | 50 / $0.03(독립 제3자) |
| Terminal Bench 2.0 | 82.7(V4-Pro 프리뷰 67.9, 벤더+Harness 최소) |
| Agent·코딩 벤치 | 9개 항목 모두 V4-Pro 프리뷰 초과(벤더 실행) |
| Harness | 7월 31일 첫 언급, 미공개 |
| 앱 / 웹 | 미갱신(API만) |
「독립 제3자」가 아닌 행은 DeepSeek 런치 자료이거나 미공개 Harness 최소 모드의 벤더 실행값입니다.
V4 Flash vs Kimi K3·Qwen3.8-Max·프론티어 폐쇄 모델
같은 주에 Kimi K3 가중치 공개(7월 27일)와 Qwen3.8-Max GA(8월 3일)가 겹치며 국산万亿 MoE 가격전이 한층 격화되었습니다.
| 모델 | 총 / 활성 | API 입력 / 출력(100만 토큰) | AA 지수 / $/태스크 | 가중치 | 독립 벤치 |
|---|---|---|---|---|---|
| V4-Flash-0731 | 284B / 13B | $0.14 / $0.28(캐시 $0.0028) | 50 / $0.03 | MIT 공개 | AA 지수 50 |
| V4-Pro 프리뷰 | 284B / 13B | $0.435 / $0.87(캐시 $0.003625) | Flash보다 낮음 | 프리뷰 | Terminal Bench 67.9 |
| Kimi K3 | 2.8T / 약104B | $3 / $15(캐시 $0.30) | 57 / $0.86 | 7월 27일 공개 | AA 57, SWE-bench 93.4% |
| Qwen3.8-Max | 2.4T / 95B | $2 / $6 | AA 미공표 | 공개 약속·HF 미도착 | Arena 잠정 5위 |
| GPT-5.6 Sol | 비공개 | 복합 약 $1.40 | 약59 / $1.86 | 폐쇄 | Flash 대비 약 9포인트 상(AA) |
| Claude Fable 5 | 비공개 | 약 $10 / $50 | 약59 / $3.15 | 폐쇄 | Flash 대비 약 9포인트 상(AA) |
Opus 4.8급에 「근접」한다는 말은 벤더 주도 벤치 맥락입니다. 독립 Artificial Analysis에서는 Flash 50점, GPT-5.6 Sol과 Claude Fable 5는 각각 약 9포인트 위지만 태스크 단가는 $1.86·$3.15로 수십 배 차이납니다. 절대 성능이 필요한 마지막 단계만 프론티어로 넘기고 볼륨 층은 Flash에 두는 하이브리드가 현실적입니다.
파라미터 없이 끌어올린 구조와 Harness 해석
DeepSeek의 7월 31일 내러티브는 「같은 284B/13B, 더 강한 Agent」입니다. 기술 핵심은 다음과 같습니다.
- CSA + HCA: Compressed Sparse Attention과 Hierarchical Context Attention 조합으로 100만 토큰 시 KV 캐시 부담을 V3.2 대비 줄인다고 주장합니다(FLOPs 27% 감, KV 10% 감).
- mHC + Muon: 긴 툴 체인 위 RL 포스트트레이닝을 안정화해 Terminal Bench 82.7 같은 점수에 기여했다고 설명합니다.
- Harness 최소 모드 한계: 공표 9개 Agent/코딩 벤치는 모두 이 모드로 측정되었습니다. 프레임워크 미공개 상태에서 자사 Harness와의 괴리는 전제로 둬야 합니다.
- V4-Pro 정식판 미도착: 4월 24일 프리뷰 이후 3개월, Flash가 먼저 「공식 API 베타」로 나왔습니다. Pro 프리뷰 사용자는 비용·점수 양면에서 Flash로 기울 압력을 받습니다.
Opus 4.8에 가깝다는 벤더 표는 프로덕션 보증이 아닙니다. 캐시 이슈와 안전 분류기 타임아웃은 표 숫자보다 먼저 자사 워크로드에서 재현해야 할 신호입니다.
프로덕션 전 V4 Flash 평가 6단계
벤치 표만으로는 라우팅 설계가 되지 않습니다. root 권한이 있는 깨끗한 macOS에서 API 병행부터 시작하세요.
- API 키와 모델 ID 고정: DeepSeek 콘솔에서 키를 발급하고
deepseek-v4-flash-0731응답을 확인합니다. 구deepseek-chat/deepseek-reasoner는 7월 24일 폐기 예정 처리되었습니다. - 동일 Harness로 베이스라인: 동일 저장소·동일 테스트·동일 토큰 상한으로 Kimi K3나 Qwen3.8-Max와 병행합니다. 벤더 표는 자사 데이터 대체가 될 수 없습니다.
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DEEPSEEK_API_KEY"],
base_url="https://api.deepseek.com",
)
resp = client.chat.completions.create(
model="deepseek-v4-flash-0731",
messages=[{"role": "user", "content": "이 함수를 동작은 유지한 채 리팩터해 줘."}],
)
print(resp.choices[0].message.content)
- 캐시 히트율 측정: 시스템 프롬프트와 RAG 컨텍스트 재사용 시 입력 $0.0028/M과 $0.14/M 차이가 실효 비용을 좌우합니다. 초기 캐시 불일치 제보는 로그로 추적하세요.
- 태스크 단가를 AA 기준과 대조: 대표 태스크 20~50건의 성공당 비용을 산출해 Kimi K3($0.86/태스크), GPT-5.6 Sol($1.86/태스크)와 비교합니다.
- 다단계 Agent를 격리 환경에서: 툴 호출 연쇄는 wipe 가능한 Mac에서 야간 배치로 돌립니다. 공유 CI의 낡은 SDK로는 벤더 Harness 최소 모드도 재현하기 어렵습니다.
- Harness 공개와 V4-Pro GA 모니터링: DeepSeek 공식 문서와 Hugging Face를 주기 확인합니다. 8월 10~20일 GA 루머는 미확인으로 남기고, 프레임워크 공개 시 벤치를 재실행합니다.
타임라인과 인용 가능한 숫자·출처
- 2026년 4월 24일: V4-Pro 프리뷰 최초 공개.
- 7월 24일:
deepseek-chat/deepseek-reasoner폐기 예정, V4 파이프라인 이전. - 7월 27일: Kimi K3 가중치 Hugging Face 공개.
- 7월 31일: V4-Flash-0731 공식 API 베타, Harness 첫 언급(미공개), Agent 벤치 9/9에서 Pro 프리뷰 초과.
- 8월 3일: Qwen3.8-Max GA(API $2/$6).
- 규모: 284B 총량, 13B 활성, 100만 토큰, MIT.
- 가격: 입력 $0.14 / 출력 $0.28(100만 토큰), 캐시 히트 입력 $0.0028.
- Artificial Analysis: 지수 50·$0.03/태스크. Kimi K3는 57·$0.86. GPT-5.6 Sol과 Claude Fable 5는 각각 약 9포인트 위에 $1.86·$3.15/태스크.
- Terminal Bench 2.0: Flash 82.7 vs Pro 프리뷰 67.9.
요금, 벤치, 공개 일정은 바뀔 수 있습니다. 아래 1차 출처를 본 글보다 우선하세요.
DeepSeek 공식:
API 문서:
독립 벤치마크:
Artificial Analysis — Intelligence Index 및 $/태스크
학습 가중치:
FAQ
V4 Flash에 파라미터가 늘었나요?
아닙니다. 284B/13B 그대로이며 성능 향상은 포스트트레이닝에서만 비롯됩니다.
Harness는 이미 쓸 수 있나요?
7월 31일 첫 언급 이후 아직 공개되지 않았습니다. 공표 Agent 벤치는 최소 모드이며 하네스 설정에 점수가 민감합니다.
앱은 언제 V4 Flash가 되나요?
현재는 API만 업데이트되었습니다. 웹과 모바일은 이전 모델이므로 프로덕션에서는 API로 모델 ID를 명시하세요.
Kimi K3와 무엇을 선택해야 하나요?
비용 최우선이면 Flash($0.03/태스크). 지수와 open-weight 자체 호스팅이면 K3(57, 7월 27일 공개). 대부분 팀은 역할 분담 병용이 현실적입니다.
8월 V4-Pro GA 루머를 믿어도 되나요?
8월 10~20일 GA 루머는 미확인입니다. Harness 공개와 함께 재평가하는 것이 안전합니다.
V4-Flash-0731은 벤더 표에서는 Opus 4.8급에 가깝고 Artificial Analysis에서는 태스크당 몇 센트 수준입니다. 그러나 Harness는 미공개, 캐시 이슈가 제보되었고 V4-Pro 정식판은 아직입니다. Kimi K3나 Qwen3.8-Max와의 병행 검증은 공유 샌드박스가 아니라 wipe 가능한 실제 Mac이 전제입니다. KVMFLUX Mac mini M4는 root·몇 분 내 SSH·일 단위 대여로, 모델 ID나 라우팅이 하룻밤에 바뀌어도 깨끗하게 다시 시작할 수 있습니다.
격리 Mac에서 V4 Flash Agent 검증
Kimi K3·Qwen3.8-Max와 API 병행 — Apple Silicon, root + SSH, SDK 충돌 없음.