8월 3일 GA 이후 놓치기 쉬운 마찰점
7월 19일 WAIC 프리뷰 이후 겨우 2주 만에 GA에 도달했지만, 도입 판단에 필요한 정보는 아직 불완전합니다. 헤드라인 숫자만으로 계약을 체결하면 이후 비용과 성능 모두에서 되돌림이 발생합니다.
- Open-Source 라벨 선행: Alibaba는 다음 주 가중치 공개를 약속했지만, 2026년 8월 3일 시점 Hugging Face에는 리포지터리가 없습니다. open-weight 이전의 「오픈소스」 표기는 법무·보안 검토 전제를 오도할 수 있습니다.
- 벤더값과 독립 검증 격차: 공표 벤치마크표는 강한 수치를 보여주지만, Artificial Analysis나 Vals AI의 독립 재현은 아직 제한적입니다. Kimi K3 독립 평가에서 본 것처럼 제3자 검증이 쌓이기 전까지 공표값은 낙관 시나리오로 취급해야 합니다.
- 활성 파라미터의 실무 영향: 총 2.4T는 인상적이지만 MoE에서는 토큰당 95B 활성이 추론 비용과 지연을 결정합니다. 자체 호스팅을 고려하는 팀은 다음 주 공개 예정 가중치(추정 약 1.6TB급)와 GPU 요건을 미리 산출해야 합니다.
- 에코시스템 이중 구조: 동일일 베타 공개된 QwenWork 오피스 에이전트와 7월 승인된 중국 Apple Intelligence 연동은 API 단독보다 넓은 채택 신호입니다. 단, 단말 롤아웃 일정은 미발표 상태입니다.
- 라우팅 업데이트: 여러 공급자를 쓰는 팀은 OpenRouter 설정 가이드의 폴백 체인에 Qwen3.8-Max를 넣는 시점과 프리뷰 ID
qwen3.8-max-preview혼동 방지 설계가 필요합니다.
Qwen3.8-Max와 Kimi K3·DeepSeek V4·Claude 비교
GA 이후에도 대부분의 팀에게 첫 경로는 DashScope OpenAI 호환 API입니다. 자체 호스팅은 다음 주 가중치 공개 후 재평가할 선택지로 두는 것이 맞습니다.
| 항목 | Qwen3.8-Max(GA) | Kimi K3(open-weight) | DeepSeek V4(공표 단계) | Claude Fable 5(폐쇄) |
|---|---|---|---|---|
| 총 / 활성 파라미터 | 2.4T / 95B(공표값) | 2.8T / 약104B | 공표 대기(MoE 계열 예상) | 비공개 |
| 컨텍스트 | 100만 토큰 | 100만 토큰 | 256K~1M급(미확정) | 100만 토큰 |
| Arena Text 순위 | 잠정 5위(Alibaba 공표) | 독립 평가 상위 클래스 | 미공표 | 리더보드 상위 |
| 가중치 다운로드 | 다음 주 공개 예정(8월 3일 미공개) | 2026-07-27 공개 | 미공개 | 불가 |
| API 입력 / 출력(100만 토큰) | $2 / $6 | $3 / 캐시 히트 $0.30 | 저가대(공표 대기) | 약 $10 / $50 |
| 독립 벤치 검증 | 2026년 8월 초 제한적 | Vals AI SWE-bench 93.4% 등 | 미공표 | Vals AI 등 재현 완료 |
| 멀티모달 | 텍스트·이미지·영상 입력 | 주로 텍스트 중심 | 미확정 | 이미지 지원 |
| 라이선스 구분 | Open-Source 라벨 선행·가중치 미공개 | open-weight(커스텀) | 미공표 | 상업 API 계약 |
가격 면에서 Qwen3.8-Max는 Claude보다 훨씬 저렴하고 Kimi K3 입력 단가보다도 낮습니다. 역량 천장과 독립 검증의 성숙도에서는 현 시점 Kimi K3나 Claude가 앞서 있습니다. DeepSeek V4는 공표 대기 상태이므로, 비용 최우선 워크로드는 DeepSeek 현행 API를 유지하며 Qwen을 병행 평가하는 단계가 현실적입니다.
벤더 공표 벤치와 독립 검증 해석법
Alibaba GA 발표에는 Terminal-Bench, 장기 태스크, 멀티모달 이해 등 공표표가 포함됩니다. Arena Text 잠정 5위·Vision Arena 2위 주장도 있지만, 이는 벤더 주도 평가 세트입니다.
독립 검증 기관 점수가 쌓이기 전에 프로덕션 트래픽을 전환하면, 공표 벤치에서 강했던 태스크와 자사 워크로드의 괴리가 표면화합니다. GA 직후는 「API로 자사 데이터를 재현하는」 단계로 보고, 공표값은 상한 시나리오로 취급하세요.
동일일 공개된 QwenWork는 문서 편집·슬라이드 생성·코드 실행을 묶는 오피스 에이전트 플랫폼입니다. Kimi Work나 Tencent WorkBuddy와 경쟁하는 제품군이며, API 단독보다 엔터프라이즈 채택 신호로 읽어야 합니다. 중국향 Apple Intelligence에서는 2026년 7월网信办 승인에 따라 Qwen이 생성 AI 핵심으로 통합된다는 점이 Alibaba에 확인되었습니다. Qwen3.8-Max GA는 이 에코시스템의 역량 강화를 보여주지만, 구체적인 단말 롤아웃일은 미발표입니다.
Qwen3.8-Max 평가·연동 6단계
헤드라인 숫자만으로는 도입 계획이 되지 않습니다. root 접근이 있는 깨끗한 macOS 환경에서 API 평가부터 시작하고 SDK 충돌과 로그 오염을 피하세요.
- 프리뷰와 GA ID 분리: 모델 ID는
qwen3.8-max(GA)입니다.qwen3.8-max-preview는 별도 상품이며 혼동 시 404나 의도치 않은 과금이 발생합니다. 프로덕션과 검증 API 키도 분리합니다. - DashScope API 키 발급: Alibaba Cloud Model Studio에서 국제 엔드포인트용 키를 생성합니다. 데이터 국외 이전 정책을 법무와 확인합니다.
python3 -m venv ~/qwen-lab && source ~/qwen-lab/bin/activate
pip install --upgrade openai
- OpenAI 호환 클라이언트를 DashScope로: base URL을
https://dashscope-intl.aliyuncs.com/compatible-mode/v1, 모델 ID를qwen3.8-max로 설정합니다.
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DASHSCOPE_API_KEY"],
base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)
resp = client.chat.completions.create(
model="qwen3.8-max",
messages=[{"role": "user", "content": "Refactor this function for clarity."}],
)
print(resp.choices[0].message.content)
- 코딩 태스크로 베이스라인 비교: 동일 저장소·동일 테스트 하네스에서 Kimi K3나 현행 Claude 호출과 병행합니다. 공표 벤치 수치가 아니라 자사 저장소 재현이 최종 판단 재료입니다.
- 장문 컨텍스트와 멀티모달 검증: 100만 토큰급 프롬프트와 이미지·영상 입력으로 에이전트 용도 실용성을 확인합니다. 추론 출력이 많은 워크로드에서는 $6/M 출력 단가가 실효 비용을 좌우합니다.
- 출처와 데이터 흐름 문서화: 어떤 프롬프트가 DashScope를 경유했는지, 고객 데이터 국외 이전 여부, 가중치 공개 후 자체 호스팅 계획, OpenRouter 폴백 경로를 기록합니다.
인용할 만한 숫자와 출처
- 모델 규모: 총 파라미터 2.4T, 스파스 MoE, 토큰당 95B 활성(Alibaba 공표값), 100만 토큰 컨텍스트, 텍스트·이미지·영상 입력 지원.
- API 요금: 입력 $2·출력 $6(100만 토큰당), 100만 토큰 전역 균일 적용. 레이트 제한은 공표로 200만 토큰/분·15000요청/분급.
- Arena 순위: Text Arena 잠정 5위·Vision Arena 2위(Alibaba 공표, 2026년 8월 3일 시점 잠정값).
- 가중치 공개: 2026년 8월 3일 미공개, 다음 주 Hugging Face·ModelScope 공개를 Alibaba가 약속. Qwen3.8-27B 체크포인트도 같은 주 예정.
- 에코시스템: QwenWork 오피스 에이전트 동일일 베타, 중국 Apple Intelligence Qwen 채택은 2026년 7월 승인(단말 롤아웃일 미발표).
- 독립 검증 현황: 2026년 8월 초 시점 Artificial Analysis·Vals AI의 Qwen3.8-Max 전용 점수는 제한적. 공표 벤치는 벤더 주도 세트입니다.
출시 세부, 요금, 가중치 공개 일정은 게시 후 변경될 수 있습니다. 1차 출처를 본 글보다 권위 있는 정보로 취급하세요.
Alibaba Cloud 공식 GA 발표:
Alibaba Cloud — Qwen3.8-Max launch press release
QwenCloud 모델 카드와 API 스펙:
QwenCloud — Qwen3.8-Max model page
중국 Apple Intelligence 승인과 Qwen 연동(제3자 보도):
TechCrunch — Apple Intelligence approved in China with Alibaba Qwen
GA 직후 개발자 실무 정리(제3자):
DEV Community — Qwen3.8-Max GA developer guide
FAQ
Qwen3.8-Max는 지금 오픈소스인가요?
2026년 8월 3일 시점에서는 학습된 가중치가 아직 공개되지 않았습니다. Alibaba는 다음 주 공개를 약속하고 Open-Source 라벨을 선행 부착했지만, 리포지터리가 생기기 전에는 API 평가가 현실적인 경로입니다.
API 요금은 경쟁 대비 어떤가요?
입력 $2·출력 $6(100만 토큰)은 Claude Fable 5나 GPT-5.6 Sol보다 저렴합니다. 추론 출력이 많은 에이전트 워크로드에서는 출력 단가가 비용을 좌우하므로 스모크 테스트로 실효 비용을 측정하세요.
공표 벤치마크를 그대로 신뢰할 수 있나요?
Alibaba 공표표는 강한 수치를 보여주지만 독립 기관 재현은 아직 제한적입니다. 프로덕션 투입 전 자사 데이터로 병행 평가하고 공표값은 참고 상한으로 취급해야 합니다.
중국 Apple Intelligence와 무슨 관계인가요?
2026년 7월 중국网信办가 Apple Intelligence를 승인했고 중국향 생성 AI에 Qwen이 통합된다는 점이 확인되었습니다. Qwen3.8-Max GA는 에코시스템 강화 신호이지만 단말 롤아웃 일정은 미발표입니다.
Qwen3.8-Max GA는 「다음 주 가중치로 누구나 노트북에서 돌릴 수 있다」는 뜻이 아닙니다. 추정 약 1.6TB급 MoE 가중치는 대규모 GPU 클러스터 대상이며, GA 직후 대부분의 팀에게 DashScope API 평가가 첫걸음입니다. 그 평가에는 낡은 Python 스택의 공유 샌드박스가 아니라 끝에서 끝까지 통제하는 머신이 필요합니다. 새로 프로비저닝된 KVMFLUX Mac mini M4는 root 접근, 몇 분 내 SSH, 초기화 후 재시도 가능한 깨끗한 Apple Silicon 박스를 일 단위로 확보할 수 있습니다.
깨끗한 Mac에서 Qwen3.8-Max API 평가
Apple Silicon에서 DashScope API와 에이전트 개발 — VM 오버헤드 없음, SDK 충돌 잔여물 없음.