Ce qui est live le 3 août — et ce qui reste une promesse
La preview WAIC de juillet livrait des specs sans benchmarks. Le GA du 3 août apporte tableaux, API et QwenWork — mais plusieurs frictions persistent pour les équipes produit :
- Poids vs API : Alibaba annonce les premiers open weights d'une classe Max Qwen ; au 4 août, aucun checkpoint sur Hugging Face ni ModelScope. Tant que l'API est le seul canal, les benchmarks vendor-run ne sont pas reproductibles en interne.
- Étiquette open source : la presse parle d'« open source » ; Alibaba formule open weights. L'open source OSI exige données d'entraînement et pipelines reproductibles — pas seulement un lien de téléchargement futur.
- Benchmarks maison : les tableaux comparant Qwen3.8-Max à Claude Fable 5 et GPT-5.6 proviennent des harness Alibaba. Jusqu'aux reruns communautaires ou Vals AI, ce sont des signaux, pas des contrats SLA.
- Claims long-horizon : agents multi-jours (logiciel, reproduction de paper, e-commerce simulé) ne se valident pas en une heure — vos workloads restent la référence.
- Contexte concurrentiel : les poids Kimi K3 sont téléchargeables depuis le 27 juillet — voir notre analyse Kimi K3 open weights. DeepSeek V4-Flash et Claude Opus/Fable 5 offrent d'autres compromis prix / capacité.
Qwen3.8-Max face à Kimi K3, DeepSeek V4-Flash et Claude — matrice de décision
Pour la majorité des équipes, l'API reste le chemin réaliste. L'auto-hébergement n'a de sens qu'une fois les poids publiés avec une licence claire — et un cluster GPU dimensionné.
| Dimension | Qwen3.8-Max (GA 03.08.2026) | Kimi K3 (poids ouverts) | DeepSeek V4-Flash | Claude Opus / Fable 5 |
|---|---|---|---|---|
| Paramètres total / actifs | 2,4 T / 95 B (MoE) | 2,8 T / ~104 B | Tier Flash compacte | Non publié |
| Fenêtre de contexte | 1 M tokens | 1 M tokens | 128K–256K | 1 M tokens (Fable 5) |
| Arena Text (provisoire) | #5, 1496 pts | Meilleur sur Frontend Code (presse) | Rang frontier inférieur | Tête de peloton |
| Téléchargement poids | Annoncé, HF vide | Sur HF depuis 27.07.2026 | Publié (Flash) | Indisponible |
| API entrée / sortie (par M) | 2 $ / 6 $ | 3 $ / 15 $ (cache 0,30 $) | Tier moins cher | ~10 $+ entrée |
| Statut open-weight | Promis, licence TBD | open-weight (Custom License) | open-weight | Fermé |
| Usage typique | Agents long-horizon, multimodal | Coding, stack agent RL | Inférence sensible au coût | Coding enterprise, reasoning |
Qwen3.8-Max se positionne sous Kimi K3 et les modèles fermés en tarif API, mais sans poids vérifiables le lock-in reste plus élevé que sur un Kimi K3 déjà téléchargeable.
Open weights promis et controverse sur l'open source
Alibaba présente Qwen3.8-Max comme le premier modèle Max avec open weights planifiés — un signal stratégique dans le débat US-Chine sur les poids ouverts. Jusqu'au drop Hugging Face :
« Open source » dans les médias signifie souvent open weights. Avant production : lisez la licence, les seuils MaaS, les obligations d'attribution et l'absence de données d'entraînement. Sans poids ni licence, l'API est le seul canal vérifiable — et un risque de conformité pour les équipes avec exigences de résidence des données.
Six étapes pour évaluer Qwen3.8-Max avant la production
Les chiffres de benchmark ne remplacent pas un plan de déploiement. Lancez l'évaluation depuis un environnement macOS propre — logs reproductibles, zéro conflit SDK — comme dans notre guide Kimi K3, adapté au stack Qwen.
- Provisionner l'accès API : clé Alibaba Cloud Model Studio ou QwenCloud ; séparer clés test et production.
- Fixer une baseline incumbent : même repo, même harness, même plafond de tokens — Kimi K3, DeepSeek V4-Flash ou Claude en référence. Ne substituez pas vos workloads aux tableaux vendor.
python3 -m venv ~/qwen-lab && source ~/qwen-lab/bin/activate
pip install --upgrade openai httpx
- Configurer un client compatible OpenAI ou Anthropic : Qwen3.8-Max supporte Chat Completions et le protocole Anthropic selon Alibaba — reprenez base URL et model ID dans la doc du jour.
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DASHSCOPE_API_KEY"],
base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)
resp = client.chat.completions.create(
model="qwen3.8-max",
messages=[{"role": "user", "content": "Refactor this function for clarity."}],
extra_body={"reasoning_effort": "high"},
)
print(resp.choices[0].message.content)
- Tester long-context et tool-calling : prompts 1 M tokens et function calling pour scénarios agents ; modéliser le coût 2 $/6 $ vs Kimi K3 (3 $/15 $) et DeepSeek V4-Flash.
- Smoke-test multimodal : entrée vision si pertinent — le rang Arena Vision #2 annoncé par Alibaba est vendor-reported et exige votre propre harness.
- Surveiller le drop de poids et la licence : vérifier Hugging Face et ModelScope ; à publication, valider licence vs seuils MaaS. Documenter un fallback OpenRouter si besoin.
Chiffres et sources vérifiables
- Échelle : 2,4 T paramètres totaux, 95 B actifs par requête (sparse MoE), contexte 1 M tokens, multimodal texte + vision.
- Chatbot Arena Text : 5e provisoire à 1496 points (Alibaba, 3 août 2026) — reruns indépendants attendus.
- Tarifs API : 2 $ entrée / 6 $ sortie par million de tokens au GA ; preview à 10 % du standard.
- Poids : annoncés sur Hugging Face et ModelScope la semaine du 10 août 2026 — absents à la date de rédaction.
- Concurrence : benchmarks vendor placent Qwen3.8-Max proche de Fable 5 et GPT-5.6 sur certains coding tasks ; Kimi K3 devance sur Frontend Code Arena — valeurs vendor-run jusqu'à vérification.
- Chronologie : preview WAIC juillet 2026 → GA 3 août + QwenWork → poids annoncés semaine suivante.
Tarifs, benchmarks et calendrier peuvent évoluer — les liens officiels ci-dessous priment.
Source officielle Alibaba :
Alibaba Cloud — Qwen3.8-Max launch press release
Analyses tierces sur les specs et la feuille open-weight :
THE DECODER — Qwen3.8-Max long-horizon et 2,4 T paramètres
Quartz — lancement API Qwen3.8-Max et calendrier des poids ouverts
FAQ
Les poids sont-ils sur Hugging Face ?
Non au 4 août 2026. Alibaba a annoncé la publication la semaine suivante sur Hugging Face et ModelScope. Jusque-là, API seule.
Qwen3.8-Max est-il open source ?
Alibaba promet des open weights pour la classe Max — ce n'est pas l'open source OSI. Licence et données d'entraînement seront connues au dépôt des poids.
Comparaison avec Kimi K3 ?
Échelle comparable (2,4 T vs 2,8 T MoE), API moins chère (2 $/6 $ vs 3 $/15 $), mais poids K3 déjà téléchargeables. Arena : Qwen provisoire #5 (1496), K3 plus fort sur coding selon presse indépendante.
Faut-il un Mac avec GPU pour tester l'API ?
Non. HTTPS + SDK Python suffisent. Un Mac mini M4 propre reste le meilleur banc d'essai client pour agents Xcode et CLI — sans polluer votre poste principal.
Le GA ne signifie pas « vérifié indépendamment ». Sans poids sur Hugging Face, le rang Arena et les tableaux restent le récit Alibaba — vos workflows agents exigent une machine que vous contrôlez de bout en bout. Un Mac mini M4 KVMFLUX — accès root, SSH en minutes, location à la journée — reste le terrain d'essai le plus rentable pour brancher l'API Qwen, logger les appels et effacer l'environnement quand les model ID ou clés API changent, avant d'envoyer des données de production vers Alibaba Cloud.
Tester Qwen3.8-Max sur du vrai Apple Silicon
Louez un Mac mini M4 à la journée, branchez l'API Qwen ou vos agents CLI — sans overhead VM ni conflits SDK.