Pourquoi le titre à 1100 % ne décrit pas la plupart des factures

Le frottement, pour les équipes produit et platform, est précis :

  • Les médias ont cité des lignes tarifaires différentes. « 11x », « plus de 1100 % » et « 350 % » sont tous exacts. Ils correspondent au cache-hit input en pointe, à l'output et au cache-miss input — pas à un taux unique.
  • Les heures de pointe sont désormais dans le prix. La pointe est 9 h–12 h et 14 h–18 h, heure de Pékin. L'« ordonnancement plus flexible des charges » parle de capacité, pas de slogan.
  • L'officiel n'est plus toujours le moins cher. En pointe, l'API DeepSeek officielle dépasse plusieurs revendeurs (GMI Cloud, Novita et d'autres listent encore V4 Pro sous le nouveau pic officiel).
  • Poids ouverts ne veut pas dire Apache par défaut. Qwen3.8-Max se télécharge, mais la licence custom conserve un levier sur les gros MaaS et assistants.

Nous avons déjà traité les scores GA de DeepSeek V4 Flash et l'ancien tarif plat ainsi que la fenêtre de lancement de Qwen3.8-Max. Ce texte porte sur le basculement à trois laboratoires de la mi-août, pas sur un nouveau recap mono-modèle.

Ce qui s'est passé en deux semaines : la chronologie

De la mi-juillet au 17 août à 00:00, heure de Pékin :

Date Événement
16 juillet 2026 Moonshot AI ouvre les poids de Kimi K3 (2.8T paramètres), attirant l'attention des autorités de sécurité américaines
2–3 août 2026 Alibaba préannonce puis lance Qwen3.8-Max en API hébergée
10 août 2026 Meta publie Muse Glimmer (30B, Apache 2.0) et tease des poids ouverts pour le flagship Muse Spark 1.2
12 août 2026 Alibaba publie Qwen3.8-2.4T-A95B sur Hugging Face / ModelScope ; xAI livre Grok 4.6
13 août 2026 DeepSeek-V4-Pro passe en GA et annonce une hausse au 17 août ; Google livre Gemini 3.7 Flash en promotion
14 août 2026 Zhipu livre GLM-5.3, même base 743B que GLM-5.2
17 août 2026, 00:00 Pékin Les nouveaux tarifs DeepSeek s'appliquent

En recul : le 30 juillet, OpenAI a baissé GPT-5.6 Luna de 80 %, puis les 6–7 août a fait de Luna le défaut gratuit avec chat texte illimité. Les labos chinois ont relevé les prix et ouvert des poids flagship pendant que les labos américains coupaient les prix et passaient en gratuit côté grand public. Même partie, deux faces. La baisse Luna est détaillée dans notre note tarifaire GPT-5.6.

Grilles et specs : DeepSeek reste-t-il l'API frontier la moins chère ?

Tarifs DeepSeek ci-dessous en RMB pour 1M tokens, en vigueur le 17 août à 00:00 heure de Pékin. Pointe : 9 h–12 h et 14 h–18 h, Pékin.

Poste Ancien Nouveau hors pointe Nouveau pointe Hausse en pointe
V4-Flash cache hit (input) ¥0.02 ¥0.05 ¥0.10 ~400%
V4-Flash cache miss (input) ¥1.0 ¥1.5 ¥3.0 200%
V4-Flash output ¥2.0 ¥4.5 ¥9.0 350%
V4-Pro cache hit (input) ¥0.025 ¥0.15 ¥0.30 ~1100%
V4-Pro cache miss (input) ¥3.0 ¥4.5 ¥9.0 200%
V4-Pro output ¥6.0 ¥13.5 ¥27.0 350%

Le 1100 % s'applique au cache-hit input en heures de pointe — la ligne qui partait le plus près de zéro. L'output, qui domine la plupart des factures réelles, a augmenté de 350 %. Une modélisation de charge lourde (environ 84M tokens/mois, surtout hors pointe, moitié de cache hits) donne une hausse de facture plus proche de 1.8x.

Qwen3.8-2.4T-A95B (poids ouverts Qwen3.8-Max) :

Spec Détail
Paramètres 2.4T au total, 95B actifs par token (MoE, 512 experts, 10 routés + 1 partagé)
Fenêtre de contexte 262144 tokens natifs (checkpoint ouvert), extensible à ~1.01M ; Max hébergé à 1M par défaut
Cadence de sortie Preview 2 août → API le 3 août → poids ouverts le 12 août
Tarif API (international) $2/M input, $6/M output
Licence Pas Apache 2.0 — Qwen3.8-Max License custom
Enjeu Première ouverture d'un modèle Max chez Alibaba ; Qwen3.5/3.6/3.7 Max restaient API only

GLM-5.3 vs GLM-5.2 : même base, post-training uniquement. Chiffres rapportés par Zhipu — aucun re-run tiers indépendant n'a encore été publié.

Benchmark GLM-5.2 GLM-5.3 Écart
Terminal-Bench 3.0 4.6% 28.3% +23.7
DeepSWE v1.1 46.2% 66.9% +20.7
Agents' Last Exam (CLI) 23.8% 28.5% +4.7
CyberGym 77.2% 84.5% +7.3
AutomationBench 26.2% 48.2% +22.0

GLM-5.3 reste derrière GPT-5.6 Sol (34.6 %) et Claude Fable 5 (33.7 %) sur Terminal-Bench 3.0. C'est un résultat de premier plan en open weights, pas une victoire frontier absolue.

Face-à-face (pour 1M tokens ; RMB/USD à ~¥7.15/$1, approximation) :

Modèle Input Output Poids ouverts ?
DeepSeek V4-Pro (pointe) ¥9.0 (~$1.26) ¥27.0 (~$3.78) Non
DeepSeek V4-Pro (hors pointe) ¥4.5 (~$0.63) ¥13.5 (~$1.89) Non
Qwen3.8-Max (API internationale) $2 $6 Oui (licence custom)
OpenAI GPT-5.6 Luna $0.20 $1.20 Non
Claude Opus 5 (implicite, ratio Alibaba) ~$5 ~$25 Non

Réponse courte : non. Le V4-Pro hors pointe reste bien sous Claude Opus 5, mais ce n'est plus l'option la moins chère dans l'absolu. Le tarif international Qwen3.8-Max et OpenAI Luna sous-cotent tous deux le hors-pointe DeepSeek. « Modèle chinois = modèle le moins cher » a tenu une bonne partie de 2025 et du début 2026. Ce n'est plus une hypothèse sûre.

Trois stratégies : prix de capacité, poids ouverts sous licence, échelle de post-training

DeepSeek : du tarif plat à la tarification selon l'heure. La lecture facile est une pression sur les marges. La structure ressemble davantage à une contrainte de compute rendue visible. Un tarif toujours bas fonctionnait comme acquisition tant que l'offre GPU suivait. Quand l'usage a crû de façon exponentielle et pas la capacité, quelque chose devait devenir explicite. « Encourager un ordonnancement plus flexible » veut dire : le compute de pointe est rare.

Alibaba : les poids ouverts achètent l'attention ; la licence custom protège le plafond de revenus. Le checkpoint 2.4T complet se télécharge librement. La licence n'est pas l'Apache 2.0 permissif des plus petits Qwen. Toute activité Model-as-a-Service ou assistant de travail IA qui dépasse 50M USD sur 12 mois doit négocier une licence commerciale séparée. Un produit à 100M+ MAU ou 20M+ USD de revenu mensuel doit afficher le nom du modèle. Ce n'est pas le même pari que Muse Glimmer de Meta sous Apache 2.0 sans clause additionnelle.

Une rumeur à écarter : la licence Alibaba interdirait les téléchargements depuis les États-Unis, l'UE, le Royaume-Uni et la Corée du Sud. Faux. Le texte publié ne contient aucune clause géographique ou territoriale.

GLM-5.3 : pas de nouveau base, un pari plus large sur le post-training. Même base 743B que GLM-5.2, pas de réentraînement, et un saut d'environ 6× sur Terminal-Bench 3.0 (4.6 % → 28.3 %) en élargissant les environnements de reinforcement learning. Quand les scaling laws du préentraînement s'essoufflent, le RL de post-training devient un levier autonome, moins coûteux que de réentraîner un fondement. Les labos de milieu de tableau peuvent encore rattraper sur les benches agents et code.

Six étapes pour relier le titre, la facture et la licence

Les tarifs, les licences et les scores bougent. Vérifier les pages officielles avant de republier ou de recaler un produit — surtout si votre pipeline Apple (Xcode, simulateur, agents de revue de PR) envoie déjà du trafic vers ces API.

  1. Copier la grille officielle, pas une capture de titre. DeepSeek sépare cache hit, cache miss et output. Noter les lignes que votre trafic touche vraiment.
  2. Mapper votre horloge locale sur les fenêtres de pointe de Pékin. La pointe est 09:00–12:00 et 14:00–18:00 Asia/Shanghai. La nuit d'une région peut être midi d'une autre.
  3. Estimer le taux de cache-hit sur les logs de la semaine dernière. Les prompts système longs et fixes absorbent la hausse cache-hit. Un taux bas signifie que les +350 % output et +200 % miss-input portent la facture.
  4. Lire le fichier de licence Qwen, pas le fil d'annonce. Usage personnel et interne largement intact. MaaS ou assistant de travail IA au-delà de 50M USD sur 12 mois exige une licence commerciale séparée.
  5. Tenir les scores GLM-5.3 comme vendor-reported jusqu'à un re-run tiers. Terminal-Bench 3.0 reste derrière GPT-5.6 Sol et Claude Fable 5.
  6. Pour un téléchargement de poids en parallèle, utiliser une machine effaçable. Un checkpoint 2.4T n'est pas un travail de laptop. Pour des modèles quantifiés plus petits ou des workflows agents sur Apple Silicon, une machine dédiée, rootable, vaut mieux qu'un notebook partagé à côté de Xcode.
shell local · contrôle des heures de pointe Pékin
TZ=Asia/Shanghai date '+%H:%M %Z'
python3 -c "from datetime import datetime; from zoneinfo import ZoneInfo
h=datetime.now(ZoneInfo('Asia/Shanghai')).hour
print('peak' if (9<=h<12 or 14<=h<18) else 'off-peak')"

Les prix revendeurs peuvent sous-coter le pic officiel un moment. Identité du fournisseur, quota et risque de coupure appartiennent à la même ligne que l'étiquette.

Ce qui reste contesté, et où vérifier

  • Le titre à 1100 % est techniquement exact et trompeur sans la ligne tarifaire. C'est le cache-hit input en pointe. L'output — le poste qui domine la plupart des factures — a augmenté de 350 %.
  • Les affirmations selon lesquelles Qwen3.8-Max tourne sur les puces internes Zhenwu M890 (et des supernodes « Pangu AL128 »), relayées par plusieurs médias financiers chinois, n'ont pas été confirmées par des docs techniques Alibaba ni par des benches tiers. Adjacent au vendor, non vérifié.
  • La découverte rapportée d'une « faille grave » dans Cursor par GLM-5.3 vient de VentureBeat et de la divulgation Zhipu. Les détails techniques ne sont pas publics. Source vendor, pas d'audit indépendant.
  • Les reports selon lesquels le ministère chinois du Commerce (MOFCOM) préparerait des contrôles à l'export en représailles sur les technologies IA/semi-conducteurs sont spéculatifs, pas une annonce officielle. Contexte seulement.

La presse financière chinoise a commencé à parler du mois dernier comme de « trois mises à jour de modèles par semaine ». Les labos américains ont joué le coup inverse côté grand public. Il existe aussi une lecture géopolitique : Kimi K3 avait déjà attiré l'attention sécuritaire américaine ; le choix de cette fenêtre par Alibaba pour un flagship 2.4T a été lu comme un ancrage d'influence internationale avant un possible resserrement réglementaire. C'est une interprétation informée, pas un fait confirmé.

Sources officielles (vérifier la page live ; les chiffres peuvent changer) :

DeepSeek API Docs — Models & Pricing

Hugging Face — Qwen/Qwen3.8-2.4T-A95B

Z.ai — GLM-5.3: Frontier Coding with Emergent Cyber Capabilities

Reportages tiers :

CIO — DeepSeek raises some V4 prices by more than 10x

NVIDIA Technical Blog — Serve Qwen3.8-2.4T-A95B

Z.ai Docs — GLM-5.3

FAQ

DeepSeek reste-t-il moins cher que GPT-5.6 ou Claude après la hausse ?

Le tarif hors pointe reste inférieur à Claude Opus 5, mais DeepSeek n'est plus l'option la moins chère dans l'absolu. GPT-5.6 Luna (0,20 $/1,20 $ par million de tokens) et Qwen3.8-Max international (2 $/6 $) sous-cotent désormais le hors-pointe DeepSeek sur au moins une dimension.

Un développeur peut-il utiliser les poids ouverts Qwen3.8-Max dans un produit commercial ?

Oui dans la plupart des cas. Les projets personnels et l'usage interne d'entreprise ne sont pas concernés. L'exception vise une activité Model-as-a-Service ou assistant de travail IA qui a généré plus de 50M USD sur une période de 12 mois consécutifs : ce palier exige une licence commerciale séparée auprès d'Alibaba. Un produit à 100M MAU ou 20M USD de revenu mensuel doit afficher le nom du modèle.

Qwen3.8-Max est-il interdit aux utilisateurs des États-Unis, de l'UE ou du Royaume-Uni ?

Non. Cette rumeur a circulé en ligne et elle est fausse. La licence publiée ne contient aucune restriction géographique. Les seuils sont liés au chiffre d'affaires, pas au lieu où se trouvent l'éditeur ou ses utilisateurs.

Quelle est la différence réelle entre GLM-5.3 et GLM-5.2 ?

Rien au niveau du modèle de base. Les deux partagent le même fondement 743B. Le gain (environ 6× sur Terminal-Bench 3.0, de 4.6 % à 28.3 %) vient entièrement de l'échelle du reinforcement learning en post-training, sans réentraînement du base.

Meta va-t-il vraiment ouvrir les poids de son flagship, au-delà de Muse Glimmer ?

Pas encore. Muse Glimmer est un distillat 30B sous Apache 2.0, pas le vrai flagship. Mark Zuckerberg a annoncé des poids ouverts pour Muse Spark 1.2, encore fermé. À la date de rédaction, cette publication n'a pas eu lieu ; c'est une intention déclarée, pas un fait confirmé.

Tarification API selon l'heure, téléchargement 2.4T et bake-off de post-training butent sur la même contrainte : un laptop partagé est sale, le disque local se remplit, et le trafic d'eval ne doit pas se mêler aux compiles Xcode du quotidien. Quand il faut une machine Apple Silicon propre, rootable, à effacer après la course, un Mac mini cloud KVMFLUX loué à la journée est en général le chemin le plus net — hardware dédié, SSH + VNC. Le calcul des durées est dans journalier, hebdomadaire, mensuel ou trimestriel.

Comparer les poids ouverts sur un Mac dédié, à la journée

Mac mini M4 physique, root et SSH, pour modèles quantifiés ou workflows agents — sans disputer disque et état à la machine de développement.

Mac Mini M4 · 16GB / 256GB
Journalier$19.3 /jour
Hebdomadaire$52.2 /sem.
Mensuel$96.7 /mois
Trimestriel$263 /trim.