Pourquoi ce lancement change la donne — et où le signal se brouille

DeepSeek a choisi une stratégie rare : améliorer les scores sans ajouter un paramètre. Pour les équipes produit, cela crée une tension entre opportunité tarifaire et risque méthodologique :

  • Post-entraînement seul : V4-Flash-0731 reprend l'architecture CSA+HCA (Compressed Sparse Attention + Hierarchical Context Attention) avec mHC et optimiseur Muon. Aucun rescale — la montée en performance vient du RL et du SFT sur le même checkpoint.
  • Harness annoncé, non publié : Les benchmarks agentiques du 31 juillet ont tourné en mode Harness minimal. DeepSeek reconnaît que la configuration du harness influence fortement les scores. Sans framework public, les chiffres restent vendor-dependent.
  • V4-Pro officiel en attente : La preview Pro existe depuis avril ; la version officielle et le framework Harness ne sont pas sortis. Les rumeurs de GA entre le 10 et le 20 août ne sont pas confirmées.
  • Mise à jour API uniquement : L'application mobile et le chat web n'ont pas été mis à jour. Le routage passe par l'API avec l'identifiant deepseek-v4-flash-0731.
  • Caveats opérationnels : Des utilisateurs signalent des problèmes de cache hit et des timeouts du classificateur de sécurité dans les premiers jours. Les rumeurs de financement autour de Liang Wenfeng (surnom « Liang Baikai » / « Liang Sheng » dans les forums chinois) restent non vérifiées.
  • La « ligne de mise à mort » tarifaire : Le concept chinois de «斩杀线» décrit le seuil où les modèles frontier occidentaux deviennent économiquement irrationnels pour le travail à volume — V4 Flash se positionne nettement en dessous.

Ce que DeepSeek a publié le 31 juillet 2026

Spécification DeepSeek V4-Flash-0731
Date de sortie31 juillet 2026 (bêta API officielle)
Paramètres total / actifs284B / 13B (inchangé vs. preview V4-Pro)
Source des gainsPost-entraînement (SFT + RL) — pas de nouveaux paramètres
ArchitectureCSA + HCA, mHC, optimiseur Muon
Fenêtre de contexte1M tokens (V4-Pro : −27 % FLOPs, −10 % KV cache vs. V3.2 — claim vendor)
LicenceMIT (poids open sur Hugging Face)
API entrée / sortie (par 1 M)$0,14 / $0,28 (cache hit entrée : $0,0028)
Artificial Analysis Intelligence Index50 — $0,03/tâche (indépendant)
Terminal Bench 2.0 (vendor + Harness minimal)82,7 (vs. preview V4-Pro 67,9)
Benchmarks agent/coding vs. V4-Pro9 sur 9 au-dessus de la preview (vendor-run)
Framework HarnessAnnoncé le 31.07., non publié
Mise à jour app / webNon effectuée — API seulement

Les lignes sans mention « indépendant » proviennent des matériaux de lancement DeepSeek ou ont tourné dans le mode Harness minimal non encore reproductible.

V4 Flash face à Kimi K3, GLM-5.2, Qwen3.8-Max et les modèles fermés

Modèle Total / actifs API entrée / sortie (1 M) Index AA / $/tâche Poids ouverts ? Benchmark indépendant
V4-Flash-0731284B / 13B$0,14 / $0,28 (cache $0,0028)50 / $0,03Oui (MIT)AA Index 50
Preview V4-Pro284B / 13B$0,435 / $0,87 (cache $0,003625)Inférieur à FlashPreviewTerminal Bench 67,9
Kimi K32,8T / ~104B$3 / $15 (cache $0,30)57 / $0,86Depuis le 27.07.2026AA Index 57, SWE-bench 93,4 %
GLM-5.2Classe MoE$0,45 / $3,31Planification type Opusopen-weightVolume OpenRouter #6 en juillet
Qwen3.8-Max2,4T / 95B$2 / $6Pas encore de score AAPromis, HF videArena #5 provisoire (1496 pts)
Claude Opus 4.8 / Fable 5Non divulgué$5–10 / $25–50~59 / $1,86–3,15FerméTête de file Arena
GPT-5.6 SolNon divulgué~$1,40 combiné~59 / $1,86Fermé+9 pts vs. Flash selon AA

Le tableau illustre le décalage : V4 Flash offre un rapport qualité-prix agressif face aux modèles fermiers, mais Kimi K3 et GLM-5.2 couvrent d'autres profils (poids téléchargeables, planification longue). Pour le contexte de routage, voir nos classements OpenRouter juillet 2026 et l'analyse baisse de prix GPT-5.6.

Architecture inchangée, post-entraînement renforcé — la logique du lancement

DeepSeek démontre qu'un checkpoint de 284B peut rivaliser avec des modèles dix fois plus chers par token — à condition d'accepter les limites méthodologiques :

  • CSA + HCA : L'attention hybride réduit la pression sur le KV cache à 1M tokens (vendor : −27 % FLOPs, −10 % KV cache vs. V3.2).
  • mHC + Muon : La compression multi-tête et l'optimiseur Muon stabilisent le RL post-entraînement sur les chaînes d'outils longues.
  • Sensibilité au Harness : Terminal Bench 82,7 et les neuf benchmarks coding ont tourné en mode minimal. Sans framework public, la communauté ne peut pas reproduire la méthodologie.
  • Pas de GA V4-Pro : Les équipes sur la preview Pro voient Flash comme un remplacement moins cher avec de meilleurs scores — jusqu'à la sortie officielle de Pro.

Des scores proches d'Opus 4.8 dans des slides vendor ne valent pas un contrat de production. Les bugs de cache et les timeouts du classificateur de sécurité des premiers jours rappellent qu'un smoke test sur votre charge réelle prime sur tout tableau de lancement.

Six étapes pour évaluer V4 Flash avant la bascule production

Jusqu'à la publication du Harness et à la reproduction communautaire, l'évaluation API sur vos propres échantillons reste la voie la plus rigoureuse.

  1. Configurer l'accès API : Obtenir une clé DeepSeek, vérifier l'identifiant deepseek-v4-flash-0731 et documenter la politique de rétention des données côté fournisseur.
  2. Établir une baseline : Même dépôt, même harness, même plafond de tokens — Kimi K3, GLM-5.2 ou Qwen3.8-Max comme référence. Les tableaux vendor ne remplacent pas vos workloads.
v4_flash_smoke.py
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["DEEPSEEK_API_KEY"],
    base_url="https://api.deepseek.com",
)
resp = client.chat.completions.create(
    model="deepseek-v4-flash-0731",
    messages=[{"role": "user", "content": "Refactor this function without changing behavior."}],
)
print(resp.choices[0].message.content)
  1. Mesurer le taux de cache hit : Prompts système répétés et contextes RAG — $0,0028/M en cache hit vs. $0,14/M sans. Documenter les incohérences signalées par les premiers utilisateurs.
  2. Comparer le coût par tâche : 20 à 50 tâches représentatives ; coût par succès contre Kimi K3 ($0,86/tâche) et GPT-5.6 Sol ($1,86/tâche) selon Artificial Analysis.
  3. Tester les chaînes d'outils en isolation : Runs multi-étapes sur un Mac dédié et wipeable — pas sur un runner CI partagé avec des SDK obsolètes.
  4. Surveiller Harness et GA V4-Pro : Docs DeepSeek et Hugging Face pour la sortie du framework ; réévaluer le routage à la GA Pro. Rumeurs 10–20 août : non confirmées.

Chronologie et chiffres clés

  • 24 avril 2026 : Preview V4-Pro — premier checkpoint V4 public.
  • 24 juillet 2026 : Dépréciation de deepseek-chat et deepseek-reasoner ; migration vers la pipeline V4.
  • 27 juillet 2026 : Poids ouverts Kimi K3 sur Hugging Face.
  • 31 juillet 2026 : V4-Flash-0731 bêta API officielle ; neuf benchmarks agent au-dessus de V4-Pro ; Harness annoncé, non publié.
  • 3 août 2026 : Qwen3.8-Max GA — MoE 2,4T concurrent, API $2/$6.
  • Rumeur ~10–20 août : GA V4-Pro — non confirmée.

Chiffres citables :

  • Échelle : 284B total, 13B actifs, 1M contexte, licence MIT.
  • Tarifs : $0,14 entrée / $0,28 sortie par million ; cache hit entrée $0,0028.
  • Artificial Analysis : Index 50, $0,03/tâche — Kimi K3 : 57, $0,86 ; GPT-5.6 Sol et Claude Fable 5 environ +9 points à $1,86 et $3,15/tâche.
  • Terminal Bench 2.0 : Flash 82,7 vs. preview Pro 67,9 (vendor + Harness minimal).
  • OpenRouter juillet : V4 Flash ~943,9B tokens/jour — 2e place derrière Mimo V2.5.

Les tarifs, benchmarks et dates de sortie évoluent — traiter les sources primaires ci-dessous comme référence.

Sources officielles DeepSeek :

DeepSeek — site officiel

DeepSeek API — documentation

Benchmarks indépendants et poids :

Artificial Analysis — Intelligence Index et $/tâche

Hugging Face — organisation deepseek-ai

Questions fréquentes

V4 Flash a-t-il de nouveaux paramètres ?

Non. Même architecture 284B/13B que la preview V4-Pro. Les gains viennent exclusivement du post-entraînement.

Le Harness est-il disponible ?

Non. Mentionné le 31 juillet, pas encore publié. Les benchmarks agent ont tourné en mode minimal — sensibles à la configuration.

Pourquoi l'app n'est-elle pas à jour ?

Le 31 juillet ne concerne que l'API. Chat web et application mobile affichent encore d'anciens modèles — routage via API avec identifiant explicite.

Flash vaut-il Kimi K3 ?

Sur le rapport qualité-prix, oui : $0,03 vs. $0,86/tâche selon AA. Sur l'index absolu et l'auto-hébergement, K3 mène (57 vs. 50, poids depuis le 27 juillet).

Quand sortira V4-Pro officiel ?

Inconnu. Rumeurs de GA entre le 10 et le 20 août non confirmées. La preview Pro reste disponible en parallèle de Flash.

V4-Flash-0731 propose des scores vendor proches d'Opus 4.8 à une fraction du coût — mais le Harness manque, des problèmes de cache sont signalés, et V4-Pro attend toujours sa sortie officielle. Les tests A/B sur vos workflows agent nécessitent un environnement que vous contrôlez de bout en bout. Un Mac mini M4 KVMFLUX dédié offre root, SSH en quelques minutes et un cycle wipe-and-retry quand les clés API ou les identifiants modèle changent du jour au lendemain.

Tester V4 Flash sur un Mac isolé

A/B API contre Kimi K3 et Qwen3.8-Max — Apple Silicon, root + SSH, zéro conflit SDK.

Mac Mini M4 · 16GB / 256GB
Journalier$19.3 /jour
Hebdomadaire$52.2 /sem.
Mensuel$96.7 /mois
Trimestriel$263 /trim.