Was am 31. Juli wirklich schiffte — und was noch fehlt

Die Kernfrage für Teams mit Budget- und Compliance-Druck ist nicht „ist Flash schneller?“, sondern „welche Claims sind reproduzierbar?“. Vier Datenpunkte dominieren die Entscheidungsmatrix:

  • Post-Training-only: V4-Flash-0731 behält 284B Gesamt- / 13B aktive Parameter. Kein Architektur-Rescale — die Gewinne kommen aus RL und SFT auf derselben CSA+HCA-Hybridaufmerksamkeit mit mHC und Muon-Optimizer.
  • Harness unveröffentlicht: Agent-Benchmarks liefen im Harness-Minimalmodus. DeepSeek warnt selbst, dass Harness-Konfigurationen die Scores stark beeinflussen — bis zum Framework-Drop sind die Tabellen vendor-run.
  • V4-Pro offiziell ausstehend: Die Pro-Preview existiert seit April; der offizielle V4-Pro-Release und das Harness-Framework stehen noch aus. Gerüchte über GA zwischen 10. und 20. August sind unbestätigt.
  • API-only-Update: DeepSeek-App und Web-Chat wurden nicht mit V4-Flash aktualisiert. Produktionsrouting läuft über deepseek-chat mit Modell-ID deepseek-v4-flash-0731.
  • Operative Caveats: Nutzer berichten über Cache-Hit-Probleme und Safety-Classifier-Timeouts in den ersten Tagen nach Launch. Funding-Gerüchte (Liang Wenfeng / „Liang Baikai“-Spitznamen-Flip in chinesischen Foren) sind unverifiziert.
  • DSGVO und Drittlandtransfer: API-Prompts mit personenbezogenen Daten verlassen die EU Richtung China. AV-Vertrag, Transfer Impact Assessment und Verarbeitungsverzeichnis sind vor Produktivbetrieb Pflicht — siehe interne Compliance und Datenschutzerklärung.

Offizielle Specs und Launch-Zahlen (31. Juli 2026)

Spec DeepSeek V4-Flash-0731
Release-Datum31. Juli 2026 (offizielle API-Beta)
Gesamt- / aktive Parameter284B / 13B (unverändert vs. V4-Pro-Preview)
LeistungsquellePost-Training (SFT + RL) — keine neuen Parameter
ArchitekturCSA + HCA Hybridaufmerksamkeit, mHC, Muon-Optimizer
Kontextfenster1M Tokens (V4-Pro: 27 % weniger FLOPs, 10 % weniger KV-Cache vs. V3.2 — vendor claim)
LizenzMIT (open weights auf Hugging Face)
API Input / Output (pro 1 Mio.)$0,14 / $0,28 (Cache-Hit Input: $0,0028)
Artificial Analysis Intelligence Index50 — $0,03/Task (unabhängig)
Terminal Bench 2.0 (vendor + Harness minimal)82,7 (vs. V4-Pro-Preview 67,9)
Agent/Coding-Benchmarks vs. V4-Pro9 von 9 über V4-Pro-Preview (vendor-run)
Harness-FrameworkAngekündigt 31.07., nicht veröffentlicht
App / Web-UpdateNicht erfolgt — nur API

Zeilen ohne „unabhängig“-Markierung stammen aus DeepSeek-Launch-Materialien oder liefen im noch nicht veröffentlichten Harness-Minimalmodus.

V4 Flash vs. Kimi K3 vs. GLM-5.2 vs. Qwen3.8-Max vs. Frontier-Closed

Modell Gesamt / aktiv API Input / Output (1 Mio.) AA Index / $/Task Open weights? Unabhängiger Benchmark
V4-Flash-0731284B / 13B$0,14 / $0,28 (Cache $0,0028)50 / $0,03Ja (MIT)AA Index 50
V4-Pro-Preview284B / 13B$0,435 / $0,87 (Cache $0,003625)Niedriger als FlashPreviewTerminal Bench 67,9
Kimi K32,8T / ~104B$3 / $15 (Cache $0,30)57 / $0,86Seit 27.07.2026AA Index 57, SWE-bench 93,4 %
GLM-5.2MoE-Klasse$0,45 / $3,31Opus-Style-Planungopen-weightOpenRouter-Volumen #6 Juli
Qwen3.8-Max2,4T / 95B$2 / $6Noch keine AA-ZahlVersprochen, HF leerArena #5 vorläufig (1496 Pkt.)
Claude Opus 4.8 / Fable 5Nicht veröffentlicht$5–10 / $25–50~59 / $1,86–3,15GeschlossenSpitzengruppe Arena
GPT-5.6 SolNicht veröffentlicht~$1,40 kombiniert~59 / $1,86Geschlossen+9 Pkt. vs. Flash laut AA

Die „斩杀线“-Debatte in chinesischen Tech-Foren beschreibt den Preis-Leistungs-Kill-Point: V4 Flash positioniert sich unterhalb der Grenze, ab der westliche Frontier-Modelle für Volumenarbeit wirtschaftlich unsinnig werden. Für Routing-Kontext siehe OpenRouter Juli 2026 Rankings und GPT-5.6 Preissenkung.

Architektur ohne Parameter-Sprung — warum Post-Training reicht

DeepSeek's Narrativ vom 31. Juli: derselbe 284B/13B-Checkpoint, bessere Agent-Scores. Technisch bedeutet das:

  • CSA + HCA: Compressed Sparse Attention plus Hierarchical Context Attention — weniger KV-Cache-Druck bei 1M-Kontext als V3.2 (vendor: 27 % FLOPs-Reduktion, 10 % KV-Cache).
  • mHC + Muon: Multi-head Compression und Muon-Optimizer stabilisieren RL-Post-Training auf langen Tool-Chains.
  • Harness-Sensitivität: Terminal Bench 82,7 und die neun Coding-Benchmarks liefen im Harness-Minimalmodus. Ohne veröffentlichtes Framework können Dritte die Methodik nicht 1:1 nachbauen.
  • Kein V4-Pro-GA: Wer auf Pro-Preview-Routing setzte, sieht Flash als günstigeren Ersatz mit höheren Scores — bis der offizielle Pro-Drop kommt.

Vendor-Benchmarks nahe Opus 4.8 sind kein Produktionsgarant. Cache-Hit-Bugs und Safety-Classifier-Timeouts in den ersten Launch-Tagen zeigen: API-Smoke-Tests auf Ihren Workloads schlagen Tabellen — besonders bei EU-Teams mit DSGVO-Pflichten vor dem Rollout.

Sechs Prüfschritte zur V4-Flash-Bewertung vor Produktion

Benchmark-Zahlen allein sind kein Rollout-Plan. Starten Sie in einer kontrollierten macOS-Umgebung mit Root-Zugriff — reproduzierbare Logs, keine SDK-Konflikte.

  1. API-Key und Compliance kartieren: DeepSeek-API-Key anlegen, Modell-ID deepseek-v4-flash-0731 verifizieren. Parallel: AV-Vertrag, Transfer Impact Assessment und Verarbeitungsverzeichnis für DSGVO Art. 28/30.
  2. Baseline gegen Incumbent festlegen: Gleiches Repo, gleicher Harness, gleiches Token-Cap — Kimi K3, GLM-5.2 oder Qwen3.8-Max als Referenz. Vendor-Tabellen nicht als Ersatz für Ihre Workloads nutzen.
v4_flash_smoke.py
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["DEEPSEEK_API_KEY"],
    base_url="https://api.deepseek.com",
)
resp = client.chat.completions.create(
    model="deepseek-v4-flash-0731",
    messages=[{"role": "user", "content": "Refactor this function without changing behavior."}],
)
print(resp.choices[0].message.content)
  1. Cache-Hit-Rate messen: Wiederholte System-Prompts und RAG-Kontexte testen — $0,0028/M bei Cache-Hit vs. $0,14/M ohne. Erste Nutzer berichteten über Cache-Inkonsistenzen; Logs dokumentieren.
  2. Task-Level-Kosten gegen AA-Baseline: 20–50 repräsentative Tasks aus Ihrem Backlog; Kosten pro erfolgreichem Abschluss gegen Kimi K3 ($0,86/Task) und GPT-5.6 Sol ($1,86/Task) kalkulieren.
  3. Agent-Tool-Chains isoliert testen: Multi-Step-Runs in wipebarem Mac-Umfeld — nicht auf geteiltem CI mit veralteten SDKs. Harness-Minimalmodus der Vendor-Benchmarks ist nicht Ihr Produktions-Harness.
  4. Harness-Drop und V4-Pro-GA überwachen: DeepSeek-Docs und Hugging Face auf Framework-Release prüfen; bei V4-Pro-GA Routing-Entscheidung neu bewerten. Gerüchte 10.–20. August als unbestätigt markieren.

Timeline und harte Zahlen

  • 24. April 2026: V4-Pro-Preview — erster öffentlicher V4-Checkpoint.
  • 24. Juli 2026: deepseek-chat und deepseek-reasoner deprecated; Migration auf V4-Pipeline.
  • 27. Juli 2026: Kimi K3 open weights auf Hugging Face.
  • 31. Juli 2026: V4-Flash-0731 offizielle API-Beta; neun Agent/Coding-Benchmarks über V4-Pro; Harness angekündigt, nicht veröffentlicht.
  • 3. August 2026: Qwen3.8-Max GA — konkurrierender 2,4T-MoE mit API $2/$6.
  • Gerücht ~10.–20. August: V4-Pro-GA — unbestätigt.

Zahlen, die man zitieren kann:

  • Skala: 284B total, 13B aktiv, 1M Kontext, MIT-Lizenz.
  • Preise: $0,14 Input / $0,28 Output pro Mio.; Cache-Hit Input $0,0028.
  • Artificial Analysis: Intelligence Index 50, $0,03/Task — Kimi K3: 57, $0,86; GPT-5.6 Sol und Claude Fable 5 jeweils ~9+ Punkte höher bei $1,86 bzw. $3,15/Task.
  • Terminal Bench 2.0: Flash 82,7 vs. Pro-Preview 67,9 (vendor + Harness minimal).
  • OpenRouter Juli: V4 Flash ~943,9B Tokens/Tag — Platz 2 hinter Mimo V2.5.

Preise, Benchmark-Tabellen und Release-Termine können sich ändern — Primärquellen unten als maßgeblich behandeln.

DeepSeek offizielle Quellen:

DeepSeek — offizielle Website

DeepSeek API — Dokumentation

Unabhängige Benchmarks und Gewichte:

Artificial Analysis — Intelligence Index und $/Task

Hugging Face — deepseek-ai Organisation

FAQ

Hat V4 Flash neue Parameter bekommen?

Nein. Gleiche 284B/13B-Architektur wie V4-Pro-Preview. Gewinne kommen ausschließlich aus Post-Training.

Ist Harness schon verfügbar?

Nein. Erstmals am 31. Juli erwähnt, noch nicht veröffentlicht. Agent-Benchmarks liefen im Minimalmodus — harness-sensitiv.

Warum ist die App nicht aktualisiert?

Der 31.-Juli-Release betraf nur die API. Web-Chat und Mobile-App zeigen weiterhin ältere Modelle — Routing über API mit expliziter Modell-ID.

Lohnt sich Flash gegen Kimi K3?

Bei Preis-Leistung ja: $0,03 vs. $0,86 pro Task laut AA. Bei absolutem Index und Self-Hosting-Option gewinnt K3 (57 vs. 50, Gewichte seit 27. Juli).

Brauche ich DSGVO-Dokumentation?

Ja bei personenbezogenen Prompts. AV-Vertrag, Transfermechanismus und Verarbeitungsverzeichnis vor Produktivbetrieb in der EU üblich.

V4-Flash-0731 liefert vendor-run Benchmarks nahe Opus 4.8 bei einem Bruchteil der Kosten — aber Harness fehlt, Cache-Probleme sind gemeldet, und V4-Pro steht noch aus. Side-by-Side-Tests auf Ihren Agent-Workflows brauchen eine Maschine, die Sie End-to-End kontrollieren. Ein frisch provisionierter KVMFLUX Mac mini M4 liefert Root-Zugriff, SSH in Minuten und einen Wipe-and-Retry-Pfad, wenn sich API-Keys, Modell-IDs oder Routing über Nacht ändern.

V4-Flash-Agenten auf isoliertem Mac testen

API-A/B gegen Kimi K3 und Qwen3.8-Max — Apple Silicon, Root + SSH, keine SDK-Altlasten.

Mac Mini M4 · 16GB / 256GB
Täglich$19.3 /Tag
Wöchentlich$52.2 /Wo.
Monatlich$96.7 /Mon.
Quartal$263 /Quartal