Was am 31. Juli wirklich schiffte — und was noch fehlt
Die Kernfrage für Teams mit Budget- und Compliance-Druck ist nicht „ist Flash schneller?“, sondern „welche Claims sind reproduzierbar?“. Vier Datenpunkte dominieren die Entscheidungsmatrix:
- Post-Training-only: V4-Flash-0731 behält 284B Gesamt- / 13B aktive Parameter. Kein Architektur-Rescale — die Gewinne kommen aus RL und SFT auf derselben CSA+HCA-Hybridaufmerksamkeit mit mHC und Muon-Optimizer.
- Harness unveröffentlicht: Agent-Benchmarks liefen im Harness-Minimalmodus. DeepSeek warnt selbst, dass Harness-Konfigurationen die Scores stark beeinflussen — bis zum Framework-Drop sind die Tabellen vendor-run.
- V4-Pro offiziell ausstehend: Die Pro-Preview existiert seit April; der offizielle V4-Pro-Release und das Harness-Framework stehen noch aus. Gerüchte über GA zwischen 10. und 20. August sind unbestätigt.
- API-only-Update: DeepSeek-App und Web-Chat wurden nicht mit V4-Flash aktualisiert. Produktionsrouting läuft über
deepseek-chatmit Modell-IDdeepseek-v4-flash-0731. - Operative Caveats: Nutzer berichten über Cache-Hit-Probleme und Safety-Classifier-Timeouts in den ersten Tagen nach Launch. Funding-Gerüchte (Liang Wenfeng / „Liang Baikai“-Spitznamen-Flip in chinesischen Foren) sind unverifiziert.
- DSGVO und Drittlandtransfer: API-Prompts mit personenbezogenen Daten verlassen die EU Richtung China. AV-Vertrag, Transfer Impact Assessment und Verarbeitungsverzeichnis sind vor Produktivbetrieb Pflicht — siehe interne Compliance und Datenschutzerklärung.
Offizielle Specs und Launch-Zahlen (31. Juli 2026)
| Spec | DeepSeek V4-Flash-0731 |
|---|---|
| Release-Datum | 31. Juli 2026 (offizielle API-Beta) |
| Gesamt- / aktive Parameter | 284B / 13B (unverändert vs. V4-Pro-Preview) |
| Leistungsquelle | Post-Training (SFT + RL) — keine neuen Parameter |
| Architektur | CSA + HCA Hybridaufmerksamkeit, mHC, Muon-Optimizer |
| Kontextfenster | 1M Tokens (V4-Pro: 27 % weniger FLOPs, 10 % weniger KV-Cache vs. V3.2 — vendor claim) |
| Lizenz | MIT (open weights auf Hugging Face) |
| API Input / Output (pro 1 Mio.) | $0,14 / $0,28 (Cache-Hit Input: $0,0028) |
| Artificial Analysis Intelligence Index | 50 — $0,03/Task (unabhängig) |
| Terminal Bench 2.0 (vendor + Harness minimal) | 82,7 (vs. V4-Pro-Preview 67,9) |
| Agent/Coding-Benchmarks vs. V4-Pro | 9 von 9 über V4-Pro-Preview (vendor-run) |
| Harness-Framework | Angekündigt 31.07., nicht veröffentlicht |
| App / Web-Update | Nicht erfolgt — nur API |
Zeilen ohne „unabhängig“-Markierung stammen aus DeepSeek-Launch-Materialien oder liefen im noch nicht veröffentlichten Harness-Minimalmodus.
V4 Flash vs. Kimi K3 vs. GLM-5.2 vs. Qwen3.8-Max vs. Frontier-Closed
| Modell | Gesamt / aktiv | API Input / Output (1 Mio.) | AA Index / $/Task | Open weights? | Unabhängiger Benchmark |
|---|---|---|---|---|---|
| V4-Flash-0731 | 284B / 13B | $0,14 / $0,28 (Cache $0,0028) | 50 / $0,03 | Ja (MIT) | AA Index 50 |
| V4-Pro-Preview | 284B / 13B | $0,435 / $0,87 (Cache $0,003625) | Niedriger als Flash | Preview | Terminal Bench 67,9 |
| Kimi K3 | 2,8T / ~104B | $3 / $15 (Cache $0,30) | 57 / $0,86 | Seit 27.07.2026 | AA Index 57, SWE-bench 93,4 % |
| GLM-5.2 | MoE-Klasse | $0,45 / $3,31 | Opus-Style-Planung | open-weight | OpenRouter-Volumen #6 Juli |
| Qwen3.8-Max | 2,4T / 95B | $2 / $6 | Noch keine AA-Zahl | Versprochen, HF leer | Arena #5 vorläufig (1496 Pkt.) |
| Claude Opus 4.8 / Fable 5 | Nicht veröffentlicht | $5–10 / $25–50 | ~59 / $1,86–3,15 | Geschlossen | Spitzengruppe Arena |
| GPT-5.6 Sol | Nicht veröffentlicht | ~$1,40 kombiniert | ~59 / $1,86 | Geschlossen | +9 Pkt. vs. Flash laut AA |
Die „斩杀线“-Debatte in chinesischen Tech-Foren beschreibt den Preis-Leistungs-Kill-Point: V4 Flash positioniert sich unterhalb der Grenze, ab der westliche Frontier-Modelle für Volumenarbeit wirtschaftlich unsinnig werden. Für Routing-Kontext siehe OpenRouter Juli 2026 Rankings und GPT-5.6 Preissenkung.
Architektur ohne Parameter-Sprung — warum Post-Training reicht
DeepSeek's Narrativ vom 31. Juli: derselbe 284B/13B-Checkpoint, bessere Agent-Scores. Technisch bedeutet das:
- CSA + HCA: Compressed Sparse Attention plus Hierarchical Context Attention — weniger KV-Cache-Druck bei 1M-Kontext als V3.2 (vendor: 27 % FLOPs-Reduktion, 10 % KV-Cache).
- mHC + Muon: Multi-head Compression und Muon-Optimizer stabilisieren RL-Post-Training auf langen Tool-Chains.
- Harness-Sensitivität: Terminal Bench 82,7 und die neun Coding-Benchmarks liefen im Harness-Minimalmodus. Ohne veröffentlichtes Framework können Dritte die Methodik nicht 1:1 nachbauen.
- Kein V4-Pro-GA: Wer auf Pro-Preview-Routing setzte, sieht Flash als günstigeren Ersatz mit höheren Scores — bis der offizielle Pro-Drop kommt.
Vendor-Benchmarks nahe Opus 4.8 sind kein Produktionsgarant. Cache-Hit-Bugs und Safety-Classifier-Timeouts in den ersten Launch-Tagen zeigen: API-Smoke-Tests auf Ihren Workloads schlagen Tabellen — besonders bei EU-Teams mit DSGVO-Pflichten vor dem Rollout.
Sechs Prüfschritte zur V4-Flash-Bewertung vor Produktion
Benchmark-Zahlen allein sind kein Rollout-Plan. Starten Sie in einer kontrollierten macOS-Umgebung mit Root-Zugriff — reproduzierbare Logs, keine SDK-Konflikte.
- API-Key und Compliance kartieren: DeepSeek-API-Key anlegen, Modell-ID
deepseek-v4-flash-0731verifizieren. Parallel: AV-Vertrag, Transfer Impact Assessment und Verarbeitungsverzeichnis für DSGVO Art. 28/30. - Baseline gegen Incumbent festlegen: Gleiches Repo, gleicher Harness, gleiches Token-Cap — Kimi K3, GLM-5.2 oder Qwen3.8-Max als Referenz. Vendor-Tabellen nicht als Ersatz für Ihre Workloads nutzen.
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DEEPSEEK_API_KEY"],
base_url="https://api.deepseek.com",
)
resp = client.chat.completions.create(
model="deepseek-v4-flash-0731",
messages=[{"role": "user", "content": "Refactor this function without changing behavior."}],
)
print(resp.choices[0].message.content)
- Cache-Hit-Rate messen: Wiederholte System-Prompts und RAG-Kontexte testen — $0,0028/M bei Cache-Hit vs. $0,14/M ohne. Erste Nutzer berichteten über Cache-Inkonsistenzen; Logs dokumentieren.
- Task-Level-Kosten gegen AA-Baseline: 20–50 repräsentative Tasks aus Ihrem Backlog; Kosten pro erfolgreichem Abschluss gegen Kimi K3 ($0,86/Task) und GPT-5.6 Sol ($1,86/Task) kalkulieren.
- Agent-Tool-Chains isoliert testen: Multi-Step-Runs in wipebarem Mac-Umfeld — nicht auf geteiltem CI mit veralteten SDKs. Harness-Minimalmodus der Vendor-Benchmarks ist nicht Ihr Produktions-Harness.
- Harness-Drop und V4-Pro-GA überwachen: DeepSeek-Docs und Hugging Face auf Framework-Release prüfen; bei V4-Pro-GA Routing-Entscheidung neu bewerten. Gerüchte 10.–20. August als unbestätigt markieren.
Timeline und harte Zahlen
- 24. April 2026: V4-Pro-Preview — erster öffentlicher V4-Checkpoint.
- 24. Juli 2026:
deepseek-chatunddeepseek-reasonerdeprecated; Migration auf V4-Pipeline. - 27. Juli 2026: Kimi K3 open weights auf Hugging Face.
- 31. Juli 2026: V4-Flash-0731 offizielle API-Beta; neun Agent/Coding-Benchmarks über V4-Pro; Harness angekündigt, nicht veröffentlicht.
- 3. August 2026: Qwen3.8-Max GA — konkurrierender 2,4T-MoE mit API $2/$6.
- Gerücht ~10.–20. August: V4-Pro-GA — unbestätigt.
Zahlen, die man zitieren kann:
- Skala: 284B total, 13B aktiv, 1M Kontext, MIT-Lizenz.
- Preise: $0,14 Input / $0,28 Output pro Mio.; Cache-Hit Input $0,0028.
- Artificial Analysis: Intelligence Index 50, $0,03/Task — Kimi K3: 57, $0,86; GPT-5.6 Sol und Claude Fable 5 jeweils ~9+ Punkte höher bei $1,86 bzw. $3,15/Task.
- Terminal Bench 2.0: Flash 82,7 vs. Pro-Preview 67,9 (vendor + Harness minimal).
- OpenRouter Juli: V4 Flash ~943,9B Tokens/Tag — Platz 2 hinter Mimo V2.5.
Preise, Benchmark-Tabellen und Release-Termine können sich ändern — Primärquellen unten als maßgeblich behandeln.
DeepSeek offizielle Quellen:
Unabhängige Benchmarks und Gewichte:
Artificial Analysis — Intelligence Index und $/Task
Hugging Face — deepseek-ai Organisation
FAQ
Hat V4 Flash neue Parameter bekommen?
Nein. Gleiche 284B/13B-Architektur wie V4-Pro-Preview. Gewinne kommen ausschließlich aus Post-Training.
Ist Harness schon verfügbar?
Nein. Erstmals am 31. Juli erwähnt, noch nicht veröffentlicht. Agent-Benchmarks liefen im Minimalmodus — harness-sensitiv.
Warum ist die App nicht aktualisiert?
Der 31.-Juli-Release betraf nur die API. Web-Chat und Mobile-App zeigen weiterhin ältere Modelle — Routing über API mit expliziter Modell-ID.
Lohnt sich Flash gegen Kimi K3?
Bei Preis-Leistung ja: $0,03 vs. $0,86 pro Task laut AA. Bei absolutem Index und Self-Hosting-Option gewinnt K3 (57 vs. 50, Gewichte seit 27. Juli).
Brauche ich DSGVO-Dokumentation?
Ja bei personenbezogenen Prompts. AV-Vertrag, Transfermechanismus und Verarbeitungsverzeichnis vor Produktivbetrieb in der EU üblich.
V4-Flash-0731 liefert vendor-run Benchmarks nahe Opus 4.8 bei einem Bruchteil der Kosten — aber Harness fehlt, Cache-Probleme sind gemeldet, und V4-Pro steht noch aus. Side-by-Side-Tests auf Ihren Agent-Workflows brauchen eine Maschine, die Sie End-to-End kontrollieren. Ein frisch provisionierter KVMFLUX Mac mini M4 liefert Root-Zugriff, SSH in Minuten und einen Wipe-and-Retry-Pfad, wenn sich API-Keys, Modell-IDs oder Routing über Nacht ändern.
V4-Flash-Agenten auf isoliertem Mac testen
API-A/B gegen Kimi K3 und Qwen3.8-Max — Apple Silicon, Root + SSH, keine SDK-Altlasten.