Warum die 1100-%-Headline die meisten Rechnungen nicht beschreibt

Die Reibung für Einkauf und Engineering ist konkret:

  • Medien zitierten unterschiedliche Tarifzeilen. «11x», «über 1100 %» und «350 %» sind jeweils korrekt. Sie gelten für Peak-Cache-Hit-Input, Output und Cache-Miss-Input — nicht für einen Mischsatz.
  • Peak-Stunden sind eingepreist. Peak ist 9–12 und 14–18 Uhr Peking-Zeit. Der Hinweis auf «flexiblere Workload-Planung» ist Kapazitätssprache, kein Marketing.
  • Official ist nicht mehr durchgängig der günstigste Kanal. Zur Peak-Zeit liegt die DeepSeek-eigene API über mehreren Resellern (GMI Cloud, Novita und andere listen V4 Pro weiter unter dem neuen Official-Peak).
  • Open Weights sind nicht automatisch Apache 2.0. Qwen3.8-Max ist ladbar, die Custom License hält Hebel über große MaaS- und Assistant-Geschäfte.

Bereits dokumentiert: DeepSeek V4 Flash GA-Scores und der alte Flattarif sowie das Qwen3.8-Max-Launchfenster. Dieser Text gilt der Drei-Lab-Verschiebung Mitte August, nicht einem weiteren Einzelmodell-Recap.

Was in zwei Wochen passierte: die Zeitachse

Von Mitte Juli bis 00:00 Peking-Zeit am 17. August:

Datum Ereignis
16. Juli 2026 Moonshot AI veröffentlicht Open Weights für Kimi K3 (2.8T Parameter), mit US-Sicherheitsaufmerksamkeit
2.–3. August 2026 Alibaba kündigt Qwen3.8-Max an und schaltet die gehostete API frei
10. August 2026 Meta veröffentlicht Muse Glimmer (30B, Apache 2.0) und kündigt Open Weights für das Flagship Muse Spark 1.2 an
12. August 2026 Alibaba stellt Qwen3.8-2.4T-A95B auf Hugging Face / ModelScope; xAI liefert Grok 4.6
13. August 2026 DeepSeek-V4-Pro geht GA und kündigt eine Preiserhöhung ab 17. August an; Google liefert rabattiertes Gemini 3.7 Flash
14. August 2026 Zhipu liefert GLM-5.3, gleicher 743B-Base wie GLM-5.2
17. August 2026, 00:00 Peking Die neuen DeepSeek-Tarife gelten

Zoom-out: Am 30. Juli senkte OpenAI GPT-5.6 Luna um 80 %, am 6.–7. August wurde Luna der Free-Default mit unbegrenztem Textchat. Chinesische Labs hoben Preise und öffneten Flagship-Gewichte, US-Labs senkten Preise und gingen auf der Consumer-Schicht auf Free. Derselbe Konflikt, zwei Seiten. Die Luna-Senkung steht in unserer GPT-5.6-Preisnotiz.

Tarifkarten und Specs: ist DeepSeek noch die günstigste Frontier-API?

DeepSeek-Sätze unten in RMB je 1M Tokens, wirksam 17. August 00:00 Peking-Zeit. Peak: 9–12 und 14–18 Uhr Peking.

Tarifzeile Alt Neu Off-Peak Neu Peak Peak-Anstieg
V4-Flash Cache-Hit (Input) ¥0.02 ¥0.05 ¥0.10 ~400%
V4-Flash Cache-Miss (Input) ¥1.0 ¥1.5 ¥3.0 200%
V4-Flash Output ¥2.0 ¥4.5 ¥9.0 350%
V4-Pro Cache-Hit (Input) ¥0.025 ¥0.15 ¥0.30 ~1100%
V4-Pro Cache-Miss (Input) ¥3.0 ¥4.5 ¥9.0 200%
V4-Pro Output ¥6.0 ¥13.5 ¥27.0 350%

Die 1100-%-Zahl gilt für Peak-Cache-Hit-Input — die Zeile, die am nächsten an kostenlos startete. Output, der die meisten realen Rechnungen trägt, stieg um 350 %. Eine unabhängige Kostenmodellierung für schwere Last (rund 84M Tokens/Monat, überwiegend Off-Peak, etwa die Hälfte Cache-Hits) sieht einen Anstieg näher bei 1.8x.

Qwen3.8-2.4T-A95B (Qwen3.8-Max Open Weights):

Spec Wert
Parameter 2.4T gesamt, 95B aktiv je Token (MoE, 512 Experts, 10 geroutet + 1 shared)
Kontextfenster 262144 Tokens nativ (Open Checkpoint), erweiterbar auf ~1.01M; gehostetes Max default 1M
Release-Takt Preview 2. August → API live 3. August → Open Weights 12. August
API-Preis (International) $2/M Input, $6/M Output
Lizenz Nicht Apache 2.0 — Custom Qwen3.8-Max License
Einordnung Erstmals Max-Tier-Gewichte von Alibaba; Qwen3.5/3.6/3.7 Max blieben API-only

GLM-5.3 vs. GLM-5.2: gleicher Base, nur Post-Training. Die folgenden Werte sind Zhipu-eigene Angaben — ein unabhängiger Drittlauf ist bisher nicht veröffentlicht.

Benchmark GLM-5.2 GLM-5.3 Änderung
Terminal-Bench 3.0 4.6% 28.3% +23.7
DeepSWE v1.1 46.2% 66.9% +20.7
Agents' Last Exam (CLI) 23.8% 28.5% +4.7
CyberGym 77.2% 84.5% +7.3
AutomationBench 26.2% 48.2% +22.0

GLM-5.3 liegt auf Terminal-Bench 3.0 weiter hinter GPT-5.6 Sol (34.6 %) und Claude Fable 5 (33.7 %). Das ist ein Spitzenwert unter Open-Weight-Modellen, kein uneingeschränkter Frontier-Sieg.

Direktvergleich (je 1M Tokens; RMB/USD bei ~¥7.15/$1, Näherung):

Modell Input Output Open Weights?
DeepSeek V4-Pro (Peak) ¥9.0 (~$1.26) ¥27.0 (~$3.78) Nein
DeepSeek V4-Pro (Off-Peak) ¥4.5 (~$0.63) ¥13.5 (~$1.89) Nein
Qwen3.8-Max (International API) $2 $6 Ja (Custom License)
OpenAI GPT-5.6 Luna $0.20 $1.20 Nein
Claude Opus 5 (impliziert, Alibaba-Verhältnis) ~$5 ~$25 Nein

Kurz: nein. Off-Peak-V4-Pro bleibt klar unter Claude Opus 5, ist aber nicht mehr das uneingeschränkt günstigste Angebot. Die internationale Qwen3.8-Max-API und OpenAI Luna unterbieten DeepSeek Off-Peak in mindestens einer Dimension. «Chinesisches Modell = günstigstes Modell» war 2025 und Anfang 2026 oft zutreffend. Als Annahme trägt es nicht mehr.

Drei Strategien: Kapazitätspreis, lizenzierte Open Weights, Post-Training-Skala

DeepSeek: vom Flattarif zur Zeitfensterpreisung. Die einfache Lesart ist Margendruck. Die Struktur liest sich eher als sichtbar gemachte Rechenknappheit. Ein dauerhaft niedriger Einheitssatz funktionierte als Akquise, solange GPU-Angebot mithielt. Als die Nutzung exponentiell wuchs und Kapazität nicht, musste etwas explizit werden. «Flexiblere Workload-Planung» heißt: Peak-Compute ist knapp.

Alibaba: Open Weights kaufen Reichweite; die Custom License schützt die Umsatzdecke. Der volle 2.4T-Checkpoint ist frei ladbar. Die Lizenz ist nicht das permissive Apache 2.0 kleinerer Qwen-Modelle. Jedes MaaS- oder AI-Work-Assistant-Geschäft mit über 50M USD in einem 12-Monats-Fenster braucht eine gesonderte kommerzielle Lizenz. Produkte mit 100M+ MAU oder 20M+ USD Monatsumsatz müssen den Modellnamen prominent zeigen. Das ist ein anderer Einsatz als Metas Muse Glimmer unter uneingeschränktem Apache 2.0.

Ein Gerücht ist falsch: Behauptungen, Alibabas Lizenz verbiete Downloads aus den USA, der EU, dem Vereinigten Königreich und Südkorea. Der veröffentlichte Text enthält keine geografische oder territoriale Klausel.

GLM-5.3: kein neuer Base, eine größere Post-Training-Wette. Derselbe 743B-Base wie GLM-5.2, kein Retraining, und ein rund 6-facher Sprung auf Terminal-Bench 3.0 (4.6 % → 28.3 %) durch Skalierung der Reinforcement-Learning-Umgebungen. Wenn Pretraining-Scaling-Laws abnehmen, wird Post-Training-RL ein eigener Hebel mit niedrigerer Kostenschwelle als ein neues Foundation-Modell. Mid-Tier-Labs können auf Agent- und Coding-Benches aufschließen.

Sechs Schritte: Headline, Rechnung und Lizenz in Einklang bringen

Preise, Lizenztexte und Scores ändern sich. Offizielle Seiten vor einer Produkt- oder Budgetentscheidung prüfen. Wer Prompts über Cloud-APIs schickt oder Gewichte auf gemieteter Hardware lädt, bleibt für Speicherort, Weisung und Löschung der Daten im Sinne der DSGVO verantwortlich.

  1. Die offizielle Tarifkarte kopieren, nicht eine Headline. DeepSeek trennt Cache-Hit, Cache-Miss und Output. Die Zeilen notieren, die der eigene Traffic trifft.
  2. Die lokale Uhr auf die Peking-Peak-Fenster mappen. Peak ist 09:00–12:00 und 14:00–18:00 Asia/Shanghai. Nacht in einer Region kann Mittag in einer anderen sein.
  3. Die Cache-Hit-Rate aus den Logs der letzten Woche schätzen. Lange feste Systemprompts absorbieren den Cache-Hit-Anstieg. Niedrige Hit-Rate heißt: 350 % Output und 200 % Miss-Input tragen die Rechnung.
  4. Die Qwen-Lizenzdatei lesen, nicht den Ankündigungsthread. Persönliche und interne Nutzung bleiben weitgehend unberührt. MaaS oder AI Work Assistant über 50M USD in 12 Monaten braucht eine gesonderte kommerzielle Lizenz.
  5. GLM-5.3-Scores als Vendor-reported führen, bis ein Dritter sie wiederholt. Terminal-Bench 3.0 liegt weiter hinter GPT-5.6 Sol und Claude Fable 5.
  6. Für einen Side-by-Side-Download eine wischbare Box nutzen. Ein 2.4T-Checkpoint ist kein Laptop-Job. Für quantisierte kleinere Modelle oder Agent-Workflows auf Apple Silicon ist eine dedizierte, rootbare Maschine sauberer als ein geteiltes Notebook.
local shell · Peking-Peak prüfen
TZ=Asia/Shanghai date '+%H:%M %Z'
python3 -c "from datetime import datetime; from zoneinfo import ZoneInfo
h=datetime.now(ZoneInfo('Asia/Shanghai')).hour
print('peak' if (9<=h<12 or 14<=h<18) else 'off-peak')"

Reseller-Listenpreise können Official-Peak eine Weile unterbieten. Lieferantenidentität, Quota und Abschaltrisiko gehören in dieselbe Zeile wie der Preis.

Was unbestätigt bleibt, und wo zu prüfen ist

  • Die 1100-%-Headline ist technisch korrekt und ohne Tarifzeile irreführend. Es ist Peak-Cache-Hit-Input. Output — der Posten der meisten realen Rechnungen — stieg um 350 %.
  • Angaben, Qwen3.8-Max laufe auf Alibabas Zhenwu M890 (und «Pangu AL128»-Supernodes), von mehreren chinesischen Finanzmedien berichtet, sind durch Alibaba-Technikdocs oder Drittbenches nicht unabhängig bestätigt. Vendor-nah, unverifiziert.
  • Die gemeldete Entdeckung einer «schweren Schwachstelle» in Cursor durch GLM-5.3 stammt von VentureBeat und Zhipus eigener Offenlegung. Technische Details sind nicht öffentlich. Vendor-sourced, nicht unabhängig auditiert.
  • Berichte, Chinas Handelsministerium (MOFCOM) bereite gegnerische Exportkontrollen für KI-/Halbleitertechnik vor, sind spekulativ, keine amtliche Ankündigung. Nur Hintergrund.

Chinesische Finanzmedien nennen den letzten Monat «drei Modellupdates pro Woche». US-Labs fuhren auf der Consumer-Schicht den Gegenzug. Es gibt auch eine geopolitische Lesart: Kimi K3 zog bereits US-Sicherheitsaufmerksamkeit; Alibabas Fenster für ein 2.4T-Flagship wird als Festigung internationaler Reichweite vor möglicher Regulierungsenge gelesen. Das ist eine informierte Interpretation, kein bestätigter Fakt.

Offizielle Quellen (Live-Seite prüfen; Zahlen können sich ändern):

DeepSeek API Docs — Models & Pricing

Hugging Face — Qwen/Qwen3.8-2.4T-A95B

Z.ai — GLM-5.3: Frontier Coding with Emergent Cyber Capabilities

Drittberichte:

CIO — DeepSeek raises some V4 prices by more than 10x

NVIDIA Technical Blog — Serve Qwen3.8-2.4T-A95B

Z.ai Docs — GLM-5.3

Häufige Fragen

Steigt jede DeepSeek-Rechnung nach der Erhöhung um 1100 %?

Nein. 1100 % gilt für Peak-Cache-Hit-Input. Output stieg um 350 %, Cache-Miss-Input um 200 %. Eine Modellrechnung für schwere Last (rund 84M Tokens/Monat, überwiegend Off-Peak, etwa die Hälfte Cache-Hits) liegt näher bei 1.8x als bei 11x. Wer dauerhaft in die Peking-Fenster 9–12 und 14–18 Uhr fällt und wenig Cache trifft, nähert sich den Headline-Sätzen.

Darf ein einzelner Entwickler die Qwen3.8-Max-Gewichte kommerziell nutzen?

Persönliche Projekte und interne Nutzung sind weitgehend unberührt. Eine gesonderte kommerzielle Lizenz von Alibaba ist nötig, wenn das Geschäft Model-as-a-Service oder AI-Work-Assistant ist und in einem beliebigen 12-Monats-Fenster über 50M USD Umsatz liegt. Produkte mit 100M MAU oder 20M USD Monatsumsatz müssen den Modellnamen sichtbar führen.

Ist GLM-5.3 ein neues Basismodell?

Nein. GLM-5.3 und GLM-5.2 teilen denselben 743B-Base. Es gab kein erneutes Pretraining. Der Sprung — Terminal-Bench 3.0 von 4.6 % auf 28.3 % — kommt aus skaliertem Reinforcement Learning in der Post-Training-Phase. Die Zahlen sind Vendor-Angaben ohne unabhängigen Drittlauf.

Verbietet die Qwen3.8-Max-Lizenz Downloads aus den USA, der EU, dem Vereinigten Königreich oder Korea?

Nein. Diese Behauptung ist falsch. Der veröffentlichte Lizenztext enthält keine geografische Klausel. Die Schwellen sind umsatzbezogen, nicht standortbezogen.

Bedeutet Muse Glimmer die Rückkehr uneingeschränkter Llama-Open-Weights?

Nur teilweise. Muse Glimmer ist ein 30B-Destillat unter Apache 2.0. Das geschlossene Flagship Muse Spark 1.2 ist nicht offen; angekündigt ist lediglich eine künftige Freigabe der Gewichte. Das ist Absicht, kein vollzogener Schritt.

Zeitfenster-API-Preise, ein 2.4T-Download und ein Post-Training-Vergleich treffen dieselbe Reibung: ein geteiltes Notebook ist unsauber, die lokale Platte läuft voll, und Eval-Traffic gehört nicht auf denselben Rechner wie der tägliche Compile. Wer eine saubere, rootbare Apple-Silicon-Box braucht, die sich nach dem Lauf wischen lässt, kommt mit einem tageweise gemieteten KVMFLUX-Cloud-Mac-mini in der Regel weiter — dedizierte Hardware, SSH + VNC, Residenz und Löschung der Testdaten unter eigener Kontrolle. Die Periodenrechnung steht in Tag / Woche / Monat / Quartal.

Open Weights im Off-Peak auf einem echten Mac vergleichen

Physischer Mac mini M4, Root und SSH, für quantisierte Modelle oder Agent-Workflows — ohne Disk und State mit dem Arbeitsrechner zu teilen.

Mac Mini M4 · 16GB / 256GB
Täglich$19.3 /Tag
Wöchentlich$52.2 /Wo.
Monatlich$96.7 /Mo.
Vierteljährlich$263 /Q.