Peak-Valley-Preise · 1M Kontext · 80,6% SWE-bench · Migration vor dem 24. Juli
Nach drei Monaten Preview-Zugang ist DeepSeek V4 am 20. Juli 2026 offiziell in die allgemeine Verfügbarkeit (GA) gegangen. Wer fragt, ob DeepSeek V4 besser als GPT-5.6 ist oder in der Produktion noch deepseek-chat aufruft, findet hier die vollständige Timeline, V4-Pro/Flash-Architektur, Benchmark-Tabellen, Peak-Valley-Preise, einen ehrlichen Vergleich mit Claude Fable 5 sowie ein Sechs-Schritte-Migrations-Runbook vor der Frist am 24. Juli. GA bringt Agent-/Mathe-/Code-Upgrades plus zeitbasierte Preise: SWE-bench Verified erreicht 80,6% (Open-Weight-Rekord) bei 0,87 USD/M Output Off-Peak. Datenstand: 20. Juli 2026.
Die Vorschau startete am 24. April 2026. Das heutige GA ist keine neue Architektur, sondern die Produktionsreife der Preview mit Stabilität, Optimierung und kommerzieller Preisdisziplin.
| Datum | Meilenstein |
|---|---|
| 24. Apr. 2026 | Preview + MIT Open Source: V4-Pro (1,6T) und V4-Flash (284B) |
| Mai 2026 | Produktionsoptimierte Versionen; API allgemein verfügbar |
| Juni 2026 | V4-Pro-Output dauerhaft um 75% auf 0,87 USD/M Token gesenkt |
| 29. Jun. 2026 | E-Mail an alle API-Nutzer: GA Mitte Juli + erste Offenlegung Peak-Valley-Preise |
| 19. Jul. 2026 | Gray-Release-Tester; Medien berichten über bevorstehenden Vollstart |
| 20. Jul. 2026 | GA weltweit live |
| 24. Jul. 2026 | deepseek-chat und deepseek-reasoner dauerhaft deaktiviert (15:59 UTC) |
Fünf Schmerzpunkte, die Entwickler gerade betreffen:
Legacy-Endpunkte enden in 4 Tagen: deepseek-chat und deepseek-reasoner funktionieren ab dem 24. Juli nicht mehr.
Peak-Preis-Komplexität: Werktags in Geschäftszeiten verdoppeln sich die Tarife; 24/7-Pipelines brauchen Scheduling.
Kosten geschlossener Modelle: Claude Fable 5 bei ca. 50 USD/M Output und GPT-5.6 Sol bei ca. 15 USD/M belasten Budgets in großem Maßstab.
1M Kontext nur auf dem Papier: Die meisten Modelle scheitern bei langem Kontext am KV-Cache-Speicher.
Datensouveränität und DSGVO: Geschlossene APIs lassen sich für compliance-kritische Workloads nicht selbst hosten.
| Spezifikation | V4-Pro | V4-Flash |
|---|---|---|
| Gesamtparameter | 1,6 Billionen | 284 Milliarden |
| Aktiv pro Token | 49B (3%) | 13B (4,6%) |
| Layer | 61 | 43 |
| Kontextfenster | 1.000.000 Token | 1.000.000 Token |
| Max. Output | 384K | 384K |
| Präzision | FP4 (MoE-Experten) + FP8 | Gleich |
| Trainingsdaten | 33T+ Token | 32T+ Token |
| Lizenz | MIT | MIT |
V4 ersetzte MLA aus V2/V3 durch ein Zwei-Spur-System. Compressed Sparse Attention (CSA) komprimiert KV 4x via Softmax-gated Pooling, nutzt einen FP4-Lightning-Indexer (top-1024 Pro / top-512 Flash) plus ein 128-Token-Sliding-Window. Heavily Compressed Attention (HCA) komprimiert 128x und führt dann dichte globale Attention aus. Layer wechseln zwischen CSA und HCA.
Bei 1M Token: V4-Pro nutzt 27% der V3.2-Inferenz-FLOPs; der KV-Cache sinkt auf 10% des V3.2-Speichers (Flash: 7%).
Manifold-Constrained Hyper-Connections (mHC) ersetzen Standard-Residuals durch einen 4-Kanal-Stream, gesteuert von einer doppelt stochastischen Matrix, mit stabilen Gradienten über 61 Layer. Muon (nicht AdamW) nutzt Newton-Schulz-Orthogonalisierung für schnelleres, stabileres Training.
| Modus | Anwendungsfall |
|---|---|
| Non-think | Schnelles Routing, Klassifikation, einfache Q&A |
| Think High | Debugging, mittlere Komplexität |
| Think Max | Komplexe Mathematik, Multi-Step-Agenten (384K+ Kontext) |
Empfohlenes Sampling: temperature=1.0, top_p=1.0 für alle Modi.
| Benchmark | V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80,6% Open-Rekord | 96,0% | N/A | ~69% |
| SWE-bench Pro | 55,4% | 80,3% | 78,1% | 69,2% |
| LiveCodeBench | 93,5% | 88,1% | 87,4% | 83,2% |
| Codeforces Elo | 3.206 | — | — | — |
| Terminal-Bench 2.1 | 83,9% | 88,0% | 85,1% | 82,7% |
Artificial Analysis Strategy & Ops Index: Fable 5 erreicht 50 Punkte bei 3,48 USD/Task; V4-Pro erreicht 38 Punkte bei 0,03 USD/Task — 116x günstiger bei einer Performance-Lücke von 24%. V4-Flash bleibt in allen sechs Index-Kategorien unter 0,04 USD/Task.
| Dimension | V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| Open / selbst hostbar | Ja (MIT) | Nein | Nein |
| 1M Kontext | Ja | Nicht bestätigt | Ja |
| Bestes Coding (schwierigste Repos) | Zweite Liga | Zweite Liga | Führt SWE-bench Pro an |
| Algorithmen / Mathematik | LiveCodeBench-Führer | Stark | — |
| Output (Off-Peak) | 0,87 USD/M | ~15 USD/M | ~50 USD/M |
| Output (Peak) | 1,74 USD/M | — | — |
| Datensouveränität | Selbst-Hosting möglich | Nein | Nein |
Peak-Zeiten (Peking-Zeit): Werktags 09:00–12:00 und 14:00–18:00 — alle Tarife verdoppeln sich.
| Modell | Position | Off-Peak | Peak |
|---|---|---|---|
| V4-Pro | Input (Cache Hit) | 0,0035 USD/M | 2x |
| Input (Cache Miss) | 0,435 USD/M | 0,87 USD/M | |
| Output | 0,87 USD/M | 1,74 USD/M | |
| V4-Flash | Input (Cache Hit) | 0,0028 USD/M | 2x |
| Input (Cache Miss) | 0,14 USD/M | 0,28 USD/M | |
| Output | 0,28 USD/M | 0,56 USD/M |
Selbst im Peak ist V4-Pro-Output 8,6x günstiger als Claude Opus 4.8 (15 USD/M) und GPT-5.6 Sol (~15 USD/M).
Kostentipps: Batch-Jobs Off-Peak planen; Prompt-Cache-Hits maximieren; einfache Anfragen an V4-Flash routen; DeepSeek-Preisänderungs-E-Mails beobachten (24h Vorlauf).
Frist: 24. Juli 2026, 15:59 UTC. Legacy-Namen deepseek-chat und deepseek-reasoner werden dauerhaft deaktiviert.
| Alter Name | Neues Äquivalent |
|---|---|
deepseek-chat | deepseek-v4-flash (Non-Thinking) |
deepseek-reasoner | deepseek-v4-flash (Thinking) oder deepseek-v4-pro |
Codebase durchsuchen: Nach deepseek-chat und deepseek-reasoner suchen, inkl. Umgebungsvariablen und CI-Konfigurationen.
Zielmodell wählen: Flash für Chat/Routing; Pro für schweres Reasoning.
OpenAI SDK aktualisieren: Nur model ändern; base_url bleibt https://api.deepseek.com.
Thinking-Modus aktivieren: extra_body mit thinking-Config nutzen, um Reasoner-Verhalten zu ersetzen.
In Staging testen: Kernflows validieren; Think Max braucht 384K+ Kontextfenster.
Vor Frist deployen: Anthropic-SDK-Nutzer tauschen nur den Modellnamen — gleiche Base-URL.
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[{"role": "user", "content": "Solve step by step..."}],
extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)
Das GA-Release muss Claude Fable 5 nicht in jedem Benchmark schlagen. Es liefert das stärkste Open-Weight-Coding-Modell zu 1/10 bis 1/100 der Kosten geschlossener Frontier-APIs.
Selbst-Hosting von V4 oder Long-Context-Agenten braucht zuverlässige Hardware: Laptops halten keinen 24/7-Betrieb durch, VMs erhöhen Performance- und Compliance-Risiken. Für produktives iOS-CI/CD und KI-Agenten-Automatisierung ist VpsMesh Mac Mini Cloud-Miete meist die bessere Wahl: Bare-Metal Apple Silicon passt gut zu lokalen Inferenz-Stacks wie ds4 + V4 Flash auf Mac.
Quellen: DeepSeek Official Docs, arXiv:2606.19348, HuggingFace, LLMReference, Artificial Analysis, MangoMind Blog, TechNode.
Werktags Peking-Zeit 09:00–12:00 und 14:00–18:00 verdoppeln sich alle Tarife. V4-Pro Off-Peak-Output kostet 0,87 USD/M; Peak 1,74 USD/M. Ergänzende Dev-Umgebungskosten finden Sie in unseren Mac Mini Mietpreisen.
Vor dem 24. Juli deepseek-chat durch deepseek-v4-flash und deepseek-reasoner durch Flash Thinking-Modus oder deepseek-v4-pro ersetzen. Base-URL unverändert.
Pro ist das 1,6T-Flaggschiff (49B aktiv); Flash hat 284B (13B aktiv). Beide unterstützen 1M Kontext. Flash ist günstiger (0,28 USD/M Output) fürs Routing; Pro für komplexe Agenten.
Fable 5 und GPT-5.6 führen bei den schwierigsten Benchmarks. V4-Pro ist MIT-lizenziert, selbst hostbar und gehört zu den günstigsten Frontier-KI-APIs 2026 mit 0,87 USD/M Off-Peak-Output.
V4-Flash läuft über Engines wie ds4 auf High-End-Macs (96GB+ Unified Memory). Vollständiges Pro braucht Cluster-Hardware. Setup-Details in unserem Hilfezentrum.
Agent-, Mathe- und Code-Performance-Upgrades; Peak-Valley-Preise; globale GA-Verfügbarkeit; Legacy-Modellnamen enden am 24. Juli. MoE-Architektur unverändert.