DeepSeek V4 GA-Release

Peak-Valley-Preise · 1M Kontext · 80,6% SWE-bench · Migration vor dem 24. Juli

DeepSeek V4 GA Release Preise Benchmarks Architektur Juli 2026

Nach drei Monaten Preview-Zugang ist DeepSeek V4 am 20. Juli 2026 offiziell in die allgemeine Verfügbarkeit (GA) gegangen. Wer fragt, ob DeepSeek V4 besser als GPT-5.6 ist oder in der Produktion noch deepseek-chat aufruft, findet hier die vollständige Timeline, V4-Pro/Flash-Architektur, Benchmark-Tabellen, Peak-Valley-Preise, einen ehrlichen Vergleich mit Claude Fable 5 sowie ein Sechs-Schritte-Migrations-Runbook vor der Frist am 24. Juli. GA bringt Agent-/Mathe-/Code-Upgrades plus zeitbasierte Preise: SWE-bench Verified erreicht 80,6% (Open-Weight-Rekord) bei 0,87 USD/M Output Off-Peak. Datenstand: 20. Juli 2026.

01

Was sich beim GA-Release gegenüber der April-Vorschau geändert hat

Die Vorschau startete am 24. April 2026. Das heutige GA ist keine neue Architektur, sondern die Produktionsreife der Preview mit Stabilität, Optimierung und kommerzieller Preisdisziplin.

DatumMeilenstein
24. Apr. 2026Preview + MIT Open Source: V4-Pro (1,6T) und V4-Flash (284B)
Mai 2026Produktionsoptimierte Versionen; API allgemein verfügbar
Juni 2026V4-Pro-Output dauerhaft um 75% auf 0,87 USD/M Token gesenkt
29. Jun. 2026E-Mail an alle API-Nutzer: GA Mitte Juli + erste Offenlegung Peak-Valley-Preise
19. Jul. 2026Gray-Release-Tester; Medien berichten über bevorstehenden Vollstart
20. Jul. 2026GA weltweit live
24. Jul. 2026deepseek-chat und deepseek-reasoner dauerhaft deaktiviert (15:59 UTC)

Fünf Schmerzpunkte, die Entwickler gerade betreffen:

  1. 01

    Legacy-Endpunkte enden in 4 Tagen: deepseek-chat und deepseek-reasoner funktionieren ab dem 24. Juli nicht mehr.

  2. 02

    Peak-Preis-Komplexität: Werktags in Geschäftszeiten verdoppeln sich die Tarife; 24/7-Pipelines brauchen Scheduling.

  3. 03

    Kosten geschlossener Modelle: Claude Fable 5 bei ca. 50 USD/M Output und GPT-5.6 Sol bei ca. 15 USD/M belasten Budgets in großem Maßstab.

  4. 04

    1M Kontext nur auf dem Papier: Die meisten Modelle scheitern bei langem Kontext am KV-Cache-Speicher.

  5. 05

    Datensouveränität und DSGVO: Geschlossene APIs lassen sich für compliance-kritische Workloads nicht selbst hosten.

02

Architektur: Wie DeepSeek 1M Token praktikabel macht

SpezifikationV4-ProV4-Flash
Gesamtparameter1,6 Billionen284 Milliarden
Aktiv pro Token49B (3%)13B (4,6%)
Layer6143
Kontextfenster1.000.000 Token1.000.000 Token
Max. Output384K384K
PräzisionFP4 (MoE-Experten) + FP8Gleich
Trainingsdaten33T+ Token32T+ Token
LizenzMITMIT

CSA + HCA Hybrid-Attention

V4 ersetzte MLA aus V2/V3 durch ein Zwei-Spur-System. Compressed Sparse Attention (CSA) komprimiert KV 4x via Softmax-gated Pooling, nutzt einen FP4-Lightning-Indexer (top-1024 Pro / top-512 Flash) plus ein 128-Token-Sliding-Window. Heavily Compressed Attention (HCA) komprimiert 128x und führt dann dichte globale Attention aus. Layer wechseln zwischen CSA und HCA.

Bei 1M Token: V4-Pro nutzt 27% der V3.2-Inferenz-FLOPs; der KV-Cache sinkt auf 10% des V3.2-Speichers (Flash: 7%).

mHC und Muon-Optimizer

Manifold-Constrained Hyper-Connections (mHC) ersetzen Standard-Residuals durch einen 4-Kanal-Stream, gesteuert von einer doppelt stochastischen Matrix, mit stabilen Gradienten über 61 Layer. Muon (nicht AdamW) nutzt Newton-Schulz-Orthogonalisierung für schnelleres, stabileres Training.

Drei Reasoning-Modi

ModusAnwendungsfall
Non-thinkSchnelles Routing, Klassifikation, einfache Q&A
Think HighDebugging, mittlere Komplexität
Think MaxKomplexe Mathematik, Multi-Step-Agenten (384K+ Kontext)

Empfohlenes Sampling: temperature=1.0, top_p=1.0 für alle Modi.

03

Benchmark-Zahlen: Wo V4 gewinnt und wo nicht

BenchmarkV4-ProClaude Fable 5GPT-5.6 UltraOpus 4.8
SWE-bench Verified80,6% Open-Rekord96,0%N/A~69%
SWE-bench Pro55,4%80,3%78,1%69,2%
LiveCodeBench93,5%88,1%87,4%83,2%
Codeforces Elo3.206
Terminal-Bench 2.183,9%88,0%85,1%82,7%

Artificial Analysis Strategy & Ops Index: Fable 5 erreicht 50 Punkte bei 3,48 USD/Task; V4-Pro erreicht 38 Punkte bei 0,03 USD/Task116x günstiger bei einer Performance-Lücke von 24%. V4-Flash bleibt in allen sechs Index-Kategorien unter 0,04 USD/Task.

04

DeepSeek V4 vs GPT-5.6 vs Claude Fable 5: ehrlicher Vergleich

DimensionV4-ProGPT-5.6 SolClaude Fable 5
Open / selbst hostbarJa (MIT)NeinNein
1M KontextJaNicht bestätigtJa
Bestes Coding (schwierigste Repos)Zweite LigaZweite LigaFührt SWE-bench Pro an
Algorithmen / MathematikLiveCodeBench-FührerStark
Output (Off-Peak)0,87 USD/M~15 USD/M~50 USD/M
Output (Peak)1,74 USD/M
DatensouveränitätSelbst-Hosting möglichNeinNein

Peak-Valley-Preistabelle

Peak-Zeiten (Peking-Zeit): Werktags 09:00–12:00 und 14:00–18:00 — alle Tarife verdoppeln sich.

ModellPositionOff-PeakPeak
V4-ProInput (Cache Hit)0,0035 USD/M2x
Input (Cache Miss)0,435 USD/M0,87 USD/M
Output0,87 USD/M1,74 USD/M
V4-FlashInput (Cache Hit)0,0028 USD/M2x
Input (Cache Miss)0,14 USD/M0,28 USD/M
Output0,28 USD/M0,56 USD/M

Selbst im Peak ist V4-Pro-Output 8,6x günstiger als Claude Opus 4.8 (15 USD/M) und GPT-5.6 Sol (~15 USD/M).

Hinweis

Kostentipps: Batch-Jobs Off-Peak planen; Prompt-Cache-Hits maximieren; einfache Anfragen an V4-Flash routen; DeepSeek-Preisänderungs-E-Mails beobachten (24h Vorlauf).

05

Migrations-Runbook: Sechs Schritte vor dem 24. Juli

Achtung

Frist: 24. Juli 2026, 15:59 UTC. Legacy-Namen deepseek-chat und deepseek-reasoner werden dauerhaft deaktiviert.

Alter NameNeues Äquivalent
deepseek-chatdeepseek-v4-flash (Non-Thinking)
deepseek-reasonerdeepseek-v4-flash (Thinking) oder deepseek-v4-pro
  1. 01

    Codebase durchsuchen: Nach deepseek-chat und deepseek-reasoner suchen, inkl. Umgebungsvariablen und CI-Konfigurationen.

  2. 02

    Zielmodell wählen: Flash für Chat/Routing; Pro für schweres Reasoning.

  3. 03

    OpenAI SDK aktualisieren: Nur model ändern; base_url bleibt https://api.deepseek.com.

  4. 04

    Thinking-Modus aktivieren: extra_body mit thinking-Config nutzen, um Reasoner-Verhalten zu ersetzen.

  5. 05

    In Staging testen: Kernflows validieren; Think Max braucht 384K+ Kontextfenster.

  6. 06

    Vor Frist deployen: Anthropic-SDK-Nutzer tauschen nur den Modellnamen — gleiche Base-URL.

python
response = client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[{"role": "user", "content": "Solve step by step..."}],
    extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)

Harte Zahlen zum Zitieren

  • SWE-bench Verified: 80,6% — bester Open-Weight-Score
  • KV-Cache: 10% des V3.2-Speichers bei 1M Token
  • Kostenverhältnis: 0,03 USD vs 3,48 USD pro Task gegenüber Fable 5
  • Peak-Output: 1,74 USD/M — immer noch 8,6x unter geschlossenen Frontier-APIs
  • Migrationsfrist: 24. Juli 2026 15:59 UTC

Das GA-Release muss Claude Fable 5 nicht in jedem Benchmark schlagen. Es liefert das stärkste Open-Weight-Coding-Modell zu 1/10 bis 1/100 der Kosten geschlossener Frontier-APIs.

Selbst-Hosting von V4 oder Long-Context-Agenten braucht zuverlässige Hardware: Laptops halten keinen 24/7-Betrieb durch, VMs erhöhen Performance- und Compliance-Risiken. Für produktives iOS-CI/CD und KI-Agenten-Automatisierung ist VpsMesh Mac Mini Cloud-Miete meist die bessere Wahl: Bare-Metal Apple Silicon passt gut zu lokalen Inferenz-Stacks wie ds4 + V4 Flash auf Mac.

Quellen: DeepSeek Official Docs, arXiv:2606.19348, HuggingFace, LLMReference, Artificial Analysis, MangoMind Blog, TechNode.

FAQ

Häufig gestellte Fragen

Werktags Peking-Zeit 09:00–12:00 und 14:00–18:00 verdoppeln sich alle Tarife. V4-Pro Off-Peak-Output kostet 0,87 USD/M; Peak 1,74 USD/M. Ergänzende Dev-Umgebungskosten finden Sie in unseren Mac Mini Mietpreisen.

Vor dem 24. Juli deepseek-chat durch deepseek-v4-flash und deepseek-reasoner durch Flash Thinking-Modus oder deepseek-v4-pro ersetzen. Base-URL unverändert.

Pro ist das 1,6T-Flaggschiff (49B aktiv); Flash hat 284B (13B aktiv). Beide unterstützen 1M Kontext. Flash ist günstiger (0,28 USD/M Output) fürs Routing; Pro für komplexe Agenten.

Fable 5 und GPT-5.6 führen bei den schwierigsten Benchmarks. V4-Pro ist MIT-lizenziert, selbst hostbar und gehört zu den günstigsten Frontier-KI-APIs 2026 mit 0,87 USD/M Off-Peak-Output.

V4-Flash läuft über Engines wie ds4 auf High-End-Macs (96GB+ Unified Memory). Vollständiges Pro braucht Cluster-Hardware. Setup-Details in unserem Hilfezentrum.

Agent-, Mathe- und Code-Performance-Upgrades; Peak-Valley-Preise; globale GA-Verfügbarkeit; Legacy-Modellnamen enden am 24. Juli. MoE-Architektur unverändert.