0731 Post-Training-Upgrade · Harness-Framework · Wettbewerbsvergleich · Benchmark-Hinweise · V4-Pro-Timeline
Am 31. Juli 2026 stufte DeepSeek V4-Flash-0731 zur offiziellen API-Version hoch: gleiche 284B / 13B-aktive Architektur wie in der April-Vorschau, Leistungsgewinne ausschließlich durch erneutes Post-Training. Auf Agent-Benchmarks schlägt das Modell jetzt DeepSeeks größere V4-Pro-Vorschau bei etwa 1/36 bis 1/179 der Claude Opus 4.8-Preise. Wer Benchmark-Glaubwürdigkeit, Vergleiche mit Kimi K3 oder Qwen3.8-Max prüft oder von abgeschalteten deepseek-chat-Aliasen migriert, findet hier Release-Timeline, Preistabelle, Harness-Analyse, Wettbewerbsvergleich, Sechs-Schritte-API-Runbook und Benchmark-Hinweise. Datenstand: 05.08.2026.
„DeepSeek V4 offizielle Version" klingt nach einem neuen Modell — ist es nicht. Es bleibt dieselbe 284B-Architektur mit erneutem Post-Training. Das Flaggschiff V4-Pro offiziell und DeepSeeks erstes Inhouse-Agent-Framework Harness sind weiterhin unveröffentlicht, ohne bestätigtes Datum.
24. April 2026: DeepSeek-V4-Vorschau startet mit zwei Open-Weight-MoE-Modellen (MIT) — V4-Pro (1,6T / 49B aktiv) und V4-Flash (284B / 13B aktiv), beide mit 1M-Token-Kontext. Siehe unsere V4-GA-Analyse.
24. Juli 2026: Legacy-Aliase deepseek-chat und deepseek-reasoner werden abgeschaltet; gesamter Traffic läuft auf die V4-Familie.
27. Juli 2026: Moonshot AI veröffentlicht Open Weights für Kimi K3 (2,8T Gesamtparameter) — erhöhter Wettbewerbsdruck Tage vor DeepSeeks Update. Siehe unsere Kimi-K3-Open-Weight-Anleitung.
31. Juli 2026: V4-Flash-0731 geht in offizielle API-Beta; Open Weights landen am selben Tag auf Hugging Face. Changelog nennt erstmals DeepSeek Harness mit Formulierung „demnächst verfügbar". Entscheidend: Update ist nur API — Consumer-App und Web-Chat bleiben unverändert.
2. August 2026: Alibabas Qwen3.8-Max-API geht GA; Gewichte stehen noch aus. Siehe unsere Qwen3.8-Max-Analyse.
Stand 5. August 2026: Offizielles V4-Pro-Release unbestätigt. Einige chinesische Medien berichten unter Berufung auf ungenannte Quellen über interne Tests ab der Woche vom 28. Juli mit möglichem GA-Fenster 10.–20. August — dieses Fenster ist von DeepSeek nicht bestätigt und gilt als Gerücht.
Teams verfolgen dieses Release oft mit fünf blinden Flecken:
„Offizielle Version" missverstehen: Architektur und Parameterzahl identisch zur April-Vorschau — Gewinne stammen ausschließlich aus Post-Training.
Benchmark-Framework-Abhängigkeit: Agent-Scores wurden mit Harness' noch nicht veröffentlichtem „Minimal Mode" gemessen, nicht mit Drittanbieter-Tools.
Nur-API-Limitierung: Consumer-App und Web-Chat wurden nicht auf Build 0731 aktualisiert.
Pro-Version-Lücke: Offizielles V4-Pro fehlt weiterhin; komplexes Reasoning erfordert ggf. die Vorschau.
Finanzierungsgerüchte: Berichte über ~7,4 Mrd. USD Finanzierung und ~48,7 Mrd. USD Bewertung stammen aus ungenannten Finanzmedien — nicht bestätigt durch DeepSeek oder Regulierungsunterlagen.
| Modell | Status | Gesamt / aktiv | Kontext | Input (Miss / Hit, $/M) | Output ($/M) | Lizenz |
|---|---|---|---|---|---|---|
| DeepSeek-V4-Flash-0731 | Offiziell (31.07.2026) | 284B / 13B | 1M | $0,14 / $0,0028 | $0,28 | MIT |
| DeepSeek-V4-Pro | Nur Vorschau (24.04.2026) | 1,6T / 49B | 1M | $0,435 / $0,003625 | $0,87 | MIT |
| Kimi K3 | Open Weights (27.07.2026) | 2,8T / ~104B (Community-Schätzung) | ~1,05M | $3,00 / $0,30 | $15,00 | Modifiziertes MIT |
| GLM-5.2 | Open (Juni 2026) | ~744B / ~40B | 1M | Nicht verifiziert | Nicht verifiziert | MIT |
| Qwen3.8-Max | API GA (02.08.2026); Gewichte ausstehend | 2,4T / 95B | 1M | $2,00 / ~$0,17–0,25 | $6,00 | Open Weights angekündigt |
Alle Preise sind Hersteller-Listenpreise. DeepSeek kündigte einen künftigen 2x-Stoßzeiten-Aufschlag an (Peking-Zeit 09:00–12:00 und 14:00–18:00) ohne bestätigtes Startdatum. Gegenüber Claude Opus 4.8: Cache-Miss-Input etwa 36x günstiger, Cache-Hit-Input etwa 179x günstiger, Output etwa 89x günstiger pro Million Token (laut 21st Century Business Herald unter Berufung auf offizielle Preise).
V4-Flash-0731 ist in Größe und Struktur identisch zur April-Vorschau. DeepSeek erklärt den gesamten Sprung auf Agent-Benchmarks durch erneutes Post-Training, nicht durch Skalierung. Das widerspricht der Branchenannahme „größer = besser" — ein 284B/13B-Modell schlägt jetzt ein 1,6T/49B-Modell derselben Familie auf mehreren agentischen Tasks und unterstreicht, wie Post-Training-Qualität Ende 2026 mit der reinen Parameterzahl konkurriert.
DeepSeeks Technical Report („DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence") beschreibt drei architektonische Änderungen aus der April-Vorschau:
Hybrid-Attention (DSA): Kombiniert Compressed Sparse Attention (CSA) und Heavily Compressed Attention (HCA) zur Senkung von Compute- und Speicherkosten bei langem Kontext.
Manifold-Constrained Hyper-Connections (mHC): Verbesserung gegenüber Standard-Residual-Verbindungen.
Muon-Optimizer: Für schnellere Konvergenz und Trainingsstabilität.
DeepSeek behauptet: Bei 1M Token benötigt V4-Pro nur 27 % der Inferenz-FLOPs pro Token und 10 % des KV-Cache-Footprints gegenüber V3.2. Das sind Herstellerangaben; unabhängige Dritt-Reproduktionen liegen noch nicht vor.
Am 31. Juli erschien erstmals die offizielle Erwähnung von DeepSeek Harness — einem Inhouse-Framework für Datei-I/O, Tool-Aufrufe und mehrstufige Engineering-Tasks als Antwort auf Claude Code. Jeder von DeepSeek veröffentlichte Agent-Benchmark für V4-Flash-0731 (Terminal Bench 2.0, Toolathlon usw.) wurde mit Harness' „Minimal Mode", der noch nicht öffentlich ist, bei max Reasoning, top_p 0,95, temperature 1,0 gemessen. DeepSeeks Changelog warnt: Agent-Scores sind „extrem sensitiv gegenüber der Harness-Wahl" — ernst zu nehmen.
| Modell | Labor | Intelligence Index (Artificial Analysis) | Kosten pro Task | DeepSeek Agent-Scores |
|---|---|---|---|---|
| V4-Flash-0731 | DeepSeek | 50 | $0,03 | Terminal Bench 2.0: 82,7 (Harness Minimal Mode) |
| Kimi K3 | Moonshot AI | 57 | $0,86 | — |
| GLM-5.2 | Zhipu / Z.ai | ~1 Punkt über V4-Flash | Nicht verifiziert | — |
| GPT-5.6 Sol | OpenAI | 9+ Punkte über V4-Flash | $1,86 | Closed Source |
| Claude Fable 5 | Anthropic | 9+ Punkte über V4-Flash | $3,15 | Closed Source |
DeepSeek konkurriert nicht um den Spitzenplatz im Leaderboard — sondern um „ausreichende Intelligenz zu einem Preis, den niemand unterbietet". Kosten pro Task: etwa 1/29 von Kimi K3 und 1/105 von Claude Fable 5.
Benchmark-Hinweise: (1) Terminal Bench 2.0 mit 82,7 (vs. V4-Pro-Vorschau 67,9) wurde mit unveröffentlichtem Harness Minimal Mode bei Max-Einstellungen gemessen; (2) Entwickler berichten niedrige Input-Cache-Hit-Raten und gelegentliche Safety-Classifier-Timeouts; (3) V4-Pro-/Harness-Release-Daten sind unbestätigte Medienberichte; (4) Finanzierungs- und IPO-Berichte stammen aus ungenannten Quellen, nicht aus offiziellen Unterlagen.
V4-Flash-0731 unterstützt OpenAI- und Anthropic-kompatible APIs und lässt sich in Claude Code, OpenCode, Cursor und andere Agent-Toolchains einbinden. Sechs Schritte von Evaluation bis Produktion:
Legacy-Aufrufe prüfen: Code nach abgeschalteten deepseek-chat / deepseek-reasoner-Aliasen durchsuchen; monatliches Volumen und Cache-Hit-Rate als Baseline erfassen.
Modellnamen umstellen: deepseek-chat auf deepseek-v4-flash (Non-Thinking); deepseek-reasoner auf Flash Thinking-Modus oder deepseek-v4-pro-Vorschau. Base URL bleibt gleich.
Cache-Strategie evaluieren: Input-Cache-Hit-Raten überwachen — Community-Feedback deutet auf niedrigere Hit-Raten als erwartet hin, was Rechnungen direkt beeinflusst. Prompt Caching zuerst auf Long-Context-Workloads testen.
A/B-Wettbewerbsvergleich: Eigene Samples gegen Kimi K3 ($3/$15), Qwen3.8-Max ($2/$6) und V4-Flash ($0,14/$0,28) für Latenz, Erfolgsrate und Kosten pro Task.
Agent-Host konfigurieren: Harness ist noch nicht öffentlich — in Produktion Claude Code oder OpenCode als Ausführungsframework nutzen; Terminal-Bench-Klassen-Tasks nach Harness-GA erneut testen.
Primary/Backup-Routing und Monitoring: High-Volume-Batch-Tasks über V4-Flash; V4-Pro-Vorschau oder Claude als Fallback für komplexes Reasoning; Kostenlimits und 2x-Stoßzeiten-Alerts setzen.
from openai import OpenAI
client = OpenAI(
api_key="your_deepseek_api_key",
base_url="https://api.deepseek.com"
)
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[{"role": "user", "content": "Analyze this code..."}]
)
Reine API-Aufrufe decken V4-Flash-Agent-Inferenz ab, aber iOS-Signing-Ketten, Xcode-Lokalbuilds, Metal-Workloads und 24/7-Agent-Langläufe brauchen echte macOS-Knoten — Laptops halten persistente OpenClaw-/Claude-Code-Agenten nicht zuverlässig durch, VMs erhöhen Performance- und EULA-Risiken. Für produktives iOS-CI/CD und KI-Agenten-Automatisierung ist VpsMesh Mac Mini Cloud-Miete meist die bessere Wahl: Bare-Metal Apple Silicon, Root-Zugriff und planbare Monatskosten passen sauber zu DeepSeek-API in einer Cloud-Inferenz-plus-Lokalbuild-Architektur. Lokale Inferenz: siehe ds4 + V4 Flash auf Mac.
Quellen: DeepSeek Official Docs und Changelog · Technical Report · Artificial Analysis · 21st Century Business Herald · Kuai Technology · V2EX-Community-Diskussion. Vor Produktionsentscheidungen offizielle Preise, Benchmarks und V4-Pro-/Harness-Status verifizieren.
Ja. V4-Pro und V4-Flash, einschließlich des offiziellen V4-Flash-0731-Builds vom 31. Juli, liegen als Open Weights unter MIT-Lizenz auf Hugging Face und dürfen kommerziell genutzt, feinabgestimmt und weiterverbreitet werden.
Laut 21st Century Business Herald kostet V4-Flash bei Cache-Miss-Input etwa 36x weniger als Claude Opus 4.8, bei Cache-Hit-Input etwa 179x weniger und bei Output etwa 89x weniger pro Million Token. Das sind Hersteller-Listenpreise, keine unabhängige Prüfung.
Es gibt kein bestätigtes Datum. DeepSeeks Changelog nennt nur, dass die offizielle V4-Pro-Version „so schnell wie möglich" folgt. Berichte über ein GA-Fenster 10.–20. August stammen aus ungenannten chinesischen Medien und sind nicht bestätigt. Für Agent-Host-Deployment siehe Mac Mini M4 Mietpreise.
Teilweise. Weit verbreitete Drittanbieter-Benchmarks wie SWE-bench Verified haben mehr Gewicht. Agent-spezifische Scores (Terminal Bench 2.0, Toolathlon usw.) wurden mit DeepSeeks noch nicht veröffentlichtem Harness gemessen; das Unternehmen warnt selbst vor hoher Harness-Sensitivität — auf unabhängige Reproduktion mit Claude Code, Cursor und anderen Agent-Tools warten.
DeepSeeks erstes eigenes Agent-Ausführungsframework als Inhouse-Alternative zu Claude Code für Dateibearbeitung, Tool-Aufrufe und mehrstufige Engineering-Aufgaben. Erstmals im Changelog vom 31.07.2026 genannt, noch nicht öffentlich verfügbar.
Bei OpenAI- oder Anthropic-Format-APIs für DeepSeek sind keine Codeänderungen nötig — deepseek-v4-flash zeigt automatisch auf den neuen offiziellen Build. Wer noch die abgeschalteten Aliase deepseek-chat / deepseek-reasoner nutzt, sollte sofort umstellen. Deployment-Details im Hilfezentrum.