Ist DeepSeek V4-Flash wirklich 100x günstiger als Claude?

0731 Post-Training-Upgrade · Harness-Framework · Wettbewerbsvergleich · Benchmark-Hinweise · V4-Pro-Timeline

DeepSeek V4 Flash offizielles Release Benchmark und API-Preisvergleich

Am 31. Juli 2026 stufte DeepSeek V4-Flash-0731 zur offiziellen API-Version hoch: gleiche 284B / 13B-aktive Architektur wie in der April-Vorschau, Leistungsgewinne ausschließlich durch erneutes Post-Training. Auf Agent-Benchmarks schlägt das Modell jetzt DeepSeeks größere V4-Pro-Vorschau bei etwa 1/36 bis 1/179 der Claude Opus 4.8-Preise. Wer Benchmark-Glaubwürdigkeit, Vergleiche mit Kimi K3 oder Qwen3.8-Max prüft oder von abgeschalteten deepseek-chat-Aliasen migriert, findet hier Release-Timeline, Preistabelle, Harness-Analyse, Wettbewerbsvergleich, Sechs-Schritte-API-Runbook und Benchmark-Hinweise. Datenstand: 05.08.2026.

01

Was am 31. Juli wirklich erschien — und was nicht

„DeepSeek V4 offizielle Version" klingt nach einem neuen Modell — ist es nicht. Es bleibt dieselbe 284B-Architektur mit erneutem Post-Training. Das Flaggschiff V4-Pro offiziell und DeepSeeks erstes Inhouse-Agent-Framework Harness sind weiterhin unveröffentlicht, ohne bestätigtes Datum.

  1. 01

    24. April 2026: DeepSeek-V4-Vorschau startet mit zwei Open-Weight-MoE-Modellen (MIT) — V4-Pro (1,6T / 49B aktiv) und V4-Flash (284B / 13B aktiv), beide mit 1M-Token-Kontext. Siehe unsere V4-GA-Analyse.

  2. 02

    24. Juli 2026: Legacy-Aliase deepseek-chat und deepseek-reasoner werden abgeschaltet; gesamter Traffic läuft auf die V4-Familie.

  3. 03

    27. Juli 2026: Moonshot AI veröffentlicht Open Weights für Kimi K3 (2,8T Gesamtparameter) — erhöhter Wettbewerbsdruck Tage vor DeepSeeks Update. Siehe unsere Kimi-K3-Open-Weight-Anleitung.

  4. 04

    31. Juli 2026: V4-Flash-0731 geht in offizielle API-Beta; Open Weights landen am selben Tag auf Hugging Face. Changelog nennt erstmals DeepSeek Harness mit Formulierung „demnächst verfügbar". Entscheidend: Update ist nur API — Consumer-App und Web-Chat bleiben unverändert.

  5. 05

    2. August 2026: Alibabas Qwen3.8-Max-API geht GA; Gewichte stehen noch aus. Siehe unsere Qwen3.8-Max-Analyse.

  6. 06

    Stand 5. August 2026: Offizielles V4-Pro-Release unbestätigt. Einige chinesische Medien berichten unter Berufung auf ungenannte Quellen über interne Tests ab der Woche vom 28. Juli mit möglichem GA-Fenster 10.–20. August — dieses Fenster ist von DeepSeek nicht bestätigt und gilt als Gerücht.

Teams verfolgen dieses Release oft mit fünf blinden Flecken:

  1. 01

    „Offizielle Version" missverstehen: Architektur und Parameterzahl identisch zur April-Vorschau — Gewinne stammen ausschließlich aus Post-Training.

  2. 02

    Benchmark-Framework-Abhängigkeit: Agent-Scores wurden mit Harness' noch nicht veröffentlichtem „Minimal Mode" gemessen, nicht mit Drittanbieter-Tools.

  3. 03

    Nur-API-Limitierung: Consumer-App und Web-Chat wurden nicht auf Build 0731 aktualisiert.

  4. 04

    Pro-Version-Lücke: Offizielles V4-Pro fehlt weiterhin; komplexes Reasoning erfordert ggf. die Vorschau.

  5. 05

    Finanzierungsgerüchte: Berichte über ~7,4 Mrd. USD Finanzierung und ~48,7 Mrd. USD Bewertung stammen aus ungenannten Finanzmedien — nicht bestätigt durch DeepSeek oder Regulierungsunterlagen.

02

Kennzahlen auf einen Blick: Preise, Parameter, Lizenz

ModellStatusGesamt / aktivKontextInput (Miss / Hit, $/M)Output ($/M)Lizenz
DeepSeek-V4-Flash-0731Offiziell (31.07.2026)284B / 13B1M$0,14 / $0,0028$0,28MIT
DeepSeek-V4-ProNur Vorschau (24.04.2026)1,6T / 49B1M$0,435 / $0,003625$0,87MIT
Kimi K3Open Weights (27.07.2026)2,8T / ~104B (Community-Schätzung)~1,05M$3,00 / $0,30$15,00Modifiziertes MIT
GLM-5.2Open (Juni 2026)~744B / ~40B1MNicht verifiziertNicht verifiziertMIT
Qwen3.8-MaxAPI GA (02.08.2026); Gewichte ausstehend2,4T / 95B1M$2,00 / ~$0,17–0,25$6,00Open Weights angekündigt
Hinweis

Alle Preise sind Hersteller-Listenpreise. DeepSeek kündigte einen künftigen 2x-Stoßzeiten-Aufschlag an (Peking-Zeit 09:00–12:00 und 14:00–18:00) ohne bestätigtes Startdatum. Gegenüber Claude Opus 4.8: Cache-Miss-Input etwa 36x günstiger, Cache-Hit-Input etwa 179x günstiger, Output etwa 89x günstiger pro Million Token (laut 21st Century Business Herald unter Berufung auf offizielle Preise).

03

Post-Training-Upgrade und Harness: woher die Performance kommt

Architektur unverändert — Trainingsdaten neu

V4-Flash-0731 ist in Größe und Struktur identisch zur April-Vorschau. DeepSeek erklärt den gesamten Sprung auf Agent-Benchmarks durch erneutes Post-Training, nicht durch Skalierung. Das widerspricht der Branchenannahme „größer = besser" — ein 284B/13B-Modell schlägt jetzt ein 1,6T/49B-Modell derselben Familie auf mehreren agentischen Tasks und unterstreicht, wie Post-Training-Qualität Ende 2026 mit der reinen Parameterzahl konkurriert.

Hybrid-Attention: CSA + HCA, mHC und Muon-Optimizer

DeepSeeks Technical Report („DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence") beschreibt drei architektonische Änderungen aus der April-Vorschau:

  1. 01

    Hybrid-Attention (DSA): Kombiniert Compressed Sparse Attention (CSA) und Heavily Compressed Attention (HCA) zur Senkung von Compute- und Speicherkosten bei langem Kontext.

  2. 02

    Manifold-Constrained Hyper-Connections (mHC): Verbesserung gegenüber Standard-Residual-Verbindungen.

  3. 03

    Muon-Optimizer: Für schnellere Konvergenz und Trainingsstabilität.

DeepSeek behauptet: Bei 1M Token benötigt V4-Pro nur 27 % der Inferenz-FLOPs pro Token und 10 % des KV-Cache-Footprints gegenüber V3.2. Das sind Herstellerangaben; unabhängige Dritt-Reproduktionen liegen noch nicht vor.

Harness: DeepSeeks erstes Inhouse-Agent-Framework

Am 31. Juli erschien erstmals die offizielle Erwähnung von DeepSeek Harness — einem Inhouse-Framework für Datei-I/O, Tool-Aufrufe und mehrstufige Engineering-Tasks als Antwort auf Claude Code. Jeder von DeepSeek veröffentlichte Agent-Benchmark für V4-Flash-0731 (Terminal Bench 2.0, Toolathlon usw.) wurde mit Harness' „Minimal Mode", der noch nicht öffentlich ist, bei max Reasoning, top_p 0,95, temperature 1,0 gemessen. DeepSeeks Changelog warnt: Agent-Scores sind „extrem sensitiv gegenüber der Harness-Wahl" — ernst zu nehmen.

04

Wettbewerbsvergleich und Benchmark-Hinweise: chinesischer Open-Weight-Markt

ModellLaborIntelligence Index (Artificial Analysis)Kosten pro TaskDeepSeek Agent-Scores
V4-Flash-0731DeepSeek50$0,03Terminal Bench 2.0: 82,7 (Harness Minimal Mode)
Kimi K3Moonshot AI57$0,86
GLM-5.2Zhipu / Z.ai~1 Punkt über V4-FlashNicht verifiziert
GPT-5.6 SolOpenAI9+ Punkte über V4-Flash$1,86Closed Source
Claude Fable 5Anthropic9+ Punkte über V4-Flash$3,15Closed Source

DeepSeek konkurriert nicht um den Spitzenplatz im Leaderboard — sondern um „ausreichende Intelligenz zu einem Preis, den niemand unterbietet". Kosten pro Task: etwa 1/29 von Kimi K3 und 1/105 von Claude Fable 5.

Achtung

Benchmark-Hinweise: (1) Terminal Bench 2.0 mit 82,7 (vs. V4-Pro-Vorschau 67,9) wurde mit unveröffentlichtem Harness Minimal Mode bei Max-Einstellungen gemessen; (2) Entwickler berichten niedrige Input-Cache-Hit-Raten und gelegentliche Safety-Classifier-Timeouts; (3) V4-Pro-/Harness-Release-Daten sind unbestätigte Medienberichte; (4) Finanzierungs- und IPO-Berichte stammen aus ungenannten Quellen, nicht aus offiziellen Unterlagen.

05

Sechs-Schritte-API-Runbook: von Migration bis Produktions-Routing

V4-Flash-0731 unterstützt OpenAI- und Anthropic-kompatible APIs und lässt sich in Claude Code, OpenCode, Cursor und andere Agent-Toolchains einbinden. Sechs Schritte von Evaluation bis Produktion:

  1. 01

    Legacy-Aufrufe prüfen: Code nach abgeschalteten deepseek-chat / deepseek-reasoner-Aliasen durchsuchen; monatliches Volumen und Cache-Hit-Rate als Baseline erfassen.

  2. 02

    Modellnamen umstellen: deepseek-chat auf deepseek-v4-flash (Non-Thinking); deepseek-reasoner auf Flash Thinking-Modus oder deepseek-v4-pro-Vorschau. Base URL bleibt gleich.

  3. 03

    Cache-Strategie evaluieren: Input-Cache-Hit-Raten überwachen — Community-Feedback deutet auf niedrigere Hit-Raten als erwartet hin, was Rechnungen direkt beeinflusst. Prompt Caching zuerst auf Long-Context-Workloads testen.

  4. 04

    A/B-Wettbewerbsvergleich: Eigene Samples gegen Kimi K3 ($3/$15), Qwen3.8-Max ($2/$6) und V4-Flash ($0,14/$0,28) für Latenz, Erfolgsrate und Kosten pro Task.

  5. 05

    Agent-Host konfigurieren: Harness ist noch nicht öffentlich — in Produktion Claude Code oder OpenCode als Ausführungsframework nutzen; Terminal-Bench-Klassen-Tasks nach Harness-GA erneut testen.

  6. 06

    Primary/Backup-Routing und Monitoring: High-Volume-Batch-Tasks über V4-Flash; V4-Pro-Vorschau oder Claude als Fallback für komplexes Reasoning; Kostenlimits und 2x-Stoßzeiten-Alerts setzen.

python
from openai import OpenAI

client = OpenAI(
    api_key="your_deepseek_api_key",
    base_url="https://api.deepseek.com"
)

response = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[{"role": "user", "content": "Analyze this code..."}]
)
06

Branchenkontext, harte Zahlen und wo VpsMesh passt

  • „Kill Line"-Effekt: Chinesische Entwicklerkreise sprechen von zhǎn shā xiàn — wörtlich „Kill Line" — wenn DeepSeeks Kombination aus „ausreichender Performance plus Tiefstpreis" eine Schwelle setzt, die Wettbewerber in Fähigkeit übertreffen oder im Preis unterbieten müssen. Das erklärt u. a. OpenAIs gemeldeten 80-%-GPT-5.6-Luna-Preisschnitt in derselben Phase.
  • Stimmungswechsel in der Community: Vor V4-Flash-0731 verspotteten Foren Gründer Liang Wenfeng als „Liang Empty Promise" wegen V4-Pro-Verzögerungen; nach dem überraschend starken Flash-Build kehrte dieselbe Community zu „Liang the Sage" zurück — ein Barometer für schnelle Stimmungswechsel in Chinas KI-Entwicklercommunity.
  • Gedämpfte Chip-Aktien-Reaktion: Nvidia, Broadcom und AMD zeigten am 31. Juli keine signifikante Bewegung, als V4-Flash offiziell wurde — im Kontrast zu Anfang 2025, als DeepSeek-R1-Effizienzclaims einen globalen KI-Chip-Verkauf auslösten. Märkte behandeln „DeepSeek liefert mehr mit weniger Compute" inzwischen als Routine-Ingenieursarbeit.
  • OpenRouter-Aufrufvolumen: Die V4-Flash-Vorschau führte Berichten zufolge sieben Wochen in Folge OpenRouters meistgenutztes Modell an — Beleg, dass großskalige, günstige Agent-Aufrufe die Kernzielgruppe sind, nicht Leaderboard-Jäger.
  • Terminal Bench 2.0: Offizieller Score 82,7 vs. V4-Pro-Vorschau 67,9 — gemessen mit unveröffentlichtem Harness; als Herstellerangabe behandeln, bis unabhängig reproduziert.

Reine API-Aufrufe decken V4-Flash-Agent-Inferenz ab, aber iOS-Signing-Ketten, Xcode-Lokalbuilds, Metal-Workloads und 24/7-Agent-Langläufe brauchen echte macOS-Knoten — Laptops halten persistente OpenClaw-/Claude-Code-Agenten nicht zuverlässig durch, VMs erhöhen Performance- und EULA-Risiken. Für produktives iOS-CI/CD und KI-Agenten-Automatisierung ist VpsMesh Mac Mini Cloud-Miete meist die bessere Wahl: Bare-Metal Apple Silicon, Root-Zugriff und planbare Monatskosten passen sauber zu DeepSeek-API in einer Cloud-Inferenz-plus-Lokalbuild-Architektur. Lokale Inferenz: siehe ds4 + V4 Flash auf Mac.

Quellen: DeepSeek Official Docs und Changelog · Technical Report · Artificial Analysis · 21st Century Business Herald · Kuai Technology · V2EX-Community-Diskussion. Vor Produktionsentscheidungen offizielle Preise, Benchmarks und V4-Pro-/Harness-Status verifizieren.

FAQ

Häufig gestellte Fragen

Ja. V4-Pro und V4-Flash, einschließlich des offiziellen V4-Flash-0731-Builds vom 31. Juli, liegen als Open Weights unter MIT-Lizenz auf Hugging Face und dürfen kommerziell genutzt, feinabgestimmt und weiterverbreitet werden.

Laut 21st Century Business Herald kostet V4-Flash bei Cache-Miss-Input etwa 36x weniger als Claude Opus 4.8, bei Cache-Hit-Input etwa 179x weniger und bei Output etwa 89x weniger pro Million Token. Das sind Hersteller-Listenpreise, keine unabhängige Prüfung.

Es gibt kein bestätigtes Datum. DeepSeeks Changelog nennt nur, dass die offizielle V4-Pro-Version „so schnell wie möglich" folgt. Berichte über ein GA-Fenster 10.–20. August stammen aus ungenannten chinesischen Medien und sind nicht bestätigt. Für Agent-Host-Deployment siehe Mac Mini M4 Mietpreise.

Teilweise. Weit verbreitete Drittanbieter-Benchmarks wie SWE-bench Verified haben mehr Gewicht. Agent-spezifische Scores (Terminal Bench 2.0, Toolathlon usw.) wurden mit DeepSeeks noch nicht veröffentlichtem Harness gemessen; das Unternehmen warnt selbst vor hoher Harness-Sensitivität — auf unabhängige Reproduktion mit Claude Code, Cursor und anderen Agent-Tools warten.

DeepSeeks erstes eigenes Agent-Ausführungsframework als Inhouse-Alternative zu Claude Code für Dateibearbeitung, Tool-Aufrufe und mehrstufige Engineering-Aufgaben. Erstmals im Changelog vom 31.07.2026 genannt, noch nicht öffentlich verfügbar.

Bei OpenAI- oder Anthropic-Format-APIs für DeepSeek sind keine Codeänderungen nötig — deepseek-v4-flash zeigt automatisch auf den neuen offiziellen Build. Wer noch die abgeschalteten Aliase deepseek-chat / deepseek-reasoner nutzt, sollte sofort umstellen. Deployment-Details im Hilfezentrum.