DeepSeek V4 en disponibilité générale

Tarification peak-valley · Contexte 1M · 80,6 % SWE-bench · Migrer avant le 24 juillet

DeepSeek V4 GA tarifs benchmarks architecture juillet 2026

Après trois mois de préversion, DeepSeek V4 est officiellement passé en disponibilité générale le 20 juillet 2026. Si vous vous demandez si DeepSeek V4 surpasse GPT-5.6 ou si vous appelez encore deepseek-chat en production, ce guide couvre la chronologie complète, l'architecture V4-Pro/Flash, les tableaux de benchmarks, la tarification peak-valley, une comparaison honnête avec Claude Fable 5 et un runbook de migration en six étapes avant l'échéance du 24 juillet. La GA apporte des gains agent/math/code plus la tarification horaire — SWE-bench Verified atteint 80,6 % (record open-weight) à 0,87 USD/M en sortie hors pointe. Données au 20.07.2026.

01

Qu'est-ce qui change entre la GA et la préversion d'avril ?

La préversion est arrivée le 24 avril 2026. La GA d'aujourd'hui n'introduit pas une nouvelle architecture — elle fait passer le modèle en production avec stabilité, optimisations et discipline tarifaire.

DateJalon
24 avr. 2026Préversion + open source MIT : V4-Pro (1,6T) et V4-Flash (284B)
Mai 2026Versions optimisées production ; API généralement disponible
Juin 2026Sortie V4-Pro réduite de 75 % à 0,87 USD/M tokens
29 juin 2026E-mail à tous les utilisateurs API : GA mi-juillet + première annonce tarification peak-valley
19 juil. 2026Testeurs en déploiement gris ; médias annoncent un lancement imminent
20 juil. 2026GA activée mondialement
24 juil. 2026deepseek-chat et deepseek-reasoner définitivement désactivés (15h59 UTC)

Cinq points de friction pour les développeurs aujourd'hui :

  1. 01

    Endpoints legacy dans 4 jours : deepseek-chat et deepseek-reasoner cessent de fonctionner le 24 juillet.

  2. 02

    Complexité tarifaire en pointe : les tarifs doublent en heures ouvrées en semaine — les pipelines 24/7 doivent être planifiés.

  3. 03

    Coût des modèles fermés : Claude Fable 5 à ~50 USD/M en sortie et GPT-5.6 Sol à ~15 USD/M épuisent les budgets à l'échelle.

  4. 04

    Contexte 1M théorique : la plupart des modèles satureront la mémoire KV cache sur de longs contextes.

  5. 05

    Souveraineté des données : les API fermées ne peuvent pas être auto-hébergées pour les charges sensibles à la conformité.

02

Architecture : comment DeepSeek rend 1M tokens praticable

SpécificationV4-ProV4-Flash
Paramètres totaux1,6 billion284 milliards
Actifs par token49B (3 %)13B (4,6 %)
Couches6143
Fenêtre de contexte1 000 000 tokens1 000 000 tokens
Sortie max384K384K
PrécisionFP4 (experts MoE) + FP8Identique
Données d'entraînement33T+ tokens32T+ tokens
LicenceMITMIT

Attention hybride CSA + HCA

V4 remplace la MLA de V2/V3 par un système à deux pistes. La Compressed Sparse Attention (CSA) compresse le KV 4x via un pooling softmax-gated, utilise un indexeur lightning FP4 (top-1024 Pro / top-512 Flash) et une fenêtre glissante de 128 tokens. La Heavily Compressed Attention (HCA) compresse 128x puis exécute une attention globale dense. Les couches alternent CSA et HCA.

À 1M tokens : V4-Pro utilise 27 % des FLOPs d'inférence de V3.2 ; le cache KV tombe à 10 % de la mémoire V3.2 (Flash : 7 %).

mHC et optimiseur Muon

Les Manifold-Constrained Hyper-Connections (mHC) remplacent les résidus standard par un flux à 4 canaux gouverné par une matrice doublement stochastique — gradients stables sur 61 couches. Muon (pas AdamW) utilise l'orthogonalisation Newton-Schulz pour un entraînement plus rapide et plus stable.

Trois modes de raisonnement

ModeCas d'usage
Non-thinkRoutage rapide, classification, Q&R simples
Think HighDébogage, complexité moyenne
Think MaxMaths complexes, agents multi-étapes (contexte 384K+)

Échantillonnage recommandé : temperature=1.0, top_p=1.0 pour tous les modes.

03

Benchmarks : où V4 gagne et où il ne gagne pas

BenchmarkV4-ProClaude Fable 5GPT-5.6 UltraOpus 4.8
SWE-bench Verified80,6 % record open96,0 %N/A~69 %
SWE-bench Pro55,4 %80,3 %78,1 %69,2 %
LiveCodeBench93,5 %88,1 %87,4 %83,2 %
Codeforces Elo3 206
Terminal-Bench 2.183,9 %88,0 %85,1 %82,7 %

Indice Strategy & Ops d'Artificial Analysis : Fable 5 marque 50 à 3,48 USD/tâche ; V4-Pro marque 38 à 0,03 USD/tâche116 fois moins cher pour un écart de performance de 24 %. V4-Flash reste sous 0,04 USD/tâche sur les six catégories de l'indice.

04

DeepSeek V4 vs GPT-5.6 vs Claude Fable 5 : comparaison honnête

DimensionV4-ProGPT-5.6 SolClaude Fable 5
Open / auto-hébergeableOui (MIT)NonNon
Contexte 1MOuiNon confirméOui
Meilleur codage (repos les plus durs)Second rangSecond rangLeader SWE-bench Pro
Algorithmes / mathsLeader LiveCodeBenchFort
Sortie (hors pointe)0,87 USD/M~15 USD/M~50 USD/M
Sortie (pointe)1,74 USD/M
Souveraineté des donnéesAuto-hébergement possibleNonNon

Grille tarifaire peak-valley

Heures de pointe (heure de Pékin) : en semaine de 09h00 à 12h00 et de 14h00 à 18h00 — tous les tarifs doublent.

ModèlePosteHors pointePointe
V4-ProEntrée (cache hit)0,0035 USD/M2x
Entrée (cache miss)0,435 USD/M0,87 USD/M
Sortie0,87 USD/M1,74 USD/M
V4-FlashEntrée (cache hit)0,0028 USD/M2x
Entrée (cache miss)0,14 USD/M0,28 USD/M
Sortie0,28 USD/M0,56 USD/M

Même en pointe, la sortie V4-Pro reste 8,6 fois moins chère que Claude Opus 4.8 (15 USD/M) et GPT-5.6 Sol (~15 USD/M).

Info

Conseils coût : planifiez les jobs batch hors pointe ; maximisez les cache hits sur les prompts ; routez les requêtes simples vers V4-Flash ; surveillez les e-mails de changement tarifaire DeepSeek (préavis 24 h).

05

Runbook de migration : six étapes avant le 24 juillet

Alerte

Échéance : 24 juillet 2026, 15h59 UTC. Les noms legacy deepseek-chat et deepseek-reasoner seront définitivement désactivés.

Ancien nomÉquivalent nouveau
deepseek-chatdeepseek-v4-flash (non-thinking)
deepseek-reasonerdeepseek-v4-flash (thinking) ou deepseek-v4-pro
  1. 01

    Auditer le code : recherchez deepseek-chat et deepseek-reasoner, y compris variables d'environnement et configs CI.

  2. 02

    Choisir le modèle cible : Flash pour chat/routage ; Pro pour le raisonnement lourd.

  3. 03

    Mettre à jour le SDK OpenAI : changez uniquement model ; base_url reste https://api.deepseek.com.

  4. 04

    Activer le mode thinking : utilisez extra_body avec la config thinking pour remplacer le comportement reasoner.

  5. 05

    Tester en staging : validez les flux principaux ; Think Max nécessite une fenêtre de contexte 384K+.

  6. 06

    Déployer avant l'échéance : les utilisateurs du SDK Anthropic changent uniquement le nom du modèle — même base URL.

python
response = client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[{"role": "user", "content": "Solve step by step..."}],
    extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)

Chiffres clés à citer

  • SWE-bench Verified : 80,6 % — meilleur score open-weight
  • Cache KV : 10 % de la mémoire V3.2 à 1M tokens
  • Ratio coût : 0,03 USD vs 3,48 USD par tâche vs Fable 5
  • Sortie en pointe : 1,74 USD/M — toujours 8,6x sous les API frontier fermées
  • Échéance migration : 24 juillet 2026 15h59 UTC

La GA n'a pas besoin de battre Claude Fable 5 sur chaque benchmark. Elle livre le modèle de codage open-weight le plus performant à 1/10 à 1/100 du coût des API frontier fermées.

Auto-héberger V4 ou exécuter des agents long contexte exige du matériel fiable — un portable ne tient pas 24/7 et les VM ajoutent risque performance et conformité. Pour la CI/CD iOS et l'automatisation Agent en production, la location cloud Mac Mini VpsMesh est généralement le meilleur choix : du bare-metal Apple Silicon s'accorde bien avec des stacks d'inférence locale comme ds4 + V4 Flash sur Mac.

Sources : documentation officielle DeepSeek, arXiv:2606.19348, HuggingFace, LLMReference, Artificial Analysis, MangoMind Blog, TechNode.

FAQ

Questions fréquentes

En semaine, heures de Pékin 09h00–12h00 et 14h00–18h00 : tous les tarifs doublent. Sortie V4-Pro hors pointe à 0,87 USD/M ; en pointe, 1,74 USD/M. Consultez nos tarifs de location Mac Mini pour les coûts d'environnement de développement complémentaires.

Avant le 24 juillet, remplacez deepseek-chat par deepseek-v4-flash et deepseek-reasoner par Flash en mode thinking ou deepseek-v4-pro. Base URL inchangée.

Pro est le flagship 1,6T (49B actifs) ; Flash fait 284B (13B actifs). Les deux supportent 1M de contexte. Flash est moins cher (0,28 USD/M en sortie) pour le routage ; Pro pour les agents complexes.

Fable 5 et GPT-5.6 dominent sur les benchmarks les plus exigeants. V4-Pro est sous licence MIT, auto-hébergeable, et figure parmi les API IA frontier les moins chères en 2026 à 0,87 USD/M en sortie hors pointe.

V4-Flash peut tourner via des moteurs comme ds4 sur Mac haut de gamme (96 Go+ de mémoire unifiée). Pro complet nécessite un cluster. Détails dans notre centre d'aide.

Gains agent, maths et code ; tarification peak-valley ; GA mondiale ; retrait des noms legacy le 24 juillet. Architecture MoE sous-jacente inchangée.