Tarification peak-valley · Contexte 1M · 80,6 % SWE-bench · Migrer avant le 24 juillet
Après trois mois de préversion, DeepSeek V4 est officiellement passé en disponibilité générale le 20 juillet 2026. Si vous vous demandez si DeepSeek V4 surpasse GPT-5.6 ou si vous appelez encore deepseek-chat en production, ce guide couvre la chronologie complète, l'architecture V4-Pro/Flash, les tableaux de benchmarks, la tarification peak-valley, une comparaison honnête avec Claude Fable 5 et un runbook de migration en six étapes avant l'échéance du 24 juillet. La GA apporte des gains agent/math/code plus la tarification horaire — SWE-bench Verified atteint 80,6 % (record open-weight) à 0,87 USD/M en sortie hors pointe. Données au 20.07.2026.
La préversion est arrivée le 24 avril 2026. La GA d'aujourd'hui n'introduit pas une nouvelle architecture — elle fait passer le modèle en production avec stabilité, optimisations et discipline tarifaire.
| Date | Jalon |
|---|---|
| 24 avr. 2026 | Préversion + open source MIT : V4-Pro (1,6T) et V4-Flash (284B) |
| Mai 2026 | Versions optimisées production ; API généralement disponible |
| Juin 2026 | Sortie V4-Pro réduite de 75 % à 0,87 USD/M tokens |
| 29 juin 2026 | E-mail à tous les utilisateurs API : GA mi-juillet + première annonce tarification peak-valley |
| 19 juil. 2026 | Testeurs en déploiement gris ; médias annoncent un lancement imminent |
| 20 juil. 2026 | GA activée mondialement |
| 24 juil. 2026 | deepseek-chat et deepseek-reasoner définitivement désactivés (15h59 UTC) |
Cinq points de friction pour les développeurs aujourd'hui :
Endpoints legacy dans 4 jours : deepseek-chat et deepseek-reasoner cessent de fonctionner le 24 juillet.
Complexité tarifaire en pointe : les tarifs doublent en heures ouvrées en semaine — les pipelines 24/7 doivent être planifiés.
Coût des modèles fermés : Claude Fable 5 à ~50 USD/M en sortie et GPT-5.6 Sol à ~15 USD/M épuisent les budgets à l'échelle.
Contexte 1M théorique : la plupart des modèles satureront la mémoire KV cache sur de longs contextes.
Souveraineté des données : les API fermées ne peuvent pas être auto-hébergées pour les charges sensibles à la conformité.
| Spécification | V4-Pro | V4-Flash |
|---|---|---|
| Paramètres totaux | 1,6 billion | 284 milliards |
| Actifs par token | 49B (3 %) | 13B (4,6 %) |
| Couches | 61 | 43 |
| Fenêtre de contexte | 1 000 000 tokens | 1 000 000 tokens |
| Sortie max | 384K | 384K |
| Précision | FP4 (experts MoE) + FP8 | Identique |
| Données d'entraînement | 33T+ tokens | 32T+ tokens |
| Licence | MIT | MIT |
V4 remplace la MLA de V2/V3 par un système à deux pistes. La Compressed Sparse Attention (CSA) compresse le KV 4x via un pooling softmax-gated, utilise un indexeur lightning FP4 (top-1024 Pro / top-512 Flash) et une fenêtre glissante de 128 tokens. La Heavily Compressed Attention (HCA) compresse 128x puis exécute une attention globale dense. Les couches alternent CSA et HCA.
À 1M tokens : V4-Pro utilise 27 % des FLOPs d'inférence de V3.2 ; le cache KV tombe à 10 % de la mémoire V3.2 (Flash : 7 %).
Les Manifold-Constrained Hyper-Connections (mHC) remplacent les résidus standard par un flux à 4 canaux gouverné par une matrice doublement stochastique — gradients stables sur 61 couches. Muon (pas AdamW) utilise l'orthogonalisation Newton-Schulz pour un entraînement plus rapide et plus stable.
| Mode | Cas d'usage |
|---|---|
| Non-think | Routage rapide, classification, Q&R simples |
| Think High | Débogage, complexité moyenne |
| Think Max | Maths complexes, agents multi-étapes (contexte 384K+) |
Échantillonnage recommandé : temperature=1.0, top_p=1.0 pour tous les modes.
| Benchmark | V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80,6 % record open | 96,0 % | N/A | ~69 % |
| SWE-bench Pro | 55,4 % | 80,3 % | 78,1 % | 69,2 % |
| LiveCodeBench | 93,5 % | 88,1 % | 87,4 % | 83,2 % |
| Codeforces Elo | 3 206 | — | — | — |
| Terminal-Bench 2.1 | 83,9 % | 88,0 % | 85,1 % | 82,7 % |
Indice Strategy & Ops d'Artificial Analysis : Fable 5 marque 50 à 3,48 USD/tâche ; V4-Pro marque 38 à 0,03 USD/tâche — 116 fois moins cher pour un écart de performance de 24 %. V4-Flash reste sous 0,04 USD/tâche sur les six catégories de l'indice.
| Dimension | V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| Open / auto-hébergeable | Oui (MIT) | Non | Non |
| Contexte 1M | Oui | Non confirmé | Oui |
| Meilleur codage (repos les plus durs) | Second rang | Second rang | Leader SWE-bench Pro |
| Algorithmes / maths | Leader LiveCodeBench | Fort | — |
| Sortie (hors pointe) | 0,87 USD/M | ~15 USD/M | ~50 USD/M |
| Sortie (pointe) | 1,74 USD/M | — | — |
| Souveraineté des données | Auto-hébergement possible | Non | Non |
Heures de pointe (heure de Pékin) : en semaine de 09h00 à 12h00 et de 14h00 à 18h00 — tous les tarifs doublent.
| Modèle | Poste | Hors pointe | Pointe |
|---|---|---|---|
| V4-Pro | Entrée (cache hit) | 0,0035 USD/M | 2x |
| Entrée (cache miss) | 0,435 USD/M | 0,87 USD/M | |
| Sortie | 0,87 USD/M | 1,74 USD/M | |
| V4-Flash | Entrée (cache hit) | 0,0028 USD/M | 2x |
| Entrée (cache miss) | 0,14 USD/M | 0,28 USD/M | |
| Sortie | 0,28 USD/M | 0,56 USD/M |
Même en pointe, la sortie V4-Pro reste 8,6 fois moins chère que Claude Opus 4.8 (15 USD/M) et GPT-5.6 Sol (~15 USD/M).
Conseils coût : planifiez les jobs batch hors pointe ; maximisez les cache hits sur les prompts ; routez les requêtes simples vers V4-Flash ; surveillez les e-mails de changement tarifaire DeepSeek (préavis 24 h).
Échéance : 24 juillet 2026, 15h59 UTC. Les noms legacy deepseek-chat et deepseek-reasoner seront définitivement désactivés.
| Ancien nom | Équivalent nouveau |
|---|---|
deepseek-chat | deepseek-v4-flash (non-thinking) |
deepseek-reasoner | deepseek-v4-flash (thinking) ou deepseek-v4-pro |
Auditer le code : recherchez deepseek-chat et deepseek-reasoner, y compris variables d'environnement et configs CI.
Choisir le modèle cible : Flash pour chat/routage ; Pro pour le raisonnement lourd.
Mettre à jour le SDK OpenAI : changez uniquement model ; base_url reste https://api.deepseek.com.
Activer le mode thinking : utilisez extra_body avec la config thinking pour remplacer le comportement reasoner.
Tester en staging : validez les flux principaux ; Think Max nécessite une fenêtre de contexte 384K+.
Déployer avant l'échéance : les utilisateurs du SDK Anthropic changent uniquement le nom du modèle — même base URL.
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[{"role": "user", "content": "Solve step by step..."}],
extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)
La GA n'a pas besoin de battre Claude Fable 5 sur chaque benchmark. Elle livre le modèle de codage open-weight le plus performant à 1/10 à 1/100 du coût des API frontier fermées.
Auto-héberger V4 ou exécuter des agents long contexte exige du matériel fiable — un portable ne tient pas 24/7 et les VM ajoutent risque performance et conformité. Pour la CI/CD iOS et l'automatisation Agent en production, la location cloud Mac Mini VpsMesh est généralement le meilleur choix : du bare-metal Apple Silicon s'accorde bien avec des stacks d'inférence locale comme ds4 + V4 Flash sur Mac.
Sources : documentation officielle DeepSeek, arXiv:2606.19348, HuggingFace, LLMReference, Artificial Analysis, MangoMind Blog, TechNode.
En semaine, heures de Pékin 09h00–12h00 et 14h00–18h00 : tous les tarifs doublent. Sortie V4-Pro hors pointe à 0,87 USD/M ; en pointe, 1,74 USD/M. Consultez nos tarifs de location Mac Mini pour les coûts d'environnement de développement complémentaires.
Avant le 24 juillet, remplacez deepseek-chat par deepseek-v4-flash et deepseek-reasoner par Flash en mode thinking ou deepseek-v4-pro. Base URL inchangée.
Pro est le flagship 1,6T (49B actifs) ; Flash fait 284B (13B actifs). Les deux supportent 1M de contexte. Flash est moins cher (0,28 USD/M en sortie) pour le routage ; Pro pour les agents complexes.
Fable 5 et GPT-5.6 dominent sur les benchmarks les plus exigeants. V4-Pro est sous licence MIT, auto-hébergeable, et figure parmi les API IA frontier les moins chères en 2026 à 0,87 USD/M en sortie hors pointe.
V4-Flash peut tourner via des moteurs comme ds4 sur Mac haut de gamme (96 Go+ de mémoire unifiée). Pro complet nécessite un cluster. Détails dans notre centre d'aide.
Gains agent, maths et code ; tarification peak-valley ; GA mondiale ; retrait des noms legacy le 24 juillet. Architecture MoE sous-jacente inchangée.