DeepSeek V4-Flash est-il vraiment 100 fois moins cher que Claude ?

Mise à jour post-entraînement 0731 · Framework Harness · Comparaison concurrents · Réserves benchmarks · Calendrier V4-Pro

DeepSeek V4 Flash version officielle benchmarks et comparaison tarifs API

Le 31 juillet 2026, DeepSeek a promu V4-Flash-0731 en version officielle de l'API publique : même architecture 284B / 13B actifs qu'en avril, les gains provenant entièrement d'un nouveau passage de post-entraînement. Le modèle dépasse désormais la préversion V4-Pro, plus volumineuse, sur les benchmarks agent, pour un coût d'environ 1/36 à 1/179 du tarif de Claude Opus 4.8. Si vous évaluez la crédibilité des benchmarks, comparez avec Kimi K3 ou Qwen3.8-Max, ou migrez depuis les alias deepseek-chat retirés, cet article propose une chronologie, une grille tarifaire, une analyse Harness, une comparaison concurrentielle, un runbook API en six étapes et des réserves sur les benchmarks directement actionnables. Données au 05.08.2026.

01

Ce qui a réellement été livré le 31 juillet — et ce qui ne l'a pas été

Il est facile de lire « version officielle DeepSeek V4 » et d'imaginer un nouveau modèle. Ce n'est pas le cas. Il s'agit de la même architecture à 284 milliards de paramètres avec un nouveau passage de post-entraînement. La version officielle V4-Pro phare et le premier framework agent maison, Harness, restent non publiés, sans date confirmée.

  1. 01

    24 avril 2026 : lancement de la préversion DeepSeek-V4 avec deux modèles MoE open-weight (MIT) — V4-Pro (1,6T / 49B actifs) et V4-Flash (284B / 13B actifs) — tous deux avec une fenêtre de contexte d'1 million de tokens. Voir notre analyse de la GA V4.

  2. 02

    24 juillet 2026 : retrait des alias legacy deepseek-chat et deepseek-reasoner ; tout le trafic est routé vers la famille V4.

  3. 03

    27 juillet 2026 : Moonshot AI publie les poids ouverts complets de Kimi K3 (2,8T paramètres totaux), renforçant la pression concurrentielle quelques jours avant la mise à jour DeepSeek. Voir notre guide Kimi K3 open-weight.

  4. 04

    31 juillet 2026 : V4-Flash-0731 entre en bêta API publique officielle ; les poids ouverts arrivent sur Hugging Face le même jour. Le changelog mentionne pour la première fois DeepSeek Harness, qualifié de « bientôt disponible ». Point crucial : cette mise à jour est API uniquement — l'application grand public et le chat web ne sont pas modifiés.

  5. 05

    2 août 2026 : l'API Alibaba Qwen3.8-Max passe en GA ; les poids restent en attente. Voir notre analyse Qwen3.8-Max open source.

  6. 06

    Au 5 août 2026 : la version officielle V4-Pro reste non confirmée. Certains médias chinois, citant des sources anonymes, rapportent des tests internes débutés la semaine du 28 juillet avec une fenêtre GA possible entre le 10 et le 20 août — cette fenêtre n'est pas confirmée par DeepSeek et doit être traitée comme une rumeur.

Les équipes qui suivent cette sortie rencontrent souvent cinq angles morts :

  1. 01

    Mauvaise lecture de « version officielle » : architecture et nombre de paramètres identiques à la préversion d'avril — les gains de performance viennent entièrement du post-entraînement.

  2. 02

    Dépendance au framework de benchmark : les scores agent ont été mesurés avec le « mode minimal » non publié de Harness, pas avec des outils agent tiers.

  3. 03

    Limitation API uniquement : l'application grand public et le chat web n'ont pas été mis à jour vers la build 0731.

  4. 04

    Écart sur la version Pro : la version officielle V4-Pro phare reste indisponible ; les tâches de raisonnement complexe peuvent nécessiter la préversion.

  5. 05

    Rumeurs de financement : les rapports évoquant un tour d'environ 7,4 milliards USD et une valorisation d'environ 48,7 milliards USD proviennent de sources financières anonymes — non confirmés par DeepSeek ni par des dépôts réglementaires.

02

Les chiffres en un coup d'œil : tarifs, paramètres et licence

ModèleStatutParams totaux / actifsContexteEntrée (miss / hit, $/M)Sortie ($/M)Licence
DeepSeek-V4-Flash-0731Officiel (31 juil. 2026)284B / 13B1M0,14 $ / 0,0028 $0,28 $MIT
DeepSeek-V4-ProPréversion uniquement (24 avr. 2026)1,6T / 49B1M0,435 $ / 0,003625 $0,87 $MIT
Kimi K3Poids ouverts (27 juil. 2026)2,8T / ~104B (estimation communautaire)~1,05M3,00 $ / 0,30 $15,00 $MIT modifiée
GLM-5.2Open (juin 2026)~744B / ~40B1MNon vérifiéNon vérifiéMIT
Qwen3.8-MaxAPI GA (2 août 2026) ; poids en attente2,4T / 95B1M2,00 $ / ~0,17–0,25 $6,00 $Poids ouverts promis
Info

Tous les tarifs ci-dessus sont des grilles publiées par les éditeurs. DeepSeek a annoncé une future surcharge de 2× en heures de pointe (9h–12h et 14h–18h, heure de Pékin), sans date d'entrée en vigueur confirmée. Par rapport à Claude Opus 4.8 : l'entrée cache miss est environ 36 fois moins chère, l'entrée cache hit environ 179 fois moins chère, et la sortie environ 89 fois moins chère par million de tokens (selon le 21st Century Business Herald citant les tarifs officiels).

03

Mise à niveau post-entraînement et Harness : d'où vient la performance

L'architecture n'a pas changé — les données d'entraînement, si

V4-Flash-0731 est identique en taille et en structure à la préversion d'avril. DeepSeek indique que l'intégralité du saut de performance sur les benchmarks agent provient d'un nouveau post-entraînement, pas d'un agrandissement du modèle. Cela va à l'encontre de l'hypothèse par défaut du secteur selon laquelle « plus gros égale meilleur » — un modèle 284B/13B bat désormais un modèle 1,6T/49B de la même famille sur plusieurs tâches agentiques, ce qui souligne combien la qualité du post-entraînement rivalise avec le nombre brut de paramètres dans la compétition de fin 2026.

Attention hybride : CSA + HCA, mHC et optimiseur Muon

Le rapport technique DeepSeek (« DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence ») décrit trois changements architecturaux repris de la préversion d'avril :

  1. 01

    Attention hybride (DSA) : combine Compressed Sparse Attention (CSA) et Heavily Compressed Attention (HCA) pour réduire les coûts de calcul et de mémoire sur les longs contextes.

  2. 02

    Manifold-Constrained Hyper-Connections (mHC) : amélioration des connexions résiduelles standard.

  3. 03

    L'optimiseur Muon : utilisé pour une convergence plus rapide et une stabilité d'entraînement accrue.

DeepSeek affirme qu'à 1 million de tokens de contexte, V4-Pro ne nécessite que 27 % des FLOPs d'inférence par token et 10 % de l'empreinte KV cache par rapport à V3.2. Ce sont des chiffres d'efficacité publiés par l'éditeur ; aucune reproduction indépendante tierce n'a encore été publiée.

Harness : premier framework agent développé en interne par DeepSeek

Le 31 juillet marque aussi la première mention officielle de DeepSeek Harness — un framework d'exécution agent maison pour les E/S fichiers, les appels d'outils et le travail d'ingénierie multi-étapes, positionné comme réponse DeepSeek à Claude Code. Chaque benchmark agent publié par DeepSeek pour V4-Flash-0731 (Terminal Bench 2.0, Toolathlon, etc.) a été mesuré avec le « mode minimal » de Harness, qui n'est pas encore publié, en effort de raisonnement maximal, top_p 0,95, température 1,0. Le changelog DeepSeek ajoute une réserve : les scores agent sont « extrêmement sensibles au choix du harness » — à prendre au sérieux.

04

Comparaison concurrentielle et réserves sur les benchmarks : la « guerre hexagonale » des modèles open source chinois

ModèleLaboIntelligence Index (Artificial Analysis)Coût moyen par tâcheScores agent officiels DeepSeek
V4-Flash-0731DeepSeek500,03 $Terminal Bench 2.0 : 82,7 (mode minimal Harness)
Kimi K3Moonshot AI570,86 $
GLM-5.2Zhipu / Z.ai~1 point au-dessus de V4-FlashNon vérifié
GPT-5.6 SolOpenAI9+ points au-dessus de V4-Flash1,86 $Source fermée
Claude Fable 5Anthropic9+ points au-dessus de V4-Flash3,15 $Source fermée

DeepSeek ne vise pas le sommet du classement — il optimise pour « une intelligence suffisante à un prix que personne d'autre ne peut égaler ». Le coût par tâche est environ 1/29e de Kimi K3 et 1/105e de Claude Fable 5.

Alerte

Réserves sur les benchmarks à signaler : ① le score Terminal Bench 2.0 de 82,7 (contre 67,9 pour la préversion V4-Pro) a été mesuré avec le mode minimal Harness non publié en réglages max ; ② des développeurs à l'étranger signalent de faibles taux de cache hit en entrée et des timeouts occasionnels du classificateur de sécurité ; ③ les dates de sortie V4-Pro / Harness restent des rumeurs médias non confirmées ; ④ les rapports de financement et d'IPO remontent à des sources anonymes, pas à des dépôts officiels.

05

Runbook API en six étapes : de la migration au routage production

V4-Flash-0731 prend en charge les API compatibles OpenAI et Anthropic et s'intègre dans Claude Code, OpenCode, Cursor et d'autres chaînes d'outils agent. Voici un parcours en six étapes de l'évaluation à la production :

  1. 01

    Auditer les appels legacy : scanner le code pour les alias retirés deepseek-chat / deepseek-reasoner et établir des bases de volume mensuel et de taux de cache hit.

  2. 02

    Basculer la dénomination des modèles : mapper deepseek-chat vers deepseek-v4-flash (sans thinking) ; mapper deepseek-reasoner vers le mode thinking Flash ou la préversion deepseek-v4-pro. L'URL de base reste identique.

  3. 03

    Évaluer la stratégie de cache : surveiller les taux de cache hit en entrée — les retours de la communauté à l'étranger suggèrent que la version officielle peut toucher le cache moins souvent que prévu, ce qui impacte directement la facture. Tester d'abord le Prompt Caching sur les charges à long contexte.

  4. 04

    Comparaison A/B concurrentielle : exécuter vos propres échantillons contre Kimi K3 (3 $/15 $), Qwen3.8-Max (2 $/6 $) et V4-Flash (0,14 $/0,28 $) pour latence, taux de succès et coût par tâche.

  5. 05

    Configurer l'environnement hôte agent : Harness n'est pas public — utiliser Claude Code ou OpenCode comme framework d'exécution en production ; retester les tâches de type Terminal Bench une fois Harness en GA.

  6. 06

    Construire routage principal/secours et monitoring : router les tâches batch à fort volume via V4-Flash ; conserver V4-Pro preview ou Claude en secours pour le raisonnement complexe ; configurer des plafonds de coût et des alertes surcharge 2× heures de pointe.

python
from openai import OpenAI

client = OpenAI(
    api_key="your_deepseek_api_key",
    base_url="https://api.deepseek.com"
)

response = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[{"role": "user", "content": "Analyze this code..."}]
)
06

Contexte sectoriel, chiffres clés et place de VpsMesh

  • L'effet « kill line » : les développeurs chinois emploient zhǎn shā xiàn — littéralement « ligne de mise à mort » — pour décrire comment la combinaison « performance suffisante + prix plancher » de DeepSeek fixe un seuil que les concurrents doivent dépasser en capacité ou sous-coter en coût. Ce cadrage éclaire des mouvements comme la baisse de 80 % du prix GPT-5.6 Luna rapportée chez OpenAI à la même période.
  • Retournement du sentiment communautaire : avant la sortie de V4-Flash-0731, les forums moquaient le fondateur Liang Wenfeng sous le surnom « Liang Empty Promise » à propos des retards V4-Pro ; après que la build Flash a dépassé les attentes, les mêmes communautés sont repassées à « Liang the Sage » — un baromètre révélateur de la vitesse à laquelle le sentiment bascule dans la communauté IA chinoise.
  • Réaction modérée des actions puces : Nvidia, Broadcom et AMD n'ont pas bougé significativement le 31 juillet lorsque V4-Flash est passé officiel — contraste avec début 2025, quand les affirmations d'efficacité de DeepSeek-R1 avaient déclenché une vente globale des actions IA. Le marché traite désormais « DeepSeek fait plus avec moins de calcul » comme une ingénierie routinière, pas un signal baissier automatique.
  • Volume d'appels OpenRouter : la préversion V4-Flash aurait dominé le classement des modèles les plus utilisés sur OpenRouter pendant sept semaines consécutives — preuve que les appels agent à grande échelle et bas coût constituent sa base d'utilisateurs principale, pas les chasseurs de leaderboard.
  • Terminal Bench 2.0 : score officiel de 82,7 contre 67,9 pour la préversion V4-Pro — mais mesuré avec Harness non publié ; à traiter comme chiffre éditeur jusqu'à reproduction indépendante.

Les appels API purs couvrent l'inférence agent V4-Flash, mais les chaînes de signature iOS, les builds Xcode locaux, les charges Metal et les longues exécutions agent 24h/24 exigent encore de vrais nœuds macOS — les ordinateurs portables ne peuvent pas héberger de façon fiable des agents OpenClaw / Claude Code persistants, et les VM ajoutent une taxe de performance plus un risque EULA. Pour la CI/CD iOS en production et l'automatisation agent IA, la location cloud Mac Mini VpsMesh est généralement le meilleur choix : Apple Silicon bare-metal, accès root et coût mensuel prévisible s'accordent proprement avec l'API DeepSeek dans une architecture inférence cloud plus build local. Options d'inférence locale : voir notre guide ds4 + V4 Flash inférence locale.

Sources : documentation API et changelog DeepSeek · rapport technique · Artificial Analysis · 21st Century Business Herald · Kuai Technology · discussion communautaire V2EX. Vérifier les tarifs officiels, benchmarks et statut de sortie V4-Pro/Harness avant toute décision de production.

FAQ

Questions fréquentes

Oui. V4-Pro et V4-Flash, y compris la version officielle V4-Flash-0731 du 31 juillet, sont publiés en poids ouverts sous licence MIT sur Hugging Face, et peuvent être utilisés, fine-tunés et redistribués commercialement sans permission supplémentaire.

Selon le 21st Century Business Herald, le tarif officiel V4-Flash est environ 36 fois moins cher que Claude Opus 4.8 en entrée cache miss, 179 fois moins cher en cache hit et 89 fois moins cher en sortie, par million de tokens. Ce sont des tarifs catalogue éditeur, pas un audit indépendant.

Aucune date confirmée. Le changelog DeepSeek indique seulement que la version officielle V4-Pro « suivra dès que possible ». Les rapports évoquant une fenêtre GA du 10 au 20 août proviennent de sources anonymes dans les médias chinois et n'ont pas été confirmés par DeepSeek. Pour le déploiement hôte agent, voir nos tarifs Mac Mini M4.

Partiellement. Les benchmarks tiers largement adoptés comme SWE-bench Verified ont plus de poids. Mais les scores agent (Terminal Bench 2.0, Toolathlon, etc.) ont été mesurés avec le framework Harness non publié de DeepSeek, et l'entreprise elle-même avertit que ces chiffres sont très sensibles au choix du harness — attendre une reproduction indépendante avec Claude Code, Cursor et d'autres outils agent avant de les traiter comme des affirmations de capacité générale.

Premier framework d'exécution agent développé en interne par DeepSeek, positionné comme alternative maison à Claude Code, pour l'édition de fichiers, les appels d'outils et le travail d'ingénierie multi-étapes. Nommé pour la première fois dans le changelog du 31 juillet 2026 et pas encore disponible publiquement.

Si vous utilisez des API au format OpenAI ou Anthropic pour accéder à DeepSeek, aucun changement de code n'est nécessaire — deepseek-v4-flash pointe automatiquement vers la nouvelle version officielle. Si vous appelez encore les alias retirés deepseek-chat / deepseek-reasoner, basculez immédiatement. Plus de détails de déploiement dans notre centre d'aide.