Lancement Opus 5 · Opus vs Fable 5 · accusation Maison Blanche · preuves Greenblatt · runbook en 6 étapes
Les équipes techniques qui suivent les sorties de modèles cette semaine font face à deux récits distincts mais convergents : rendre l'intelligence de pointe abordable tout en questionnant l'origine réelle de ces capacités. Le 24 juillet, Anthropic a lancé Claude Opus 5 comme modèle par défaut sur Claude Max. Le 16 juillet, Moonshot AI a publié Kimi K3, puis s'est retrouvé visé par une accusation de distillation industrielle de la Maison Blanche — tandis que le chercheur Ryan Greenblatt a montré que K3 se présente comme Claude et fuit des identifiants de déploiement internes. Cet article propose un tableau comparatif Opus 5 vs Fable 5, une chronologie complète de la controverse, une lecture technique de la question pourquoi Kimi K3 dit-il être Claude, et un runbook de sélection en six étapes, avec renvois vers notre analyse approfondie de Kimi K3 et notre guide OpenRouter multi-modèles.
Anthropic a répondu à la pression tarifaire en rapprochant le modèle phare du modèle du quotidien. Moonshot a répondu avec un lancement open-weight à 2,8 billions de paramètres à une fraction du coût API des modèles de pointe. Dans une fenêtre de 72 heures, les équipes interprètent souvent mal le signal de cinq manières prévisibles.
Confondre communiqué et capacité vérifiée : les poids complets de K3 ne sont prévus que le 27 juillet ; les chercheurs externes n'ont pas pu reproduire les benchmarks pendant la controverse. Opus 5 dispose de chiffres officiels, mais votre charge de travail peut ne pas correspondre à CursorBench.
Confondre prix au token et coût par tâche : Opus 5 conserve la tarification Opus 4.8 (5/25 USD par million de tokens) avec Thinking activé par défaut ; les niveaux d'effort modifient la longueur de sortie. Fable 5 coûte environ le double mais reste en tête de 0,5 % à effort max sur CursorBench 3.2.
Négliger rétention et conformité : Fable 5 et Mythos 5 exigent une opt-in de rétention des données sur 30 jours. Opus 5 suit la politique Opus antérieure — pas de rétention forcée pour l'accès général — ce qui peut peser davantage que l'écart de benchmark pour les charges enterprise.
Équivaloir accusation politique et preuve : Michael Kratsios, directeur de l'OSTP à la Maison Blanche, a accusé Moonshot de distillation industrielle clandestine sans publier de preuves à l'appui. Des chercheurs indépendants contestent largement qu'une distillation profonde depuis Fable 5 — public seulement depuis le 1er juillet — puisse aboutir en deux semaines.
Manquer le signal d'identité : l'analyse de Greenblatt montre que K3 se présente disproportionnellement comme Claude et émet des chaînes comme claude-opus-4-5-20250929. C'est plus intéressant techniquement que le titre — mais cela ne constitue toujours pas une preuve concluante de distillation.
Anthropic a publié Claude Opus 5 le 24 juillet 2026 (ID modèle : claude-opus-5) et l'a immédiatement défini comme modèle par défaut sur Claude Max — le modèle Opus le plus puissant accessible aux abonnés Claude Pro. La tarification reste identique à Opus 4.8 : 5 USD par million de tokens en entrée, 25 USD en sortie. Fenêtre de contexte de 1M tokens (niveau unique), sortie max 128K, Thinking activé par défaut.
« Claude Opus 5 offre une intelligence proche de Fable 5 à la vitesse et au coût d'Opus. Sur CursorBench, il est juste en dessous de Fable 5 et partage beaucoup de comportements. » — équipe Cursor
| Dimension | Claude Opus 5 | Claude Fable 5 |
|---|---|---|
| Prix entrée/sortie | 5 / 25 USD par million de tokens | ~10 / 50 USD par million (~2× Opus 5) |
| CursorBench 3.2 (max) | À moins de 0,5 % du pic Fable 5 | Référence actuelle coding/agent au sommet |
| Rétention des données | Pas de rétention forcée pour l'accès général | Opt-in rétention 30 jours requise |
| Classificateurs cybersécurité | ~85 % moins d'interventions que Fable 5 ; utilisable pour la découverte de vulnérabilités au niveau source | Blocages plus fréquents ; frontière dual-use portée par Mythos 5 |
| Positionnement | Défaut Claude Max / Opus le plus fort pour Pro | Tarification phare ; public depuis le 1er juillet |
| Idéal pour | Production quotidienne, conformité, charges agent sensibles au coût | Tâches au sommet absolu où rétention et coût 2× sont acceptables |
Le client enterprise Box a signalé un gain de précision global de 8 % — 11 % sur les workflows d'analyse de données et 17 % sur la due diligence. Des tests internes en sciences de la vie montrent +10,2 points sur l'inférence de structure moléculaire à partir de spectroscopie et +7,7 points sur la prédiction de fonction de variants protéiques vs Opus 4.8.
Alignement : Opus 5 est le modèle le plus aligné à ce jour d'Anthropic — taux de comportement trompeur le plus bas, le plus difficile à détourner vers un usage abusif. Anthropic n'a volontairement pas poussé Opus 5 à la frontière offensive cyber ou biologie ; ce créneau reste Mythos 5.
Moonshot AI a publié Kimi K3 le 16 juillet 2026, revendiquant 2,8 billions de paramètres totaux — le premier modèle open-weight à franchir la barre des 3T. Il s'agit d'un MoE sparse (896 experts, 16 actifs par token, ~50B paramètres actifs équivalents) avec contexte 1M tokens, vision native et architecture Kimi Delta Attention (KDA).
| Benchmark | Score Kimi K3 | Notes |
|---|---|---|
| GPQA-Diamond | 93,5 % | Meilleur score open-weight au lancement |
| BrowseComp | 91,2 % | Meilleur de catégorie au lancement |
| Terminal-Bench 2.1 | 88,3 % | 0,5 point derrière GPT-5.6 Sol |
| SWE Marathon | 42,0 % | Meilleur global de catégorie |
| Poids complets | Engagement 27 juillet | Non vérifiables indépendamment au pic de la controverse |
Les 22–23 juillet, le directeur de l'OSTP Michael Kratsios a publié sur X accusant Moonshot de « distillation industrielle clandestine à grande échelle visant à voler une technologie propriétaire américaine » depuis le modèle Fable d'Anthropic — et a séparément allégué l'obtention de puces Nvidia GB300 soumises à restrictions d'export via des serveurs en Thaïlande. Le secrétaire au Trésor Scott Bessent a déclaré que les responsables « trouvaient des filigranes de nos grands modèles de langage américains sur de nombreux modèles chinois » sans préciser ce que cela signifie.
Ce n'était pas la première salve : en février 2026, Anthropic a publiquement nommé Moonshot, DeepSeek et MiniMax, revendiquant plus de 3,4 millions d'interactions API anormales reflétant une « extraction délibérée de capacités », avec une activité tracée jusqu'à des cadres Moonshot via les métadonnées de requête. Moonshot n'a jamais confirmé ni infirmé publiquement.
Contre-argument temporel : TechCrunch a interrogé des chercheurs sceptiques sur l'explication par distillation — principalement parce que Fable 5 n'est public que depuis le 1er juillet, laissant deux semaines pour distiller, entraîner et livrer. Braden Hancock (co-fondateur Snorkel AI) : « On ne peut pas distiller autant de données, entraîner un modèle et le publier en deux semaines. » Nathan Lambert (Allen Institute for AI) estime que l'impact marginal de la distillation diminue alors que les laboratoires chinois basculent vers le renforcement par apprentissage.
Vers le 24 juillet, Ryan Greenblatt, chief scientist chez Redwood Research (GitHub : rgreenblatt/which_claude_is_k3), a publié une comparaison statistique du comportement d'auto-identification des modèles. Constat :
claude-opus-4-5-20250929 et claude-sonnet-4-5-20250929.Q : Qui êtes-vous ? Kimi K3 (anormalement souvent) : Je suis Claude, version claude-opus-4-5-20250929 Claude Opus 4.5 réel : Ne rapporte généralement pas cet ID de déploiement interne
L'interprétation de Greenblatt : reproduire les métadonnées de déploiement d'un modèle enseignant plus fidèlement que l'enseignant ne le fait lui-même est difficile à expliquer par une simple mimique conversationnelle. Cela pointe vers un entraînement sur des données Claude étiquetées avec des métadonnées de déploiement — journaux API ou données synthétiques taguées. Il précise que cela ne prouve pas qu'une distillation a eu lieu ; contamination ou fuites de prompts restent des explications alternatives.
La réaction sur r/LocalLLaMA se partage en trois : enthousiasme que l'écart open-closed se mesure désormais en jours ; plaisanteries sur le fait que presque personne ne peut exécuter 2,8T en local ; et une lecture pragmatique selon laquelle le vrai argument de K3 est prix plus bas et moins de refus, pas battre Fable 5. Voir notre analyse d'architecture Kimi K3 pour plus de spécifications.
Utilisez cette checklist en revue d'équipe plutôt que de réagir aux seuls titres.
Définir d'abord les limites de conformité : si la rétention 30 jours ou le risque géopolitique/chaîne d'approvisionnement est inacceptable, privilégiez Opus 5 (pas de rétention forcée) plutôt que Fable 5 ; si vous envisagez K3, évaluez séparément la licence open-weight et la controverse sur la provenance.
Mesurer le coût total par tâche, pas le prix catalogue : exécutez votre jeu de prompts de référence sur Opus 5 vs Fable 5 et comparez consommation de tokens plus taux de réussite ; l'écart de 0,5 % sur CursorBench peut varier selon les réglages d'effort.
Séparer disponibilité API et vérifiabilité des poids : l'API K3 est en ligne mais les poids complets arrivent le 27 juillet ; les revendications d'architecture et les scores ne peuvent pas être entièrement reproduits avant cette date.
Superposer les niveaux de preuve de distillation : politique (Maison Blanche/Kratsios) → calendrier (experts TechCrunch) → technique (statistiques d'identité Greenblatt). Ne les fusionnez pas en un seul verdict.
Réduire le coût de bascule avec une passerelle : pour tester Claude aux côtés d'alternatives ouvertes, configurez des chaînes de fallback via notre guide OpenRouter plutôt que de maintenir des piles SDK séparées par éditeur.
Réévaluer K3 après le 27 juillet : les poids ouverts sont le nœud clé — reportez l'adoption production jusqu'à ce que des chercheurs indépendants puissent vérifier paramètres, architecture et reproduction des benchmarks.
| Date | Événement |
|---|---|
| 2026-02 | Première accusation publique de distillation d'Anthropic vs Moonshot/DeepSeek/MiniMax |
| 2026-07-01 | Claude Fable 5 disponible publiquement |
| 2026-07-16 | Lancement API/produit Kimi K3 (2,8T paramètres) |
| 2026-07-22/23 | Accusation distillation + puces de la Maison Blanche OSTP |
| 2026-07-24 | Sortie Claude Opus 5 ; analyse d'identité Greenblatt |
| 2026-07-27 (prévu) | Poids open complets Kimi K3 |
Côte à côte, le schéma est clair. Anthropic resserre l'écart tarifaire phare/quotidien avec Opus 5. Moonshot pousse l'open-weight, ultra-abordable et largement moins restrictif avec K3. La controverse pose en réalité la question : quand un laboratoire revendique des performances de pointe à une fraction du coût, comment distinguer une meilleure ingénierie d'un modèle qui s'appuierait discrètement sur celui d'un autre ?
Si votre pipeline agent ou workflow CI exige un accès API Claude stable 24/7, des runs de benchmark longs ou des tests A/B multi-modèles, faire tourner passerelles et runners sur un portable en veille provoque des coupures réseau, des processus tués et des secrets dispersés — souvent plus coûteux que les tokens eux-mêmes. Pour la CI/CD iOS et l'automatisation d'Agents IA en production, la location cloud Mac Mini VpsMesh est généralement la meilleure option : des nœuds Apple Silicon dédiés, louables au cycle de projet, pour que vos agents et builds restent actifs sans maintenir votre machine personnelle en ligne. Consultez nos tarifs de location Mac Mini M4.
Opus 5 reste à 5/25 USD par million de tokens entrée/sortie — environ la moitié de Fable 5 (~10/50 USD). Sur CursorBench 3.2 à effort max, il se situe à moins de 0,5 % du pic Fable 5. Pour le codage et les tâches agent quotidiennes, Opus 5 offre généralement le meilleur rapport qualité-prix. La configuration Mac distante pour benchmarks agent est couverte dans notre centre d'aide.
Oui. Depuis le 24 juillet 2026, Opus 5 est le défaut Claude Max et l'Opus le plus puissant accessible aux abonnés Claude Pro. Accès via Claude API, AWS Bedrock, Google Vertex AI et Microsoft Foundry sous l'ID modèle claude-opus-5.
Non confirmé et contesté. L'accusation de la Maison Blanche n'a pas été accompagnée de preuves publiques. Des chercheurs estiment que la fenêtre de deux semaines Fable-K3 rend une distillation profonde peu plausible. La découverte de Ryan Greenblatt — K3 se présente comme Claude avec des identifiants de déploiement exacts — constitue le signal technique le plus fort à ce jour, sans être conclusif.
Moonshot s'est engagé pour le 27 juillet 2026. À la publication, les poids n'étaient pas encore disponibles : les revendications d'architecture et de benchmark ne pouvaient pas être vérifiées indépendamment — une raison majeure pour laquelle la controverse reste ouverte.
L'analyse statistique de Greenblatt montre que K3 se présente disproportionnellement comme Claude et émet parfois des identifiants de déploiement internes Anthropic comme claude-opus-4-5-20250929 — plus fidèlement que les vrais modèles Claude ne le font eux-mêmes. L'explication la plus plausible est un entraînement sur des données Claude taguées avec des métadonnées de déploiement, mais Greenblatt insiste : cela seul ne prouve pas une distillation.