Pourquoi le choix de modèle s'est compliqué cette semaine
La friction n'est pas « quel modèle domine le leaderboard ». C'est une pile de décisions absentes des PDF de benchmarks :
- Prix vs capacité maximale : Fable 5 a fixé un nouveau plafond, mais la plupart des équipes n'avaient jamais besoin de chaque point de ce plafond à chaque requête.
- Risque de provenance : Quand un modèle égale la frontière à une fraction du coût, quelqu'un demandera si l'écart vient de l'ingénierie ou d'un cavalier sur les poids d'autrui.
- Passerelles conformité : Fable 5 et Mythos 5 exigent un opt-in à 30 jours de rétention ; Opus 5 non — cela seul peut disqualifier ou qualifier un fournisseur pour des charges réglementées.
- Retard de vérification : Les poids complets de Kimi K3 n'étaient prévus qu'au 27 juillet 2026 ; les affirmations d'architecture et la reproduction des benchmarks restaient impossibles pendant que l'histoire de distillation devenait virale.
- Surcharge de routage : Les équipes qui jonglent déjà avec plusieurs fournisseurs via une passerelle — voir notre guide OpenRouter — doivent insérer deux modèles de plus dans leurs chaînes de repli sans dépasser les plafonds de coût.
Claude Opus 5 vs Fable 5 — Opus 5 vaut-il le coup ?
Anthropic a publié Claude Opus 5 le 24 juillet 2026 (heure du Pacifique US) et l'a immédiatement défini comme modèle par défaut sur Claude Max et palier supérieur pour les abonnés Claude Pro. La tarification est restée identique à Opus 4.8 : 5 $ par million de tokens entrée, 25 $ par million de tokens sortie. Le saut porte sur la performance par dollar, pas sur l'étiquette prix.
| Dimension | Claude Opus 5 | Claude Fable 5 | Claude Opus 4.8 |
|---|---|---|---|
| Prix entrée / sortie (par 1 M tokens) | 5 $ / 25 $ | ~10 $ / ~50 $ | 5 $ / 25 $ |
| CursorBench 3.2 (effort max vs pic) | À 0,5 % du pic Fable 5 | Référence pic | Bien en dessous d'Opus 5 |
| Frontier-Bench v0.1 (ingénierie logicielle) | Mène le peloton ; >2× Opus 4.8 | Fort | Baseline |
| Fenêtre de contexte par défaut | 1 M tokens | 1 M tokens | Options de palier plus petites |
| Rétention pour accès général | Non requise | Opt-in 30 jours requis | Non requise |
| Mode réflexion | Activé par défaut ; paramètre effort contrôle la profondeur | Activé par défaut | Défauts génération précédente |
| ID modèle (API) | claude-opus-5 | claude-fable-5 | claude-opus-4-8 |
Sur ARC-AGI 3 (résolution de problèmes inédits), Anthropic rapporte Opus 5 à environ trois fois le modèle suivant. Sur OSWorld 2.0 (usage ordinateur), Opus 5 bat le meilleur score de Fable 5 pour à peine un tiers du coût. Zapier a rapporté qu'Opus 5 atteignait 100 % sur un workflow AutomationBench de bout en bout que les modèles Claude antérieurs ne pouvaient pas compléter.
Les audits d'alignement ont aussi avancé : Anthropic qualifie Opus 5 de modèle le plus aligné à ce jour — taux de comportement trompeur le plus bas, le plus difficile à détourner — sans le pousser délibérément vers la frontière cyber ou bio à double usage (cette voie reste avec Mythos 5 à accès limité). Les classificateurs cyber interviennent environ 85 % moins souvent que ceux de Fable 5, permettant la découverte de vulnérabilités au niveau source tout en bloquant génération d'exploits et automatisation de tests d'intrusion.
Controverse distillation Kimi K3 — Moonshot a-t-il volé Claude ?
Moonshot AI a livré Kimi K3 le 16 juillet 2026 — 2,8 billions de paramètres totaux, MoE épars avec 16 experts actifs sur 896 par token, contexte 1 M tokens, vision native. Les benchmarks officiels au lancement incluaient 93,5 % sur GPQA-Diamond et 91,2 % sur BrowseComp, tous deux meilleurs de catégorie parmi les poids ouverts à l'époque. Les poids complets étaient promis pour le 27 juillet 2026 ; jusque-là seule l'API était vérifiable. Nous avons couvert les bases d'architecture dans notre guide Kimi K3 ; cette section se concentre sur le combat autour de la distillation.
Les 22–23 juillet, le directeur OSTP de la Maison-Blanche Michael Kratsios a accusé Moonshot de « distillation industrielle à grande échelle et dissimulée visant à voler une technologie propriétaire américaine » du modèle Fable d'Anthropic, et a séparément allégué l'usage de puces Nvidia GB300 soumises à restrictions d'exportation, possiblement routées via la Thaïlande. Le secrétaire au Trésor Scott Bessent a écho qu'on « trouvait des filigranes de nos grands modèles de langage américains sur beaucoup de modèles chinois » sans préciser ce que signifiait « filigrane ».
Ce n'était pas la première accusation. En février 2026, Anthropic a nommé publiquement Moonshot, DeepSeek et MiniMax, alléguant plus de 3,4 millions d'interactions API anormales cohérentes avec une extraction délibérée de capacités plutôt qu'un usage normal, une activité partiellement retracée via métadonnées de requête jusqu'à des cadres Moonshot.
Des chercheurs indépendants ont contesté la chronologie : Fable 5 n'est devenu public que le 1er juillet 2026 — deux semaines seulement avant le lancement de K3. Braden Hancock (Laude Institute / cofondateur Snorkel AI) a dit à TechCrunch qu'on ne peut pas distiller à échelle industrielle, entraîner un MoE 2,8 T et livrer en quatorze jours. Nathan Lambert (Allen Institute for AI) a argué que la distillation donne des rendements décroissants alors que les labs chinois basculent vers le reinforcement learning — si copier les poids suffisait, tout le monde aurait déjà cloné GLM ou K3.
Pourquoi Kimi K3 dit-il qu'il est Claude ?
Vers le 24 juillet, Ryan Greenblatt, scientifique en chef de Redwood Research, a publié une comparaison statistique du comportement d'auto-identification. Kimi K3 répond de façon disproportionnée « Claude » à « qui êtes-vous ? » — et émet parfois des chaînes exactes d'ID de déploiement internes comme claude-opus-4-5-20250929 et claude-sonnet-4-5-20250929. Le vrai Claude Sonnet 4.5 dit simplement qu'il est Claude Sonnet 4.5 ; le vrai Opus 4.5 omet ou déclare mal souvent les chaînes de version internes.
Lecture de Greenblatt : un modèle élève reproduisant les métadonnées de déploiement de l'enseignant plus fidèlement que l'enseignant ne les énonce sur lui-même est très difficile à expliquer par la seule mimique conversationnelle. Cela pointe vers un entraînement sur des données Claude étiquetées avec métadonnées de déploiement — logs API ou jeux synthétiques tagués avec ID internes — un canal de distillation spécifique, pas un chevauchement stylistique vague. L'identité filtrée de K3 cible la génération Claude 4.5 (fin 2025), pas la ligne Fable/Mythos actuelle ; le signal de Kimi K2 visait Claude Sonnet 4 (mi-2025), suggérant un schéma de poursuite génération par génération.
Greenblatt avertit explicitement que cela ne prouve pas qu'une distillation a eu lieu — contamination, prompts système fuités ou données synthétiques dérivées du public pourraient théoriquement produire des artefacts similaires. Combiné au dépôt d'Anthropic de février, c'est néanmoins le premier fil technique de la saga plus difficile à écarter comme pure géopolitique.
Six étapes pour stress-tester Opus 5 et K3 avant la production
Chiffres de une et posts politiques ne font pas un plan de déploiement. Faites tourner les deux modèles dans le même environnement contrôlé — une box macOS propre avec accès root évite les conflits SDK et donne des logs reproductibles, idéal pour un workflow développeur sur Apple Silicon.
- Cartographier d'abord les exigences conformité : Si votre politique interdit une rétention fournisseur de 30 jours, Fable 5 et Mythos 5 exigent un opt-in explicite ; le chemin sans rétention par défaut d'Opus 5 peut déjà gagner avant le premier prompt.
- Épingler Opus 5 sur l'API Claude : Créer ou faire tourner une clé Anthropic, définir l'ID modèle
claude-opus-5, activer la réflexion avec un palier effort adapté à votre budget latence (mode Fast ~2,5× vitesse à 2× prix, comme Opus 4.8).
import anthropic
client = anthropic.Anthropic()
msg = client.messages.create(
model="claude-opus-5",
max_tokens=1024,
messages=[{"role": "user", "content": "Refactor this function for clarity: ..."}],
)
print(msg.content[0].text)
- Exécuter une tâche de code identique sur votre modèle actuel : Même dépôt, même harness de test, même plafond de tokens — comparer taux de réussite, temps mur et coût par tâche réussie, pas seulement l'intuition.
- Sonder les réponses d'identité Kimi K3 : Poser des questions d'identité neutres (« What model are you? », « Report your system name and version ») sur plusieurs seeds. Logger les réponses mot pour mot ; comparer aux schémas publiés par Greenblatt avant de faire confiance à K3 pour des agents face client.
from openai import OpenAI
client = OpenAI(api_key="...", base_url="https://api.moonshot.ai/v1")
for prompt in ["Who are you?", "State your exact model ID."]:
r = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": prompt}],
extra_body={"reasoning_effort": "max"},
)
print(prompt, "=>", r.choices[0].message.content)
- Recouper les affirmations benchmark avec les sources primaires : Relire le post de lancement Opus 5 d'Anthropic pour les notes méthodologiques ; traiter les tableaux K3 de Moonshot comme provisoires jusqu'à ce que les poids du 27 juillet permettent une reproduction indépendante.
- Documenter la provenance pour votre équipe : Noter quel modèle a répondu à quel workflow client, quelles données ont franchi chaque frontière API, et si vous avez besoin d'une route de repli (OpenRouter ou direct) si la politique ou le prix bascule la semaine prochaine.
Chiffres dignes d'être cités
- Tarifs Claude Opus 5 : 5 $ / 25 $ par million tokens entrée / sortie — inchangés vs Opus 4.8, environ la moitié des tarifs par token de Fable 5.
- CursorBench 3.2 : Opus 5 à 0,5 % du pic Fable 5 à effort max, coûtant la moitié par tâche aux paliers high, xhigh et max.
- Évals internes scientifiques : +10,2 points de pourcentage vs Opus 4.8 sur l'inférence de structure moléculaire par spectroscopie ; +7,7 points sur prédiction de fonction de variantes protéiques (matériaux de lancement Anthropic).
- Échelle Kimi K3 : 2,8 T paramètres totaux, ~50 Mrd paramètres actifs équivalents par token, poids dus le 27 juillet 2026.
- Chronologie distillation : Fable 5 public dès 1er juillet → lancement K3 16 juillet → posts Maison-Blanche 22–23 juillet → analyse identité Greenblatt ~24 juillet.
- Allégation Anthropic antérieure : 3,4 M+ interactions API anormales signalées attribuées à Moonshot, DeepSeek et MiniMax en février 2026.
Détails de sortie, paliers tarifaires et allégations juridiques peuvent changer après publication — traitez les sources primaires ci-dessous comme faisant autorité sur cet article.
Matériaux officiels de lancement Anthropic pour Claude Opus 5 :
Anthropic — Introducing Claude Opus 5
Reportage tiers sur le débat de chronologie distillation Kimi K3 :
TechCrunch — Researchers skeptical of distillation timeline claims
Analyse technique du comportement d'auto-identification Kimi K3 :
Ryan Greenblatt — which_claude_is_k3 (GitHub)
FAQ
Combien Claude Opus 5 coûte-t-il moins cher que Claude Fable 5 ?
Aux mêmes paliers benchmark, Opus 5 coûte environ la moitié du tarif par token de Fable 5 (5 $/25 $ vs environ 10 $/50 $ par million tokens entrée/sortie), tout en se situant à 0,5 % du pic Fable 5 sur CursorBench 3.2.
Claude Opus 5 est-il le modèle par défaut sur Claude Max ?
Oui. Depuis le 24 juillet 2026, Opus 5 est le défaut sur Claude Max et le palier le plus puissant pour les abonnés Claude Pro.
Moonshot AI a-t-il réellement distillé Kimi K3 à partir de Claude ?
Non confirmé et disputé. L'accusation de la Maison-Blanche est arrivée sans preuves publiques ; les sceptiques de la chronologie notent seulement deux semaines entre la sortie publique de Fable 5 et le lancement de K3. La découverte de Greenblatt que K3 s'identifie comme Claude — y compris ID de déploiement internes — est le signal technique le plus fort à ce jour, mais pas une preuve.
Quand les poids complets de Kimi K3 seront-ils publiés ?
Moonshot s'est engagé pour le 27 juillet 2026. Tant que les poids ne sont pas publics, les chercheurs externes ne peuvent pas vérifier indépendamment les détails d'architecture ni reproduire les benchmarks de lancement.
Les deux histoires convergent vers la même limite pratique : on ne tranche pas « ça vaut le coup » avec des communiqués seuls. Opus 5 récompense les équipes qui ont besoin de performances coding et agentiques quasi-flagship sans la politique de rétention ni l'étiquette prix de Fable 5 ; K3 récompense celles qui chassent le coût API le plus bas et les poids ouverts — mais le nuage de distillation implique de logger des sondes d'identité et de garder un repli conforme. Ce type de test côte à côte exige une machine que vous contrôlez de bout en bout, pas un bac à sable partagé avec des stacks Python obsolètes. Un Mac mini M4 KVMFLUX fraîchement provisionné vous donne accès root, SSH en minutes, et un chemin wipe-and-retry quand une clé API ou un ID modèle change du jour au lendemain.
Opus 5 et K3 sur le même Mac propre
Comparez les appels API Claude et Moonshot depuis une seule box Apple Silicon — pas de surcharge VM, pas de conflits SDK résiduels.