Claude Opus 5 : comment bien le prompter ? (Et quand lui préférer Fable 5 ou Sonnet 5)

Anthropic a lancé Claude Opus 5 le 24 juillet 2026, au même tarif qu’Opus 4.8. Le modèle passe devant Fable 5 sur les évaluations de code et de travail intellectuel, pour deux fois moins cher au token. Mais si vous réutilisez vos anciens prompts tels quels, vous allez payer pour rien. Voici ce qu’il faut savoir sur ce nouveau modèle de pointe.
Dario Amodei - Anthropic
Dario Amodei – Anthropic

L’essentiel en bref

  • Claude Opus 5 coûte 5 $ par million de tokens en entrée et 25 $ en sortie, soit la moitié du tarif de Fable 5 (10 $ / 50 $). (Source : Anthropic)
  • Anthropic le présente comme le nouvel état de l’art sur Frontier-Bench et GDPval-AA, devant Fable 5, mais il reste derrière Mythos 5 sur les tâches de cybersécurité.
  • La consigne de prompting la plus rentable consiste à retirer des instructions : les demandes de double vérification héritées d’Opus 4.8 provoquent une sur-vérification coûteuse.

Ce qu’Anthropic a réellement annoncé avec Claude Opus 5

Le modèle est disponible depuis le 24 juillet 2026 sur toutes les plateformes de l’éditeur.

Il devient le modèle par défaut sur Claude Max et le plus puissant accessible sur Claude Pro.

Côté API, l’identifiant est claude-opus-5, au prix inchangé de 5 $ / 25 $ par million de tokens.

La fenêtre de contexte atteint 1 million de tokens, à la fois par défaut et au maximum.

Un mode Fast tourne environ 2,5 fois plus vite, pour le double du prix de base.

Les chiffres annoncés par Anthropic méritent d’être lus sur l’angle du coût par tâche terminée, pas via le score brut de performance.

Sur Frontier-Bench v0.1, Opus 5 fait plus que doubler le score d’Opus 4.8, à un coût par tâche inférieur.

Sur CursorBench 3.2 à effort maximal, il arrive à moins de 0,5 % du meilleur score de Fable 5, pour moitié moins cher par tâche.

Sur OSWorld 2.0, un test d’usage de l’ordinateur, il dépasse le meilleur résultat de Fable 5 pour un peu plus du tiers du coût.

Ce qui change concrètement face à Claude Fable 5 ?

Sur les évaluations de code et de travail intellectuel citées par Anthropic, Opus 5 passe devant le modèle Fable 5 sorti en juin.

Fable 5 conserve son avantage sur d’autres cas d’usages : les runs autonomes qui durent des heures ou des jours, et les problèmes que vos équipes n’ont pas encore résolus.

La documentation d’Anthropic est explicite sur ce point : les équipes qui obtiennent le plus de Fable 5 lui confient leurs tâches les plus dures, pas leurs tâches courantes.

Deuxième différence, beaucoup plus opérationnelle : les garde-fous.

Anthropic indique s’attendre à ce que les classifieurs cyber d’Opus 5 se déclenchent environ 85 % moins souvent que sur Fable 5.

Si vous travaillez sur des sujets techniques légitimes qui déclenchaient des refus intempestifs, vous allez clairement voir la différence (pratique pour les audits cybersécurité par exemple).

Ceci étant dit, le nouveau modèle bloque toujours le scan de vulnérabilités sur binaires, le pentest et la génération d’exploits.

Comment bien prompter Claude Opus 5 ? Commencez par retirer les instructions inutiles

Vos prompts d’Opus 4.8 fonctionnent tels quels, mais plusieurs de vos consignes peuvent devenir contre-productives.

1- Supprimez vos consignes de vérification et de double contrôle

L’une des nouveautés associées nativement à Opus 5 concerne le contrôle : il contrôle son propre travail sans qu’on le lui demande.

Anthropic recommande donc de retirer les instructions du type « ajoute une étape de vérification finale » ou « relis ta réponse avant de répondre ».

La même logique vaut pour les workflows historiques tournant sur des outils comme n8n qui intégraient un noeud dédié à la vérification de l’output.

2- Demandez au modèle d’être concis (le seul choix de l’effort ne suffit plus)

Les réponses par défaut d’Opus 5 sont plus longues que celles des précédents modèles Opus.

Le paramètre effort pilote la quantité de réflexion, pas la longueur du texte visible. Baisser l’effort ne raccourcira donc pas de façon fiable la réponse affichée à l’utilisateur.

La bonne pratique consiste ainsi à ajouter une consigne de concision courte dans votre prompt système, et répétez-la brièvement à la fin s’il est long.

Même réflexe pour les livrables écrits : les fichiers que le modèle produit nativement sont plus volumineux qu’avant, et il faut calibrer leur longueur à la main.

3- Bornez le périmètre des tâches étroites

Opus 5 ne va pas nativement s’empêcher d’élargir le spectre initial. Si on pouvait parfois trouver Claude fainéant, ce nouveau modèle l’est en tout cas beaucoup moins, et il convient donc de mieux le cadrer !

Il ajoute des étapes non demandées, ou applique son propre jugement sur ce que devrait être la tâche.

Pour un périmètre restreint à réaliser, indiquez dans vos prompts de livrer exactement ce qui est demandé, de trancher seul les arbitrages de routine et de ne revenir vers vous que si deux lectures du brief mènent à des livrables différents.

4- Plafonnez la délégation aux sous-agents

Le modèle déclenche des sous-agents plus facilement que ses prédécesseurs, ce qui est bien dans certains cas, mais pas toujours le plus économique et efficace.

Sur des chantiers réellement parallélisables, le gain en temps de traitement des tâches est très intéressant.

Il est ainsi recommandé de décrire explicitement dans le CLAUDE.md ou le système prompt dans quels cas déléguer, et indiquer un plafond maximum sur le nombre d’agents lançables pour une seule et même tâche.

Précisez aussi de ne jamais utiliser un sous-agent pour vérifier son propre travail.

5- Pour la revue de code, ne filtrez surtout pas en amont

Pour les équipes techniques et les développeurs, si votre prompt de revue mentionnait « ne remonte que les problèmes critiques » ou « reste conservateur », Opus 5 obéira à la lettre.

Il fera alors le même travail d’investigation mais remontera moins de problèmes à corriger.

La bonne pratique documentée par Anthropic consiste donc à demander une couverture maximale, puis à filtrer les priorités dans une seconde passe.

Le réglage d’effort, votre vrai levier de coût sur Opus 5

Cinq niveaux sont disponibles : low, medium, high, xhigh et max.

Le défaut de l’API est high, et ne rien passer revient exactement à passer high.

Anthropic recommande de partir de ce défaut, puis d’ajuster selon vos propres besoins et vos propres tests :

  • Low et medium sont désormais à utiliser largement, dès que la qualité est conforme à vos attentes.
  • Montez à xhigh pour le code agentique exigeant et les runs longs.

Si vous avez repris les réglages d’un modèle antérieur, refaites un balayage complet des niveaux d’effort sur vos évaluations : les correspondances ne tiennent plus.

Trois détails techniques sont importants à connaître :

  • La réflexion est active par défaut, et elle ne peut pas être désactivée aux niveaux xhigh et max.
  • Changer d’effort en cours de conversation invalide le cache de prompt, donc fixez le niveau au début d’une session longue et ne changez pas en cours de route.
  • Enfin, aux niveaux xhigh et max, prévoyez un max_tokens large : 64 000 tokens est un point de départ raisonnable selon la documentation de Claude Platform.

Opus 5, Fable 5 ou Sonnet 5 : quel modèle pour quel usage ?

Désormais, le bon arbitrage ne se joue plus sur la performance des modèles sur les benchmarks mais sur le rapport qualité de l’output vs le coût de la tâche terminée.

Un modèle deux fois plus cher au token peut ainsi revenir moins cher s’il évite trois allers-retours et une relecture humaine plus approfondie.

Critère Claude Opus 5 Claude Fable 5 Claude Sonnet 5
Prix API (entrée / sortie par million de tokens) 5 $ / 25 $ 10 $ / 50 $ 3 $ / 15 $ (tarif de lancement 2 $ / 10 $ jusqu’au 31 août 2026)
Positionnement Anthropic Conçu pour l’usage quotidien, état de l’art sur le code et le travail intellectuel Classe Mythos, pour les problèmes trop complexes ou trop longs pour les autres modèles Le Sonnet le plus agentique à ce jour, pensé pour la production
Là où il gagne Code multi-fichiers, revue de code, tableurs et slides complexes, usage de l’ordinateur Runs autonomes de plusieurs heures ou jours, sujets ambigus à cadrer seul Volume, latence, extraction structurée, pipelines à comportement prévisible
Ce qu’il faut retirer de vos prompts Les consignes de vérification et de double contrôle Les skills trop prescriptives et les demandes d’expliquer son raisonnement Les paramètres temperature et top_p, refusés avec une erreur 400
Quand ne pas le choisir Pentest, génération d’exploits, scan sur binaires : bloqués par les classifieurs Tâches simples, tâches liées à la cybersécurité (elles seront bloquées) Tâches nécessitant un raisonnement approfondi

En clair : envoyez la plupart de vos tâches du quotidien sur Sonnet 5, les tâches plus exigeantes à Opus 5, et réservez Fable 5 aux chantiers vraiment complexes.

Ce raisonnement de rentabilité par modèle vaut d’ailleurs bien au-delà de la gamme Claude.

Notre verdict :

Opus 5 devient avec Sonnet 5 le choix par défaut raisonnable pour la majorité des workflows pros avancés, et Fable 5 redevient un outil de spécialiste. Le vrai chantier n’est pas de changer d’identifiant de modèle dans votre codebase ou vos workflows professionnel : c’est d’auditer vos prompts système et votre bibliothèque de prompts pour en retirer les consignes qui vous coûtent désormais plus d’argent qu’elles n’en vous rapportent en qualité d’output.

Ce que ça implique pour vos prompts déjà en production

La logique de fond dépasse largement Claude. Nos prompts système et bibliothèques personnelles de prompts accumulent depuis deux ans des béquilles écrites pour compenser les faiblesses de modèles qui n’existent souvent plus.

Les instructions de relecture, les rappels de format répétés trois fois, les étapes de contrôle manuelles : tout cela avait un sens en 2024.

Aujourd’hui, ces couches se cumulent avec le comportement natif du modèle et dégradent le rapport coût / qualité.

Le même travail de nettoyage s’impose sur les autres familles, comme le montrent les guides de prompting publiés côté GPT-5.

Un audit sérieux prend une demi-journée et se mesure sur vos propres workflows professionnels personnel.

Sans tests et audits ponctuels récurrents à chaque mise à jour de modèle, vous ne saurez jamais si une consigne vous aide ou vous coûte de l’argent.

Et vous, auditez-vous et améliorez-vous régulièrement vos anciens prompts pour qu’ils restent performants sur les derniers modèles ?

Un avis ? post

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *