Claude Sonnet 5.5 vs Opus 5.5 : quel modèle choisir pour le marketing

Affiches Claude Sonnet et Opus 5.5 dans le métro
Claude s’affiche dans le métro avec Sonnet 5.5 et Opus 5.5.

Pourtant, le moins cher des deux gagne parfois : Sonnet 5.5, facturé 2 dollars le million de tokens d’entrée, marque 70,6 % sur Terminal-Bench 4.0 contre 66,4 % pour Opus 5.5 à 4 dollars. Les relevés n’utilisent pas le même effort : max pour Sonnet, xhigh pour Opus (Anthropic, 28 septembre 2026). Si chaque membre de votre équipe choisit son modèle au feeling, vous n’avez aucune cohérence de sortie d’un brief à l’autre.

Sonnet 5.5 prend les volumes réguliers : déclinaisons de contenu, résumés, classification de leads, agents outillés. Opus 5.5 vise les briefs ambigus et les audits multi-sources, ainsi que les visuels denses et les agents de longue durée. Fixez l’effort à la main : les deux modèles n’ont pas le même défaut.

Benchmarks : cinq scores, aucun sur la rédaction

Sonnet 5.5 est sorti le 28 septembre 2026, six jours après Opus 5.5. VentureBeat a relevé cinq scores comparables publiés pour les deux modèles. Sonnet 5.5 en gagne un et frôle un autre. Opus 5.5 garde l’avantage sur les trois restants, avec des écarts de 1,7 à 2,8 points.

Scores publiés au lancement de Sonnet 5.5, 28 septembre 2026
Benchmark Sonnet 5.5 Opus 5.5 Lecture pour un marketeur
Terminal-Bench 4.0 70,6 % 66,4 % Travail en ligne de commande : utile si vos agents lancent des scripts
GDPval-AA 1 844 1 846 Travail intellectuel de bureau : match nul, 2 points d’écart
OSWorld 2.1 80,1 % 81,8 % Pilotage d’un poste de travail : agents qui manipulent des interfaces
Chartography 61,6 % 64,4 % Lecture de graphiques : reporting depuis des captures de dashboards
CursorBench 4.0 55,5 % 57,8 % Code dans l’éditeur Cursor : peu de poids hors scripts d’automatisation

Aucun de ces tests ne mesure de la rédaction marketing. Le plus proche d’un brief livré est GDPval-AA, qui ne départage pas les deux modèles. Anthropic prévient elle-même que ces scores ne remplacent pas un test sur votre charge réelle. Elle juge Opus 5.5 plus solide sur le travail ouvert et ambigu (d’après VentureBeat).

L’auteur du billet publié sur DEV Community lit ce calendrier comme une stratégie de volume : Anthropic ferait exprès de rapprocher son modèle intermédiaire du haut de gamme. Aucun document officiel ne mentionne ce motif. Anthropic présente Sonnet 5.5 comme le complément plus rapide et moins cher d’Opus 5.5. L’intention prêtée reste invérifiable.

Prix, cache et batch : là où l’écart se creuse

Le tableau reprend la grille tarifaire officielle d’Anthropic consultée le 30 septembre 2026. Opus 5.5 coûte 20 % de moins qu’Opus 5 (4 et 20 dollars contre 5 et 25). Sonnet 5.5 garde le tarif de Sonnet 5, devenu définitif après une hausse annoncée puis annulée.

Tarifs et caractéristiques de Claude Sonnet 5.5 et Opus 5.5 (par million de tokens, en dollars)
Critère Sonnet 5.5 Opus 5.5
Entrée / sortie 2 / 10 4 / 20
Écriture en cache (5 minutes) 2,50 5
Lecture en cache 0,20 0,20
Batch : entrée / sortie 1 / 5 2 / 10
Mode rapide (fast mode) Non listé 8 / 40 (aperçu de recherche)
Context window / sortie max 1 M / 128 K tokens 1 M / 128 K tokens
Latence relative Rapide Modérée
Effort par défaut high medium
ID d’API claude-sonnet-5-5 claude-opus-5-5

Une ligne surprend : la lecture en prompt caching coûte 0,20 dollar sur les deux modèles. Un system prompt de 20 000 tokens (charte éditoriale, exemples de ton) relu 1 000 fois représente 20 millions de tokens, soit 4 dollars sur chaque modèle. L’avantage de Sonnet se concentre donc sur la sortie et sur l’entrée non cachée. Le cache démarre à 512 tokens sur les deux.

Un calcul sur les tarifs de liste, avec des volumes hypothétiques : 500 déclinaisons par mois, 3 000 tokens en entrée et 1 500 en sortie chacune. Cela fait 1,5 million de tokens en entrée et 0,75 million en sortie. Sonnet 5.5 revient à 10,50 dollars (3 + 7,50), Opus 5.5 à 21 dollars (6 + 15). En batch : 5,25 et 10,50 dollars. À ce volume l’écart reste symbolique. À 50 000 tâches par mois il passe à 1 050 dollars contre 2 100. Ce calcul ignore les tokens de réflexion, qui dépendent de l’effort choisi.

Régler l’effort avant de comparer

Un test lancé sans réglage compare Sonnet 5.5 à l’effort high avec Opus 5.5 à l’effort medium. C’est le défaut de chaque modèle d’après la documentation Anthropic. Pour Sonnet 5.5, la documentation conseille de partir de medium sur les tâches agentiques bien définies et de medium ou low sur le chat. Les niveaux ont été recalibrés depuis Sonnet 5 : refaites votre balayage. La réflexion compte dans max_tokens même quand elle n’est pas renvoyée.

Choisir par tâche marketing

Anthropic recommande de partir d’Opus 5.5 quand la tâche est complexe puis de descendre : baisser l’effort ou passer à Sonnet 5.5 une fois le workflow stabilisé. Pour un volume régulier, la démarche inverse fonctionne aussi : partir de Sonnet 5.5 et n’escalader que les échecs.

Sonnet 5.5, effort medium au départ :

  • déclinaison d’un article validé en posts LinkedIn, newsletters et variantes de titres
  • résumé de transcriptions d’appels commerciaux
  • classification et enrichissement de leads via un MCP server branché sur le CRM
  • rapports récurrents produits depuis des exports de campagnes

Opus 5.5, effort medium puis high :

  • audit de positionnement croisant de nombreuses sources concurrentes
  • lecture de dashboards et de captures denses : la documentation Anthropic indique qu’Opus 5.5 lit les valeurs des graphiques denses avec plus de précision
  • brief flou où la reformulation du besoin fait partie du travail
  • agents de longue durée, cible affichée du modèle pour le travail de connaissance

Si vos évaluations sur Opus 5.5 à xhigh ou max restent insuffisantes, Anthropic oriente vers Fable 5.1, traité dans notre article sur ce modèle pour le marketing de contenu. Le découpage par tâche, avec les économies qu’il permet, est détaillé dans le guide de migration modèle par tâche. Ces affectations restent des hypothèses à vérifier sur vos propres briefs.

Les erreurs 400 et le fil de raisonnement perdu

Les deux modèles refusent le tool use forcé : un tool_choice de type any ou tool renvoie une erreur 400. Un scénario n8n ou Make qui force un appel d’outil pour obtenir du JSON casse à la migration. Gardez auto et ajoutez strict: true. Les sorties structurées offrent l’autre voie. Autre écart : thinking: disabled renvoie aussi une 400 sur Opus 5.5, où la réflexion reste toujours active. Sur Sonnet 5.5, le réglage le plus bas s’appelle between_tools et fonctionne jusqu’à l’effort high.

Le second piège touche les conversations longues. Chaque bloc de réflexion est lié au modèle qui l’a produit : aucun des deux ne lit les blocs de l’autre. Si vous escaladez de l’un à l’autre en cours de fil, la requête réussit mais le raisonnement précédent disparaît. Anthropic ne facture pas les blocs écartés. Escaladez au début d’une nouvelle tâche ou transmettez un résumé écrit. Sur les comptes créés depuis le 31 août 2026, modifier l’historique avant un bloc rejoué provoque une 400 : gardez le fil en ajout seul.

Pour combiner les deux, l’advisor tool (bêta) accepte Opus 5.5 comme conseiller d’un exécutant Sonnet 5.5. Les conseils reviennent chiffrés dans un bloc advisor_redacted_result : votre application ne peut pas les lire. Une interface qui affiche les notes d’avancement de l’agent reste muette entre deux appels d’outils tant que thinking.display n’est pas réglé.

Tester sur vos briefs

Box a mesuré Sonnet 5.5 2,4 fois plus rapide que le modèle précédent, avec 12 % de tokens en moins, sur ses propres tâches (Yashodha Bhavnani, VP of AI Products, cité par Anthropic). Vos chiffres seront différents. Mesurez-les :

  • prélevez 20 briefs déjà livrés, avec la version validée par votre éditeur
  • figez le system prompt, les outils et un max_tokens avec de la marge pour la réflexion
  • lancez 4 configurations : Sonnet 5.5 et Opus 5.5, chacun à medium puis à high
  • relevez les tokens de sortie totaux, le coût par livrable accepté et le temps de retouche humaine
  • faites noter les textes à l’aveugle par un éditeur qui ignore le modèle utilisé

Le contexte partagé se fixe avant le test : system prompt commun, CLAUDE.md d’équipe, permissions. Les réglages sont décrits dans le setup Claude des 7 réglages du premier jour. Sans base commune, l’écart mesuré entre deux modèles se mélange à l’écart entre deux rédacteurs.

Verdict par profil

  • Équipe contenu à volume : Sonnet 5.5 à medium, en batch (1 et 5 dollars le million) pour tout ce qui n’est pas urgent.
  • Consultant qui livre peu de documents très denses : Opus 5.5 à high, avec le cache activé sur les corpus relus souvent.
  • Équipe qui construit des agents CRM ou reporting : Sonnet 5.5 en exécutant, Opus 5.5 en conseiller via l’advisor tool, après test sur vos données.
  • Tâche où les deux échouent : Fable 5.1 à 10 et 50 dollars le million.

Le routage automatique entre les deux modèles depuis un scénario n8n, avec repli sur Opus 5.5 quand Sonnet 5.5 échoue, mérite son propre guide.

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *