Pourtant, le moins cher des deux gagne parfois : Sonnet 5.5, facturé 2 dollars le million de tokens d’entrée, marque 70,6 % sur Terminal-Bench 4.0 contre 66,4 % pour Opus 5.5 à 4 dollars. Les relevés n’utilisent pas le même effort : max pour Sonnet, xhigh pour Opus (Anthropic, 28 septembre 2026). Si chaque membre de votre équipe choisit son modèle au feeling, vous n’avez aucune cohérence de sortie d’un brief à l’autre.
Sonnet 5.5 prend les volumes réguliers : déclinaisons de contenu, résumés, classification de leads, agents outillés. Opus 5.5 vise les briefs ambigus et les audits multi-sources, ainsi que les visuels denses et les agents de longue durée. Fixez l’effort à la main : les deux modèles n’ont pas le même défaut.
Benchmarks : cinq scores, aucun sur la rédaction
Sonnet 5.5 est sorti le 28 septembre 2026, six jours après Opus 5.5. VentureBeat a relevé cinq scores comparables publiés pour les deux modèles. Sonnet 5.5 en gagne un et frôle un autre. Opus 5.5 garde l’avantage sur les trois restants, avec des écarts de 1,7 à 2,8 points.
| Benchmark | Sonnet 5.5 | Opus 5.5 | Lecture pour un marketeur |
|---|---|---|---|
| Terminal-Bench 4.0 | 70,6 % | 66,4 % | Travail en ligne de commande : utile si vos agents lancent des scripts |
| GDPval-AA | 1 844 | 1 846 | Travail intellectuel de bureau : match nul, 2 points d’écart |
| OSWorld 2.1 | 80,1 % | 81,8 % | Pilotage d’un poste de travail : agents qui manipulent des interfaces |
| Chartography | 61,6 % | 64,4 % | Lecture de graphiques : reporting depuis des captures de dashboards |
| CursorBench 4.0 | 55,5 % | 57,8 % | Code dans l’éditeur Cursor : peu de poids hors scripts d’automatisation |
Aucun de ces tests ne mesure de la rédaction marketing. Le plus proche d’un brief livré est GDPval-AA, qui ne départage pas les deux modèles. Anthropic prévient elle-même que ces scores ne remplacent pas un test sur votre charge réelle. Elle juge Opus 5.5 plus solide sur le travail ouvert et ambigu (d’après VentureBeat).
L’auteur du billet publié sur DEV Community lit ce calendrier comme une stratégie de volume : Anthropic ferait exprès de rapprocher son modèle intermédiaire du haut de gamme. Aucun document officiel ne mentionne ce motif. Anthropic présente Sonnet 5.5 comme le complément plus rapide et moins cher d’Opus 5.5. L’intention prêtée reste invérifiable.
Prix, cache et batch : là où l’écart se creuse
Le tableau reprend la grille tarifaire officielle d’Anthropic consultée le 30 septembre 2026. Opus 5.5 coûte 20 % de moins qu’Opus 5 (4 et 20 dollars contre 5 et 25). Sonnet 5.5 garde le tarif de Sonnet 5, devenu définitif après une hausse annoncée puis annulée.
| Critère | Sonnet 5.5 | Opus 5.5 |
|---|---|---|
| Entrée / sortie | 2 / 10 | 4 / 20 |
| Écriture en cache (5 minutes) | 2,50 | 5 |
| Lecture en cache | 0,20 | 0,20 |
| Batch : entrée / sortie | 1 / 5 | 2 / 10 |
| Mode rapide (fast mode) | Non listé | 8 / 40 (aperçu de recherche) |
| Context window / sortie max | 1 M / 128 K tokens | 1 M / 128 K tokens |
| Latence relative | Rapide | Modérée |
| Effort par défaut | high |
medium |
| ID d’API | claude-sonnet-5-5 |
claude-opus-5-5 |
Une ligne surprend : la lecture en prompt caching coûte 0,20 dollar sur les deux modèles. Un system prompt de 20 000 tokens (charte éditoriale, exemples de ton) relu 1 000 fois représente 20 millions de tokens, soit 4 dollars sur chaque modèle. L’avantage de Sonnet se concentre donc sur la sortie et sur l’entrée non cachée. Le cache démarre à 512 tokens sur les deux.
Un calcul sur les tarifs de liste, avec des volumes hypothétiques : 500 déclinaisons par mois, 3 000 tokens en entrée et 1 500 en sortie chacune. Cela fait 1,5 million de tokens en entrée et 0,75 million en sortie. Sonnet 5.5 revient à 10,50 dollars (3 + 7,50), Opus 5.5 à 21 dollars (6 + 15). En batch : 5,25 et 10,50 dollars. À ce volume l’écart reste symbolique. À 50 000 tâches par mois il passe à 1 050 dollars contre 2 100. Ce calcul ignore les tokens de réflexion, qui dépendent de l’effort choisi.
Régler l’effort avant de comparer
Un test lancé sans réglage compare Sonnet 5.5 à l’effort high avec Opus 5.5 à l’effort medium. C’est le défaut de chaque modèle d’après la documentation Anthropic. Pour Sonnet 5.5, la documentation conseille de partir de medium sur les tâches agentiques bien définies et de medium ou low sur le chat. Les niveaux ont été recalibrés depuis Sonnet 5 : refaites votre balayage. La réflexion compte dans max_tokens même quand elle n’est pas renvoyée.
Choisir par tâche marketing
Anthropic recommande de partir d’Opus 5.5 quand la tâche est complexe puis de descendre : baisser l’effort ou passer à Sonnet 5.5 une fois le workflow stabilisé. Pour un volume régulier, la démarche inverse fonctionne aussi : partir de Sonnet 5.5 et n’escalader que les échecs.
Sonnet 5.5, effort medium au départ :
- déclinaison d’un article validé en posts LinkedIn, newsletters et variantes de titres
- résumé de transcriptions d’appels commerciaux
- classification et enrichissement de leads via un MCP server branché sur le CRM
- rapports récurrents produits depuis des exports de campagnes
Opus 5.5, effort medium puis high :
- audit de positionnement croisant de nombreuses sources concurrentes
- lecture de dashboards et de captures denses : la documentation Anthropic indique qu’Opus 5.5 lit les valeurs des graphiques denses avec plus de précision
- brief flou où la reformulation du besoin fait partie du travail
- agents de longue durée, cible affichée du modèle pour le travail de connaissance
Si vos évaluations sur Opus 5.5 à xhigh ou max restent insuffisantes, Anthropic oriente vers Fable 5.1, traité dans notre article sur ce modèle pour le marketing de contenu. Le découpage par tâche, avec les économies qu’il permet, est détaillé dans le guide de migration modèle par tâche. Ces affectations restent des hypothèses à vérifier sur vos propres briefs.
Les erreurs 400 et le fil de raisonnement perdu
Les deux modèles refusent le tool use forcé : un tool_choice de type any ou tool renvoie une erreur 400. Un scénario n8n ou Make qui force un appel d’outil pour obtenir du JSON casse à la migration. Gardez auto et ajoutez strict: true. Les sorties structurées offrent l’autre voie. Autre écart : thinking: disabled renvoie aussi une 400 sur Opus 5.5, où la réflexion reste toujours active. Sur Sonnet 5.5, le réglage le plus bas s’appelle between_tools et fonctionne jusqu’à l’effort high.
Le second piège touche les conversations longues. Chaque bloc de réflexion est lié au modèle qui l’a produit : aucun des deux ne lit les blocs de l’autre. Si vous escaladez de l’un à l’autre en cours de fil, la requête réussit mais le raisonnement précédent disparaît. Anthropic ne facture pas les blocs écartés. Escaladez au début d’une nouvelle tâche ou transmettez un résumé écrit. Sur les comptes créés depuis le 31 août 2026, modifier l’historique avant un bloc rejoué provoque une 400 : gardez le fil en ajout seul.
Pour combiner les deux, l’advisor tool (bêta) accepte Opus 5.5 comme conseiller d’un exécutant Sonnet 5.5. Les conseils reviennent chiffrés dans un bloc advisor_redacted_result : votre application ne peut pas les lire. Une interface qui affiche les notes d’avancement de l’agent reste muette entre deux appels d’outils tant que thinking.display n’est pas réglé.
Tester sur vos briefs
Box a mesuré Sonnet 5.5 2,4 fois plus rapide que le modèle précédent, avec 12 % de tokens en moins, sur ses propres tâches (Yashodha Bhavnani, VP of AI Products, cité par Anthropic). Vos chiffres seront différents. Mesurez-les :
- prélevez 20 briefs déjà livrés, avec la version validée par votre éditeur
- figez le system prompt, les outils et un
max_tokensavec de la marge pour la réflexion - lancez 4 configurations : Sonnet 5.5 et Opus 5.5, chacun à
mediumpuis àhigh - relevez les tokens de sortie totaux, le coût par livrable accepté et le temps de retouche humaine
- faites noter les textes à l’aveugle par un éditeur qui ignore le modèle utilisé
Le contexte partagé se fixe avant le test : system prompt commun, CLAUDE.md d’équipe, permissions. Les réglages sont décrits dans le setup Claude des 7 réglages du premier jour. Sans base commune, l’écart mesuré entre deux modèles se mélange à l’écart entre deux rédacteurs.
Verdict par profil
- Équipe contenu à volume : Sonnet 5.5 à
medium, en batch (1 et 5 dollars le million) pour tout ce qui n’est pas urgent. - Consultant qui livre peu de documents très denses : Opus 5.5 à
high, avec le cache activé sur les corpus relus souvent. - Équipe qui construit des agents CRM ou reporting : Sonnet 5.5 en exécutant, Opus 5.5 en conseiller via l’advisor tool, après test sur vos données.
- Tâche où les deux échouent : Fable 5.1 à 10 et 50 dollars le million.
Le routage automatique entre les deux modèles depuis un scénario n8n, avec repli sur Opus 5.5 quand Sonnet 5.5 échoue, mérite son propre guide.