Par Tamsi Besson ·
Opus 5.5 et Sonnet 5.5 — le jugement d’un côté, le débit de l’autre
Opus 5.5 (22 septembre) au niveau de Fable 5.1, 40 % moins cher qu’Opus 5. Sonnet 5.5 (28 septembre) au tarif de Sonnet 5, 30 % plus rapide, collé à Opus sur le travail cadré.
- Claude
- Opus
- Sonnet
- Anthropic
- Agents
En six jours, Anthropic a posé les deux premiers modèles de la famille Claude 5.5. Opus 5.5 le 22 septembre, Sonnet 5.5 le 28. Opus est la première sortie depuis l’appel à ralentir la frontière : le labo le place au niveau de Fable 5.1 sur la plupart du travail, 40 % moins cher à servir qu’Opus 5. Sonnet est le complément — tâches cadrées, bugs, documents, slides, tableurs, et un œil pour le design. Haiku 5.5 est nommé pour les semaines qui viennent, sans prix ni identifiant public. Les marges de bench, à ce niveau, sont un guide fragile : l’annonce Opus dit que l’écart ressenti avec Fable est plus étroit que les scores. Je lis les tableaux comme un plafond vendeur, effort et garde-fous inclus.
Prix et vitesse
Par million de tokens. Opus 5.5 : entrée 4 $, sortie 20 $, lectures de cache 0,20 $, écritures 5 $. Opus 5 était à 5 $ / 25 $ / 0,50 $ / 6,25 $. Le mode rapide d’Opus (jusqu’à 2,5×, Claude Code et la Platform) passe à 8 $ / 40 $. Sonnet 5.5 : entrée 2 $, sortie 10 $, lectures de cache 0,20 $, écritures 2,50 $. Entrée, sortie et lectures de cache reprennent la grille de Sonnet 5.
- Charge typique : Opus 5.5 coûte 40 % de moins qu’Opus 5 (token moins cher, et moins de tokens par tâche). Sonnet 5.5 coûte jusqu’à 30 % de moins par tâche que Sonnet 5, surtout parce qu’il écrit moins.
- Les deux génèrent plus de 30 % plus vite que leur prédécesseur. Sonnet 5.5 est le Sonnet le plus rapide à ce jour.
- Les lectures de cache, qui dominent la facture d’un agent de code, sont au même prix : 0,20 $. L’écart qui reste, c’est l’entrée, la sortie, et les écritures de cache (2,50 $ contre 5 $).
- Avec Opus, Anthropic relève les plafonds de cinq heures sur Pro, Max, Team, et sur l’Enterprise facturé au siège, plus un reset de rate limit à garder pour plus tard.
Code
Sur plusieurs evals, Sonnet 5.5 à effort max se tient à côté d’Opus. Anthropic ajoute que, dans ses tests et ceux des testeurs externes, Opus reste nettement plus fort dès que le travail est ouvert et qu’il faut tenir un jugement. Le défaut dans Claude Code et les apps est Medium ; sur la Platform, c’est High. Sonnet complète Opus surtout aux efforts bas. Aux efforts hauts, scores et coût se rapprochent.
- Terminal-Bench 4.0 : Sonnet 5.5 70,6 % · Opus 5.5 xhigh 66,4 % · Astra high 57,9 % · Fable 55,8 % · Opus 5 52,3 % · Sonnet 5 10,3 %. The New Stack rapporte que les mainteneurs du bench ont vu Sonnet 5 buter sur des timeouts et des limites de tokens, ce qui aide à lire le 10,3 %.
- FrontierCode v1.1 (le diff serait-il mergé, hors-scope pénalisé) : Opus 54,4 % max / 54,6 % medium, au-dessus du meilleur Astra publié (53,3 %) pour environ un cinquième du coût. Sonnet 52,1 % xhigh / 46,2 % max · GPT-6 Sol 49,3 % · Sonnet 5 42,4 %. Le max sous le xhigh est documenté : à max, Sonnet lance plus souvent la revue Claude Code en sous-agents. Dans deux cas vus par Cognition, timeout ou edits hors sujet.
- CursorBench 4.0 : Opus 57,8 % max / 52,5 % medium · Sonnet 55,5 % · Fable max 51,8 % · Opus 5 max 46,6 % · Sonnet 5 34,1 %.
- Coût annoncé : à effort high, Sonnet prend 10 points à Sonnet 5 sur FrontierCode pour environ un quinzième du coût. À effort low sur CursorBench, et à effort medium sur Terminal-Bench, il dépasse le meilleur Sonnet 5 pour moins d’un dixième du coût.
Ordres de grandeur cités par Anthropic, pas des mesures à moi. Migration de 680 000 lignes en moins d’une journée avec Opus 5.5. Audit de 200 000 lignes sous trois heures, là où Opus 5 prenait plus de 20 heures et 2,5× plus de tokens. HAProxy réécrit de C vers Rust : presque toute la non-régression chez Opus 5.5 et Fable, Opus en 9,5 h contre 12 h, 51 % moins cher. Chez Lovable, sur 118 builds, Sonnet 5.5 arrive au niveau d’Opus 5 en 3,6 itérations en moyenne, contre 7,7.
Travail de connaissance
- GDPval-AA v2.1 (44 métiers) : Opus 1846 Elo · Sonnet 1844 · Fable 1735 · Opus 5 1708 · Sonnet 5 1449.
- AA-Briefcase v1.1 : Opus 1822 · Sonnet 1811 · Sonnet 5 1359.
- Humanity’s Last Exam, avec outils : Opus 67,7 % · Fable 65,6 % · Sonnet 64,5 % · Sonnet 5 54,9 %.
- OSWorld, partiel : Opus 81,8 % (2.0 dans son annonce, 2.1 dans le tableau Sonnet) · Sonnet 80,1 % sur 2.1 · Sonnet 5 57,0 % · Opus 5 74,0 % sur 2.0.
- Chartography sans outils : Opus 64,4 % · Sonnet 61,6 % · Sonnet 5 15,6 %. Avec outils, Opus annonce 89,0 %.
- Là où Opus 5.5 n’est pas devant : Terminal-Bench-Science 0.1, Astra 64,6 % contre Opus 58,7 % (pas de chiffre Sonnet 5.5). AutomationBench, Astra 41,4 % contre Opus 40,0 % — et ce 40 % est un plancher, une intervention des garde-fous compte comme un échec.
Sonnet 5.5 est aussi le premier Sonnet à finir Pokémon Red à partir des seules captures d’écran. Les deux 5.5 écrivent plus clairement que la génération d’avant : l’info importante d’abord, moins de jargon. Sur une session longue, ça pèse autant que deux points de CursorBench.
Garde-fous
Opus 5.5 a le meilleur score à ce jour sur l’audit comportemental d’Anthropic. Moins enclin aux actions difficiles à annuler, plus résistant qu’Opus 5 à l’injection de prompt — à égalité avec Fable chez Gray Swan pour le plus bas taux de succès. Évalué avant la sortie par Frontier Design et METR. Bio et cyber comparables à Mythos 5.1, donc safeguards du calibre de Fable. Life Sciences Verification est ouvert ; Cyber Verification s’élargit dans les semaines qui viennent. Les benches d’Opus tournent avec ces safeguards : s’ils interviennent, le cyber est fini par Opus 4.8, la bio et le développement de LLM frontier par Opus 5. Anthropic dit que ça baisse probablement les scores.
Sonnet 5.5 n’avance pas la frontière des capacités du labo. Sur ~1 850 scénarios, il est au niveau ou au-dessus de Sonnet 5 sur la plupart des mesures d’alignement. C’est le modèle Anthropic le moins enclin à sonder son conteneur, et il s’approche d’Opus pour la rareté des sorties de sandbox. Cyber au niveau d’Opus 5 : premier Sonnet avec ces safeguards, et les requêtes à haut risque retombent sur Sonnet 5. La bio reste celle de Sonnet 5. Premier Sonnet aussi avec des classifieurs anti-distillation et un preserved thinking élargi : le raisonnement reste attaché au compte qui l’a produit.
Comment je les répartis
Je n’ai pas encore rejoué mes boucles (revue, refactors, MCP) sur les deux identifiants. Le découpage est une lecture des annonces.
- Sonnet 5.5 en low ou medium : bugs cadrés, revue, docs, slides, UI. C’est là que le 2 $ / 10 $ et le débit se voient.
- Opus 5.5 : migrations, audits, nuits multi-dépôts, jugement quand la spec est floue.
- Si Sonnet est déjà en xhigh ou max et que la facture rejoint Opus, je bascule. Le 70,6 % de Terminal-Bench ne remplace pas cette bascule.
- API :
claude-sonnet-5-5. Si le thinking était coupé, passer àbetween_toolsavant de migrer. Les deux sont sur AWS, Google Cloud et Azure, avec zero data retention.
Bilan
Un flagship qui redescend en coût, un modèle du quotidien qui monte au score. Opus 5.5 fait le travail de Fable sur la plupart des tâches, plus vite, 40 % moins cher qu’Opus 5, devant sur le coding agentique, le computer use et GDPval — Astra reste devant sur AutomationBench et Terminal-Bench-Science. Sonnet 5.5 garde la grille de Sonnet 5, écrit moins, répond 30 % plus vite, et colle Opus sur GDPval, CursorBench et OSWorld. Le jugement long reste chez Opus. Haiku 5.5 dira si le bas de la gamme suit.
- Opus 5.5 : https://www.anthropic.com/claude-opus-5-5
- Sonnet 5.5 : https://www.anthropic.com/claude-sonnet-5-5