Skip to content
research

Anthropic vient de détrôner le roi

Peu après avoir appelé à un ralentissement, Anthropic a lancé un modèle explosif qui écrase les benchmarks. Ce n'est pas seulement mieux, cela change radicalement l'économie de l'IA agentique.

Aki Tanaka
Anthropic vient de détrôner le roi

Le nouveau roi du code et du travail intellectuel

Anthropic vient de dévoiler Opus 5.5, sa première version de modèle majeure depuis que le cofondateur Dario Amodei a publiquement appelé à « modérer la frontière » du développement de l'IA. Cette sortie présente un paradoxe industriel immédiat : Opus 5.5 n'apparaît pas comme une étape prudente, mais comme un modèle de pointe absolu, redéfinissant agressivement les capacités de l'état de l'art.

Opus 5.5 mène désormais l'industrie, surpassant de manière décisive les précédents concurrents de premier plan comme Fable 5.1 et GPT-6 Astra lors d'évaluations critiques. Sur Terminal-Bench 4.0, un benchmark de référence pour le codage agentique qui mesure la capacité d'un modèle à exécuter des commandes de terminal de manière autonome, Opus 5.5 a atteint un score impressionnant de 66,0 %. Cela marque un bond significatif de 10 points par rapport aux 57,9 % d'Astra et aux 55,8 % de Fable 5.1, signalant une nouvelle ère pour le développement piloté par l'IA.

Ses capacités s'étendent largement au-delà du code. Pour les tâches complexes de connaissances réelles, Opus 5.5 domine le benchmark GDPVal version 2.1 d'OpenAI. Il a obtenu un score Elo de 1846, dépassant largement les 1735 de Fable 5.1 et les 1542 de GPT-6 Astra. Ce bond remarquable de 300 points Elo signifie une performance inégalée dans diverses tâches professionnelles, notamment la création de PowerPoint, la saisie de données et l'envoi d'e-mails, établissant une nouvelle barre formidable pour l'utilité de l'IA dans le travail intellectuel.

Écraser les benchmarks là où ça compte

Opus 5.5 a fait un bond massif sur Terminal-Bench 4.0, une mesure critique de la maîtrise de la ligne de commande et du codage. Il a atteint un score sans précédent de 66,0 %, démontrant des compétences supérieures en codage agentique. Ce chiffre représente un bond de plus de 10 points par rapport au précédent leader, Fable 5.1, qui a obtenu 55,8 %, et a nettement surpassé les 57,9 % de GPT-6 Astra.

Opus 5.5 a également démontré ses prouesses dans le travail intellectuel réel, enregistrant un score Elo stupéfiant de 1846 sur le benchmark GDPVal 2.1 d'OpenAI. Cela marque un bond de plus de 300 points Elo par rapport au précédent meilleur score de 1735 de Fable 5.1. GDPVal mesure les performances sur des tâches essentielles telles que :

  • La création de PowerPoint
  • La saisie de données
  • Le traitement de texte
  • L'envoi d'e-mails

Bien qu'Opus 5.5 ait remporté des victoires dominantes dans ces domaines agentiques cruciaux, ses performances sur d'autres benchmarks ont montré des résultats comparables, plutôt qu'écrasants. Par exemple, il a atteint 40 % sur Automation Bench, légèrement derrière les 41,4 % d'Astra, et 54,4 % sur Frontier Code V1.1, s'alignant étroitement sur les 53,3 % d'Astra. Ce ciblage stratégique des benchmarks clés du codage et du travail intellectuel souligne son accent sur les capacités agentiques les plus percutantes.

Plus rapide, moins cher, plus intelligent : le trio gagnant de l'efficacité

Opus 5.5 introduit un ajustement tarifaire notable, réduisant les coûts par jeton d'environ 20 %. Les jetons d'entrée coûtent désormais 4 $ par million, contre 5 $ pour Opus 5, les jetons de sortie diminuant de la même manière de 25 $ à 20 $ par million. Surtout, cette économie au niveau des jetons se traduit par une valeur bien plus grande si l'on considère la véritable mesure de l'efficacité : le coût par tâche accomplie.

La dernière version d'Anthropic permet une réduction totale des coûts de 40 % sur les charges de travail typiques par rapport à Opus 5. Ce gain d'efficacité significatif découle de la densité d'intelligence accrue d'Opus 5.5, ce qui signifie qu'il nécessite moins de jetons pour parvenir à une conclusion de haute qualité. De plus, le modèle accélère l'achèvement des tâches, générant des résultats plus de 30 % plus rapidement que son prédécesseur.

Ces facteurs combinés positionnent Opus 5.5 comme un leader en matière de rapport performance-coût. Les analyses de référence, y compris celles pour Automation Bench et Frontier Code, placent systématiquement le modèle dans le « quadrant supérieur gauche » optimal des graphiques qualité-coût. Cela signifie l'obtention de la meilleure qualité possible pour le coût par tâche le plus bas, un avantage crucial pour les déploiements d'IA évolutifs.

Une telle efficacité transforme l'économie opérationnelle, offrant aux développeurs et aux entreprises une valeur inégalée. La capacité du modèle à fournir des résultats de pointe à une fraction des coûts précédents redéfinit la viabilité économique des flux de travail complexes pilotés par l'IA. Pour une analyse plus approfondie de ces mesures de performance, consultez les détails officiels de la version : Introducing Claude Opus 5.5 - Anthropic.

Cet article vous plaît ? Recevez-en un comme celui-ci chaque matin.

un e-mail par jour · désinscription en deux clics · aucun traqueur tiers

Au-delà de la vitesse : une IA plus sûre et plus utilisable

Opus 5.5 affine son interface avec les utilisateurs, offrant une communication plus naturelle et concise. Cette amélioration réduit la charge cognitive nécessaire pour gérer des tâches complexes, rendant l'orchestration de multiples agents parallèles nettement plus efficace. Le style conversationnel raffiné du modèle se traduit directement par une collaboration humain-IA plus fluide et plus intuitive.

Anthropic a également renforcé la sécurité et l'alignement du modèle, un objectif critique pour l'IA de pointe. Opus 5.5 démontre une résistance accrue au prompt injection, une vulnérabilité omniprésente où des entrées malveillantes peuvent outrepasser les instructions prévues. De plus, le modèle a été rigoureusement testé contre des « tâches impossibles », conçues pour détecter des comportements trompeurs ou de la « triche » de la part de l'IA, garantissant que ses résultats restent fondés et véridiques.

Surtout, Opus 5.5 introduit des dual-use safeguards robustes pour ses capacités les plus sensibles, en particulier dans les domaines de la biologie et de la cybersécurité. L'accès à ces fonctions avancées nécessite une vérification de l'utilisateur, une mesure proactive pour atténuer les risques d'utilisation abusive. Cette approche d'accès par paliers établit une nouvelle norme pour un déploiement responsable, suscitant d'importantes discussions sur la gouvernance et la trajectoire future des modèles de pointe open-source.

Foire aux questions

Qu'est-ce que Claude Opus 5.5 ?

Claude Opus 5.5 est le tout dernier modèle d'IA de pointe d'Anthropic. Il offre des performances de pointe, notamment en matière de codage et de travail intellectuel, tout en étant plus rapide et plus rentable que son prédécesseur.

Comment Opus 5.5 s'améliore-t-il par rapport aux modèles précédents ?

Opus 5.5 affiche des gains de performance massifs sur des benchmarks clés comme Terminal Bench (codage agentique) et GDPVal (travail intellectuel), surpassant significativement des modèles comme Fable 5.1 et GPT-6 Astra dans ces domaines.

Claude Opus 5.5 est-il moins cher à utiliser ?

Oui. Bien que le prix par jeton soit environ 20 % inférieur à celui d'Opus 5, son efficacité accrue signifie qu'il accomplit des charges de travail typiques pour un coût jusqu'à 40 % inférieur. Ceci est mesuré par la métrique plus importante du « coût par tâche ».

Quels sont les principaux cas d'utilisation d'Opus 5.5 ?

Ses performances exceptionnelles le rendent idéal pour des tâches agentiques complexes telles que le codage, le développement logiciel et le travail intellectuel avancé comme l'analyse de données, la recherche et l'automatisation des tâches de bureau.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$500 · AI tools & software only

Pour les builders

Cette page travaille pour l’outil de quelqu’un d’autre.

Les agents IA la lisent. Des acheteurs y arrivent. Elle répond en huit langues et via MCP. Votre outil peut avoir la sienne — en ligne en 24 heures.