Claude Code a été conçu pour les développeurs qui aiment avoir le contrôle. Directement depuis le terminal, il pouvait chercher et lire du code, modifier des fichiers, lancer des tests et pousser des modifications sur GitHub . L'adoption a été immédiate. Dès mars 2025, l'outil s'enrichissait du support du glisser-déposer d'images et de la mention de fichiers. En avril 2025, il apprenait à persister et à reprendre les sessions, conservant le contexte d'une session à l'autre
. La version 0.2.x, peaufinée jusqu'à la sortie officielle le 22 mai 2025, a stabilisé l'expérience pour un usage professionnel
.
Si Claude Code est l'interface, les modèles Claude Opus en sont le cerveau. Chaque nouvelle génération a apporté un bond en avant significatif dans les capacités de codage et de raisonnement.
Présenté comme le meilleur modèle au monde pour le codage, les agents et l'utilisation d'ordinateur, Opus 4.5 a posé les fondations de ce qui allait devenir la plateforme de référence .
Cette version a apporté des améliorations cruciales : une meilleure planification, une fiabilité accrue sur les tâches de longue durée et une capacité à opérer sur des bases de code volumineuses. Son innovation majeure ? L'introduction en version bêta d'une fenêtre de contexte d'un million de jetons (tokens), une première pour la gamme Opus .
C'est avec Opus 4.7 que le monde de la tech a vraiment mesuré l'avance d'Anthropic. D'un seul bond, le score sur SWE-bench Verified est passé de 80,8 % à 87,6 % (en mode adaptatif). Sur le benchmark plus exigeant SWE-bench Pro, le score a grimpé de 53,4 % à 64,3 %, creusant un écart de plus de dix points avec le concurrent le plus proche . Cette prouesse a été rendue possible par la « pensée adaptative », qui alloue dynamiquement la puissance de calcul en fonction de la complexité de la tâche, et par la généralisation de la fenêtre de contexte d'un million de jetons
.
La dernière itération ne cherche pas à révolutionner, mais à raffiner. Opus 4.8 améliore le score SWE-bench Pro de 64,3 % à 69,2 %, mais son apport le plus notable est ailleurs. Anthropic a annoncé que le modèle est quatre fois moins susceptible de laisser passer des erreurs dans le code qu'il génère. Les testeurs ont également rapporté une plus grande honnêteté intellectuelle : le modèle signale davantage ses incertitudes et évite les affirmations non étayées . Cerise sur le gâteau, un « Mode Rapide » 2,5 fois plus véloce et trois fois moins coûteux a été introduit
.
Le 6 mai 2026, lors de sa première conférence développeurs à San Francisco — avec des événements satellites à Londres et Tokyo —, Anthropic a créé la surprise. Pas de nouveau modèle annoncé, mais une concentration inédite sur les capacités de la plateforme, et notamment sur les Agents Managés .
Ces fonctionnalités, ajoutées à l'environnement d'exécution hébergé pour agents, visaient toutes un objectif : transformer l'agent IA d'un simple exécutant en un collaborateur autonome, capable d'apprendre et de s'organiser .
La Rêverie (Aperçu de recherche) est la plus ambitieuse. Lorsqu'un agent est inactif, un processus de fond analyse jusqu'à 100 de ses sessions passées. Il en extrait les schémas récurrents, les erreurs et les flux de travail, puis réécrit la mémoire de l'agent pour ne garder que l'essentiel. Les données originales restent intactes, et l'agent n'adopte ces améliorations qu'avec l'accord explicite du développeur . En somme, les agents apprennent de leurs erreurs, sans entraînement supplémentaire
.
Les Résultats (Bêta publique) introduisent des critères de succès stricts. Un évaluateur indépendant note la production de l'agent selon une grille définie par le développeur. Si la note est insuffisante, l'agent recommence automatiquement .
L'Orchestration multi-agents (Bêta publique) permet à un agent « chef d'orchestre » de décomposer une tâche complexe et de la distribuer à une équipe de sous-agents spécialisés, chacun avec son propre modèle, ses instructions et ses outils, travaillant en parallèle sur un système de fichiers partagé .
Les Webhooks (Bêta publique) font entrer les agents dans l'ère de l'événementiel, leur permettant de notifier des systèmes externes dès qu'une tâche est achevée .
La conférence a aussi été l'occasion de présenter :
Le score phare de Claude Code reste ses 87,6 % sur SWE-bench Verified, obtenus avec Claude Opus 4.7 en mode adaptatif . Ce score est le plus élevé jamais publié pour un agent de codage IA disponible commercialement.
SWE-bench Verified est un ensemble de 500 tickets GitHub réels, issus de dépôts Python open source, que l'agent doit résoudre de bout en bout. La progression de Claude Code sur ce banc d'essai — de 80,9 % avec Opus 4.5 à 87,6 % — est au cœur de son récit marketing .
Ce score n'est pas figé. Il dépend du modèle, de l'instruction (le « prompt ») et du « harnais » — l'environnement d'exécution qui orchestre les outils. Le mode adaptatif d'Opus 4.7 alloue dynamiquement les ressources : peu pour une tâche simple, beaucoup pour une refonte complexe. Sans ce harnais, le score tombe à 80,8 % .
Sur le plus difficile SWE-bench Pro, Opus 4.8 atteint 69,2 %, après un passage de 53,4 % à 64,3 % avec Opus 4.7, devançant largement les modèles concurrents comme GPT-5.5 (58,6 %) . Et dans les comparaisons à l'aveugle de qualité de code, Claude Code l'emporte 67 % du temps
. À noter que la compétition reste rude, OpenAI ayant brièvement pris la tête sur SWE-bench Verified avec GPT-5.5 à 88,7 %, illustrant un classement en perpétuelle évolution
.
La différenciation de Claude Code ne se joue pas uniquement sur les scores bruts. Anthropic met l'accent sur l'autonomie de longue haleine. Claude Opus 4.8 est décrit comme ayant « la constance et l'autonomie nécessaires pour continuer à travailler sur des tâches de longue durée » .
Cette philosophie, qui privilégie un fonctionnement soutenu et indépendant plutôt que de simples réponses ponctuelles, se retrouve dans toutes les fonctionnalités : la rêverie pour l'apprentissage continu, l'allocation de calcul adaptative et l'orchestration multi-agents. L'objectif est de créer un agent capable d'opérer à travers les sessions, d'apprendre de ses propres productions et de gérer des projets complexes avec une intervention humaine minimale.
Enfin, Anthropic met en avant l'honnêteté de son modèle comme un avantage concurrentiel. La sortie d'Opus 4.8 a été l'occasion d'insister sur sa capacité à signaler ses incertitudes et à éviter les affirmations non fondées — un argument de poids pour les développeurs qui doivent pouvoir faire confiance à leur agent en production .