Autrement dit : la bonne question n’est pas seulement « lequel est le plus fort ? », mais « lequel correspond le mieux à mon flux de travail, à mon budget et à mon niveau d’intégration existant ? »
Claude Opus 4.7 obtient 1 753 Elo sur GDPval-AA, qu’Artificial Analysis présente comme son indicateur principal de performance agentique générale sur des tâches de travail intellectuel. Un score Elo se lit comme un classement relatif dans un cadre donné, pas comme un pourcentage universel.
GPT-5.5, lui, est surtout documenté ici à travers trois variantes sur l’Artificial Analysis Intelligence Index : GPT-5.5 high à 59, GPT-5.5 low à 51 et GPT-5.5 non-reasoning à 41.
Ces chiffres ne se soustraient pas les uns aux autres. On ne peut pas conclure que 1 753 Elo « bat » 59 points, ni l’inverse. Ce sont deux grilles de lecture différentes : l’une met en avant des tâches de connaissance en mode agent, l’autre un indice d’intelligence plus général et décliné par version.
| Critère | Claude Opus 4.7 | GPT-5.5 | Lecture pratique |
|---|---|---|---|
| Travail intellectuel agentique | Opus 4.7 est présenté comme le nouveau leader de GDPval-AA, avec 1 753 Elo, soit environ 79 points Elo devant les modèles les plus proches cités. | Les sources fournies ne donnent pas de score GDPval-AA directement comparable pour GPT-5.5. | Pour des tâches de recherche, de synthèse et d’analyse longue, Opus 4.7 doit être testé très tôt. |
| Indice d’intelligence général | Opus 4.7 fait mieux qu’Opus 4.6 sur l’Intelligence Index tout en utilisant environ 35 % de tokens de sortie en moins. | GPT-5.5 high, low et non-reasoning obtiennent respectivement 59, 51 et 41 sur l’Intelligence Index. | GPT-5.5 offre une lecture plus granulaire par version, utile pour le routage de tâches. |
| Intégration produit | Les sources fournies ne détaillent pas un périmètre d’intégration équivalent à ChatGPT/Codex pour Opus 4.7. | Appwrite indique que gpt-5.5 sert de modèle de base pour ChatGPT Plus, Pro, Business, Enterprise et Codex. | Si votre équipe travaille déjà dans l’écosystème OpenAI, GPT-5.5 peut être plus simple à déployer. |
| Programmation et agents de code | Les sources fournies ne permettent pas d’établir une victoire directe d’Opus 4.7 sur GPT-5.5 en coding. | TechflowPost rapporte qu’OpenAI présente GPT-5.5 comme son modèle de programmation autonome le plus capable à ce stade. | GPT-5.5 a un positionnement fort en développement, mais il faut tester sur vos dépôts et vos tickets réels. |
| Coûts et tokens | Opus 4.7 a utilisé 102 M de tokens de sortie sur l’Intelligence Index, contre 157 M pour Opus 4.6. | GPT-5.5 high a généré 45 M de tokens dans l’évaluation, contre 23 M en moyenne comparable ; GPT-5.5 low est listé à 5,00 $ par million de tokens d’entrée, au-dessus du médian de 1,60 $. |
Le principal argument en faveur de Claude Opus 4.7 est clair : sur GDPval-AA, il atteint 1 753 Elo et prend la tête du classement, avec environ 79 points Elo d’avance sur les modèles les plus proches cités, Claude Sonnet 4.6 et GPT-5.4, tous deux à 1 674 Elo.
Pour une équipe qui demande au modèle de lire des documents, croiser des sources, préparer des livrables, décomposer un problème ou conduire une recherche en plusieurs étapes, ce signal est important. Il ne prouve pas qu’Opus 4.7 gagne partout ; il indique plutôt que, dans ce type de tâches agentiques de connaissance, il mérite d’être dans les premiers modèles testés.
Artificial Analysis indique aussi qu’Opus 4.7 utilise environ 35 % de tokens de sortie en moins qu’Opus 4.6 sur l’Intelligence Index, tout en obtenant 4 points de plus ; les volumes cités sont 102 M de tokens de sortie pour Opus 4.7 contre 157 M pour Opus 4.6.
C’est un point à ne pas négliger pour les tâches longues. Des sorties plus courtes peuvent réduire la latence, le coût, mais aussi le temps de relecture humaine. Attention toutefois : cette comparaison oppose Opus 4.7 à Opus 4.6, pas directement à GPT-5.5.
La première limite est l’absence d’un face-à-face complet avec GPT-5.5 dans les données citées. Sur GDPval-AA, le modèle GPT mentionné dans la comparaison directe est GPT-5.4, pas GPT-5.5.
La deuxième limite concerne le produit et le déploiement. Dans les sources fournies, GPT-5.5 bénéficie d’une description plus explicite de son intégration à ChatGPT et Codex ; Opus 4.7 n’a pas, ici, le même niveau de détail public sur les offres, la disponibilité, les prix, les latences ou les modalités d’entreprise.
Pour une décision d’achat ou de mise en production, il faudra donc compléter le benchmark par des informations contractuelles, des tests API et des essais sur vos propres données.
GPT-5.5 est documenté en plusieurs profils visibles : high, low et non-reasoning. GPT-5.5 high obtient 59 sur l’Artificial Analysis Intelligence Index, au-dessus des modèles comparables ; GPT-5.5 low obtient 51, au-dessus du médian de 33 indiqué sur sa page ; GPT-5.5 non-reasoning obtient 41, au-dessus de la moyenne comparable de 10.
Cette segmentation peut être intéressante en production. On peut imaginer réserver high aux tâches les plus difficiles, utiliser low pour des demandes de raisonnement courant, et évaluer non-reasoning pour des flux plus simples ou plus standardisés. Mais ce routage doit être testé : les écarts de score montrent justement que les variantes ne sont pas interchangeables.
Selon le récapitulatif d’Appwrite, gpt-5.5 est le modèle de base des offres ChatGPT Plus, Pro, Business et Enterprise, ainsi que de Codex.
Pour une organisation déjà équipée en ChatGPT ou en outils de développement liés à Codex, c’est un avantage très concret. L’adoption peut être plus simple : moins de changement d’interface, moins de formation interne et une intégration plus directe dans les habitudes existantes.
TechflowPost rapporte qu’OpenAI décrit GPT-5.5 comme son modèle de programmation autonome le plus capable à ce stade. C’est un signal important pour les équipes de développement, surtout si les usages visés incluent la résolution de tickets, les workflows en ligne de commande, la génération de correctifs ou l’automatisation de tâches de code.
Mais il faut rester prudent : les sources fournies ne donnent pas de benchmark coding complet, dans les mêmes conditions, opposant directement GPT-5.5 à Claude Opus 4.7.
Le premier risque est la verbosité. GPT-5.5 high a généré 45 M de tokens lors de l’évaluation Intelligence Index, contre 23 M en moyenne pour les modèles comparables ; Artificial Analysis le décrit comme relativement verbeux.
Le deuxième risque vient des écarts entre variantes. Les scores 59, 51 et 41 pour high, low et non-reasoning montrent que le comportement peut fortement dépendre du mode utilisé. Si votre application route automatiquement les requêtes, l’expérience utilisateur, la latence et le coût peuvent varier.
Le troisième point est le prix. Appwrite indique que GPT-5.5 Pro coûte environ 7 fois plus cher en sortie que Claude Opus 4.7 ; de son côté, la page GPT-5.5 low d’Artificial Analysis liste 5,00 $ par million de tokens d’entrée, contre un médian de 1,60 $ sur la page. Ces chiffres ne remplacent pas un calcul sur vos propres volumes, mais ils justifient un test de coût sérieux avant généralisation.
Opus 4.7 doit être placé très haut dans votre banc d’essai si le cœur du besoin ressemble à du travail intellectuel en plusieurs étapes : recherche, analyse de longs documents, comparaison de sources, production de notes structurées, préparation de livrables, revue et synthèse.
Le point fort n’est pas une supériorité universelle démontrée ; c’est un signal robuste sur une catégorie précise de tâches.
GPT-5.5 est le candidat naturel si votre équipe travaille déjà dans ChatGPT, Codex ou plus largement dans l’écosystème OpenAI, car son intégration produit est plus explicitement documentée dans les sources disponibles.
Il est aussi intéressant si vous voulez construire une architecture de routage entre plusieurs niveaux de capacité : high pour les demandes critiques, low pour les tâches intermédiaires, non-reasoning pour des traitements plus simples.
GPT-5.5 a un positionnement très fort sur la programmation autonome, mais la bonne méthode consiste à tester les deux modèles sur vos propres dépôts : issues réelles, refactorings, corrections de tests, revues de pull request, contraintes de style et échecs connus de votre CI.
Un bon score général ne garantit pas qu’un modèle comprendra mieux votre architecture, vos conventions internes ou vos dépendances historiques.
Ne comparez pas seulement le prix affiché par million de tokens. Mesurez le coût total : tokens d’entrée, tokens de sortie, nombre de tentatives, appels d’outils, temps humain de correction et taux de réussite. Les signaux publics sont suffisants pour imposer cette prudence : GPT-5.5 high paraît plus verbeux que la moyenne comparable, Opus 4.7 améliore son efficacité par rapport à Opus 4.6, et GPT-5.5 low a un prix d’entrée supérieur au médian indiqué.
Claude Opus 4.7 est le modèle à tester en priorité pour le travail intellectuel agentique, car son signal public le plus fort est sa première place sur GDPval-AA.
GPT-5.5 est plus convaincant pour les équipes déjà installées dans l’écosystème OpenAI, celles qui veulent une intégration ChatGPT/Codex directe, ou celles qui ont besoin de router les tâches entre plusieurs niveaux de modèle.
Avec les données disponibles, il serait excessif d’annoncer un gagnant absolu. Le bon choix dépend de votre charge réelle : agents de connaissance et longs dossiers d’un côté ; intégration produit, développement et routage multi-versions de l’autre.
| Le coût réel dépendra de la longueur des sorties, des retries, des appels d’outils et du taux de réussite. |