Mais il ne finit pas premier partout. Sur SWE-Bench Pro, un benchmark centré sur la résolution d’issues GitHub, Claude Opus 4.7 devance GPT-5.5. Sur BrowseComp, qui mesure des capacités de navigation et de recherche, Gemini 3.1 Pro et Mythos Preview obtiennent de meilleurs scores que GPT-5.5.
La bonne lecture est donc pragmatique : GPT-5.5 est un modèle à tester en priorité dans beaucoup de cas, mais il ne faut pas le choisir les yeux fermés pour tous les usages.
| Benchmark | Score de GPT-5.5 | Ce que cela suggère |
|---|---|---|
| Terminal-Bench 2.0 | 82,7 | Très bon résultat sur les workflows en ligne de commande : GPT-5.5 dépasse Claude Opus 4.7 à 69,4, Gemini 3.1 Pro à 68,5 et Mythos Preview à 82,0. |
| FrontierMath Tier 1–3 / Tier 4 | 51,7 / 35,4 | Sur ce test de mathématiques et de raisonnement, GPT-5.5 devance Claude Opus 4.7 à 43,8 / 22,9 et Gemini 3.1 Pro à 36,9 / 16,7 dans le même tableau comparatif. |
| OfficeQA Pro | 54,1 | GPT-5.5 fait mieux que Claude Opus 4.7 à 43,6 et Gemini 3.1 Pro à 18,1 sur cette évaluation orientée tâches de bureau. |
| GDPval | 84,9 | Sur cette évaluation du travail de connaissance, GPT-5.5 est devant Claude Opus 4.7 à 80,3 et Gemini 3.1 Pro à 67,3. |
| SWE-Bench Pro | 58,6 | Sur la résolution d’issues GitHub, GPT-5.5 est derrière Claude Opus 4.7 à 64,3, mais devant Gemini 3.1 Pro à 54,2. |
| BrowseComp | 84,4 | GPT-5.5 est performant, mais inférieur à Gemini 3.1 Pro à 85,9 et Mythos Preview à 86,9. |
| OSWorld-Verified | 78,7 | Sur l’usage d’un ordinateur et de logiciels, GPT-5.5 dépasse de peu Claude Opus 4.7 à 78,0, mais reste derrière Mythos Preview à 79,6. |
Le tableau montre une tendance nette : GPT-5.5 est très compétitif pour les tâches de terminal, le raisonnement mathématique, la bureautique et le travail de connaissance. En revanche, pour les issues GitHub, la navigation web ou certains usages de logiciels, la concurrence reste sérieuse.
Le code est l’un des terrains les plus convaincants pour GPT-5.5. OpenAI affirme que le modèle excelle dans l’écriture et le débogage de code, et son score de 82,7 à Terminal-Bench 2.0 confirme une forte capacité sur des workflows techniques en ligne de commande.
Cela ne veut pas dire qu’il domine tout le développement logiciel. Sur SWE-Bench Pro, GPT-5.5 atteint 58,6, contre 64,3 pour Claude Opus 4.7. Pour corriger des bugs dans un dépôt existant, traiter des issues GitHub ou travailler sur une base de code complexe, Claude mérite donc aussi d’être testé.
OpenAI met aussi en avant la recherche en ligne, l’analyse de données et les tâches qui traversent plusieurs outils. L’idée est de pouvoir confier à GPT-5.5 une demande un peu brouillonne, composée de plusieurs étapes, et de le laisser planifier, utiliser les outils nécessaires, vérifier son travail et avancer malgré l’ambiguïté.
La nuance est importante : dans BrowseComp, GPT-5.5 obtient 84,4, mais Gemini 3.1 Pro monte à 85,9 et Mythos Preview à 86,9. Pour des tâches où la navigation, la recherche web et la collecte d’informations dominent, il est donc prudent de comparer plusieurs modèles.
Pour les documents, les feuilles de calcul et les tâches de bureau, GPT-5.5 apparaît particulièrement bien positionné. OpenAI cite explicitement la création de documents et de tableurs ainsi que l’utilisation de logiciels parmi ses points forts, et le New York Times rapporte qu’OpenAI a présenté sa nouvelle technologie comme meilleure pour l’écriture de code et les tâches liées au travail de bureau.
OfficeQA Pro va dans le même sens : GPT-5.5 y obtient 54,1, devant Claude Opus 4.7 à 43,6 et Gemini 3.1 Pro à 18,1. Pour produire des notes, structurer des rapports, manipuler des feuilles de calcul ou suivre des procédures dans un logiciel, c’est probablement l’un des modèles les plus intéressants à évaluer.
Sur FrontierMath, GPT-5.5 atteint 51,7 sur les niveaux Tier 1–3 et 35,4 sur le Tier 4, au-dessus des scores de Claude Opus 4.7 et Gemini 3.1 Pro dans le même comparatif. Pour les tâches qui combinent calcul, raisonnement technique et analyse structurée, GPT-5.5 fait donc partie des candidats les plus solides.
GPT-5.4 était déjà présenté comme un modèle réunissant les avancées d’OpenAI en raisonnement, codage et workflows agentiques, avec une meilleure prise en charge des environnements logiciels et des tâches professionnelles autour des tableurs, présentations et documents.
Avec GPT-5.5, OpenAI insiste davantage sur l’autonomie opérationnelle : le modèle comprendrait plus vite ce que l’utilisateur veut faire et pourrait prendre en charge davantage d’étapes sans supervision constante. OpenAI indique aussi que GPT-5.5 progresse clairement par rapport à GPT-5.4 sur GeneBench, une évaluation centrée sur des tâches scientifiques en plusieurs étapes.
Tout dépend du travail à accomplir. Dans les comparaisons publiques, GPT-5.5 est devant Claude Opus 4.7 et Gemini 3.1 Pro sur Terminal-Bench 2.0, FrontierMath, OfficeQA Pro et GDPval.
Mais Claude Opus 4.7 passe devant sur SWE-Bench Pro, tandis que Gemini 3.1 Pro et Mythos Preview font mieux sur BrowseComp. Autrement dit : pour des workflows de terminal, de bureautique ou de raisonnement mathématique, GPT-5.5 est un premier choix naturel. Pour de la résolution d’issues GitHub ou de la recherche web intensive, il faut garder Claude, Gemini ou Mythos Preview dans la comparaison.
Un benchmark donne une indication, pas une décision. Pour un usage professionnel, le bon test consiste à reprendre vos propres tâches : vos dépôts de code, vos documents, vos tableurs, vos outils internes, vos contraintes de vérification.
Quelques repères pratiques :
GPT-5.5 est bel et bien un modèle de premier plan. Les benchmarks publics le placent très haut pour les tâches de terminal, le raisonnement mathématique, la bureautique et le travail de connaissance.
Mais il n’est pas le numéro un universel. BrowseComp, SWE-Bench Pro et OSWorld-Verified montrent que d’autres modèles peuvent faire mieux selon le contexte.
La conclusion la plus utile est donc simple : GPT-5.5 est l’un des meilleurs modèles généralistes à essayer aujourd’hui, surtout pour les tâches professionnelles complexes. Mais pour choisir le bon outil, le vrai test reste celui de vos propres fichiers, de vos propres outils et de vos propres critères de réussite.