GPT-5.5 paraît particulièrement adapté aux équipes qui utilisent déjà l’IA comme un assistant de développement, de recherche ou d’automatisation. Dans le changelog de Codex, l’agent de développement d’OpenAI, GPT-5.5 est présenté comme le nouveau modèle de pointe pour le codage complexe, l’usage d’un ordinateur, le travail de connaissance et les workflows de recherche. La system card d’OpenAI va dans le même sens, en insistant sur les tâches réelles qui combinent code, recherche, analyse, documents, feuilles de calcul et outils multiples.
Mais les chiffres invitent à la prudence. LLM Stats indique que GPT-5.5 améliore 9 des 10 benchmarks directement comparables à GPT-5.4. En revanche, dans la comparaison BenchLM entre GPT-5.4 Pro et GPT-5.5, GPT-5.4 Pro est devant au classement provisoire, 92 contre 89. BenchLM précise aussi que le profil public de GPT-5.5 ne couvre pour l’instant que 20 benchmarks sur 153 suivis, ce qui limite la portée d’une conclusion générale.
| Critère | Ce qui plaide pour GPT-5.5 | Ce qu’il faut vérifier avant migration |
|---|---|---|
| Usage principal | OpenAI positionne GPT-5.5 sur les tâches complexes : code, recherche en ligne, analyse d’information, documents, feuilles de calcul et passage entre outils. | Ne pas supposer que tous les usages de GPT-5.4 gagnent automatiquement : testez vos prompts et vos données. |
| Code et agents | GPT-5.5 est disponible dans Codex comme modèle de pointe pour le codage complexe, l’usage d’ordinateur, le travail de connaissance et les workflows de recherche. | Les gains réels dépendront de votre base de code, de vos tests, de vos outils et de la manière dont l’agent les appelle. |
| Benchmarks | LLM Stats rapporte une progression sur 9 des 10 benchmarks directement comparables à GPT-5.4. | BenchLM donne GPT-5.4 Pro devant GPT-5.5 dans son classement provisoire, 92 contre 89. |
| Coût | Face à GPT-5.4 Pro, BenchLM affiche GPT-5.5 à 5,00 $ en entrée et 30,00 $ en sortie par million de tokens, contre 30,00 $ et 180,00 $ pour GPT-5.4 Pro. | Face à GPT-5.4 standard, LLM Stats indique que le prix par token de GPT-5.5 a doublé. |
| Contexte | La fenêtre de contexte de GPT-5.5 est indiquée à 1 M par BenchLM. | GPT-5.4 Pro est indiqué à 1,05 M, donc légèrement au-dessus. |
| Sécurité | Dans les prompts difficiles du Safety Hub d’OpenAI, GPT-5.5 est meilleur que gpt-5.4-thinking dans certaines catégories, par exemple harcèlement ou violence. | D’autres catégories sont moins favorables à GPT-5.5 ; il faut donc regarder les risques propres à votre produit. |
Le mot clé ici est agentique : un modèle ne se contente pas de répondre, il planifie, utilise des outils, vérifie une partie de son travail et enchaîne plusieurs étapes. C’est précisément le terrain sur lequel OpenAI place GPT-5.5, avec des exemples comme le développement logiciel, la recherche en ligne, l’analyse d’informations ou la création de documents et de tableurs.
Les signaux de tiers vont dans le même sens. BenchLM décrit la catégorie la plus forte de GPT-5.5 comme Agentic et estime que son profil est particulièrement utile pour les agents de code, la recherche via navigateur et les workflows d’usage d’ordinateur. LLM Stats, de son côté, affirme que GPT-5.5 progresse sur 9 des 10 benchmarks directement comparables à GPT-5.4.
Ce n’est toutefois pas une preuve que GPT-5.5 bat toute la famille GPT-5.4 dans toutes les situations. BenchLM n’expose que les lignes de benchmarks disposant d’une évaluation sourcée, et le profil public de GPT-5.5 ne couvre actuellement que 20 benchmarks sur 153 suivis. Autrement dit, les résultats publics donnent une direction, pas une garantie pour votre application.
La confusion la plus fréquente consiste à comparer GPT-5.5 à GPT-5.4 standard, puis à appliquer cette conclusion à GPT-5.4 Pro. Or ce n’est pas le même arbitrage.
Dans la comparaison LLM Stats GPT-5.5 vs GPT-5.4, GPT-5.5 améliore 9 benchmarks directement comparables sur 10. Mais dans la comparaison BenchLM GPT-5.4 Pro vs GPT-5.5, GPT-5.4 Pro arrive devant au classement provisoire, 92 contre 89.
BenchLM signale aussi un écart notable sur MMMU-Pro : 94 % pour GPT-5.4 Pro contre 81,2 % pour GPT-5.5. Et côté contexte, GPT-5.4 Pro est listé à 1,05 M, contre 1 M pour GPT-5.5. Si vous êtes déjà sur GPT-5.4 Pro et que vos tâches dépendent fortement d’un benchmark précis, de documents très longs ou d’un contexte maximal, mieux vaut lancer un test en parallèle plutôt que basculer immédiatement.
La question du prix n’a pas une réponse unique. Tout dépend du modèle que vous utilisez aujourd’hui.
Par rapport à GPT-5.4 Pro, GPT-5.5 apparaît nettement moins coûteux dans les données BenchLM : GPT-5.4 Pro est affiché à 30,00 $ par million de tokens en entrée et 180,00 $ en sortie, contre 5,00 $ en entrée et 30,00 $ en sortie pour GPT-5.5. Pour une équipe qui consomme beaucoup de tokens de sortie, l’écart peut donc être significatif.
Par rapport à GPT-5.4 standard, la lecture est différente. LLM Stats indique que le prix par token de GPT-5.5 a doublé par rapport à GPT-5.4. Dire que GPT-5.5 est moins cher est donc vrai dans une comparaison avec GPT-5.4 Pro, mais pas forcément dans une comparaison avec GPT-5.4 standard.
Il faut aussi regarder l’efficacité en tokens, pas seulement le prix unitaire. DataCamp résume que GPT-5.5 maintient une latence par token comparable à GPT-5.4 tout en utilisant moins de tokens pour terminer les mêmes tâches Codex. En pratique, le bon calcul consiste à mesurer : tokens d’entrée, tokens de sortie, durée totale, taux de réussite et nombre de relances nécessaires sur vos propres scénarios.
Sur la vitesse, les signaux publics sont plutôt rassurants. DataCamp indique que GPT-5.5 égale GPT-5.4 en latence par token, et LLM Stats affirme aussi que la latence par token n’a pas augmenté. DataCamp ajoute que GPT-5.5 utilise moins de tokens pour effectuer les mêmes tâches Codex.
Mais la latence par token n’est pas toujours ce que ressent l’utilisateur final. Dans un workflow avec outils, le temps total dépend aussi du nombre d’appels, de la taille des sorties, du comportement de l’agent, de la récupération d’informations et des vérifications intermédiaires. GPT-5.5 peut donc être plus efficace dans certains cas sans que cela se traduise automatiquement par le même temps de réponse dans chaque produit.
Pour le contexte, GPT-5.5 n’est pas faible : BenchLM l’indique à 1 M de tokens. Mais GPT-5.4 Pro garde une légère avance sur ce point, avec 1,05 M de tokens. Si votre cas d’usage repose sur de très longs dépôts de code, des dossiers documentaires massifs ou des historiques de conversation étendus, comparez non seulement la taille maximale du contexte, mais aussi la qualité de récupération, de synthèse et de fidélité aux détails.
Le Safety Hub d’OpenAI compare gpt-5.4-thinking et GPT-5.5 sur des prompts difficiles, avec une règle simple : plus le score est élevé, mieux c’est. Le tableau ne montre pas une victoire uniforme de GPT-5.5 ; certains résultats montent, d’autres baissent.
| Catégorie de sécurité | gpt-5.4-thinking | GPT-5.5 | Lecture |
|---|---|---|---|
| Comportement illicite violent | 0,971 | 0,979 | GPT-5.5 au-dessus |
| Harcèlement | 0,790 | 0,822 | GPT-5.5 au-dessus |
| Violence | 0,831 | 0,846 | GPT-5.5 au-dessus |
| Comportement illicite non violent | 1,000 | 0,993 | GPT-5.5 en dessous |
| Extrémisme | 1,000 | 0,925 | GPT-5.5 en dessous |
| Haine | 0,943 | 0,868 | GPT-5.5 en dessous |
| Automutilation, standard | 0,987 | 0,959 | GPT-5.5 en dessous |
| Sexuel | 0,933 | 0,925 | GPT-5.5 en dessous |
La conclusion opérationnelle est simple : ne vous contentez pas d’un score moyen. Un produit exposé à des contenus de harcèlement, de violence, de haine, d’automutilation ou d’activités illicites doit évaluer les catégories qui correspondent réellement à son risque.
Testez GPT-5.5 en priorité si vos usages principaux sont le développement assisté, les agents de code, Codex, la recherche web, les documents, les feuilles de calcul ou les automatisations qui passent par plusieurs outils. C’est précisément le positionnement mis en avant par OpenAI dans Codex et dans la system card de GPT-5.5.
Gardez GPT-5.4 Pro en parallèle si vous l’utilisez déjà pour des tâches sensibles aux benchmarks, au très long contexte ou à des performances spécifiques. BenchLM donne GPT-5.4 Pro devant GPT-5.5 dans son classement provisoire et lui attribue une fenêtre de contexte légèrement plus grande.
Refaites le calcul de coût si vous êtes sur GPT-5.4 standard. GPT-5.5 peut être avantageux par rapport à GPT-5.4 Pro, mais LLM Stats signale un prix par token doublé face à GPT-5.4 standard.
Mesurez sur vos propres données. La page d’introduction de GPT-5.4 précise que les benchmarks ont été menés dans un environnement de recherche et que les sorties peuvent différer dans ChatGPT en production. Et pour GPT-5.5, BenchLM rappelle que le profil public ne couvre qu’une partie des benchmarks suivis.
Au final, GPT-5.5 est un candidat sérieux pour moderniser les workflows de code, de recherche et d’agents. Mais entre les écarts avec GPT-5.4 Pro, les différences de prix selon le modèle de départ, la fenêtre de contexte et les scores de sécurité par catégorie, la stratégie la plus sûre reste une évaluation parallèle sur vos tâches critiques avant une migration complète.