C’est le bon repère si l’on veut situer GPT-5.5 comme modèle de travail généraliste : rédaction structurée, analyse, synthèse, préparation de livrables ou tâches de connaissance proches d’un contexte professionnel.
Mais GDPval ne remplace pas un test de programmation, un benchmark scientifique ou un classement externe de modèles. Mettre côte à côte plusieurs pourcentages sans expliquer ce qu’ils mesurent peut donc donner une impression trompeuse.
| Benchmark ou comparaison | Valeur rapportée | Ce que le score mesure | Comment l’interpréter |
|---|---|---|---|
| GDPval | 84,9 % | Travail intellectuel bien spécifié dans 44 métiers | Le chiffre le plus naturel à citer pour une réponse générale, car il est donné directement dans l’annonce d’OpenAI. |
| Expert-SWE | 73,1 % | Tâches de programmation ; l’article cité le présente comme une évaluation interne portant sur des tâches estimées à 20 heures | Plus pertinent pour le développement logiciel que GDPval, mais non comparable directement. |
| BixBench | 80,5 % | Benchmark de bioinformatique en conditions réelles | Pertinent pour la bioinformatique, mais à manier avec plus de prudence dans les sources disponibles que le score GDPval communiqué par OpenAI. |
| Artificial Analysis Intelligence Index | 1re place, avec 3 points d’avance | Indice externe de comparaison entre modèles | Utile pour une vue d’ensemble, mais ce n’est pas un benchmark officiel unique d’OpenAI. |
À première vue, 84,9 %, 73,1 % et 80,5 % semblent appartenir à la même échelle. Ce n’est pas le cas.
La bonne question n’est donc pas : « quel pourcentage est le plus élevé ? » Elle est plutôt : « quel benchmark correspond à l’usage visé ? »
Pour de la production de documents, de l’analyse ou de la connaissance métier, GDPval est le meilleur point de départ. Pour du développement logiciel, Expert-SWE est plus proche du problème. Pour la bioinformatique, BixBench est thématiquement plus adapté.
Artificial Analysis indique que GPT-5.5 prend la tête de son Intelligence Index avec trois points d’avance. Le même compte rendu précise aussi qu’OpenAI mène cinq de ses évaluations principales et arrive deuxième derrière Gemini 3.1 Pro Preview dans trois autres.
Autrement dit, une première place dans un indice externe ne signifie pas que le modèle gagne tous les tests. Cela signifie que, selon la méthode de calcul d’Artificial Analysis, GPT-5.5 obtient le meilleur résultat global.
D’autres articles mentionnent encore d’autres valeurs, par exemple 91,7 % dans un contexte de capacités juridiques ou 82,7 % pour du codage agentique.
Ces chiffres peuvent être intéressants pour des usages spécialisés. En revanche, ils sont moins adaptés comme réponse générale tant que le protocole, le périmètre du test et le groupe de comparaison ne sont pas aussi clairement posés que pour le score GDPval communiqué par OpenAI.
Pour la plupart des comparaisons générales, la formule la plus propre est :
GPT-5.5 obtient 84,9 % sur GDPval selon OpenAI ; GDPval teste la capacité d’agents à produire du travail intellectuel bien spécifié dans 44 métiers.
Si le contexte est plus précis, il vaut mieux changer de référence :
Le meilleur chiffre court pour situer GPT-5.5 est 84,9 % sur GDPval. Il est directement attribué à OpenAI et son périmètre est clair : du travail intellectuel bien spécifié dans 44 métiers.
Les autres scores ne sont pas à ignorer, mais ils doivent toujours être cités avec leur benchmark. Sinon, on compare des tests qui ne mesurent pas la même chose.