| Le chiffre le plus naturel à citer pour une réponse générale, car il est donné directement dans l’annonce d’OpenAI. |
À première vue, 84,9 %, 73,1 % et 80,5 % semblent appartenir à la même échelle. Ce n’est pas le cas.
La bonne question n’est donc pas : « quel pourcentage est le plus élevé ? » Elle est plutôt : « quel benchmark correspond à l’usage visé ? »
Pour de la production de documents, de l’analyse ou de la connaissance métier, GDPval est le meilleur point de départ. Pour du développement logiciel, Expert-SWE est plus proche du problème. Pour la bioinformatique, BixBench est thématiquement plus adapté.
Artificial Analysis indique que GPT-5.5 prend la tête de son Intelligence Index avec trois points d’avance. Le même compte rendu précise aussi qu’OpenAI mène cinq de ses évaluations principales et arrive deuxième derrière Gemini 3.1 Pro Preview dans trois autres.
Autrement dit, une première place dans un indice externe ne signifie pas que le modèle gagne tous les tests. Cela signifie que, selon la méthode de calcul d’Artificial Analysis, GPT-5.5 obtient le meilleur résultat global.
D’autres articles mentionnent encore d’autres valeurs, par exemple 91,7 % dans un contexte de capacités juridiques ou 82,7 % pour du codage agentique.
Ces chiffres peuvent être intéressants pour des usages spécialisés. En revanche, ils sont moins adaptés comme réponse générale tant que le protocole, le périmètre du test et le groupe de comparaison ne sont pas aussi clairement posés que pour le score GDPval communiqué par OpenAI.
Pour la plupart des comparaisons générales, la formule la plus propre est :
GPT-5.5 obtient 84,9 % sur GDPval selon OpenAI ; GDPval teste la capacité d’agents à produire du travail intellectuel bien spécifié dans 44 métiers.
Si le contexte est plus précis, il vaut mieux changer de référence :
Le meilleur chiffre court pour situer GPT-5.5 est 84,9 % sur GDPval. Il est directement attribué à OpenAI et son périmètre est clair : du travail intellectuel bien spécifié dans 44 métiers.
Les autres scores ne sont pas à ignorer, mais ils doivent toujours être cités avec leur benchmark. Sinon, on compare des tests qui ne mesurent pas la même chose.