Esse é o dado mais direto para uma visão geral porque vem da própria apresentação da OpenAI e tem um escopo descrito com clareza. Ainda assim, GDPval não é a mesma coisa que um teste de programação, um benchmark de bioinformática ou um índice externo que combina várias avaliações.
Em outras palavras: o número é relevante, mas só faz sentido quando acompanhado do nome do teste.
| Benchmark ou comparação | Valor informado | O que mede | Como interpretar |
|---|---|---|---|
| GDPval | 84,9% | Trabalho de conhecimento bem especificado em 44 ocupações | É o valor citado diretamente pela OpenAI e, por isso, o melhor benchmark curto para uma resposta geral. |
| Expert-SWE | 73,1% | Tarefas de programação; segundo o relato, uma avaliação interna para tarefas com tempo estimado de 20 horas | É mais relevante para desenvolvimento de software do que o GDPval, mas não é comparável diretamente a ele. |
| BixBench | 80,5% | Benchmark de bioinformática em cenários reais | Faz mais sentido para bioinformática; nas fontes disponíveis aqui, tem base menos forte do que o dado da OpenAI sobre o GDPval. |
| Artificial Analysis Intelligence Index | 1º lugar, com vantagem de 3 pontos | Índice externo de comparação de modelos da Artificial Analysis | Ajuda a comparar modelos de forma ampla, mas não é um benchmark oficial único da OpenAI. |
À primeira vista, 84,9%, 73,1% e 80,5% parecem notas da mesma prova. Não são.
Por isso, a pergunta certa não é simplesmente “qual porcentagem é maior?”. A pergunta mais útil é: qual benchmark combina com o uso que você tem em mente?
Para trabalho de conhecimento em geral, GDPval é a referência mais adequada entre os números citados. Para desenvolvimento de software, Expert-SWE está mais perto do problema. Para bioinformática, BixBench é o recorte temático mais apropriado.
A Artificial Analysis afirma que o GPT-5.5 lidera seu Intelligence Index com três pontos de vantagem. A mesma análise também diz que a OpenAI lidera cinco das avaliações principais e fica atrás do Gemini 3.1 Pro Preview em outras três.
Essa diferença é importante. Estar em primeiro lugar em um índice externo não quer dizer que o modelo vença todos os testes. Quer dizer que, pela metodologia daquele índice, o GPT-5.5 fica à frente no resultado agregado.
Também aparecem outros números associados ao GPT-5.5, como 91,7% em contexto de capacidades jurídicas de IA ou 82,7% em programação agentic. Esses dados podem ser úteis em seus recortes específicos, mas são menos indicados para responder, de forma geral, “qual é o benchmark do GPT-5.5?”.
O motivo é simples: sem comparar o desenho do teste, o grupo de modelos avaliados e o objetivo da medição, um percentual isolado pode parecer mais conclusivo do que realmente é. Para uma resposta geral, o dado de 84,9% no GDPval é mais limpo porque vem diretamente da OpenAI e tem uma descrição clara do que está sendo medido.
Para a maioria das comparações gerais, use esta versão:
O GPT-5.5 alcança 84,9% no GDPval, segundo a OpenAI; o GDPval avalia a capacidade de agentes de produzir trabalho de conhecimento bem especificado em 44 ocupações.
Se o contexto for mais específico, troque a referência:
O melhor benchmark curto para o GPT-5.5 é 84,9% no GDPval. Ele é o número mais diretamente sustentado pela fonte da OpenAI e mede um tipo específico de desempenho: trabalho de conhecimento bem especificado em 44 ocupações.
Outros valores podem ser importantes, especialmente para programação, bioinformática ou comparações entre modelos. Só não devem ser tratados como se fossem a mesma métrica.