| 84,9% |
| Trabalho de conhecimento bem especificado em 44 ocupações |
| É o valor citado diretamente pela OpenAI e, por isso, o melhor benchmark curto para uma resposta geral. |
| BixBench | 80,5% | Benchmark de bioinformática em cenários reais | Faz mais sentido para bioinformática; nas fontes disponíveis aqui, tem base menos forte do que o dado da OpenAI sobre o GDPval. |
À primeira vista, 84,9%, 73,1% e 80,5% parecem notas da mesma prova. Não são.
Por isso, a pergunta certa não é simplesmente “qual porcentagem é maior?”. A pergunta mais útil é: qual benchmark combina com o uso que você tem em mente?
Para trabalho de conhecimento em geral, GDPval é a referência mais adequada entre os números citados. Para desenvolvimento de software, Expert-SWE está mais perto do problema. Para bioinformática, BixBench é o recorte temático mais apropriado.
A Artificial Analysis afirma que o GPT-5.5 lidera seu Intelligence Index com três pontos de vantagem. A mesma análise também diz que a OpenAI lidera cinco das avaliações principais e fica atrás do Gemini 3.1 Pro Preview em outras três.
Essa diferença é importante. Estar em primeiro lugar em um índice externo não quer dizer que o modelo vença todos os testes. Quer dizer que, pela metodologia daquele índice, o GPT-5.5 fica à frente no resultado agregado.
Também aparecem outros números associados ao GPT-5.5, como 91,7% em contexto de capacidades jurídicas de IA ou 82,7% em programação agentic. Esses dados podem ser úteis em seus recortes específicos, mas são menos indicados para responder, de forma geral, “qual é o benchmark do GPT-5.5?”.
O motivo é simples: sem comparar o desenho do teste, o grupo de modelos avaliados e o objetivo da medição, um percentual isolado pode parecer mais conclusivo do que realmente é. Para uma resposta geral, o dado de 84,9% no GDPval é mais limpo porque vem diretamente da OpenAI e tem uma descrição clara do que está sendo medido.
Para a maioria das comparações gerais, use esta versão:
O GPT-5.5 alcança 84,9% no GDPval, segundo a OpenAI; o GDPval avalia a capacidade de agentes de produzir trabalho de conhecimento bem especificado em 44 ocupações.
Se o contexto for mais específico, troque a referência:
O melhor benchmark curto para o GPT-5.5 é 84,9% no GDPval. Ele é o número mais diretamente sustentado pela fonte da OpenAI e mede um tipo específico de desempenho: trabalho de conhecimento bem especificado em 44 ocupações.
Outros valores podem ser importantes, especialmente para programação, bioinformática ou comparações entre modelos. Só não devem ser tratados como se fossem a mesma métrica.