Também há um sinal claro de recência: a documentação da API da OpenAI lista o GPT-5.5 como latest, e a página de pesquisa da OpenAI o posiciona depois do GPT-5.4. Isso, porém, não resolve a pergunta principal para quem paga a conta: o ganho de qualidade compensa o custo?
| Aspecto | O que as fontes mostram | Leitura prática |
|---|---|---|
| Modelo mais recente | A documentação da API lista o GPT-5.5 como latest, e a página de pesquisa da OpenAI o coloca depois do GPT-5.4. | É a linha mais nova documentada. |
| Qualidade no GDPval | GPT-5.5: 84,9%; GPT-5.4: 83,0%. | Ganho de 1,9 ponto percentual nessa avaliação. |
| Benchmarks compartilhados | A LLM Stats relata vantagem do GPT-5.5 em 9 de 10 benchmarks compartilhados. | Sinal positivo, mas vindo de uma comparação externa. |
| Janela de contexto | A LLM Stats aponta 1 milhão de tokens para ambos. | Contexto maior não parece ser o motivo para migrar. |
| Latência por token | A LLM Stats relata latência por token semelhante. | Não dá para contar com ganho claro de velocidade. |
| Preço | A LLM Stats lista o GPT-5.5 em US$ 5/US$ 30 por 1 milhão de tokens, contra US$ 2,50/US$ 15 no GPT-5.4. | O custo variável por token fica aproximadamente dobrado. |
A OpenAI descreve o GDPval como uma avaliação da capacidade de agentes de produzir trabalho de conhecimento bem especificado em 44 ocupações. Em termos simples, é um teste voltado a tarefas profissionais com requisitos claros — não uma garantia ampla de que um modelo será melhor em qualquer conversa, idioma, integração ou caso de uso.
Nesse recorte, o salto existe: o GPT-5.4 foi publicado com 83,0% no GDPval, enquanto o GPT-5.5 aparece com 84,9%. O ganho de 1,9 ponto percentual é a comparação quantitativa mais direta entre os dois modelos nas fontes disponíveis.
O ponto importante é não exagerar a leitura. Esse resultado sugere melhora em trabalho profissional bem definido, mas não prova que o GPT-5.5 superará o GPT-5.4 em todos os prompts, bases de conhecimento, ferramentas conectadas ou rotinas de produção.
A comparação direta mais ampla vem da LLM Stats, que relata melhora do GPT-5.5 sobre o GPT-5.4 em 9 de 10 benchmarks compartilhados. Isso reforça a leitura de que o GPT-5.5 tende a ser mais capaz em média.
Mas há uma diferença relevante entre sinal e decisão. Essa matriz de benchmarks, preço, contexto e latência não é uma tabela oficial da OpenAI; é uma comparação externa. Para uma equipe que usa modelo em volume, o caminho mais prudente não é trocar o padrão de uma vez, e sim rodar um teste A/B com tarefas reais, critérios de aceitação claros e cálculo de custo por tarefa concluída.
Em muitos produtos, qualidade não é a única variável. Janela de contexto e tempo de resposta pesam bastante, especialmente em fluxos com documentos longos, atendimento, agentes ou análise de bases extensas.
Só que, segundo a LLM Stats, GPT-5.5 e GPT-5.4 mantêm a mesma janela de contexto de 1 milhão de tokens e latência por token semelhante. Isso não quer dizer que as respostas serão iguais. Quer dizer que, com a evidência disponível, o argumento forte para testar o GPT-5.5 não é caber mais contexto nem responder mais rápido — é produzir resultados melhores em tarefas difíceis.
A parte menos confortável é o custo. A LLM Stats lista o GPT-5.5 em US$ 5/US$ 30 por 1 milhão de tokens, contra US$ 2,50/US$ 15 para o GPT-5.4. Nessa comparação, o preço por token fica aproximadamente duas vezes maior.
Por isso, a métrica certa não é apenas custo por token. É custo por resultado aceitável. O GPT-5.5 pode valer a pena se reduzir erros críticos, retrabalho humano, reenvios de prompt ou revisões demoradas em tarefas de alto valor. Se o GPT-5.4 já entrega a qualidade necessária, pagar o dobro pode não fechar a conta.
A OpenAI já havia apresentado o GPT-5.4 como um modelo com fortes capacidades de codificação e melhorias no uso de ferramentas, ambientes de software e tarefas profissionais envolvendo planilhas, apresentações e documentos. Isso importa porque muitas migrações não dependem de uma média de benchmark, mas de um fluxo específico: código, agentes, análise documental, automações com ferramentas ou geração de entregáveis.
Com as fontes disponíveis aqui, não há um detalhamento oficial que atribua a melhora do GPT-5.5 a cada uma dessas subáreas. Se o seu produto depende de uma delas, vale comparar os dois modelos com seus próprios exemplos antes de mudar o modelo padrão.
Vale priorizar o GPT-5.5 se suas tarefas se parecem com trabalho profissional bem especificado, se erros custam caro ou se uma pequena melhora de qualidade pode economizar revisão humana. Também faz sentido avaliá-lo se a sua equipe quer trabalhar com o modelo mais recente documentado na API da OpenAI.
Por outro lado, faz sentido permanecer no GPT-5.4 se a aplicação é muito sensível a custo, se a qualidade atual já bate suas métricas internas ou se você esperava uma vantagem clara em contexto ou latência que a comparação externa não mostra.
Para uma migração séria, rode os dois modelos no mesmo conjunto de prompts, documentos, ferramentas e critérios de aceitação. Meça pelo menos cinco pontos:
A decisão também pode ser parcial. Você pode usar o GPT-5.5 apenas em rotas onde a melhora seja mensurável — por exemplo, tarefas mais complexas ou de maior risco — e manter o GPT-5.4 em fluxos de alto volume nos quais a diferença de qualidade não compensa o custo.
O GPT-5.5 melhora o GPT-5.4, mas o salto parece incremental e vem com uma decisão econômica clara. A evidência mais forte é o avanço no GDPval, de 83,0% para 84,9%, somado ao sinal externo de melhores resultados em 9 de 10 benchmarks compartilhados.
A migração, porém, não deve ser automática: a LLM Stats relata mesma janela de contexto, latência por token semelhante e preço aproximadamente dobrado para o GPT-5.5. A conclusão prática é simples: teste o GPT-5.5 onde qualidade tem impacto direto; mantenha o GPT-5.4 onde custo, contexto ou velocidade forem os fatores dominantes.