Se o seu fluxo envolve agentes de programação, Codex, pesquisa na web, automação com ferramentas ou produção de documentos e planilhas, o GPT-5.5 é um dos primeiros modelos que vale colocar em teste. O changelog do Codex diz que ele está disponível como o novo modelo frontier da OpenAI para codificação complexa, uso de computador, trabalho de conhecimento e pesquisa. O System Card reforça essa mesma direção ao listar código, pesquisa online, análise de informação e criação de documentos como usos centrais.
Mas se você já usa GPT-5.4 Pro, a decisão exige mais calma. No BenchLM, o GPT-5.4 Pro aparece à frente do GPT-5.5 no ranking provisório, por 92 a 89, e também tem janela de contexto ligeiramente maior: 1,05 milhão contra 1 milhão. Ou seja: para alguns times, o GPT-5.5 pode ser melhor; para outros, o GPT-5.4 Pro ainda pode ser a opção mais segura.
| Critério | O que favorece o GPT-5.5 | O que checar antes de trocar |
|---|---|---|
| Uso principal | A OpenAI posiciona o GPT-5.5 para código, pesquisa online, análise de informação, documentos, planilhas e uso de ferramentas. | Não há uma única tabela oficial que compare todos os pontos do GPT-5.4 padrão contra o GPT-5.5 em produção. |
| Codificação e agentes | O GPT-5.5 entrou no Codex como modelo frontier para codificação complexa, uso de computador, trabalho de conhecimento e pesquisa. | O ganho real depende do seu repositório, dos testes, dos prompts e da forma como as ferramentas são chamadas. |
| Benchmarks | O LLM Stats diz que o GPT-5.5 melhora em 9 de 10 benchmarks diretamente comparáveis ao GPT-5.4. | No BenchLM, contra o GPT-5.4 Pro, o GPT-5.5 perde no ranking provisório: 89 contra 92. |
| Custo | No BenchLM, o GPT-5.5 sai mais barato que o GPT-5.4 Pro: US$ 5,00 de entrada e US$ 30,00 de saída por 1 milhão de tokens, contra US$ 30,00 e US$ 180,00. | Contra o GPT-5.4 padrão, o LLM Stats informa que o preço por token do GPT-5.5 dobrou. |
| Contexto | A janela de 1 milhão de tokens do GPT-5.5 é grande o bastante para muitos fluxos longos. | O GPT-5.4 Pro aparece com 1,05 milhão de tokens no BenchLM, um pouco acima do GPT-5.5. |
| Segurança | Em prompts difíceis, o GPT-5.5 fica acima do gpt-5.4-thinking em categorias como assédio, violência e comportamento ilícito violento. | Em outras categorias, como ódio, extremismo, autolesão e conteúdo sexual, o GPT-5.5 aparece abaixo do gpt-5.4-thinking. |
A proposta do GPT-5.5 é menos sobre responder perguntas simples e mais sobre executar tarefas com várias etapas. A OpenAI descreve o modelo como adequado a trabalho complexo no mundo real, incluindo código, pesquisa online, análise de informações e criação de documentos e planilhas.
Fontes externas seguem a mesma leitura. O perfil do BenchLM aponta a categoria Agentic como a mais forte do GPT-5.5 e diz que o modelo é particularmente útil para agentes de codificação, pesquisa em navegador e fluxos de uso de computador. O LLM Stats também afirma que, nos 10 benchmarks em que conseguiu comparar diretamente GPT-5.5 e GPT-5.4, o GPT-5.5 melhorou em 9.
Ainda assim, isso não prova que o GPT-5.5 vença em todo cenário. O próprio BenchLM informa que o perfil público do GPT-5.5 tem apenas 20 dos 153 benchmarks acompanhados, deixando categorias sem avaliação pública até que haja uma medição com fonte. Para uma equipe de produto ou engenharia, esses números servem como sinal de direção, não como substituto para teste interno.
O erro mais comum é tratar GPT-5.4, GPT-5.4 Pro e gpt-5.4-thinking como se fossem a mesma coisa. Não são. Contra o GPT-5.4 padrão, o LLM Stats relata vantagem do GPT-5.5 em 9 de 10 benchmarks comparáveis. Contra o GPT-5.4 Pro, o quadro fica menos favorável: o BenchLM mostra o GPT-5.4 Pro à frente no ranking provisório, por 92 a 89.
Há também diferenças em benchmarks específicos. No MMMU-Pro, o BenchLM mostra 94% para o GPT-5.4 Pro e 81,2% para o GPT-5.5. Em contexto, o GPT-5.4 Pro aparece com 1,05 milhão de tokens, contra 1 milhão do GPT-5.5.
A leitura prática é simples: quem usa GPT-5.4 padrão deve olhar o GPT-5.5 com bastante interesse; quem usa GPT-5.4 Pro precisa rodar uma avaliação lado a lado antes de substituir.
O GPT-5.5 parece muito mais barato quando comparado ao GPT-5.4 Pro. No BenchLM, o GPT-5.4 Pro aparece a US$ 30,00 por 1 milhão de tokens de entrada e US$ 180,00 por 1 milhão de tokens de saída. O GPT-5.5 aparece a US$ 5,00 e US$ 30,00, respectivamente.
Mas essa conclusão não vale automaticamente contra o GPT-5.4 padrão. O LLM Stats afirma que, nessa comparação, o preço por token do GPT-5.5 dobrou. Portanto, a pergunta correta não é apenas se o GPT-5.5 é caro, e sim caro em relação a qual modelo?
Também vale medir eficiência em tokens. A DataCamp resume que o GPT-5.5 mantém latência por token semelhante à do GPT-5.4 e usa menos tokens para concluir as mesmas tarefas no Codex. Se ele gera menos tokens para entregar o mesmo resultado, o custo final de uma tarefa pode não seguir a tabela de preço de forma linear.
DataCamp e LLM Stats convergem em um ponto importante: o GPT-5.5 manteria latência por token no nível do GPT-5.4. A DataCamp acrescenta que o modelo usa menos tokens para concluir as mesmas tarefas no Codex.
Na prática, isso significa que o tempo percebido pelo usuário pode depender de mais fatores: tamanho do prompt, extensão da resposta, número de chamadas de ferramenta, navegação, execução de código e retries. Um modelo com latência por token semelhante pode ser mais rápido em um fluxo e igual ou mais lento em outro.
Sobre contexto, o GPT-5.5 não é pequeno: o BenchLM lista janela de 1 milhão de tokens. Mas o GPT-5.4 Pro aparece com 1,05 milhão. Para bases de código enormes, análise de muitos documentos ou conversas longas, o teste não deve medir só o tamanho máximo da janela; deve medir também recuperação de informação, consistência e qualidade do resumo ao longo do contexto.
A tabela de prompts desafiadores do OpenAI Deployment Safety Hub compara gpt-5.4-thinking e GPT-5.5 por categoria, usando a regra de que pontuação maior é melhor. Os valores abaixo vêm dessa tabela.
| Categoria de segurança | gpt-5.4-thinking | GPT-5.5 | Direção |
|---|---|---|---|
| Comportamento ilícito violento | 0,971 | 0,979 | GPT-5.5 acima |
| Assédio | 0,790 | 0,822 | GPT-5.5 acima |
| Violência | 0,831 | 0,846 | GPT-5.5 acima |
| Comportamento ilícito não violento | 1,000 | 0,993 | GPT-5.5 abaixo |
| Extremismo | 1,000 | 0,925 | GPT-5.5 abaixo |
| Ódio | 0,943 | 0,868 | GPT-5.5 abaixo |
| Autolesão, padrão | 0,987 | 0,959 | GPT-5.5 abaixo |
| Sexual | 0,933 | 0,925 | GPT-5.5 abaixo |
Isso não permite dizer que o GPT-5.5 é simplesmente mais seguro ou menos seguro. Para produtos expostos a usuários finais, moderação, conteúdo sensível ou automação com impacto real, a avaliação precisa considerar o tipo de risco mais provável no seu caso.
Teste o GPT-5.5 primeiro se o seu fluxo depende de agentes de código, Codex, pesquisa online, uso de computador, análise de documentos, planilhas ou múltiplas ferramentas. Essas são justamente as áreas destacadas pela OpenAI no changelog do Codex e no System Card.
Não migre no piloto automático se você já usa GPT-5.4 Pro e depende de benchmarks específicos, janela máxima de contexto ou desempenho em tarefas de conhecimento. O BenchLM mostra o GPT-5.4 Pro à frente do GPT-5.5 no ranking provisório e com contexto um pouco maior.
Se custo é o fator principal, identifique primeiro qual modelo você usa hoje. Contra GPT-5.4 Pro, o GPT-5.5 aparece bem mais barato no BenchLM. Contra GPT-5.4 padrão, o LLM Stats informa preço por token duas vezes maior.
Se o produto está em produção, rode um comparativo com tarefas reais: mesmos prompts, mesmos documentos, mesmas ferramentas e mesmas métricas de sucesso. A própria página de introdução do GPT-5.4 observa que benchmarks foram conduzidos em ambiente de pesquisa e que o ChatGPT em produção pode ter saídas ligeiramente diferentes em alguns casos. Além disso, a cobertura pública do GPT-5.5 no BenchLM ainda é parcial, com 20 de 153 benchmarks acompanhados.
A conclusão mais equilibrada: o GPT-5.5 é um upgrade muito promissor para codificação, agentes, pesquisa e fluxos com ferramentas. Mas diferenças de preço, comparação com GPT-5.4 Pro, janela de contexto e segurança por categoria tornam a migração total uma decisão que deve vir depois de um teste lado a lado.