| Se a sua prioridade é... | Teste primeiro | Por quê |
|---|---|---|
| Navegação agentic, automação em terminal e fluxos com várias ferramentas | GPT-5.5 | Tem 84,4% no BrowseComp e 82,7% no Terminal-Bench 2.0, acima dos números de Claude Opus 4.7 e DeepSeek-V4-Pro-Max listados no mesmo resumo da VentureBeat. |
| Raciocínio difícil, auditoria, revisão e decisões com baixa tolerância a erro | Claude Opus 4.7 | Lidera no GPQA Diamond, com 94,2%, e no Humanity’s Last Exam sem ferramentas, com 46,9%, no recorte citado pela VentureBeat. |
| API de alto volume e orçamento sensível a tokens | DeepSeek V4 | O preço público listado é de US$ 1,74 por 1 milhão de tokens de entrada e US$ 3,48 por 1 milhão de tokens de saída, abaixo de GPT-5.5 e Claude Opus 4.7 no mesmo comparativo. |
| Experimentos de coding agent open-source e fluxos longos de programação | Kimi K2.6 | É descrito como modelo agentic multimodal open-source da Moonshot AI, com contexto de 256K, mas ainda sem uma bateria pública completa e diretamente comparável contra GPT-5.5, Claude Opus 4.7 e DeepSeek V4. |
Um cuidado importante: as fontes usam nomes diferentes para a família DeepSeek — DeepSeek V4, DeepSeek V4 Pro e DeepSeek-V4-Pro-Max — e isso pode refletir configurações diferentes. A tabela abaixo preserva os nomes usados nas fontes para não tratar variantes distintas como se fossem a mesma configuração.
| Métrica | GPT-5.5 | Claude Opus 4.7 | DeepSeek V4 / V4-Pro-Max | Kimi K2.6 |
|---|---|---|---|---|
| Artificial Analysis Intelligence Index | xhigh: 60; high: 59. | Adaptive Reasoning, Max Effort: 57. | Sem pontuação visível no mesmo recorte. | Sem pontuação visível no mesmo recorte. |
| BrowseComp | 84,4%. | 79,3%. | DeepSeek-V4-Pro-Max: 83,4%. | |
| Terminal-Bench 2.0 | 82,7%. | 69,4%. | ||
| SWE-Bench Pro | 58,6%. | 64,3%. | ||
| GPQA Diamond | 93,6%. | 94,2%. | DeepSeek-V4-Pro-Max: 90,1%. | |
| Humanity’s Last Exam, sem ferramentas | 41,4%; GPT-5.5 Pro: 43,1%. | 46,9%. | 37,7%. | |
| Preço de API, entrada / saída, por 1 milhão de tokens | US$ 5 / US$ 30; janela de contexto de 1M. | US$ 5 / US$ 25; janela de contexto de 1M. | US$ 1,74 / US$ 3,48; janela de contexto de 1M. |
O resumo visível da Artificial Analysis lista os cinco primeiros modelos por Intelligence Index: GPT-5.5 xhigh com 60, GPT-5.5 high com 59, Claude Opus 4.7 Adaptive Reasoning, Max Effort com 57, seguido por Gemini 3.1 Pro Preview e GPT-5.4 xhigh também com 57.
Isso permite uma conclusão limitada: nesse recorte do Intelligence Index, GPT-5.5 aparece à frente de Claude Opus 4.7. O que não dá para concluir é um ranking completo dos quatro modelos, porque o mesmo resumo não mostra pontuações equivalentes para DeepSeek V4 e Kimi K2.6.
O BrowseComp mede desempenho em navegação agentic na web, especialmente em busca de informação estruturada e altamente “containerizada”. Nesse teste, a VentureBeat lista GPT-5.5 com 84,4%, DeepSeek-V4-Pro-Max com 83,4% e Claude Opus 4.7 com 79,3%.
A diferença é pequena entre GPT-5.5 e DeepSeek-V4-Pro-Max no BrowseComp, mas aumenta no Terminal-Bench 2.0. No mesmo resumo, GPT-5.5 aparece com 82,7%, Claude Opus 4.7 com 69,4% e DeepSeek com 67,9%. O Yahoo / Investing.com também descreve o Terminal-Bench 2.0 como um teste de fluxos de linha de comando e lista GPT-5.5 com 82,7%.
Kimi K2.6 tem um número visível de 66,70% no Terminal-Bench 2.0, mas esse dado vem de outro comparativo, contra Claude Opus 4.6 e GPT-5.4. Por isso, ele não deve ser usado como se fosse uma medição direta contra GPT-5.5, Claude Opus 4.7 e DeepSeek V4.
No comparativo citado pela DataCamp, o SWE-Bench Pro mostra Claude Opus 4.7 com 64,3%, GPT-5.5 com 58,6% e DeepSeek V4 Pro com 55,4%. O Yahoo / Investing.com também lista GPT-5.5 com 58,6% no SWE-Bench Pro, descrevendo o teste como uma avaliação de resolução de issues do GitHub.
Para Kimi K2.6, os números de código merecem atenção, mas com cautela. A Verdent lista Kimi K2.6 com 58,60% no SWE-Bench Pro, 80,20% no SWE-Bench Verified e 89,60% no LiveCodeBench v6; porém, a mesma fonte informa que os números de Kimi K2.6 vêm do model card oficial da Moonshot AI e que o SWE-Bench Pro usou um harness interno da Moonshot.
Na prática, se o seu caso envolve manutenção de repositórios grandes, revisão de código ou agentes que programam por muito tempo, não basta olhar uma única linha de benchmark. Claude Opus 4.7 tem o melhor número visível no SWE-Bench Pro; GPT-5.5 lidera nos testes de uso prolongado de ferramentas, como Terminal-Bench 2.0; e Kimi K2.6 deve ser avaliado no seu próprio repositório e na sua própria cadeia de ferramentas.
Nos benchmarks de raciocínio mais pesado, Claude Opus 4.7 aparece forte. A VentureBeat lista GPQA Diamond com Claude Opus 4.7 em 94,2%, GPT-5.5 em 93,6% e DeepSeek-V4-Pro-Max em 90,1%.
No Humanity’s Last Exam sem ferramentas, a mesma fonte mostra Claude Opus 4.7 com 46,9%, GPT-5.5 com 41,4%, GPT-5.5 Pro com 43,1% e DeepSeek-V4-Pro-Max com 37,7%.
A leitura da LLM Stats vai na mesma direção: nos 10 benchmarks que os dois fornecedores reportam, Claude Opus 4.7 lidera em 6 e GPT-5.5 em 4. A vantagem de Claude se concentra em testes de raciocínio pesado e revisão de alto rigor, enquanto GPT-5.5 lidera nos testes de uso prolongado de ferramentas.
No comparativo de preços citado pela Mashable, DeepSeek V4 custa US$ 1,74 por 1 milhão de tokens de entrada e US$ 3,48 por 1 milhão de tokens de saída, com janela de contexto de 1 milhão de tokens. No mesmo padrão, GPT-5.5 custa US$ 5 por 1 milhão de tokens de entrada e US$ 30 por 1 milhão de tokens de saída; Claude Opus 4.7 custa US$ 5 por 1 milhão de tokens de entrada e US$ 25 por 1 milhão de tokens de saída.
A DataCamp usa o mesmo recorte de preço para DeepSeek V4 Pro, GPT-5.5 e Claude Opus 4.7, e também lista janelas de contexto próximas de 1 milhão de tokens para os três. Com esses números públicos, a vantagem de custo de DeepSeek V4 é a mais evidente. Somada ao resultado de 83,4% no BrowseComp para DeepSeek-V4-Pro-Max, próximo dos 84,4% de GPT-5.5, ela torna o modelo um candidato natural para rotas de API sensíveis a custo.
Já Kimi K2.6 não aparece nas fontes fornecidas com preço de API no mesmo padrão. O dado público relevante aqui é outro: a DocsBot descreve Kimi K2.6 como um modelo agentic multimodal open-source da Moonshot AI, com contexto de 256K e foco em long-horizon coding, design orientado por código, execução autônoma e orquestração de enxames de agentes.
Para a maioria dos times que vão colocar IA em produto, a pergunta não deveria ser “qual modelo vence?”, mas “qual modelo deve atender cada rota?”. Uma arquitetura prática pode começar assim:
Com os dados públicos disponíveis, GPT-5.5 é o candidato mais forte para agentes com ferramentas, navegação e automação; Claude Opus 4.7 é a escolha mais convincente para raciocínio difícil e revisão; DeepSeek V4 oferece a relação custo-desempenho mais chamativa para APIs de alto volume; e Kimi K2.6 deve entrar no radar de quem quer explorar coding agents open-source, mas ainda não tem evidência suficiente para ocupar uma posição justa em um ranking completo entre os quatro.
Antes de contratar ou colocar em produção, rode uma bateria própria: mesmos prompts, mesmas ferramentas liberadas, mesmo tamanho de contexto e mesmo critério de sucesso. Benchmark público ajuda a decidir quem entra primeiro no teste; a escolha final depende do seu fluxo real, do custo do erro e do custo por token.
| Sem resultado público de comparação direta entre os quatro. |
| 67,9%. |
| 66,70%, mas em outro comparativo, contra Claude Opus 4.6 e GPT-5.4, não contra os quatro modelos desta análise. |
| DeepSeek V4 Pro: 55,4%. |
| 58,60%, mas com harness interno da Moonshot e sem comparação direta completa com GPT-5.5, Claude Opus 4.7 e DeepSeek V4. |
| Sem resultado público no mesmo comparativo. |
| Sem resultado público no mesmo comparativo. |
| As fontes fornecidas não trazem preço no mesmo padrão; o contexto citado é de 256K. |