Se a decisão é para um produto, uma equipe de engenharia ou um fluxo de automação, o melhor caminho é escolher por tarefa:
Nos benchmarks em que GPT-5.5 e Claude Opus 4.7 aparecem lado a lado, o placar muda conforme o tipo de tarefa. A Vellum reporta GPT-5.5 à frente no Terminal-Bench 2.0, com 82,7% contra 69,4%, e no GDPval, com 84,9% contra 80,3%. Já Claude Opus 4.7 lidera no SWE-Bench Pro, com 64,3% contra 58,6%, e no GPQA Diamond, com 94,2% contra 93,6% .
Em computer use e tool use, a OpenAI informa que GPT-5.5 chega a 78,7% no OSWorld-Verified, contra 78,0% do Claude Opus 4.7, e a 84,4% no BrowseComp, contra 79,3%. No MCP Atlas, porém, Claude Opus 4.7 fica à frente: 79,1% contra 75,3% do GPT-5.5 .
Para DeepSeek V4 e Kimi K2.6, as evidências citadas não cobrem os mesmos benchmarks de GPT-5.5 e Claude Opus 4.7 em todos os casos. Por isso, não é correto declarar que eles venceram ou perderam em categorias sem pontuação comparável na mesma fonte .
| Benchmark ou métrica | GPT-5.5 | Claude Opus 4.7 | DeepSeek V4 | Kimi K2.6 | Como ler o resultado |
|---|---|---|---|---|---|
| Terminal-Bench 2.0 | 82,7% | 69,4% | Sem pontuação direta na mesma fonte | Sem pontuação direta na mesma fonte | GPT-5.5 lidera Claude Opus 4.7 na tabela da Vellum . |
| SWE-Bench Pro | 58,6% | 64,3% | Sem pontuação direta na mesma fonte | Sem pontuação direta na mesma fonte | Claude Opus 4.7 lidera GPT-5.5 em software engineering nesse benchmark . |
| GDPval | 84,9% | 80,3% | Sem pontuação direta na mesma fonte | Sem pontuação direta na mesma fonte | GPT-5.5 lidera Claude Opus 4.7 nesse teste . |
| OSWorld-Verified | 78,7% | 78,0% | Sem pontuação direta na mesma fonte | Sem pontuação direta na mesma fonte | GPT-5.5 fica ligeiramente à frente na tabela da OpenAI . |
| BrowseComp | 84,4% | 79,3% | Sem pontuação direta na mesma fonte | Sem pontuação direta na mesma fonte | GPT-5.5 lidera em tool use segundo a OpenAI . |
| MCP Atlas | 75,3% | 79,1% | Sem pontuação direta na mesma fonte | Sem pontuação direta na mesma fonte | Claude Opus 4.7 lidera GPT-5.5 nesse teste . |
| GPQA Diamond | 93,6% | 94,2% | Sem pontuação direta na mesma fonte | Sem pontuação direta na mesma fonte | Claude Opus 4.7 tem pequena vantagem na tabela da Vellum . |
| FrontierMath T1–3 | 51,7% | 43,8% | Sem pontuação direta na mesma fonte | Sem pontuação direta na mesma fonte | GPT-5.5 lidera Claude Opus 4.7 segundo a Vellum . |
| Janela de contexto | Não consta nessa tabela da Artificial Analysis | Não consta nessa tabela da Artificial Analysis | DeepSeek V4 Pro: 1.000k tokens | 256k tokens | DeepSeek V4 Pro tem janela maior que Kimi K2.6 na mesma fonte . |
| AA-Omniscience / hallucination | Sem pontuação direta na mesma fonte | Sem pontuação direta na mesma fonte | V4 Pro Max: -10; V4 Pro hallucination rate: 94% | Sem pontuação direta na mesma fonte | Sinal de que respostas do DeepSeek V4 devem ser verificadas com cuidado . |
| Artificial Analysis Intelligence Index | Não encontrado nas fontes usadas | Não encontrado nas fontes usadas | Não encontrado nas fontes usadas | 54 | Dado específico do Kimi K2.6; não é a mesma leaderboard da Vellum/OpenAI . |
“Sem pontuação direta na mesma fonte” não significa que o modelo seja pior. Significa apenas que, nas fontes usadas aqui, não há nota daquele modelo no mesmo benchmark e sob o mesmo avaliador.
Entre os quatro modelos, GPT-5.5 é o que aparece com mais números públicos comparáveis contra Claude Opus 4.7 nas fontes citadas. A Vellum traz Terminal-Bench 2.0, SWE-Bench Pro, GDPval, GPQA Diamond e FrontierMath; a OpenAI traz OSWorld-Verified, BrowseComp e MCP Atlas .
O ponto forte mais claro está em fluxos de terminal, automação agentic e uso de ferramentas. GPT-5.5 supera Claude Opus 4.7 no Terminal-Bench 2.0, com 82,7% contra 69,4%; no BrowseComp, com 84,4% contra 79,3%; e no OSWorld-Verified, com 78,7% contra 78,0% .
Isso não quer dizer que ele vença sempre. Claude Opus 4.7 aparece à frente no SWE-Bench Pro, no MCP Atlas e no GPQA Diamond nas fontes citadas .
Na parte de safety e avaliação de comportamento, o System Card da OpenAI diz que GPT-5.5 foi avaliado com CoT-Control, uma suíte com mais de 13 mil tarefas construídas a partir de benchmarks como GPQA, MMLU-Pro, HLE, BFCL e SWE-Bench Verified . Esse dado ajuda a entender o controle de comportamento do modelo, mas não deve ser lido como substituto direto para benchmarks de desempenho.
A documentação da Anthropic lista Claude Opus 4.7 nos Claude API Docs com data de 16 de abril de 2026 . Olhando apenas para as pontuações comparáveis com GPT-5.5, o destaque é o SWE-Bench Pro: 64,3% para Claude Opus 4.7 contra 58,6% para GPT-5.5 .
Claude Opus 4.7 também lidera GPT-5.5 no MCP Atlas, com 79,1% contra 75,3%, segundo a tabela da OpenAI . Por outro lado, GPT-5.5 aparece à frente no OSWorld-Verified e no BrowseComp na mesma fonte, além de liderar Terminal-Bench 2.0, GDPval e FrontierMath T1–3 na tabela da Vellum .
Em safety, a Anthropic reporta no Petri 2.0 que duas intervenções combinadas levaram, em modelos Claude, a uma queda relativa mediana de 47,3% em eval-awareness . Esse número deve ser tratado como informação de comportamento e segurança da família Claude, não como benchmark direto de performance do Claude Opus 4.7.
O relatório técnico do DeepSeek-V4 diz que a série V4 mantém o DeepSeekMoE framework e a estratégia Multi-Token Prediction do DeepSeek-V3, enquanto adiciona um mecanismo de atenção híbrida para melhorar a eficiência em contextos longos .
Na tabela da Artificial Analysis, o DeepSeek V4 Pro aparece com janela de contexto de 1.000k tokens, contra 256k tokens do Kimi K2.6 . Esse é um diferencial importante para fluxos com documentos extensos, bases grandes de conhecimento ou tarefas em que o modelo precisa carregar muito contexto de uma vez.
O ponto de atenção é a confiabilidade. A Artificial Analysis informa que o DeepSeek V4 Pro Max marcou -10 no AA-Omniscience, uma melhora em relação ao -21 do DeepSeek V3.2 Reasoning, mas também reporta hallucination rate de 94% para o DeepSeek V4 Pro e 96% para o DeepSeek V4 Flash .
Na prática, DeepSeek V4 Pro pode ser atraente para long context, mas deve ser usado com grounding por recuperação, checagem factual e revisão humana quando o erro tiver custo alto .
A Artificial Analysis descreve Kimi K2.6 como um modelo de pesos abertos lançado em abril de 2026 e atribui a ele pontuação 54 no Artificial Analysis Intelligence Index . Em outra análise, a mesma fonte informa que Kimi K2.6 aceita entrada nativa de imagem e vídeo, com saída em texto, e mantém contexto máximo de 256k tokens .
Comparando apenas janela de contexto na mesma tabela, Kimi K2.6 fica abaixo do DeepSeek V4 Pro, que aparece com 1.000k tokens . Ainda assim, Kimi K2.6 pode entrar na lista curta de quem precisa de um modelo de pesos abertos e multimodal.
O limite é que, nas fontes usadas, não foram encontrados resultados do Kimi K2.6 diretamente comparáveis a GPT-5.5 e Claude Opus 4.7 em Terminal-Bench 2.0, SWE-Bench Pro, GDPval, OSWorld-Verified ou MCP Atlas .
| Caso de uso | Modelo a considerar primeiro | Por quê |
|---|---|---|
| Automação em terminal e workflows agentic | GPT-5.5 | Lidera Claude Opus 4.7 no Terminal-Bench 2.0: 82,7% contra 69,4% . |
| Engenharia de software e resolução de issues | Claude Opus 4.7 | Lidera GPT-5.5 no SWE-Bench Pro: 64,3% contra 58,6% . |
| Browser e uso de ferramentas | GPT-5.5 ou Claude Opus 4.7, conforme o stack | GPT-5.5 lidera no BrowseComp; Claude Opus 4.7 lidera no MCP Atlas . |
| Computer-use workflow | GPT-5.5, por pequena margem | OSWorld-Verified: 78,7% para GPT-5.5 e 78,0% para Claude Opus 4.7 . |
| Contexto muito longo | DeepSeek V4 Pro | Janela de 1.000k tokens, com necessidade de verificação extra pelo hallucination rate de 94% . |
| Modelo de pesos abertos e multimodal | Kimi K2.6 | A Artificial Analysis informa que é open weights e aceita entrada nativa de imagem e vídeo . |
| Reduzir hallucination ao máximo | Não há vencedor geral com estes dados | Há alerta claro para DeepSeek V4, mas faltam métricas de confiabilidade comparáveis para os quatro modelos na mesma fonte . |
Pontuações vindas de fontes diferentes não devem ser somadas em um ranking único. Vellum, OpenAI e Artificial Analysis usam conjuntos de teste, modos de avaliação e contextos distintos .
Isso é especialmente importante em coding. A literatura acadêmica aponta que benchmarks como HumanEval têm limitações e que avaliações mais próximas do trabalho real devem considerar testes de resolução de issues, como SWE-Bench, entre outros .
Outro ponto: janela de contexto não é sinônimo de precisão. DeepSeek V4 Pro tem 1.000k tokens de contexto na tabela da Artificial Analysis, mas a mesma fonte reporta hallucination rate de 94% para o V4 Pro . Em produção, vale montar um conjunto de testes interno com os próprios dados, prompts e fluxos de trabalho antes de migrar uma aplicação crítica.
Com as evidências disponíveis, GPT-5.5 é a escolha mais forte para fluxos agentic, terminal e uso de ferramentas em vários testes, pois lidera Claude Opus 4.7 no Terminal-Bench 2.0, no BrowseComp e no OSWorld-Verified .
Claude Opus 4.7 merece prioridade quando o foco é engenharia de software baseada em benchmarks como SWE-Bench Pro, onde marca 64,3% contra 58,6% do GPT-5.5 .
DeepSeek V4 Pro se destaca pelo contexto longo de 1.000k tokens, mas precisa ser equilibrado com o alerta de hallucination rate de 94% reportado pela Artificial Analysis .
Kimi K2.6 é um candidato interessante para pesos abertos e multimodalidade, com contexto de 256k tokens, entrada nativa de imagem e vídeo e Intelligence Index 54. Para uma decisão de produção mais segura, porém, ainda faltam comparações diretas em mais benchmarks contra GPT-5.5, Claude Opus 4.7 e DeepSeek V4 .