| Modelo | Como aparece nos materiais públicos | Sinal mais forte | Principal ressalva |
|---|---|---|---|
| GPT‑5.5 | O material de lançamento da OpenAI enfatiza uso de computador, ferramentas e fluxos agentic. | Terminal‑Bench 2.0 em 82,7%, OSWorld‑Verified em 78,7% e BrowseComp em 84,4%; GPT‑5.5 Pro chega a 90,1% no BrowseComp. | Não compare o score Pro diretamente com o GPT‑5.5 comum: o Pro usa computação paralela no momento do teste. |
| Claude Opus 4.7 | A Anthropic o descreve como modelo de raciocínio híbrido para código e agentes de IA, com janela de contexto de 1 milhão de tokens. | SWE‑Bench Verified em 87,6% e SWE‑Bench Pro em 64,3%. | Janela grande não garante recuperação perfeita: o resumo da StationX aponta ressalvas em recall extremo na janela de 1 milhão de tokens. |
| Kimi K2.6 | Modelo de pesos abertos da Moonshot/Kimi com foco forte em programação. | Terminal‑Bench 2.0 em 66,7%, SWE‑Bench Pro em 58,6%, SWE‑Bench Verified em 80,2% e LiveCodeBench v6 em 89,6. | |
| DeepSeek V4-Pro / Pro-Max | A DeepSeek diz que o V4 Preview está disponível e aberto; o card no Hugging Face apresenta a série V4 como modelos de linguagem MoE. | Tabelas reportam SWE Verified em 80,6, SWE Pro em 55,4, Terminal Bench 2.0 em 67,9 e GPQA Diamond em 90,1. | DeepSeek V4 não é um número único: resultados de variantes como Preview, Pro e Pro-Max precisam ser lidos separadamente. |
| Benchmark | GPT‑5.5 | Claude Opus 4.7 | Kimi K2.6 | DeepSeek V4-Pro / Pro-Max | Como ler |
|---|---|---|---|---|---|
| Terminal‑Bench 2.0 | 82,7% | 69,4% reportado | 66,7% | 67,9% | Em tarefas de linha de comando e programação autônoma, o avanço do GPT‑5.5 é o sinal mais claro. |
| SWE‑Bench Pro | 58,6% | 64,3% | 58,6% | ||
| SWE‑Bench Verified | Sem valor comparável claro neste conjunto de fontes | 87,6% | 80,2% | 80,6% | Para tarefas de resolução de issues em repositórios, Claude tem o sinal reportado mais forte. |
| OSWorld‑Verified | 78,7% | 78,0% | 73,1% | ||
| BrowseComp | 84,4%; GPT‑5.5 Pro em 90,1% | 79,3% | 83,2%; Agent Swarm em 86,3% | ||
| GPQA Diamond | Sem valor oficial comparável claro neste conjunto de fontes | 94,2% | 90,5% | 90,1% | Em raciocínio científico de nível avançado, Claude tem o maior score reportado aqui. |
| HLE / raciocínio difícil | Sem valor diretamente comparável claro | HLE sem ferramentas em 46,9%; com ferramentas em 54,7% | HLE-Full em 34,7%; com ferramentas em 54,0% | ||
| Contexto longo | Especificação pública de contexto não está clara no trecho de lançamento fornecido | Janela de contexto de 1 milhão de tokens | Contexto máximo de 256 mil tokens | Materiais do V4 enfatizam uso em contexto longo |
Se o seu produto depende de ações em terminal, navegação, uso de ferramentas, tarefas em sistema operacional e loops de agente com várias etapas, GPT‑5.5 é o nome mais forte neste conjunto de dados. A OpenAI reporta 82,7% no Terminal‑Bench 2.0, 78,7% no OSWorld‑Verified, 84,4% no BrowseComp e 55,6% no Toolathlon.
O GPT‑5.5 Pro também chama atenção com 90,1% no BrowseComp, mas esse número não deve ser lido como se fosse o mesmo orçamento do GPT‑5.5 padrão, já que o system card da OpenAI descreve o Pro como uma configuração com computação paralela no momento do teste.
Melhor encaixe: agentes de programação, agentes de pesquisa na web, automação de uso de computador e assistentes corporativos que orquestram muitas ferramentas.
Se o principal KPI é corrigir bugs, preparar pull requests, passar testes e entender bases de código grandes, Claude Opus 4.7 deve estar no topo da lista curta. Os números reportados de 87,6% no SWE‑Bench Verified e 64,3% no SWE‑Bench Pro colocam o modelo à frente nos sinais de engenharia de software.
A Anthropic também posiciona o Opus 4.7 como um modelo de raciocínio híbrido para código e agentes de IA, com janela de contexto de 1 milhão de tokens. Isso torna natural testá-lo em fluxos com bases de código extensas, desde que a equipe valide recall e custo nos próprios repositórios.
Melhor encaixe: manutenção de repositórios, revisão de código, refatorações complexas, copilotos internos e agentes de engenharia.
Quando a exigência é usar um modelo de pesos abertos, Kimi K2.6 entra como uma das opções mais competitivas. A tabela oficial da Kimi traz 66,7% no Terminal‑Bench 2.0, 58,6% no SWE‑Bench Pro, 80,2% no SWE‑Bench Verified, 52,2% no SciCode e 89,6 no LiveCodeBench v6.
O material público também mostra bons sinais em workloads de agentes e busca, com BrowseComp em 83,2% e Agent Swarm BrowseComp em 86,3%. Segundo a Artificial Analysis, Kimi K2.6 aceita entrada nativa de imagem e vídeo e mantém contexto máximo de 256 mil tokens.
Melhor encaixe: times que precisam de mais controle de hospedagem, agentes de programação, agentes de pesquisa e stacks que priorizam pesos abertos.
A DeepSeek informou que o V4 Preview ficou disponível e foi aberto em 24 de abril de 2026. O card do DeepSeek‑V4‑Pro no Hugging Face apresenta a série V4 como modelos de linguagem Mixture-of-Experts, ou MoE.
Nos números reportados para DeepSeek V4-Pro/Pro-Max aparecem Terminal Bench 2.0 em 67,9, SWE Verified em 80,6, SWE Pro em 55,4 e GPQA Diamond em 90,1. Isso coloca o DeepSeek V4 como candidato estratégico para testes open source/open weights e aplicações de contexto longo, mas sempre separando a variante exata usada no benchmark.
Melhor encaixe: aplicações de contexto longo, experimentos com pesos abertos e equipes que querem comparar modelos frontier hospedados com alternativas implantáveis.
Nos números disponíveis, Claude Opus 4.7 chega a 94,2% no GPQA Diamond. Kimi K2.6 reporta 90,5% no GPQA-Diamond e 96,4% no AIME 2026. DeepSeek V4-Pro/Pro-Max reporta 90,1% no GPQA Diamond.
Isso torna Claude uma escolha forte para raciocínio científico, mas não transforma um único benchmark em resposta definitiva. Configuração de ferramentas, modo de esforço, tempo de execução e formato do prompt podem alterar bastante o resultado.
Coloque GPT‑5.5 na lista curta quando o trabalho envolver agentes que usam computador, navegador, terminal e várias ferramentas em sequência.
Priorize Claude Opus 4.7 quando o valor principal do produto for corrigir código em nível de repositório, resolver issues e operar fluxos de engenharia de software.
Avalie Kimi K2.6 quando a exigência for um modelo de pesos abertos com bons sinais em programação, Terminal‑Bench e busca agentic.
Teste DeepSeek V4-Pro/Pro-Max quando contexto longo, experimentação open source/open weights e possibilidade de implantação forem restrições importantes, sempre verificando variante e configuração de benchmark.
A escolha mais segura é simples: use a tabela pública para montar a lista curta; depois decida com base nos seus próprios testes de tarefa, latência, custo, privacidade e modos de falha.
| Segundo a Artificial Analysis, o modelo aceita entrada nativa de imagem/vídeo e tem contexto máximo de 256 mil tokens; a performance real pode variar conforme a infraestrutura de serving. |
| 55,4% |
| No benchmark difícil de engenharia de software, Claude Opus 4.7 aparece à frente. |
| Sem valor comparável claro |
| Em uso de computador, GPT‑5.5 e Claude Opus 4.7 aparecem praticamente empatados. |
| Sem valor comparável claro |
| Para agentes de navegador e pesquisa na web, GPT‑5.5 Pro e Kimi Agent Swarm são sinais fortes. |
| HLE em 37,7% |
| Com ferramentas, Claude e Kimi ficam próximos; o HLE listado para DeepSeek é menor. |
| Para contexto longo, Claude e DeepSeek estão mais claramente posicionados; ainda assim, recall real precisa ser testado. |