O sinal — indica que o trecho de fonte disponível não traz um resultado comparável para aquela modelo no mesmo benchmark.
| Benchmark / fonte | GPT-5.5 | Claude Opus 4.7 | Kimi K2.6 | DeepSeek V4 | Leitura prática |
|---|---|---|---|---|---|
| ARC-AGI-2, DocsBot | 85% | 75,8% | — | — | GPT-5.5 fica 9,2 pontos percentuais à frente do Claude. |
| ARC-AGI-1, DocsBot | 95% | 93,5% | — | — | GPT-5.5 também aparece ligeiramente acima no ARC-AGI-1. |
| Leaderboard da Artificial Analysis | 57, GPT-5.5 medium | 52, Claude Opus 4.7 non-reasoning high | 54 | — | Nesse recorte, GPT-5.5 supera Kimi e o modo listado do Claude; DeepSeek V4 não aparece no trecho disponível. |
| Humanity’s Last Exam sem ferramentas, VentureBeat | 41,4% | 46,9% | — | 37,7% | Claude lidera entre as linhas básicas mostradas. |
| Humanity’s Last Exam com ferramentas, VentureBeat | 52,2%; GPT-5.5 Pro — 57,2% | 54,7% | — | 48,2% | Claude supera o GPT-5.5 base, mas a linha separada GPT-5.5 Pro fica acima do Claude. |
| Terminal-Bench 2.0, VentureBeat | 82,7% | 69,4% | — | 67,9% | É a vantagem mais clara do GPT-5.5 neste conjunto. |
| SWE-Bench Pro, DataCamp | 58,6% | 64,3% | — | 55,4%, DeepSeek V4 Pro | Claude fica acima de GPT-5.5 e DeepSeek V4 Pro. |
| SWE-Bench Verified, Verdent | — | 87,6% | 80,2% | — | Claude supera Kimi nesse recorte de coding. |
| Benchmark de coding, AkitaOnRails | 96, GPT-5.5 xHigh/Codex | 97 | 87 | 78, V4 Flash; 69, V4 Pro | Claude e GPT-5.5 ficam quase empatados; Kimi supera as duas linhas do DeepSeek V4. |
O principal problema não é falta de modelos fortes, e sim falta de comparações perfeitamente equivalentes. A Artificial Analysis compara GPT-5.5 medium, Kimi K2.6 e Claude Opus 4.7 non-reasoning high. A AkitaOnRails usa GPT-5.5 xHigh/Codex e separa DeepSeek V4 Flash de DeepSeek V4 Pro. A VentureBeat, por sua vez, mostra linhas distintas para GPT-5.5 e GPT-5.5 Pro.
Mesmo quando o duelo é só entre GPT-5.5 e Claude Opus 4.7, o resultado depende da tarefa. A LLM Stats afirma que, em 10 benchmarks reportados pelos dois provedores, o Opus 4.7 lidera em 6 e o GPT-5.5 em 4. As vantagens do Claude se concentram em testes pesados de raciocínio e revisão; as do GPT-5.5, em tarefas longas de uso de ferramentas e trabalho via shell.
Os sinais mais convincentes a favor do GPT-5.5 vêm de ARC e Terminal-Bench. No ARC-AGI-2, ele faz 85% contra 75,8% do Claude Opus 4.7; no ARC-AGI-1, faz 95% contra 93,5%. Já no Terminal-Bench 2.0, o GPT-5.5 marca 82,7%, bem acima dos 69,4% do Claude Opus 4.7 e dos 67,9% do DeepSeek.
A Artificial Analysis também coloca o GPT-5.5 medium acima dos dois concorrentes disponíveis nesse recorte: 57 contra 54 do Kimi K2.6 e 52 do Claude Opus 4.7 non-reasoning high. Isso, porém, não deve ser lido como um ranking universal de todos os modos de cada modelo. A própria LLM Stats aponta que Claude Opus 4.7 vence o GPT-5.5 em parte dos testes de raciocínio e engenharia de software.
Claude Opus 4.7 se sai melhor quando a tarefa exige raciocínio pesado ou revisão de código complexo. No Humanity’s Last Exam sem ferramentas, a VentureBeat lista 46,9% para Claude, 41,4% para GPT-5.5 e 37,7% para DeepSeek; com ferramentas, são 54,7% para Claude, 52,2% para GPT-5.5 e 48,2% para DeepSeek.
No SWE-Bench Pro, a DataCamp informa 64,3% para Claude Opus 4.7, 58,6% para GPT-5.5 e 55,4% para DeepSeek V4 Pro. Essa leitura combina com o panorama da LLM Stats: Claude lidera GPT-5.5 em GPQA, HLE sem ferramentas, HLE com ferramentas, SWE-Bench Pro, MCP Atlas e FinanceAgent v1.1.
Kimi K2.6 é mais difícil de encaixar em um ranking único porque não aparece em todas as mesmas tabelas. No trecho disponível da Artificial Analysis, Kimi K2.6 marca 54, abaixo do GPT-5.5 medium com 57, mas acima do Claude Opus 4.7 non-reasoning high com 52.
No benchmark de coding da AkitaOnRails, Kimi K2.6 faz 87: abaixo do Claude Opus 4.7 com 97 e do GPT-5.5 xHigh/Codex com 96, mas acima do DeepSeek V4 Flash com 78 e do DeepSeek V4 Pro com 69. Em outra comparação da Verdent no SWE-Bench Verified, aparecem 80,2% para Kimi K2.6 e 87,6% para Claude Opus 4.7.
A diferença prática do Kimi está no caminho open-weight. A Verdent afirma que os pesos do K2.6 estão no Hugging Face e rodam via vLLM, SGLang ou KTransformers; a mesma fonte cita uma configuração mínima viável de 4× H100 para a variante INT4 com contexto reduzido. O README no Hugging Face também lista métricas agentic do Kimi K2.6, como HLE-Full com ferramentas em 54,0, BrowseComp em 83,2, DeepSearchQA com f1-score de 92,5, Toolathlon em 50,0 e MCPMark em 55,9. Mas essa tabela compara Kimi principalmente com GPT-5.4, Claude Opus 4.6 e Gemini 3.1 Pro, não com todo o grupo analisado aqui.
Nos dados reunidos, DeepSeek V4 aparece mais como modelo de valor do que como líder de score máximo. Na VentureBeat, ele fica atrás de GPT-5.5 e Claude Opus 4.7 no HLE sem ferramentas, no HLE com ferramentas e no Terminal-Bench 2.0. Na DataCamp, DeepSeek V4 Pro faz 55,4% no SWE-Bench Pro, contra 58,6% do GPT-5.5 e 64,3% do Claude Opus 4.7. Na AkitaOnRails, DeepSeek V4 Flash marca 78 e DeepSeek V4 Pro marca 69, ambos abaixo de Kimi K2.6, GPT-5.5 xHigh/Codex e Claude Opus 4.7 na mesma tabela.
O preço, porém, muda a lógica de produto. A Mashable lista o DeepSeek V4 a US$ 1,74 por 1 milhão de tokens de entrada e US$ 3,48 por 1 milhão de tokens de saída, enquanto GPT-5.5 aparece a US$ 5/US$ 30 e Claude Opus 4.7 a US$ 5/US$ 25. Isso não transforma DeepSeek em vencedor dos benchmarks, mas pode torná-lo atraente para rascunhos em grande volume, tarefas de baixo risco e avaliações internas baratas.
Pelo retrato dos benchmarks, a dupla de ponta é GPT-5.5 e Claude Opus 4.7, mas por razões diferentes. GPT-5.5 se sai melhor em ARC e Terminal-Bench; Claude Opus 4.7 aparece mais forte em HLE e SWE-Bench Pro. Kimi K2.6 continua relevante como opção de coding e agentic, especialmente quando o acesso a pesos e a possibilidade de self-hosting importam, mas há menos comparações diretas com todos os rivais. DeepSeek V4 fica atrás em vários scores brutos, mas seu preço de API o torna uma alternativa séria para pilotos orientados a custo-benefício.