A OpenAI define o Terminal-Bench 2.0 como um benchmark para fluxos complexos de linha de comando, que exigem planejamento, iteração e coordenação de ferramentas; nele, GPT-5.5 alcança 82,7% segundo a empresa . No SWE-Bench Pro, voltado à resolução de issues reais do GitHub, a OpenAI informa 58,6% para GPT-5.5 .
No caso da DeepSeek, a documentação oficial diz que V4-Pro e V4-Flash podem ser usados tanto pela interface OpenAI ChatCompletions quanto pela interface Anthropic. Os parâmetros de modelo são deepseek-v4-pro e deepseek-v4-flash . Isso comprova disponibilidade, não liderança em benchmark.
Para Claude Opus 4.7 e Kimi K2.6, a leitura precisa ser mais cuidadosa. A LushBinary traz números comparativos de Claude contra GPT-5.5, enquanto a CodeRouter apresenta dados de preço e posicionamento para Kimi K2.6 e DeepSeek V4 .
Quando a tabela mostra sem dado comparável, significa que as fontes usadas não oferecem um número suficientemente direto para aquela combinação de modelo e benchmark.
| Benchmark / critério | DeepSeek V4 | Kimi K2.6 | Claude Opus 4.7 | GPT-5.5 |
|---|---|---|---|---|
| SWE-Bench Pro | sem dado comparável | segundo a CodeRouter, no nível do GPT-5.5 | 64,3% | 58,6% |
| SWE-Bench Verified | sem dado comparável | sem dado comparável | 87,6% | cerca de 85% |
| Terminal-Bench 2.0 | sem dado comparável | sem dado comparável | cerca de 72% | 82,7% |
| GDPval / Knowledge Work | sem dado comparável | sem dado comparável | cerca de 78% | 84,9% |
| OSWorld-Verified / Computer Use | sem dado comparável | sem dado comparável | cerca de 65% | 78,7% |
| GPQA Diamond | sem dado comparável | sem dado comparável | 94,2% | cerca de 93% |
| CursorBench | sem dado comparável | sem dado comparável | 70% | cerca de 65% |
| Tau2-bench Telecom | sem dado comparável | sem dado comparável | cerca de 90% | 98,0% |
| Vision & Document Arena | sem dado comparável | sem dado comparável | 1º lugar segundo relatório da Arena | sem dado comparável |
| Preço / contexto | V4 Flash: US$ 0,14 input / US$ 0,28 output por milhão de tokens e contexto de 1M | US$ 0,60 input / US$ 4,00 output por milhão de tokens | sem dado comparável | sem dado comparável |
Se o seu principal critério é programação, especialmente correção de bugs e resolução de issues, Claude Opus 4.7 aparece como o mais forte na fotografia disponível. A LushBinary aponta 64,3% para Claude Opus 4.7 no SWE-Bench Pro, contra 58,6% para GPT-5.5; o valor de 58,6% para GPT-5.5 também é confirmado pela própria OpenAI . A mesma fonte secundária coloca Claude Opus 4.7 à frente em SWE-Bench Verified e CursorBench .
Isso não significa que GPT-5.5 seja fraco em código. Significa que, dentro dos dados disponíveis aqui, Claude Opus 4.7 tem a melhor indicação para tarefas de coding puro e correção de repositórios.
Kimi K2.6 entra na conversa por outro motivo: custo. A CodeRouter afirma que o modelo fica no nível do GPT-5.5 em SWE-Bench Pro e, ao mesmo tempo, lista preços menores por milhão de tokens . Para times que rodam muitos agentes, fazem várias tentativas ou pagam por muitos rascunhos e retries, esse tipo de diferença pode importar bastante. Ainda assim, isso não substitui uma avaliação própria no seu código.
Para DeepSeek V4, a documentação oficial consultada não traz um número de benchmark de coding que permita compará-lo diretamente com os outros três. O que está confirmado é a disponibilidade de V4-Pro e V4-Flash via API .
Quando o foco sai de coding isolado e vai para fluxos agentivos — comandos de terminal, coordenação de ferramentas e execução passo a passo — GPT-5.5 tem a evidência mais forte. A OpenAI informa 82,7% no Terminal-Bench 2.0 e descreve o teste como uma avaliação de workflows complexos de linha de comando, com planejamento, iteração e uso coordenado de ferramentas . A LushBinary coloca Claude Opus 4.7 em cerca de 72% nesse mesmo benchmark .
A fonte secundária também favorece GPT-5.5 em métricas de knowledge work e computer use: 84,9% no GDPval contra cerca de 78% para Claude Opus 4.7, e 78,7% no OSWorld-Verified contra cerca de 65% para Claude Opus 4.7 . Para tarefas que misturam shell, ferramentas, ambiente gráfico e decisões em sequência, GPT-5.5 é o ponto de partida mais bem sustentado pelas fontes.
Para tarefas multimodais, documentos e imagens, as fontes não trazem uma tabela completa com os quatro modelos. O melhor sinal disponível é para Claude Opus 4.7: um relatório da Arena citado por Latent Space/AINews aponta o modelo em 1º lugar na Vision & Document Arena .
A LLM Stats também informa que Claude Opus 4.7 processa imagens com até 2.576 pixels no lado maior, ou cerca de 3,75 megapixels; para GPT-5.5, a mesma fonte registra suporte a entrada de imagem e valores de MMMU-Pro de 81,2% sem ferramentas e 83,2% com ferramentas . Esses dados ajudam a comparar Claude e GPT-5.5, mas não fecham um confronto direto e completo contra Kimi K2.6 e DeepSeek V4.
O argumento de preço mais forte, entre as fontes usadas, é o de Kimi K2.6. A CodeRouter descreve o modelo como vencedor em custo/qualidade e lista US$ 0,60 de input e US$ 4,00 de output por milhão de tokens .
DeepSeek V4 Flash aparece na mesma fonte como uma opção de baixo custo, com US$ 0,14 de input e US$ 0,28 de output por milhão de tokens, além de contexto de 1M . A documentação oficial da DeepSeek confirma que V4-Pro e V4-Flash estão disponíveis pelas interfaces atuais da API .
Só que preço baixo não é a mesma coisa que vitória em benchmark. Um modelo barato pode ser ótimo para rodadas exploratórias, geração de drafts e tarefas de menor risco. Em produção, o que importa é o custo por resultado aceito: quantas vezes o modelo acerta, quanto retrabalho gera, quanto demora e qual é o impacto de um erro.
Para uma decisão real, ranking público é só ponto de partida. Monte um pequeno conjunto de avaliação com tarefas do seu próprio ambiente: issues do seu repositório, documentos que sua equipe realmente usa, fluxos de terminal que aparecem no dia a dia ou tarefas multimodais relevantes para o produto.
Na hora de medir, não olhe apenas a primeira resposta. Compare custo por solução aceita, número de retries, gravidade dos erros, tempo de execução, estabilidade e facilidade de integração. Em agentes de coding, por exemplo, um modelo que cobra menos por token pode sair mais caro se precisar de muitas correções humanas.
Também é importante não misturar dados oficiais e dados de terceiros como se fossem equivalentes. Nesta comparação, GPT-5.5 tem valores oficiais da OpenAI para Terminal-Bench 2.0 e SWE-Bench Pro . DeepSeek V4 tem confirmação oficial de disponibilidade de API . Já as melhores afirmações comparativas sobre Claude Opus 4.7 e Kimi K2.6, dentro das fontes usadas, vêm de análises externas .
O comparativo não aponta um campeão universal. Claude Opus 4.7 lidera os números citados mais próximos de coding; GPT-5.5 é o mais bem sustentado para agentes de terminal, computer use e workflows com ferramentas; Kimi K2.6 tem o argumento mais claro de custo/qualidade; e DeepSeek V4 aparece como candidato já disponível via API, mas que precisa ser medido em avaliações próprias antes de qualquer conclusão de desempenho .