O cuidado é essencial: os números misturam variantes e configurações diferentes, com ferramentas, sem ferramentas, modos de esforço alto, max effort ou thinking. Portanto, leia os benchmarks como sinais de direção, não como sentença final .
| Se a prioridade é... | Primeiro modelo a testar | Por quê |
|---|---|---|
| Máxima qualidade em tarefas difíceis | Claude Opus 4.7 | Lidera os dados comparáveis de HLE contra GPT-5.5 e DeepSeek; a CodeRouter também o coloca em primeiro no SWE-Bench Pro, com 64,3% . |
| Terminal, agentes e ambiente OpenAI | GPT-5.5 | A VentureBeat reporta 82,7% no Terminal-Bench 2.0, acima de Claude Opus 4.7 e DeepSeek V4; uma guia prática também o associa a fluxos em ChatGPT/Codex . |
| Coding competitivo com custo baixo | Kimi K2.6 | A CodeRouter o lista com 58,6% no SWE-Bench Pro, empatado com GPT-5.5, e preço de US$ 0,60/US$ 4,00 por 1 milhão de tokens de entrada/saída . |
| Alto volume com contexto longo barato | DeepSeek V4-Pro ou V4 Flash | V4-Pro aparece com US$ 1,74/US$ 3,48 por 1 milhão de tokens e 1 milhão de contexto; V4 Flash é citado a US$ 0,14/US$ 0,28 com 1 milhão de contexto, embora seja outra variante . |
| Caminho documentado para self-hosting | Kimi K2.6 | A Verdent informa que os pesos do K2.6 estão no Hugging Face e rodam com vLLM, SGLang ou KTransformers . |
Humanity’s Last Exam, ou HLE, é um benchmark acadêmico multimodal com 2.500 perguntas de matemática, humanidades e ciências naturais, criado para medir capacidades de fronteira com respostas verificáveis . Já o SWE-Bench Pro avalia engenharia de software em várias linguagens a partir de issues reais do GitHub, segundo a descrição reunida pela DocsBot . O Terminal-Bench 2.0 aparece na VentureBeat dentro dos resultados de agentes e engenharia de software .
| Benchmark | Leitura prática | Números disponíveis |
|---|---|---|
| HLE sem ferramentas | Claude Opus 4.7 lidera entre os modelos que aparecem na mesma tabela da VentureBeat. | Claude Opus 4.7: 46,9%; GPT-5.5: 41,4%; DeepSeek V4: 37,7%. Kimi K2.6 não aparece nesse mesmo recorte comparável . |
| HLE com ferramentas | Claude continua à frente de GPT-5.5 e DeepSeek; Kimi tem um número competitivo, mas vindo de outra tabela. | Claude Opus 4.7: 54,7%; GPT-5.5: 52,2%; DeepSeek V4: 48,2% na VentureBeat. A CodeRouter lista Kimi K2.6 com 54,0 em HLE com ferramentas, mas não é a mesma comparação direta . |
| SWE-Bench Pro | Claude é o líder; GPT-5.5 e Kimi formam o segundo grupo; DeepSeek fica perto, mas abaixo. | A CodeRouter reporta Claude Opus 4.7 com 64,3%, GPT-5.5 e Kimi K2.6 com 58,6%, e DeepSeek V4-Pro perto de 55%; a VentureBeat cita 55,4% para DeepSeek . |
| Terminal-Bench 2.0 | É o argumento mais forte a favor do GPT-5.5 nos dados comparáveis. | GPT-5.5: 82,7%; Claude Opus 4.7: 69,4%; DeepSeek V4: 67,9%. Não há número de Kimi K2.6 no recorte disponível . |
A síntese: Claude Opus 4.7 tem a melhor sinalização de qualidade geral nas comparações disponíveis, GPT-5.5 tem vantagem clara em Terminal-Bench 2.0, Kimi K2.6 se destaca pela relação desempenho/preço em código, e DeepSeek V4 fica mais interessante quando custo e contexto são as variáveis principais .
Em agentes que fazem muitas chamadas, o preço por token pode pesar mais do que alguns pontos percentuais em um benchmark. Nas fontes disponíveis, Kimi K2.6 e DeepSeek V4 aparecem na faixa de custo mais agressiva, enquanto GPT-5.5 e Claude Opus 4.7 ficam no segmento premium .
| Modelo ou variante | Preço reportado | Contexto reportado | Observação |
|---|---|---|---|
| Claude Opus 4.7 | US$ 5 entrada / US$ 25 saída por 1 milhão de tokens na Artificial Analysis . | 1 milhão de tokens e saída máxima de 128 mil tokens . | A Artificial Analysis também o descreve como um dos modelos líderes em inteligência, mas caro, mais lento e verboso . |
| GPT-5.5 | US$ 5 entrada / US$ 30 saída por 1 milhão de tokens na CodeRouter . | 1 milhão de tokens . | Faz mais sentido se você já trabalha com ChatGPT/Codex ou precisa do bom resultado em Terminal-Bench . |
| Kimi K2.6 | US$ 0,60 entrada / US$ 4,00 saída por 1 milhão de tokens na CodeRouter . | 256 mil tokens . | A Artificial Analysis também mostra 256 mil tokens de contexto para Kimi contra 1 milhão para Claude Opus 4.7 em sua comparação direta . |
| DeepSeek V4-Pro | US$ 1,74 entrada / US$ 3,48 saída por 1 milhão de tokens na CodeRouter . | 1 milhão de tokens . | É uma opção atraente para alto volume com contexto longo, embora não lidere HLE nem SWE-Bench Pro nos números disponíveis . |
| DeepSeek V4 Flash | US$ 0,14 entrada / US$ 0,28 saída por 1 milhão de tokens na CodeRouter . | 1 milhão de tokens . | É uma variante diferente; não convém transferir automaticamente para ela os benchmarks de V4-Pro ou V4-Pro-Max . |
Há uma discrepância importante para Claude: a ficha específica da Artificial Analysis reporta US$ 5/US$ 25 e 1 milhão de contexto, enquanto a tabela da CodeRouter usada para Kimi lista outros valores para Claude . Para orçamento de produção, vale a regra óbvia, mas frequentemente ignorada: use sempre o preço atual do seu provedor e o contrato em vigor.
Claude Opus 4.7 é a primeira opção a validar em revisão de código complexa, análise longa e tarefas em que encontrar defeitos escondidos vale mais do que economizar tokens. A justificativa é sua vantagem em HLE frente a GPT-5.5 e DeepSeek, sua liderança em SWE-Bench Pro segundo a CodeRouter, e a avaliação da Artificial Analysis, que o coloca entre os modelos líderes de inteligência, embora com custo, latência e verbosidade elevados . Ele também aparece com 1 milhão de contexto e disponibilidade via API da Anthropic, Amazon Bedrock, Microsoft Azure e Google Vertex, segundo a Artificial Analysis .
GPT-5.5 não supera Claude Opus 4.7 em HLE nos dados da VentureBeat, mas tem o melhor resultado reportado em Terminal-Bench 2.0: 82,7%, contra 69,4% de Claude Opus 4.7 e 67,9% de DeepSeek V4 . Se sua equipe já trabalha em ChatGPT ou Codex, uma guia prática o apresenta como uma rota natural antes de migrar tudo para outro fornecedor .
Kimi K2.6 é o caso mais claro de custo/desempenho nas fontes disponíveis. A CodeRouter o coloca empatado com GPT-5.5 no SWE-Bench Pro, com 58,6%, e lista preço de US$ 0,60/US$ 4,00 por 1 milhão de tokens . A janela de 256 mil tokens é menor que o 1 milhão reportado para GPT-5.5 e DeepSeek V4-Pro na mesma tabela, mas pode ser suficiente se seu repositório, documentação e histórico de tarefa couberem nesse espaço .
Se operar seus próprios pesos for importante, a Verdent afirma que o K2.6 está no Hugging Face e roda com vLLM, SGLang ou KTransformers; a mesma fonte cita 4× H100 como hardware mínimo viável para a variante INT4 com contexto reduzido .
DeepSeek V4 Pro/Pro-Max fica atrás de Claude Opus 4.7 e GPT-5.5 em HLE, Terminal-Bench 2.0 e SWE-Bench Pro nos números da VentureBeat, mas a combinação de preço e 1 milhão de contexto o torna competitivo para pipelines com muitas chamadas . Se o objetivo for custo mínimo, V4 Flash aparece ainda mais barato na CodeRouter, mas deve ser tratado como variante separada de V4-Pro .
Se a prioridade absoluta for qualidade, comece por Claude Opus 4.7. Se o trabalho depende de terminal, agentes ou integração com o ecossistema OpenAI, teste GPT-5.5. Se você quer coding competitivo com custo baixo, Kimi K2.6 merece a primeira avaliação. Se o problema principal for volume barato com contexto longo, DeepSeek V4-Pro ou V4 Flash é a rota a validar, aceitando que ele não lidera os benchmarks mais duros nas fontes disponíveis .