| 80.6 |
| 80.2 |
| SWE-Bench Pro | 60.6 | 55.4 | 58.6 |
| SWE-Bench Multilingual | 78.3 | — | 76.7 |
| Terminal-Bench 2.0 | 69.7 | 67.9 | 66.7 |
| LiveCodeBench (Pass@1) | — | 93.5 | 89.6 |
| Codeforces Rating | — | 3206 | — |
| SciCode | 53.5 | — | — |
Aqui, a conversa muda. O foco está em matemática, ciência e exames complexos.
| Benchmark | Qwen3.7 Max | DeepSeek V4 Pro Max | Kimi K2.6 Thinking |
|---|---|---|---|
| GPQA Diamond | 92.4 | — | — |
| HLE (com ferramentas) | 41.4 | 37.7 | 54.0 |
| HMMT 2026 (Matemática) | 97.1% | 95.2% | |
| AIME 2026 | — | — | 96.4% |
| IMOAnswerBench | 90.0 | 89.8 | — |
| Chinese SimpleQA | — | 84.4 | 75.9 |
| DeepSearchQA (F1) | — | — | 92.5 |
Aqui, o jogo vira completamente. O melhor desempenho nem sempre cabe no bolso.
| Componente do Preço | Qwen3.7 Max | DeepSeek V4 Pro | Kimi K2.6 |
|---|---|---|---|
| Input (cache miss) | $2.50 | $0.435 ($1.74 sem promoção*) | $0.95 |
| Output | $7.50 | $0.87 ($3.48 sem promoção*) | |
| Cache Hit (input) | $0.25 (-90%) | $0.0036 (-99%) | $0.16 (-83%) |
| Janela de Contexto | 1M tokens | 1M tokens | |
| Máximo de Tokens de Saída | 65,536 | 384,000 | — |
| Código Aberto (Open Weights) | Não (somente API) | Sim (Hugging Face) | Sim |
Nota sobre o preço do DeepSeek: A DeepSeek tornou permanente um desconto de 75% . Assim, os preços promocionais de $0.435 (entrada) e $0.87 (saída) agora são o preço oficial. O valor sem desconto de $1.74 / $3.48 é um valor de tabela que serve apenas como referência histórica . A tabela já reflete o preço oficial permanente.
O Mestre da Programação Pura: DeepSeek V4 Pro Max
Se você busca potência bruta para escrever e depurar código, o DeepSeek é imbatível. Com um rating de 3206 no Codeforces e 93.5% no LiveCodeBench, ele supera todos os concorrentes diretos nesses quesitos . Além disso, seu preço agressivo o torna a opção com melhor custo-benefício por uma margem considerável.
O Campeão dos Agentes e Ferramentas: Kimi K2.6
O modelo da Moonshot AI é rei quando o assunto é usar o computador de forma autônoma. Ele lidera em cenários de busca profunda (DeepSearchQA 92.5 F1) e no uso de ferramentas externas, como mostra a pontuação de 54.0 no HLE com ferramentas . Se seu fluxo de trabalho depende de agentes que pesquisam e executam múltiplas tarefas, o Kimi é imbatível.
O Balanço do Raciocínio: Qwen3.7 Max
O modelo da Alibaba é o azarão que surpreende no raciocínio lógico-matemático. Com 97.1% no HMMT e 92.4% no GPQA Diamond, ele prova que tem uma capacidade de abstração e lógica afiada . Se você precisa de um generalista muito forte em raciocínio, ele é a melhor pedida.
A Escolha pelo Custo-Benefício
Não há discussão: o DeepSeek V4 Pro Max é o mais barato por uma margem enorme, chegando a custar centavos de dólar por milhão de tokens com cache. O Kimi K2.6 oferece um meio-termo interessante, enquanto o Qwen3.7 Max cobra um valor premium que se justifica apenas para cargas de trabalho pesadas de raciocínio .
Um Alerta Importante: O Relatório do NIST sobre o DeepSeek V4
Uma avaliação de maio de 2026 feita pelo NIST (Instituto Nacional de Padrões e Tecnologia dos EUA) descobriu que os benchmarks divulgados pela DeepSeek para o V4 Pro são otimistas. Em testes independentes e não públicos, o desempenho do modelo foi mais próximo do GPT-5 (lançado em agosto de 2025) do que do topo de linha atual . Isso serve como um lembrete para sempre testar o modelo com seus próprios dados e tarefas antes de decidir.
| 92.7% |
| $4.00 |
| 256K tokens |