| 80.2 |
| SWE-Bench Pro | 60.6 | 55.4 | 58.6 |
| SWE-Bench Multilingual | 78.3 | — | 76.7 |
| Terminal-Bench 2.0 | 69.7 | 67.9 | 66.7 |
| LiveCodeBench (Pass@1) | — | 93.5 | 89.6 |
| Codeforces Rating | — | 3206 | — |
| SciCode | 53.5 | — | — |
Aqui, a conversa muda. O foco está em matemática, ciência e exames complexos.
Aqui, o jogo vira completamente. O melhor desempenho nem sempre cabe no bolso.
Nota sobre o preço do DeepSeek: A DeepSeek tornou permanente um desconto de 75%
. Assim, os preços promocionais de $0.435 (entrada) e $0.87 (saída) agora são o preço oficial. O valor sem desconto de $1.74 / $3.48 é um valor de tabela que serve apenas como referência histórica
. A tabela já reflete o preço oficial permanente.
O Mestre da Programação Pura: DeepSeek V4 Pro Max
Se você busca potência bruta para escrever e depurar código, o DeepSeek é imbatível. Com um rating de 3206 no Codeforces e 93.5% no LiveCodeBench, ele supera todos os concorrentes diretos nesses quesitos . Além disso, seu preço agressivo o torna a opção com melhor custo-benefício por uma margem considerável.
O Campeão dos Agentes e Ferramentas: Kimi K2.6
O modelo da Moonshot AI é rei quando o assunto é usar o computador de forma autônoma. Ele lidera em cenários de busca profunda (DeepSearchQA 92.5 F1) e no uso de ferramentas externas, como mostra a pontuação de 54.0 no HLE com ferramentas . Se seu fluxo de trabalho depende de agentes que pesquisam e executam múltiplas tarefas, o Kimi é imbatível.
O Balanço do Raciocínio: Qwen3.7 Max
O modelo da Alibaba é o azarão que surpreende no raciocínio lógico-matemático. Com 97.1% no HMMT e 92.4% no GPQA Diamond, ele prova que tem uma capacidade de abstração e lógica afiada . Se você precisa de um generalista muito forte em raciocínio, ele é a melhor pedida.
A Escolha pelo Custo-Benefício
Não há discussão: o DeepSeek V4 Pro Max é o mais barato por uma margem enorme, chegando a custar centavos de dólar por milhão de tokens com cache. O Kimi K2.6 oferece um meio-termo interessante, enquanto o Qwen3.7 Max cobra um valor premium que se justifica apenas para cargas de trabalho pesadas de raciocínio .
Um Alerta Importante: O Relatório do NIST sobre o DeepSeek V4
Uma avaliação de maio de 2026 feita pelo NIST (Instituto Nacional de Padrões e Tecnologia dos EUA) descobriu que os benchmarks divulgados pela DeepSeek para o V4 Pro são otimistas. Em testes independentes e não públicos, o desempenho do modelo foi mais próximo do GPT-5 (lançado em agosto de 2025) do que do topo de linha atual . Isso serve como um lembrete para sempre testar o modelo com seus próprios dados e tarefas antes de decidir.