| 64,3% |
| 58,6% |
| ~21,4%* |
| ~19,4%* |
| ~18,1%* |
| SWE-Bench Verified (Correção de Bugs) | ~83% (est.) | 87,6% | 85,0% | 82,1% | 81,0% | 80,6% |
| Terminal-Bench 2.0/2.1 (Codificação no Terminal) | 74,6% | 66,1–69,4% | 78,2–82,7% | 76,2% | 68,5% | 65,0% |
| OSWorld-Verified (Uso do Computador) | 83,4% | 82,8% | 78,7% | 75,0% | 72,1% | 70,5% |
| GDPval-AA (Trabalho de Conhecimento) | 1890 ELO | 1753 ELO | 1620–1769 ELO | 1656 ELO | 1500–1570 ELO | 1550 ELO |
| O Último Exame da Humanidade (com ferramentas) | 57,9% | 54,7% | — | — | — | — |
| O Último Exame da Humanidade (sem ferramentas) | 49,8% | — | — | — | — | — |
| GPQA Diamond (Raciocínio Científico) | ~94% (est.) | 94,2% | 96,0% | 92,4% | 90,1–91,5% | 95,1% |
| ARC-AGI-2 (Raciocínio Visual Abstrato) | ~80% (est.) | 80,2% | 85,0% | 75,8% | 76,1% | 74,0% |
| MCP Atlas (Confiabilidade no Uso de Ferramentas) | — | 77,3% | 79,1% | 83,6% | 74,2% | 71,5% |
| Índice de Inteligência AA (v4.0) | ~59–60 (est.) | 59 | 60 | 57 | 53 | 55 |
| Agente Financeiro v2 | 53,9% | 51,5% | — | — | — | — |
| LiveCodeBench (Programação Competitiva) | — | — | ~91–92% (est.) | — | — | 93,5% |
| Codeforces ELO (Rating em Competições) | — | ~3050 (est.) | 3168 | — | — | 3206 |
| FrontierMath Nível 1–3 | — | 43,8% | 51,7% | — | — | — |
| MMLU-Pro (Conhecimento Multidisciplinar) | — | — | — | — | — | 87,5% |
| AIME 2025 (Matemática) | — | — | 95,2% | — | — | — |
| BrowseComp (Pesquisa na Web) | — | 79,3% | 84,4% | — | — | — |
* As pontuações do SWE-Bench Pro para Gemini 3.5 Flash, Grok 4.3 e DeepSeek V4 Pro vêm de um único teste de terceiros . O modelo oficial do Google mostra números diferentes (veja as notas abaixo).
De nada adianta o modelo ser o melhor do mundo se ele não cabe no seu bolso. Esta tabela resume o custo por token, a rapidez na resposta e quanta informação cada modelo consegue processar de uma só vez.
| Métrica | Claude Opus 4.8 | Claude Opus 4.7 | GPT-5.5 | Gemini 3.5 Flash | Grok 4.3 | DeepSeek V4 Pro |
|---|---|---|---|---|---|---|
| Preço de Entrada (por 1M tokens) | $5,00 | $15,00 | $5,00 | $1,50 | $1,25–1,50 | ~$0,50–2,00 (est.) |
| Preço de Saída (por 1M tokens) | $25,00 | ~$75,00 (est.) | $30,00 | $9,00 | ||
| Velocidade de Saída (tokens/segundo) | ~90–100 (est.) | ~67–78 | ~71 | |||
| Janela de Contexto | 1M | 200K | 400K | 1M | ||
| Data de Lançamento | 28 de mai. 2026 | 16 de abr. 2026 | 23 de abr. 2026 | 19 de mai. 2026 | 30 de abr. 2026 | 24 de abr. 2026 |
| Ranking BenchLM (Provisório) | #2 de 119 | — | #5 de 119 | — | — | — |
Em vez de tentar cravar um vencedor absoluto, a análise realista mostra que cada modelo tem a sua praia.
| ~$6,00–8,00 (est.) |
| ~$2,00–8,00 (est.) |
| 289 |
| ~159–207 |
| ~80–100 (est.) |
| 1M |
| 1M |