| Área | Benchmark | Resultado reportado | Como interpretar |
|---|---|---|---|
| Programação e agentes | SWE-bench Verified | 87,6% | A cifra mais forte e direta para avaliar tarefas de software no Claude Opus 4.7 . |
| Programação e agentes | SWE-bench Pro | 64,3% | Leitura complementar para tarefas de software mais exigentes ou diferentes do SWE-bench Verified . |
| Agentes em terminal | Terminal-Bench 2.0 | 69,4% | Mais útil quando o caso envolve operar em ambientes de terminal ou com ferramentas . |
| Agentes financeiros | Finance Agent v1.1 | 64,4% | Mais relevante para fluxos de análise ou automação financeira . |
| Coding interno | Benchmark interno de 93 tarefas | +13% de resolução vs. Opus 4.6 | Melhora relativa em uma avaliação específica, não promessa de ganho uniforme em qualquer projeto . |
| Agente de pesquisa interno | Score geral | 0,715 | A Anthropic apresenta como resultado forte para trabalho em múltiplas etapas em seu benchmark interno de research-agent . |
| Agente de pesquisa interno | General Finance | 0,813 vs. 0,767 do Opus 4.6 | Indica melhora frente ao Opus 4.6 no módulo financeiro interno da Anthropic . |
Para quem compara modelos como agentes de programação, o SWE-bench Verified é o dado mais claro entre as fontes disponíveis: a AWS reporta 87,6% para o Claude Opus 4.7 . Na prática, isso reforça o posicionamento do modelo em tarefas de engenharia de software e resolução de problemas de código, em linha com a descrição da Anthropic de que o Opus 4.7 é forte em raciocínio complexo e programação agêntica .
Mas esse percentual não equivale ao desempenho geral do modelo em qualquer cenário. SWE-bench Verified mede um recorte específico de capacidade; não substitui benchmarks de terminal, finanças, visão, tarefas longas ou pesquisa. Para uma decisão técnica mais segura, faz sentido olhar pelo menos o SWE-bench Pro e o Terminal-Bench 2.0 junto com a pontuação principal .
Nem todas as fontes publicam a mesma pontuação. Uma fonte secundária reporta 82,4% no SWE-bench Verified, enquanto a AWS reporta 87,6% para o Claude Opus 4.7 . Essa diferença importa: copiar apenas o percentual, sem explicar a origem, pode levar a uma comparação ruim.
A leitura mais prudente é sempre informar o nome exato do benchmark, a pontuação e a fonte. Além disso, a AWS afirma que o Opus 4.7 pode exigir mudanças de prompting e ajustes de harness para ser melhor aproveitado, o que reforça que a configuração da avaliação pode influenciar o resultado observado .
Se o foco é programação, comece pelo SWE-bench Verified, mas não pare nele. O SWE-bench Pro e o Terminal-Bench 2.0 ajudam a observar cenários em que o modelo precisa lidar com tarefas de software mais complexas ou interagir com ambientes e ferramentas .
Se o objetivo é finanças ou pesquisa, os dados internos da Anthropic ficam mais próximos desse tipo de fluxo. No benchmark interno de research-agent, o Opus 4.7 obteve 0,715 de score geral e 0,813 em General Finance, contra 0,767 do Opus 4.6 nesse módulo . Ainda assim, esses números devem ser lidos como avaliações internas, não como verificação independente.
Se o interesse está em workflows empresariais longos, a informação pública aponta melhorias em tarefas de longa duração, acompanhamento de instruções e trabalho sob ambiguidade, segundo a AWS citando a Anthropic . Nesse contexto, benchmarks servem como ponto de partida; a validação mais importante é testar com seu próprio harness, suas ferramentas e seus prompts.
O benchmark mais forte e fácil de citar do Claude Opus 4.7 é 87,6% no SWE-bench Verified, especialmente relevante para programação agêntica . A interpretação correta, porém, é mais cuidadosa: o modelo também aparece com 64,3% no SWE-bench Pro, 69,4% no Terminal-Bench 2.0 e 64,4% no Finance Agent v1.1, enquanto a Anthropic destaca melhorias internas em trabalho de múltiplas etapas e finanças .
A comparação responsável não é perguntar apenas qual é o benchmark do Claude Opus 4.7, mas qual benchmark se parece com o seu fluxo real. Para desenvolvimento de software, o SWE-bench Verified é um bom ponto de partida; para agentes, terminal, finanças ou pesquisa, os resultados complementares podem contar tanto quanto — ou até mais.