O Claude passou de 49,0% no SWE bench Verified, com o Claude 3.5 Sonnet atualizado, para 72,5%–72,7% na geração Claude 4 e 97,0% para o Opus 5 em um leaderboard posterior. O SWE bench Verified mede a resolução de 500 issues públicas, sobretudo em repositórios Python; como o teste está perto da saturação, ele diferen...
Publicado porEditado com GPT-5.6 TerraImagens geradas com GPT Image 2
Resposta de pesquisa

Create a landscape editorial hero image for this Studio Global article: As of September 2026, how do Anthropic’s Claude models perform across the major SWE-bench coding benchmarks—including the definitions, probl. Article summary: As of September 2026, Claude appears to lead the reported SWE-bench results, but the evidence supports a narrower conclusion than “Anthropic is unambiguously best at software engineering.” SWE-bench Verified is close to . Topic tags: general, general web, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
Os resultados reportados para Claude em benchmarks de programação impressionam: o Claude 3.5 Sonnet atualizado alcançou 49,0% no SWE-bench Verified no início de 2025; os modelos Claude 4 chegaram a 72,5%–72,7% poucos meses depois; e um leaderboard mais recente apontou 97,0% para o Claude Opus 5. 23
24
9
A leitura correta não é que o Claude “resolveu” a engenharia de software. É que ele se tornou altamente competitivo — e, em alguns rankings publicados, líder — em avaliações de agentes de programação. Quando um benchmark público e finito se aproxima de 100%, a pergunta mais relevante deixa de ser quem ganhou mais um ponto percentual e passa a ser: qual teste prevê melhor o desempenho no repositório, nas ferramentas e no processo de revisão da sua equipe?
| Benchmark | O que o agente faz | Cobertura e pontuação | Por que importa |
|---|---|---|---|
| SWE-bench Verified | Recebe uma issue real do GitHub e um instantâneo do repositório; então produz um patch. | Conjunto de 500 casos do SWE-bench filtrados por humanos, formado principalmente por projetos Python populares de código aberto. A tarefa conta como resolvida quando o patch passa nos testes do ambiente de avaliação. |
É uma referência amplamente usada para testar a correção de issues em bases de código reais. |
| SWE-bench Pro | Resolve tarefas de repositórios mais difíceis e de horizonte mais longo, sob uma estrutura padronizada de agente. | Reportado com 1.865 tarefas de 41 repositórios, em 123 linguagens; normalmente medido por Pass@1. |
Busca ampliar o escopo além das tarefas públicas e centradas em Python do Verified, além de reduzir o risco de contaminação. |
| Terminal-Bench 4.0 | Executa trabalho técnico de ponta a ponta em um terminal. | Inclui investigação, execução de comandos, edição, testes e recuperação de erros — não apenas a criação de um patch para uma issue. |
Acrescenta exigências operacionais e de uso de ferramentas mais próximas de fluxos de trabalho de agentes. |
A Anthropic informou que o Claude 3.5 Sonnet atualizado obteve 49,0% no SWE-bench Verified, acima do então recorde reportado de 45%. Naquele momento, nenhum modelo havia ultrapassado 50% no teste. 23
37
Em maio de 2025, a empresa informou 72,5% para o Claude Opus 4 e 72,7% para o Claude Sonnet 4 no SWE-bench Verified. Esses números foram reportados sem extended thinking. 24
Em 2026, o retrato dos leaderboards mudou de forma substancial. A Vals AI reporta 97,0% para o Claude Opus 5; sete modelos avaliados aparecem com 95% ou mais, e o DeepSeek V4 Pro 0813 registra 96,4%. 9 Portanto, dizer que o Opus 5 ficou “na casa dos 96%” é uma simplificação razoável para um resultado reportado muito alto, mas não um número único e definitivo: a pontuação varia com a versão do modelo, a estrutura do agente, o orçamento de tokens e a configuração da avaliação.
Em um conjunto de 500 tarefas, 97% deixa pouca margem para separar sistemas de fronteira. Além disso, o Verified é composto por tarefas públicas e finitas extraídas de repositórios públicos. Guias sobre benchmarks o classificam como de alto risco de contaminação e próximo da saturação. 3
Isso não torna a pontuação inútil. Ela continua sendo evidência de que um agente consegue resolver esse tipo de issue bem especificada e verificável por testes. Mas é uma previsão mais fraca para trabalho novo em uma base de código privada, em evolução constante e cheia de conhecimento interno não documentado.
O SWE-bench Pro é apresentado como uma alternativa mais difícil e mais resistente à contaminação. A cobertura reportada é de 1.865 tarefas em 41 repositórios e 123 linguagens de programação, contra os 500 casos filtrados por humanos do Verified, concentrados em projetos Python populares. 12
16
Um leaderboard agregado publicado em setembro de 2026 lista Claude Fable 5.1 com 81,2%, à frente de Claude Mythos 5, com 80,3%, e Claude Fable 5, com 80,0%. 53 Nesse ranking, as três primeiras posições são ocupadas por modelos Claude.
Há, porém, uma ressalva importante: nem todos os números do Pro são comparáveis diretamente. Uma fonte diferencia os 59,1% do líder no conjunto público padronizado da Scale de resultados agregados mais altos fornecidos por vendedores, o que ilustra o peso da estrutura do agente e da metodologia de divulgação. 13 Outra fonte alerta que os 81,2% atribuídos ao Fable 5.1 não estão claramente sustentados por um resultado específico do modelo publicado diretamente e podem refletir uma agregação ou atribuição incorreta de versão.
55
Na prática, convém tratar 81,2% como um valor reportado em leaderboard, e não como um fato independente, consolidado e replicado sobre o modelo-base isoladamente.
O Terminal-Bench avalia trabalho técnico de agentes em ambiente de linha de comando, como compilar software ou treinar um modelo de aprendizado de máquina. Ao contrário do formato de issue e patch do SWE-bench Verified, ele testa um fluxo mais operacional. 38
A comparação citada informa 55,8% para Claude Fable 5.1 e 37,3% para GPT-5.6 Sol — uma diferença de 18,5 pontos percentuais. 44 É uma evidência relevante de que a configuração reportada do Claude teve desempenho superior nessa avaliação.
Mas isso não estabelece um ranking geral entre Anthropic, OpenAI, Google, Cognition ou AWS. Uma afirmação ampla desse tipo exigiria modelos comparados sob a mesma estrutura de agente, com orçamentos equivalentes de tempo e tokens, e resultados em várias suítes independentes. As evidências fornecidas não trazem essa comparação completa.
Os dados disponíveis sustentam três conclusões mensuráveis:
Os dados não demonstram que Claude consiga concluir sozinho projetos de várias semanas, compreender com confiabilidade sistemas internos sem documentação, tomar boas decisões de arquitetura ou publicar mudanças em produção sem revisão humana. As tarefas do SWE-bench têm resultados verificáveis por testes; engenharia de software real também envolve descoberta de requisitos, escolhas técnicas, integração, segurança, implantação e colaboração.
O SWE-bench Verified foi importante porque foi além de pequenos exercícios de programação: os agentes trabalham em repositórios reais, recebem descrições de issues e têm seus patches avaliados por testes. 1
38 Porém, segundo a discussão da Anthropic sobre avaliações de agentes, os modelos avançaram de cerca de 40% para mais de 80% nesse teste em apenas um ano.
38
Neste estágio, uma avaliação útil deveria combinar:
A Anthropic cita tanto o SWE-bench Verified quanto o Terminal-Bench como exemplos de avaliações de agentes e destaca a capacidade do Claude 4 em tarefas de longa duração. 38
42 Ainda assim, as fontes disponíveis não bastam para provar uma mudança formal, em toda a empresa, do SWE-bench para avaliações de horizonte mais longo.
O desempenho reportado do Claude em benchmarks o coloca entre as opções mais fortes de agentes de programação a considerar em setembro de 2026. O marco mais claro é a passagem de 49% no SWE-bench Verified no início de 2025 para 97,0% em um leaderboard para o Opus 5, somada à liderança reportada de 81,2% no SWE-bench Pro. 23
9
53
Para escolher uma ferramenta, não decida com base em uma única manchete. Use esses placares para montar uma lista curta de candidatos e, em seguida, faça uma avaliação controlada com tarefas representativas dos seus próprios repositórios. Benchmarks públicos quase saturados mostram que os modelos conseguem corrigir muitos problemas de um padrão conhecido; sozinhos, não provam engenharia autônoma confiável em uma organização de produção.
Studio Global AI
Esta página inclui uma resposta baseada na fonte que você pode continuar em Studio Global.
O Claude passou de 49,0% no SWE bench Verified, com o Claude 3.5 Sonnet atualizado, para 72,5%–72,7% na geração Claude 4 e 97,0% para o Opus 5 em um leaderboard posterior.
O Claude passou de 49,0% no SWE bench Verified, com o Claude 3.5 Sonnet atualizado, para 72,5%–72,7% na geração Claude 4 e 97,0% para o Opus 5 em um leaderboard posterior. O SWE bench Verified mede a resolução de 500 issues públicas, sobretudo em repositórios Python; como o teste está perto da saturação, ele diferencia cada vez menos os sistemas de ponta.
No Terminal Bench 4.0 citado, Claude Fable 5.1 marcou 55,8%, ante 37,3% do GPT 5.6 Sol.