Um detalhe central é a configuração do teste. Resultados altos em SWE-bench costumam aparecer quando o modelo opera como agente: ele pode ler arquivos, executar código, inspecionar resultados de testes e tentar de novo depois de uma falha .
Isso não torna o resultado inválido. Pelo contrário: para muitos usos reais em desenvolvimento, esse é justamente o tipo de ambiente que importa. Mas significa que o número reflete uma combinação de fatores: a capacidade do modelo, as ferramentas disponíveis, o fluxo de avaliação e o número de oportunidades para iterar.
Os 93,9% não devem ser tratados como uma “nota geral” de Claude Mythos Preview. Um benchmark de software não mede, sozinho, raciocínio geral, segurança, custo operacional, disponibilidade, qualidade em tarefas fora de código ou desempenho em contextos muito diferentes de engenharia de software .
A regra prática é simples: compare modelos dentro do mesmo benchmark e em condições parecidas. Se um modelo tem acesso a arquivos, execução de código e várias iterações, enquanto outro responde sem ferramentas, a comparação direta pode levar a uma conclusão enganosa .
As métricas de cibersegurança associadas a Claude Mythos Preview pertencem a outra categoria. Uma fonte reporta 83,1% para Mythos Preview contra 66,6% do Claude Opus 4.6 em benchmarks de capacidade de cibersegurança . Outra afirma que Mythos alcançou 100% no Cybench, descrito como um benchmark de desafios de cibersegurança
.
As fontes da Anthropic disponíveis nesse contexto também se concentram nesse campo: o Anthropic Red Team publicou uma avaliação das capacidades de cibersegurança de Claude Mythos Preview, e o Project Glasswing inclui trabalho sobre identificação de vulnerabilidades e exploits com o modelo . Isso pode ser muito relevante para equipes de segurança, mas não deve ser misturado com SWE-bench como se tudo fosse uma única pontuação.
Se o seu caso de uso é um agente que trabalha sobre repositórios, corrige código, executa testes e melhora a solução por tentativa e erro, o 93,9% no SWE-bench é a referência mais útil para começar a análise .
Se o foco é análise de vulnerabilidades, revisão de segurança ou pesquisa de exploits, as métricas e avaliações de cibersegurança são o contexto mais adequado .
O resumo é: Claude Mythos Preview é reportado com 93,9% no SWE-bench, e essa é a resposta direta sobre seu benchmark mais citado . A leitura rigorosa é mais específica: trata-se de um sinal forte para tarefas de software em condições de avaliação próprias, não de uma prova automática de superioridade em todos os domínios.