O DeepSeek V4 Pro 0813 encontrou 28 das 32 vulnerabilidades em três execuções combinadas, por cerca de US$ 295 — o melhor resultado de recall do benchmark, mas não uma garantia em uma única execução. Os resultados favorecem um sistema orquestrado: agentes econômicos e abrangentes para descoberta, modelos consistente...
Resposta de pesquisa

Create a landscape editorial hero image for this Studio Global article: What did Aikido’s August 2026 benchmark of 10 AI models—using 11.7 billion tokens, 32 recently disclosed real-world vulnerabilities, three i. Article summary: Aikido’s result was not that one model is universally “best,” but that agentic vulnerability discovery is highly stochastic and system-dependent. Pooling three independent, internet-free investigations materially improve. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
O benchmark divulgado pela Aikido em agosto de 2026 colocou 10 modelos de IA diante de 32 vulnerabilidades recentemente divulgadas. Cada modelo foi executado três vezes, e os resultados foram analisados em conjunto. O DeepSeek V4 Pro 0813 ficou à frente em recall agrupado, com 28 das 32 descobertas por cerca de US$ 295. 3
A conclusão mais importante, no entanto, não é que um modelo tenha vencido todos os demais. O teste mostra que a descoberta de vulnerabilidades depende de um sistema capaz de combinar investigações repetidas, validação de evidências, deduplicação e especialização entre modelos.
O DeepSeek V4 Pro 0813 alcançou 28 de 32 vulnerabilidades, ou 87,5% de recall agrupado, quando os resultados das três execuções foram combinados. Isso faz dele o modelo mais forte na etapa de descoberta do benchmark.
Mas há uma ressalva importante: trata-se de um resultado de pass@3, e não da demonstração de que uma única chamada ao modelo encontre 28 vulnerabilidades de forma confiável.
Execuções diferentes podem investigar arquivos, caminhos de execução e hipóteses de exploração distintos. Ao reunir os resultados, o sistema se beneficia dessa diversidade de busca. Na prática, o dado favorece várias investigações independentes, em vez de tratar a primeira resposta de um modelo como uma auditoria completa de segurança. 3
O DeepSeek Pro liderou a cobertura total, com 28 de 32 vulnerabilidades e custo aproximado de US$ 295 em três execuções. Sua principal vantagem foi a amplitude: quando as investigações foram combinadas, ele encontrou uma parcela maior dos problemas do conjunto de teste.
Isso o torna um candidato forte para a primeira etapa de um fluxo de segurança. Ainda assim, seus achados precisam passar por validação baseada em evidências, remoção de duplicidades e revisão de severidade antes de se transformarem em alertas para ambientes de produção.
Três execuções do Flash encontraram 24 das 32 vulnerabilidades por aproximadamente US$ 108. O resultado dá ao modelo um perfil atraente de cobertura por dólar e o torna adequado para varreduras paralelas econômicas ou novas tentativas dentro de um orçamento limitado.
Isso não significa que o Flash seja automaticamente a melhor opção para a revisão final. Seu valor está em aumentar o número de investigações realizadas e encaminhar os achados combinados para uma etapa de verificação mais seletiva. 3
O Grok 4.6 se destacou pela repetibilidade: 21 vulnerabilidades apareceram nas três execuções. Essa consistência é relevante para equipes que precisam de comportamento previsível, relatórios estáveis e menos variação entre uma análise e outra.
Sua força é diferente da apresentada pelo DeepSeek Pro. Um modelo altamente consistente pode ser mais adequado ao monitoramento recorrente e a fluxos padronizados, mesmo que um modelo mais exploratório alcance recall agrupado superior.
O Claude Opus 5 alcançou 26 de 32 no recall agrupado, enquanto o GPT-5.6 Sol chegou a 25 de 32. Os dois permaneceram entre as opções de melhor desempenho, mas os resultados enfraquecem a ideia de que o modelo fechado mais caro necessariamente oferece a maior cobertura de vulnerabilidades.
A escolha por qualquer um deles não deve se basear apenas na marca ou na reputação em benchmarks gerais. As equipes precisam avaliar se o raciocínio, a qualidade dos relatórios ou o comportamento na revisão acrescentam valor ao restante do pipeline de segurança. 3
O principal destaque do Kimi K3 foi a precisão agrupada de 92,3%. Essa métrica mede quantos dos achados apresentados foram aceitos, e não quantas vulnerabilidades foram encontradas no total.
A diferença é essencial. Um agente de alto recall pode pesquisar de forma ampla e tolerar mais ruído; um modelo de alta precisão pode ajudar a confirmar achados, preparar relatórios e reduzir o número de alertas encaminhados aos engenheiros.
A Aikido observou o Qwen3.8-Max revisitando a mesma CVE ou linha de raciocínio. A repetição é ineficiente quando consome turnos sem ampliar a cobertura, mas também pode ser útil: uma segunda análise pode revelar uma condição, um caminho de execução ou um detalhe de validação que havia passado despercebido.
A resposta prática está no controle de estado do próprio sistema. O agente precisa saber o que já foi testado, ter limites para ramificações repetidas e encaminhar casos não resolvidos para uma investigação nova, em vez de simplesmente reproduzir o mesmo caminho.
O GLM-5.3 passou de 24/32 para 25/32 na comparação atualizada, mantendo um perfil de custo inferior ao das alternativas fechadas de fronteira mencionadas no benchmark. Isso o posiciona como um trabalhador de alto volume ou como parte de um conjunto de agentes.
Seu maior valor aparece quando a organização usa custo e flexibilidade de implantação para executar mais investigações, em vez de depender de uma única passagem de qualquer modelo.
Um sistema de descoberta de vulnerabilidades não deveria resumir todo o desempenho a uma única posição em um ranking:
Cada métrica corresponde a uma necessidade operacional distinta. A descoberta favorece recall elevado e comportamento investigativo diversificado. Já os alertas enviados à produção exigem precisão, evidências reproduzíveis, deduplicação e uma classificação de risco útil.
Por isso, um modelo excelente para levantar possibilidades pode ser uma escolha ruim para enviar alertas diretamente aos desenvolvedores sem revisão.
A principal lição de engenharia de sistemas do teste é que o desempenho dos modelos foi estocástico. Uma única execução percorre apenas um caminho de investigação; várias execuções independentes aumentam a chance de testar hipóteses diferentes.
É por isso que três execuções relativamente baratas do DeepSeek conseguiram competir com — ou superar — a cobertura total de uma única passagem de modelos de fronteira mais caros. A unidade relevante não é apenas a chamada ao modelo, mas a investigação completa: modelo, ferramentas, instruções, limite de turnos, memória, novas execuções e processo de validação. 3
Uma implantação baseada nesses resultados deveria separar descoberta de julgamento:
Essa abordagem de roteamento entre modelos é mais robusta do que tratar modelos de pesos abertos e modelos fechados como substitutos diretos uns dos outros.
Os resultados da Aikido são úteis, mas não representam um ranking universal de modelos de IA para segurança. O teste cobriu 32 vulnerabilidades recentemente divulgadas, três tentativas por modelo e um conjunto específico de ferramentas e regras de execução. O desempenho pode mudar conforme a linguagem de programação, a estrutura do repositório, o acesso a ferramentas, o modelo de ameaça, o orçamento de investigação e a tolerância da organização a falsos positivos. 3
A conclusão mais defensável é mais específica — e também mais útil: nesse cenário, modelos de pesos abertos, especialmente o DeepSeek V4 Pro, conseguiram rivalizar com ou superar modelos fechados de fronteira quando combinados com repetição e orquestração.
O melhor produto de segurança não é necessariamente o modelo com a maior pontuação de destaque. É o sistema que combina descoberta ampla, validação confiável e evidências que os engenheiros conseguem transformar em ação.
Studio Global AI
Esta página inclui uma resposta baseada na fonte que você pode continuar em Studio Global.
O DeepSeek V4 Pro 0813 encontrou 28 das 32 vulnerabilidades em três execuções combinadas, por cerca de US$ 295 — o melhor resultado de recall do benchmark, mas não uma garantia em uma única execução.
O DeepSeek V4 Pro 0813 encontrou 28 das 32 vulnerabilidades em três execuções combinadas, por cerca de US$ 295 — o melhor resultado de recall do benchmark, mas não uma garantia em uma única execução. Os resultados favorecem um sistema orquestrado: agentes econômicos e abrangentes para descoberta, modelos consistentes ou precisos para validação e revisão humana para achados de maior impacto.