DeepSeek V4 Pro 0813 detectó 28 de 32 vulnerabilidades al combinar tres ejecuciones, con un coste aproximado de 295 dólares. Los resultados favorecen un sistema orquestado: agentes económicos y exploratorios para descubrir problemas, modelos precisos o consistentes para validarlos y revisión humana antes de tomar de...
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: What did Aikido’s August 2026 benchmark of 10 AI models—using 11.7 billion tokens, 32 recently disclosed real-world vulnerabilities, three i. Article summary: Aikido’s result was not that one model is universally “best,” but that agentic vulnerability discovery is highly stochastic and system-dependent. Pooling three independent, internet-free investigations materially improve. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
El benchmark publicado por Aikido en agosto de 2026 puso a prueba 10 modelos de IA frente a 32 vulnerabilidades reveladas recientemente. Cada modelo realizó tres investigaciones independientes, sin acceso a internet y con un límite de 30 turnos. En el resultado acumulado, DeepSeek V4 Pro 0813 quedó primero con 28 hallazgos, pero la conclusión más importante no es que exista un ganador absoluto: es que la seguridad depende tanto del sistema de investigación como del modelo elegido. 3
Al combinar sus tres ejecuciones, DeepSeek V4 Pro 0813 alcanzó 28 de 32 vulnerabilidades, es decir, un 87,5 % de recall acumulado. El recall indica cuántos de los fallos conocidos consiguió redescubrir el sistema.
La cifra debe interpretarse como un resultado de pass@3, no como una garantía de que una única llamada al modelo detecte 28 vulnerabilidades. Cada ejecución puede recorrer archivos, rutas de código e hipótesis de explotación diferentes. Al sumar los resultados, el sistema aprovecha esa diversidad de búsqueda y aumenta la cobertura.
En la práctica, el dato respalda una estrategia concreta: ejecutar varias investigaciones independientes en lugar de tratar la primera respuesta de un modelo como una auditoría de seguridad completa. 3
DeepSeek Pro cubrió 28 de 32 vulnerabilidades por aproximadamente 295 dólares en tres ejecuciones. Su principal fortaleza fue la amplitud: al combinar sus investigaciones, encontró más problemas que cualquier otro modelo del estudio.
Por eso encaja especialmente bien en la primera fase de un flujo de seguridad. Sus resultados, sin embargo, todavía necesitan pruebas, deduplicación y revisión de gravedad antes de convertirse en alertas para producción.
Tres ejecuciones de Flash encontraron 24 de 32 vulnerabilidades por unos 108 dólares. Esa relación entre cobertura y coste lo convierte en una opción atractiva para lanzar exploraciones paralelas, repetir análisis o ampliar la búsqueda con un presupuesto limitado.
Eso no significa que Flash sea necesariamente el mejor revisor final. Su valor está en multiplicar los intentos de investigación y entregar los hallazgos combinados a una fase posterior de verificación más selectiva. 3
Grok 4.6 destacó por su repetibilidad: 21 vulnerabilidades aparecieron en las tres ejecuciones. La consistencia es importante para equipos que necesitan informes previsibles, operaciones estables y menos variaciones entre análisis.
Su ventaja es distinta de la de DeepSeek Pro. Un modelo muy consistente puede ser preferible para la monitorización recurrente o los procesos estandarizados, aunque otro más exploratorio consiga un recall acumulado superior.
Claude Opus 5 alcanzó un recall acumulado de 26/32, mientras que GPT-5.6 Sol llegó a 25/32. Ambos siguieron siendo opciones de alto rendimiento, pero el resultado cuestiona la idea de que el modelo cerrado más caro tenga que ofrecer automáticamente la mejor cobertura de vulnerabilidades.
La elección de cualquiera de los dos debería basarse en el valor que aporte al conjunto del proceso: capacidad de razonamiento, calidad de los informes, comportamiento durante la revisión o confirmación de cadenas de explotación. No basta con elegir por marca o por reputación general en otros benchmarks. 3
El resultado más llamativo de Kimi K3 fue un 92,3 % de precisión acumulada. La precisión mide qué proporción de los hallazgos enviados fue aceptada, no cuántas vulnerabilidades detectó el modelo en total.
Esa diferencia le asigna un papel distinto al de un modelo de búsqueda amplia. Un agente con mucho recall puede explorar más y tolerar cierto ruido; uno con alta precisión puede ayudar a verificar hallazgos, redactar informes y reducir el número de alertas que llegan a los equipos de ingeniería.
Aikido observó que Qwen3.8-Max tendía a volver sobre la misma CVE —el identificador de una vulnerabilidad conocida— o sobre una ruta de razonamiento ya explorada. La repetición es ineficiente si consume turnos sin ampliar la cobertura, pero también puede servir para detectar una condición, una ruta de ejecución o un detalle de validación que se pasó por alto en el primer intento.
La solución debe estar en el nivel del sistema que coordina al agente. Hay que registrar qué se ha probado, limitar las ramas repetidas y enviar los casos pendientes a una investigación nueva, en lugar de reproducir automáticamente el mismo camino.
GLM-5.3 mejoró de 24/32 a 25/32 en la comparación actualizada y mantuvo un perfil de costes inferior al de las alternativas cerradas de frontera analizadas en el benchmark. Eso lo sitúa como un candidato viable para tareas de alto volumen o como componente de un conjunto de agentes.
Su ventaja es mayor cuando el ahorro permite ejecutar más investigaciones, no cuando se utiliza para justificar una única pasada del modelo.
Un sistema de detección de vulnerabilidades no debería reducir todo su rendimiento a una sola posición en una tabla:
Cada métrica refleja una necesidad operativa diferente. La fase de descubrimiento favorece un recall alto y comportamientos de investigación diversos. Las alertas destinadas a producción requieren precisión, pruebas reproducibles, deduplicación y una priorización de riesgos útil.
Por eso un modelo que es excelente para encontrar posibilidades puede ser una mala opción para enviar alertas sin revisar directamente a los desarrolladores. El coste relevante tampoco es solo el precio por token o por petición: es el coste de encontrar vulnerabilidades validadas y accionables.
La lección más importante del benchmark es que el rendimiento de los modelos fue estocástico. Una sola ejecución solo recorre una ruta de investigación; varias ejecuciones independientes aumentan la probabilidad de probar hipótesis diferentes.
Esa es la razón por la que tres ejecuciones relativamente económicas de DeepSeek pudieron igualar o superar la cobertura total de una única pasada de modelos de frontera más caros. La unidad relevante no es solo la llamada al modelo, sino la investigación completa: modelo, herramientas, instrucciones, límite de turnos, memoria, repeticiones y proceso de validación. 3
Una implementación inspirada en estos resultados debería separar el descubrimiento del juicio final:
Este enfoque de asignación de modelos es más sólido que tratar los modelos de pesos abiertos y los modelos cerrados como sustitutos directos. Los pesos por sí solos no constituyen un producto de seguridad: también hacen falta herramientas, memoria, control de estado, triage y reglas para gestionar los falsos positivos.
Los resultados de Aikido son útiles, pero no constituyen una clasificación universal de los modelos de IA para ciberseguridad. La prueba utilizó 32 vulnerabilidades reales reveladas recientemente, tres intentos por modelo y un arnés de agentes concreto. El rendimiento puede cambiar según el lenguaje de programación, la estructura del repositorio, el acceso a herramientas, el modelo de amenaza, el presupuesto de investigación y la tolerancia de cada organización a los falsos positivos. 3
La conclusión más prudente —y también la más útil— es más específica: en este entorno, los modelos de pesos abiertos, especialmente DeepSeek V4 Pro, pudieron rivalizar con modelos cerrados de frontera o superarlos cuando se combinaron con ejecuciones repetidas y una buena orquestación.
El mejor producto de seguridad no tiene por qué ser el modelo que encabeza una tabla. Es el sistema que combina descubrimiento amplio, validación fiable, control del ruido y evidencias que los equipos de ingeniería pueden utilizar para actuar.
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
DeepSeek V4 Pro 0813 detectó 28 de 32 vulnerabilidades al combinar tres ejecuciones, con un coste aproximado de 295 dólares.
DeepSeek V4 Pro 0813 detectó 28 de 32 vulnerabilidades al combinar tres ejecuciones, con un coste aproximado de 295 dólares. Los resultados favorecen un sistema orquestado: agentes económicos y exploratorios para descubrir problemas, modelos precisos o consistentes para validarlos y revisión humana antes de tomar decisiones importantes.