Claude 3.5 Sonnet registró un 49,0% en SWE bench Verified a comienzos de 2025; Claude 4 llegó a alrededor del 72,5% 72,7%, y un ranking posterior atribuye un 97,0% a Claude Opus 5. SWE bench Verified reúne 500 incidencias públicas, revisadas por humanos y centradas principalmente en repositorios Python; su cercanía...
Publicado porEditado con GPT-5.6 TerraImágenes generadas con GPT Image 2
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: As of September 2026, how do Anthropic’s Claude models perform across the major SWE-bench coding benchmarks—including the definitions, probl. Article summary: As of September 2026, Claude appears to lead the reported SWE-bench results, but the evidence supports a narrower conclusion than “Anthropic is unambiguously best at software engineering.” SWE-bench Verified is close to . Topic tags: general, general web, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
Los resultados publicados de Claude en pruebas de programación han avanzado a gran velocidad: Anthropic informó de un 49,0% para Claude 3.5 Sonnet actualizado en SWE-bench Verified a comienzos de 2025; unos meses después comunicó 72,5% para Claude Opus 4 y 72,7% para Claude Sonnet 4. Más tarde, el ranking de Vals AI situó a Claude Opus 5 en 97,0%. 23
24
9
La lectura correcta no es que Claude haya resuelto la ingeniería de software. Sí es una señal sólida de que se ha vuelto muy competitivo —y con frecuencia líder— en evaluaciones públicas de agentes de código. Cuando un benchmark finito se acerca al 100%, la pregunta más útil deja de ser quién suma un punto más y pasa a ser: ¿qué prueba anticipa mejor el rendimiento en el repositorio, las herramientas y las revisiones de código de cada equipo?
| Benchmark | Qué hace el agente | Cobertura y puntuación | Por qué importa |
|---|---|---|---|
| SWE-bench Verified | Recibe una incidencia real de GitHub y una instantánea del repositorio; debe entregar un parche. | Es un conjunto de 500 casos de SWE-bench filtrados por humanos, principalmente de repositorios abiertos populares en Python. Se considera resuelto si el parche supera las pruebas del entorno de evaluación. |
Es una referencia ampliamente usada para medir la resolución de incidencias en bases de código reales. |
| SWE-bench Pro | Aborda tareas de repositorio más difíciles y de mayor duración bajo un andamiaje de agente estandarizado. | Se describe con 1.865 tareas de 41 repositorios y 123 lenguajes; suele puntuarse como Pass@1, es decir, éxito en el primer intento. |
Busca ir más allá de las tareas públicas y centradas en Python de Verified, y reducir el riesgo de contaminación. |
| Terminal-Bench 4.0 | Ejecuta trabajo técnico integral en una terminal. | Incluye investigación, ejecución de comandos, edición, pruebas y recuperación ante errores, no solo el parche para una incidencia de GitHub. |
Añade exigencias operativas y de uso de herramientas más próximas a los flujos de trabajo de un agente. |
Anthropic comunicó que Claude 3.5 Sonnet actualizado alcanzó el 49,0% en SWE-bench Verified, por encima del anterior resultado de referencia del 45%. En ese momento, ningún modelo había superado el 50% en la prueba. 23
37
En mayo de 2025, Anthropic informó de un 72,5% para Claude Opus 4 y un 72,7% para Claude Sonnet 4 en SWE-bench Verified. Esas cifras se comunicaron sin razonamiento extendido. 24
Para 2026, el panorama de los rankings ya era muy distinto. Vals AI registra un 97,0% para Claude Opus 5, con siete de los modelos evaluados en 95% o más y DeepSeek V4 Pro 0813 en 96,4%. 9 Por eso, hablar de «Opus 5 en torno al 96%» puede servir como resumen de un resultado en la franja alta del 90%, pero no como una cifra única y definitiva: el marcador cambia según la versión del modelo, el andamiaje del agente, el presupuesto de tiempo o tokens y el diseño de la evaluación.
Un 97% en un conjunto de 500 tareas deja poco margen para separar a los sistemas de frontera. Además, Verified está compuesto por tareas públicas y finitas procedentes de repositorios públicos. La guía sobre benchmarks lo caracteriza como una prueba con alto riesgo de contaminación y próxima a la saturación. 3
Eso no vuelve irrelevante el resultado. Indica, más bien, que sirve sobre todo como evidencia de que un agente puede resolver esta clase de incidencia bien especificada y verificable mediante pruebas. Es una señal mucho menos completa sobre trabajo nuevo en una base de código privada y en continua evolución.
SWE-bench Pro se presenta como una alternativa más exigente y más resistente a la contaminación. Su cobertura reportada es de 1.865 tareas en 41 repositorios y 123 lenguajes de programación, frente a las 500 instancias filtradas por humanos de Verified, centradas en repositorios Python populares. 12
16
Los rankings agregados publicados en septiembre de 2026 sitúan a Claude Fable 5.1 en 81,2%, por delante de Claude Mythos 5, con 80,3%, y Claude Fable 5, con 80,0%. 53 En ese listado, Claude ocupa las tres primeras posiciones.
Hay, no obstante, una salvedad importante: los resultados de Pro no siempre son comparables entre sí. Una fuente distingue el 59,1% del mejor resultado en el conjunto público estandarizado de Scale de cifras agregadas de proveedores más altas, lo que ilustra cuánto pueden afectar al resultado el arnés del agente y la metodología de reporte. 13 Otra fuente advierte expresamente que el 81,2% atribuido a Fable 5.1 no está respaldado con claridad por un resultado específico publicado directamente para ese modelo y podría responder a una agregación o a una atribución errónea de versión.
55
La conclusión práctica es sencilla: el 81,2% debe leerse como un valor publicado en un ranking, no como un hecho cerrado e independientemente replicado sobre el modelo base por sí solo.
Terminal-Bench evalúa trabajo técnico de un agente dentro de una interfaz de línea de comandos: por ejemplo, compilar software o entrenar un modelo de aprendizaje automático. A diferencia del formato de incidencia y parche de SWE-bench Verified, prueba un flujo de trabajo más operativo. 38
La comparación citada arroja 55,8% para Claude Fable 5.1 y 37,3% para GPT-5.6 Sol, una diferencia de 18,5 puntos. 44 Es una evidencia significativa de que la configuración de Claude reportada rindió mejor en esa evaluación.
No demuestra, sin embargo, una jerarquía general entre Anthropic, OpenAI, Google, Cognition o AWS. Para sostener una afirmación así harían falta modelos comparados en condiciones equivalentes, el mismo andamiaje de agente, presupuestos similares de tiempo y tokens, y resultados en varias suites independientes. La evidencia disponible no aporta esa comparación.
Los datos disponibles respaldan tres afirmaciones acotadas:
Lo que no prueban es que Claude pueda completar sin supervisión proyectos de varias semanas, comprender sistemas internos sin documentar, tomar buenas decisiones de arquitectura o desplegar código de forma segura sin revisión humana. Las tareas de SWE-bench tienen resultados verificables mediante tests; la ingeniería real incluye descubrir requisitos, decidir entre alternativas, integrar sistemas, proteger la seguridad, desplegar y colaborar.
SWE-bench Verified fue valioso porque superó los acertijos breves de programación: los agentes trabajan con repositorios reales y descripciones de incidencias, y sus parches se califican con pruebas. 1
38 Pero los modelos pasaron de alrededor del 40% a más del 80% en esta evaluación en apenas un año, según la explicación de Anthropic sobre evaluaciones de agentes.
38
A estas alturas, una evaluación útil debería combinar:
Anthropic ha citado tanto SWE-bench Verified como Terminal-Bench como ejemplos de evaluaciones de agentes y ha puesto el acento en la capacidad sostenida de Claude 4 para tareas largas. 38
42 Pero la evidencia aportada no basta para afirmar que exista un cambio formal, a escala de toda la compañía, desde SWE-bench hacia evaluaciones de mayor horizonte. Esa conclusión más fuerte sigue sin demostrarse.
El rendimiento publicado de Claude lo convierte en una de las opciones de agentes de programación más potentes que conviene evaluar a septiembre de 2026. El hito más claro es el salto del 49% en SWE-bench Verified a comienzos de 2025 al 97,0% atribuido a Opus 5 en un ranking posterior, junto con el 81,2% reportado como liderazgo en SWE-bench Pro. 23
9
53
Para elegir una herramienta, no basta con un titular ni con un solo marcador. Estas pruebas sirven para preseleccionar agentes; la decisión debería completarse con una evaluación controlada sobre tareas representativas de los propios repositorios. Un benchmark público casi saturado muestra que los modelos ya resuelven muchas incidencias de un tipo conocido. Por sí solo, no demuestra ingeniería autónoma y fiable en una organización de producción.
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
Claude 3.5 Sonnet registró un 49,0% en SWE bench Verified a comienzos de 2025; Claude 4 llegó a alrededor del 72,5% 72,7%, y un ranking posterior atribuye un 97,0% a Claude Opus 5.
Claude 3.5 Sonnet registró un 49,0% en SWE bench Verified a comienzos de 2025; Claude 4 llegó a alrededor del 72,5% 72,7%, y un ranking posterior atribuye un 97,0% a Claude Opus 5. SWE bench Verified reúne 500 incidencias públicas, revisadas por humanos y centradas principalmente en repositorios Python; su cercanía a la saturación limita su capacidad para distinguir a los modelos punteros.
SWE bench Pro amplía el alcance a 1.865 tareas, 41 repositorios y 123 lenguajes, pero sus resultados dependen mucho del arnés del agente y de la metodología empleada.