Si necesitas una primera opción para ingeniería de software seria, empieza por Claude Code con modelos Opus. Emergent identifica Claude Code con Opus 4.6 como opción para depuración compleja, razonamiento en múltiples archivos y cambios de alto riesgo; Awesome Agents informa, además, que Claude Opus 4.5/4.6 queda por delante cuando Scale SEAL estandariza el uso de herramientas en SWE-bench Pro.
Eso no significa que Claude gane siempre. Awesome Agents también reporta GPT-5.4 con 57,7 % en SWE-bench Pro cuando se usa andamiaje personalizado de agente, mientras que el leaderboard de SWE-bench muestra entradas de Gemini 3 Flash en 75,80 y GPT-5-2 Codex en 72,80.
| Prioridad | Punto de partida | Por qué |
|---|---|---|
| Depuración compleja, cambios multiarchivo y modificaciones de alto riesgo | Claude Code con modelos Opus | Emergent sitúa Claude Code con Opus 4.6 en este tipo de trabajo, y Awesome Agents señala ventaja para Claude Opus 4.5/4.6 cuando la herramienta se estandariza en SWE-bench Pro. |
| SWE-bench Pro con agente propio o andamiaje personalizado | GPT-5.4 | Awesome Agents reporta GPT-5.4 con 57,7 % en SWE-bench Pro usando andamiaje personalizado de agente. |
| Selección guiada por el leaderboard público de SWE-bench | Gemini 3 Flash y GPT-5-2 Codex | La fuente de SWE-bench muestra Gemini 3 Flash con 75,80 y GPT-5-2 Codex con 72,80 en las entradas visibles. |
| Lista corta amplia de modelos | Comparar varios rankings | LLM Stats dice que combina arenas de programación en vivo, benchmarks y ejemplos reales de generación en 144 modelos, 7 arenas de código, 46 benchmarks y 726 votos ciegos. |
| Un ganador universal para todos los equipos | No hay una elección defendible | El líder cambia cuando cambia la evaluación, especialmente al comparar andamiaje personalizado frente a herramientas estandarizadas. |
El caso de Claude es más convincente cuando el trabajo se parece a la ingeniería de software real, no a escribir una función desde cero. Emergent plantea que el rendimiento en programación depende de cómo un sistema soporta trabajo de varios pasos a nivel de repositorio bajo presión, y sitúa a Claude Code con Opus 4.6 en depuración compleja, razonamiento multiarchivo y cambios de alto riesgo.
La parte importante para un equipo de desarrollo es la estabilidad del contexto. Emergent afirma que Claude Code mantiene contexto en bases de código grandes y aguanta la depuración iterativa sin degradarse. En la práctica, eso importa cuando un bug salta entre seis archivos, las pruebas fallan por razones indirectas o el asistente debe modificar poco y explicar bien.
El segundo punto clave es el control del entorno. Awesome Agents señala que GPT-5.4 lidera SWE-bench Pro con andamiaje personalizado, pero que Claude Opus 4.5/4.6 se adelanta en la evaluación Scale SEAL de SWE-bench Pro cuando se estandariza la capa de agente. Para comparar asistentes de programación con agente, no basta con mirar el nombre del modelo: hay que mirar el conjunto modelo + herramientas + permisos + pruebas.
GPT-5.4 y GPT-5-2 Codex deben estar en cualquier prueba seria si tu equipo toma decisiones por benchmarks o ya trabaja con flujos cercanos a Codex. Awesome Agents reporta GPT-5.4 liderando SWE-bench Pro con 57,7 % cuando usa andamiaje personalizado, y describe SWE-bench Pro como una variante más difícil con 1.865 tareas en 41 repositorios.
La fuente de SWE-bench también muestra GPT-5-2 Codex con 72,80 en las entradas visibles. Es una señal fuerte para equipos que optimizan contra benchmarks, pero no cierra la discusión: la misma evidencia muestra que el andamiaje personalizado frente al estandarizado puede cambiar qué modelo queda primero.
Gemini entra con fuerza por el lado del leaderboard. La fuente de SWE-bench muestra Gemini 3 Flash (high reasoning) con 75,80, por delante de la entrada visible de GPT-5-2 Codex con 72,80.
Eso hace que Gemini sea una opción que conviene probar si SWE-bench pesa mucho en tu proceso de selección. Aun así, una entrada pública de benchmark no garantiza el mismo resultado dentro de tu repositorio: tu base de código, tus permisos, tu suite de pruebas, tus estándares de revisión y tu capa de agente pueden cambiar el resultado práctico.
Las listas de mejores modelos para programar suelen contradecirse porque no miden exactamente lo mismo.
La conclusión práctica: usa los rankings públicos para armar una lista corta, no para sustituir tu propia evaluación.
Haz una prueba controlada con tareas que se parezcan a tu día a día. Usa el mismo repositorio, las mismas instrucciones, los mismos permisos, el mismo límite de tiempo y el mismo proceso de revisión para cada candidato.
Un buen conjunto de prueba debería incluir:
pull request para detectar cambios riesgosos o innecesarios.Separa la evaluación del modelo de la evaluación de la herramienta que lo rodea. La evidencia disponible muestra que el andamiaje personalizado frente al estandarizado puede cambiar qué modelo parece liderar.
Al puntuar, mira resultados de ingeniería: si las pruebas pasan, si la explicación es correcta, si el modelo conserva contexto, si toca solo lo necesario y cuánta revisión humana exige. Para código de producción, esas métricas suelen valer más que una cifra aislada de leaderboard.
Para el trabajo de programación más difícil en repositorios reales, Claude Code con modelos Opus es el punto de partida mejor respaldado por la evidencia disponible. Para evaluaciones centradas en benchmarks, GPT-5.4/GPT-5-2 Codex y Gemini siguen siendo candidatos fuertes: GPT-5.4 aparece con 57,7 % en SWE-bench Pro con andamiaje personalizado, y SWE-bench muestra Gemini 3 Flash con 75,80.
La respuesta más segura no es que un modelo gane siempre. La regla útil es esta: empieza con Claude Code/Opus para trabajo difícil a nivel de repositorio, incluye GPT-5.x Codex y Gemini en pruebas guiadas por benchmarks, y decide con tareas reales de tu propia base de código.