La conclusion d'OpenAI était sans appel : "Les améliorations sur SWE-bench Verified ne reflètent plus d'améliorations significatives dans les capacités réelles de développement logiciel des modèles. Elles reflètent de plus en plus à quel point le modèle a été exposé au benchmark lors de l'entraînement" .
OpenAI a alors explicitement recommandé SWE-bench Pro — un benchmark plus vaste construit par Scale AI à partir de référentiels privés et sous licence copyleft — comme remplacement .
Le 8 juillet 2026, OpenAI a publié les résultats d'un audit détaillé de SWE-bench Pro — le benchmark qu'elle venait tout juste de promouvoir comme plus robuste. Les conclusions étaient accablantes :
Cela a contraint OpenAI à retirer sa recommandation de SWE-bench Pro, laissant l'industrie sans successeur fiable .
Ce double reniement d'OpenAI n'est pas un incident isolé. Il s'inscrit dans une crise systémique de la manière dont le domaine de l'IA évalue la capacité de codage :
Ce double reniement d'OpenAI — d'abord abandonner son propre benchmark, puis désavouer le remplacement — a laissé le paysage de l'évaluation du codage IA sans leader de confiance. La communauté reconnaît de plus en plus que des scores élevés sur les benchmarks ne prédisent plus de manière fiable si un agent de codage IA peut gérer des tâches réelles de génie logiciel . De nouvelles méthodologies d'évaluation — telles que des benchmarks spécifiques à des tâches, adversaires ou continuellement mis à jour — sont urgemment nécessaires mais ne sont pas encore matures
.
Pour l'instant, quiconque tente d'évaluer un agent de codage IA n'a aucun standard unique auquel se fier. L'effondrement de SWE-bench Verified et de SWE-bench Pro n'est pas seulement l'histoire de deux tests défectueux. C'est l'histoire d'une industrie qui a construit plus vite qu'elle n'a pu mesurer.