OpenAIの結論は明白でした。「SWE-bench Verifiedのスコア向上は、モデルの現実世界のソフトウェア開発能力における意味のある進歩を反映していない。むしろ、訓練時にモデルがベンチマークにどれだけ露出したかを反映するものになっている」。
OpenAIの二段階撤退は、単独の不祥事ではありません。これは、AI分野におけるコーディング能力評価のシステム全体を蝕む危機の一部です。
OpenAIの連続撤退——最初に自社のベンチマークを放棄し、次にその代替品を否定する——により、AIコーディング評価の世界は信頼できる指標を失いました。コミュニティでは、高いベンチマックスコアが、AIコーディングエージェントが実際のソフトウェアエンジニアリングタスクを処理できるかどうかを、もはや確実に予測しないという認識が広がっています 。タスク固有、敵対的(adversarial)、継続的に更新されるベンチマークなど、新しい評価方法論が緊急に求められていますが、まだ成熟していません
。
現時点では、AIコーディングエージェントを評価しようとする誰もが、信頼できるたった一つの基準を持っていません。SWE-bench VerifiedとSWE-bench Proの崩壊は、単に二つの欠陥のあるテストの話ではありません。それは、測定する速度よりも速くシステムを構築してしまった業界の物語なのです。