OpenAI pensionerade SWE bench Verified i februari 2026 efter en internrevision som visade att minst 59,4 % av de svåraste testfallen var felaktiga och underkände korrekta lösningar, samt att alla frontlinjemodeller ku... Bara fem månader senare, i juli 2026, drog OpenAI tillbaka sin rekommendation av ersättaren SWE...
Research answer

Create a landscape editorial hero image for this Studio Global article: Search & fact-check with cited sources for What led OpenAI to retract its recommendation of SWE-Bench Pro, and how does this retraction fit. Article summary: Here are the findings on the two-phase collapse of OpenAI's SWE-bench benchmarks and the broader pattern of AI coding benchmark erosion.. Topic tags: general, general web, user generated, education, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layo
På bara sju månader har OpenAI lämnat båda de kodningsriktmärken som man själv varit med och skapat. Först pensionerades SWE-bench Verified i februari 2026 – ett riktmärke som OpenAI själva varit med och tagit fram och som hunnit bli industristandard. Sedan, i juli 2026, drog OpenAI tillbaka sin egen rekommendation av den tänkta ersättaren SWE-bench Pro. Det här handlar inte bara om logistiska problem för modellutvärderare – det är en signal om att hela sättet att mäta AI:s kodningsförmåga i grunden är trasigt.
SWE-bench Verified lanserades i augusti 2024 som en mänskligt validerad delmängd av det ursprungliga Princeton SWE-bench, med 500 Python-uppgifter hämtade från verkliga GitHub-ärenden . I ungefär 18 månader fungerade det som den primära måttstocken för hur väl AI-kodningsagenter kunde lösa verkliga mjukvaruproblem
.
Den 23 februari 2026 avvecklade OpenAIs Frontier Evals-team riktmärket formellt . Skälen var tydliga:
OpenAIs slutsats var otvetydig: ”Förbättringar på SWE-bench Verified återspeglar inte längre meningsfulla förbättringar av modellernas verkliga mjukvaruutvecklingsförmåga. De återspeglar i allt högre grad hur mycket modellen exponerades för riktmärket under träningen” .
OpenAI rekommenderade uttryckligen SWE-bench Pro – ett större riktmärke byggt av Scale AI från privata och copyleft-licensierade databaser – som ersättning .
Den 8 juli 2026 rapporterade OpenAI resultaten av en detaljerad granskning av SWE-bench Pro – samma riktmärke som man nyss hade marknadsfört som mer robust. Resultatet var förödande :
Detta tvingade OpenAI att dra tillbaka sin rekommendation av SWE-bench Pro, vilket lämnade branschen utan en pålitlig efterträdare .
OpenAIs tvåstegs reträtt är ingen isolerad olycka. Det är en del av en systemisk kris i hur AI-fältet utvärderar kodningsförmåga:
OpenAIs reträtt i två steg – först att överge sitt eget riktmärke, sedan att ta avstånd från ersättaren – har lämnat AI-utvärderingslandskapet för kodning utan en pålitlig ledare. Samhället inser alltmer att höga riktmärkespoäng inte längre på ett tillförlitligt sätt förutsäger om en AI-kodningsagent kan hantera verkliga mjukvaruteknikuppgifter . Nya utvärderingsmetoder – såsom uppgiftsspecifika, adversariella eller kontinuerligt uppdaterade riktmärken – är akut nödvändiga men ännu inte mogna
.
För tillfället har den som försöker utvärdera en AI-kodningsagent ingen enskild standard att lita på. Kollapsen av SWE-bench Verified och SWE-bench Pro är inte bara en berättelse om två bristfälliga tester. Det är en berättelse om en bransch som byggde snabbare än den kunde mäta.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
OpenAI pensionerade SWE bench Verified i februari 2026 efter en internrevision som visade att minst 59,4 % av de svåraste testfallen var felaktiga och underkände korrekta lösningar, samt att alla frontlinjemodeller ku...
OpenAI pensionerade SWE bench Verified i februari 2026 efter en internrevision som visade att minst 59,4 % av de svåraste testfallen var felaktiga och underkände korrekta lösningar, samt att alla frontlinjemodeller ku... Bara fem månader senare, i juli 2026, drog OpenAI tillbaka sin rekommendation av ersättaren SWE bench Pro efter en granskning som visade att cirka 30 % av uppgifterna var trasiga, eftersom GitHub ärenden inte är utfor...
Kollapsen av dessa riktmärken avslöjar en systematisk kris: AI branschen bygger snabbare än den kan mäta, och höga riktmärkespoäng speglar allt oftare memorering snarare än verklig kodningsförmåga.