Claude gik fra 49,0 % på SWE bench Verified i begyndelsen af 2025 til en rapporteret score på 97,0 % for Opus 5 på en senere Verified ledertavle. SWE bench Verified er et offentligt, Python domineret sæt på 500 opgaver og nærmer sig mætning.
Udgivet afRedigeret med GPT-5.6 TerraBilleder genereret med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: As of September 2026, how do Anthropic’s Claude models perform across the major SWE-bench coding benchmarks—including the definitions, probl. Article summary: As of September 2026, Claude appears to lead the reported SWE-bench results, but the evidence supports a narrower conclusion than “Anthropic is unambiguously best at software engineering.” SWE-bench Verified is close to . Topic tags: general, general web, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
Claude’ens rapporterede udvikling på kodningsbenchmarks er markant: Den opgraderede Claude 3.5 Sonnet nåede 49 % på SWE-bench Verified i begyndelsen af 2025. Få måneder senere rapporterede Anthropic omkring 72,5-72,7 % for Claude 4-modellerne, og senere ledertavler viste scorer tæt på benchmarkets loft. 23
24
9
Den rigtige konklusion er ikke, at Claude har løst softwareudvikling. Den er, at Claude er blevet særdeles konkurrencedygtig – og ofte førende – i offentliggjorte evalueringer af kodeagenter. Når resultaterne nærmer sig 100 % på et endeligt, offentligt benchmark, bliver det vigtigere at spørge: Hvilken evaluering forudsiger bedst præstationen i vores egne kodebaser, værktøjer og reviewproces?
| Benchmark | Hvad agenten skal gøre | Dækning og måling | Hvorfor det er relevant |
|---|---|---|---|
| SWE-bench Verified | Får en rigtig GitHub-issue og et øjebliksbillede af et repository og skal derefter levere en patch. | Et menneskefiltreret sæt med 500 SWE-bench-opgaver, primært fra populære open source-Python-repositories. En opgave tæller som løst, når patchen klarer benchmarkets tests i evalueringsmiljøet. |
En bredt anerkendt test af fejl- og issue-løsning i rigtige kodebaser. |
| SWE-bench Pro | Løser sværere opgaver i repositories med længere forløb under en standardiseret agentramme. | Angives at rumme 1.865 opgaver fra 41 repositories på tværs af 123 programmeringssprog; måles ofte som Pass@1. |
Skal udvide dækningen ud over Verifieds offentlige, Python-centrerede opgaver og mindske risikoen for datakontaminering. |
| Terminal-Bench 4.0 | Udfører teknisk arbejde fra ende til ende i et terminalmiljø. | Opgaverne kræver blandt andet undersøgelse, kommandoer, redigering, test og fejlhåndtering – ikke blot en patch til en GitHub-issue. |
Tilføjer krav om praktisk værktøjsbrug, der minder mere om agentarbejdsgange. |
Anthropic oplyste, at den opgraderede Claude 3.5 Sonnet opnåede 49,0 % på SWE-bench Verified – over den tidligere rapporterede rekord på 45 %. På det tidspunkt fremhævede Anthropic, at ingen model endnu havde passeret 50 % på benchmarken. 23
37
I maj 2025 rapporterede Anthropic 72,5 % for Claude Opus 4 og 72,7 % for Claude Sonnet 4 på SWE-bench Verified. Tallene blev oplyst uden udvidet tænkning. 24
I 2026 havde ledertavlerne ændret sig betydeligt. Vals AI angiver Claude Opus 5 til 97,0 %, mens syv evaluerede modeller ligger på mindst 95 %, og DeepSeek V4 Pro 0813 står til 96,4 %. 9 Derfor er “Opus 5 på 96 %” en rimelig kortform for et rapporteret resultat i den høje ende af 90’erne, men ikke ét entydigt autoritativt tal. Resultaterne afhænger af modelversion, agentramme, budget og evalueringsopsætning.
En score på 97 % på et sæt med 500 opgaver efterlader meget lidt plads til at skelne mellem de mest avancerede systemer. Samtidig består Verified af offentlige, endelige opgaver fra offentlige repositories. Benchmarkvejledninger beskriver derfor sættet som udsat for høj risiko for kontaminering og mætning. 3
Det gør ikke resultatet ligegyldigt. Det gør det mest brugbart som dokumentation for, at en agent kan løse denne type klart afgrænsede og testbare issue – og mindre brugbart som en samlet prognose for nyt arbejde i en privat kodebase, der løbende ændrer sig.
SWE-bench Pro er positioneret som et sværere og mere kontamineringsresistent alternativ. Den rapporterede dækning er 1.865 opgaver fra 41 repositories og 123 programmeringssprog, mod Verifieds 500 menneskefiltrerede opgaver fra populære Python-repositories. 12
16
En samlet ledertavle offentliggjort i september 2026 angiver Claude Fable 5.1 til 81,2 %, foran Claude Mythos 5 med 80,3 % og Claude Fable 5 med 80,0 %. 53 På den ledertavle indtager Claude de tre øverste placeringer.
Men der er et vigtigt forbehold: Pro-tal er ikke altid direkte sammenlignelige. En kilde skelner mellem en førende score på 59,1 % på Scales standardiserede offentlige sæt og højere, leverandøraggregede tal. Det illustrerer, hvor meget agentrammen og rapporteringsmetoden kan påvirke resultatet. 13 En anden kilde advarer direkte om, at Fable 5.1-tallet på 81,2 % ikke klart er dokumenteret af et direkte offentliggjort, modelspecifikt SWE-bench-resultat og kan skyldes en sammenblanding af aggregering eller versionsnavn.
55
Den praktiske konklusion er enkel: Se 81,2 % som en rapporteret ledertavleværdi, ikke som et endeligt, uafhængigt replikeret faktum om grundmodellen alene.
Terminal-Bench evaluerer teknisk agentarbejde i et kommandolinjemiljø, eksempelvis at bygge software eller træne en maskinlæringsmodel. I modsætning til SWE-bench Verifieds issue-og-patch-format tester den en mere operationel arbejdsgang. 38
Den citerede sammenligning angiver 55,8 % for Claude Fable 5.1 og 37,3 % for GPT-5.6 Sol – en forskel på 18,5 procentpoint. 44 Det er relevant dokumentation for, at den rapporterede Claude-konfiguration klarede sig bedre i netop denne evaluering.
Det fastslår derimod ikke en generel rangorden mellem Anthropic, OpenAI, Google, Cognition og AWS. En bred leverandørpåstand ville kræve matchede modeller, identiske agentrammer, sammenlignelige token- og tidsbudgetter samt resultater på flere uafhængige opgavesuiter. Det foreliggende materiale giver ikke den sammenligning.
De tilgængelige resultater understøtter tre afgrænsede påstande:
De viser ikke, at Claude selvstændigt kan gennemføre projekter over flere uger, pålideligt forstå udokumenterede interne systemer, træffe sunde arkitekturvalg eller levere sikkert uden menneskelig kontrol. SWE-bench-opgaver har verificerbare testresultater. Virkelig softwareudvikling omfatter også kravafdækning, afvejninger, integration, sikkerhed, udrulning og samarbejde.
SWE-bench Verified blev værdifuld, fordi den gik videre end korte programmeringsopgaver: Agenter arbejder med rigtige repositories og issuebeskrivelser, og deres patches bedømmes med tests. 1
38 Men modellerne er hurtigt gået fra omkring 40 % til over 80 % på denne evaluering, ifølge Anthropics gennemgang af agentevalueringer.
38
En brugbar evalueringspakke bør derfor omfatte:
Anthropic har omtalt både SWE-bench Verified og Terminal-Bench som eksempler på agentevalueringer og har fremhævet Claude 4’s kapacitet til langvarige opgaver. 38
42 Men det foreliggende materiale er ikke nok til at dokumentere et formelt, virksomhedsdækkende skift væk fra SWE-bench og mod evalueringer med længere tidshorisont. Den stærkere påstand bør derfor stå ubevist.
Claudes rapporterede benchmarkresultater gør modellen til en af de stærkeste kandidater blandt kodeagenter, man bør evaluere pr. september 2026. Den tydeligste udvikling er springet fra 49 % på SWE-bench Verified i begyndelsen af 2025 til en rapporteret 97,0 % for Opus 5 på en Verified-ledertavle, suppleret af en rapporteret førsteplads på 81,2 % på SWE-bench Pro. 23
9
53
Ved valg af værktøj bør én overskrift ikke afgøre sagen. Brug resultaterne til at udvælge kandidater, og lav derefter en kontrolleret afprøvning på repræsentative opgaver i jeres egne repositories. Næsten mættede offentlige benchmarks viser, at modeller kan rette mange kendte typer fejl – men de kan ikke alene dokumentere pålidelig, autonom softwareudvikling i en produktionsorganisation.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Claude gik fra 49,0 % på SWE bench Verified i begyndelsen af 2025 til en rapporteret score på 97,0 % for Opus 5 på en senere Verified ledertavle.
Claude gik fra 49,0 % på SWE bench Verified i begyndelsen af 2025 til en rapporteret score på 97,0 % for Opus 5 på en senere Verified ledertavle. SWE bench Verified er et offentligt, Python domineret sæt på 500 opgaver og nærmer sig mætning.
På den citerede Terminal Bench 4.0 måling scorede Claude Fable 5.1 55,8 % mod 37,3 % for GPT 5.6 Sol.