Claude gikk fra 49,0 prosent på SWE bench Verified tidlig i 2025 til en rapportert topplassering på 97,0 prosent for Opus 5 i én senere oversikt. SWE bench Verified består av 500 offentlige, menneskefiltrerte GitHub oppgaver, mens SWE bench Pro dekker 1 865 oppgaver fra 41 kodebaser og 123 programmeringsspråk.
Publisert avRedigert med GPT-5.6 TerraBilder generert med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: As of September 2026, how do Anthropic’s Claude models perform across the major SWE-bench coding benchmarks—including the definitions, probl. Article summary: As of September 2026, Claude appears to lead the reported SWE-bench results, but the evidence supports a narrower conclusion than “Anthropic is unambiguously best at software engineering.” SWE-bench Verified is close to . Topic tags: general, general web, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
Claude har hatt en kraftig framgang på kodebenchmarker. Det betyr at modellene er svært konkurransedyktige – og ofte i tet – i publiserte tester av kodeagenter. Det betyr derimot ikke at programvareutvikling er «løst».
Når resultatene nærmer seg 100 prosent på en begrenset og offentlig oppgavesamling, blir det viktigere å spørre hva som faktisk forutsier ytelse i en virksomhets egne kodebaser, verktøy og kodegjennomganger.
| Benchmark | Hva agenten gjør | Omfang og vurdering | Hvorfor den er relevant |
|---|---|---|---|
| SWE-bench Verified | Får en reell GitHub-sak og et øyeblikksbilde av en kodebase, og lager en patch. | 500 menneskefiltrerte oppgaver, hovedsakelig fra populære Python-prosjekter med åpen kildekode. En oppgave regnes som løst når patchen består benchmarkens tester. |
En etablert test av feilretting og saksbehandling i ekte kodebaser. |
| SWE-bench Pro | Løser vanskeligere oppgaver i kodebaser over lengre tid, med et standardisert agentoppsett. | Oppgitt til 1 865 oppgaver fra 41 kodebaser og 123 programmeringsspråk. Resultater oppgis ofte som Pass@1. |
Skal være bredere enn Verified og mindre utsatt for at offentlige oppgaver allerede er kjent av modellene. |
| Terminal-Bench 4.0 | Utfører teknisk arbeid ende til ende i et terminalmiljø. | Omfatter undersøkelser, kommandoer, redigering, testing og feilretting – ikke bare en GitHub-sak med én patch. |
Tester arbeidsflyter og verktøybruk som ligger nærmere agentbasert utviklerarbeid. |
Anthropic oppga at den oppgraderte Claude 3.5 Sonnet nådde 49,0 prosent på SWE-bench Verified. Det var over den tidligere rapporterte toppscoren på 45 prosent, og på dette tidspunktet hadde ingen modell passert 50 prosent. 23
37
I mai 2025 rapporterte Anthropic 72,5 prosent for Claude Opus 4 og 72,7 prosent for Claude Sonnet 4 på SWE-bench Verified. Tallene ble oppgitt uten utvidet resonnering. 24
I 2026 ser bildet på resultatlistene ganske annerledes ut: Vals AI oppgir 97,0 prosent for Claude Opus 5. Sju evaluerte modeller ligger på 95 prosent eller mer, og DeepSeek V4 Pro 0813 oppgis til 96,4 prosent. 9 Det gjør «rundt 96 prosent» til en rimelig kortform for en rapportert Opus 5-score i øvre 90-tall, men ikke til én entydig fasit. Resultatet avhenger av modellversjon, agentoppsett, tids- og tokenbudsjett og selve evalueringsmetoden.
På et sett med 500 oppgaver gir 97 prosent svært lite rom for å skille systemene i front. I tillegg består Verified av et endelig sett med offentlige oppgaver fra offentlige kodebaser. Benchmarkveiledning omtaler derfor Verified som en test med høy risiko for datakontaminering og metning. 3
Det gjør ikke resultatet verdiløst. Det er fortsatt god dokumentasjon på at en agent kan løse denne typen tydelig spesifiserte og testbare feil. Men det er et svakere mål på hvordan den vil fungere med nyutvikling i en privat kodebase som stadig endrer seg.
SWE-bench Pro er posisjonert som et mer krevende og mer kontamineringsrobust alternativ. Det oppgitte omfanget er 1 865 oppgaver fra 41 kodebaser og 123 programmeringsspråk, mot Verifieds 500 menneskefiltrerte oppgaver som i hovedsak er sentrert om Python. 12
16
En samlet resultatliste fra september 2026 oppgir Claude Fable 5.1 til 81,2 prosent, foran Claude Mythos 5 med 80,3 prosent og Claude Fable 5 med 80,0 prosent. 53 I denne oversikten har Claude de tre øverste plassene.
Men Pro-tallene er ikke nødvendigvis direkte sammenlignbare. Én kilde skiller mellom en ledende score på 59,1 prosent i Scales standardiserte, offentlige oppsett og høyere, leverandøraggregerte tall. Det illustrerer hvor mye agentrammeverket og rapporteringsmetoden kan påvirke resultatet. 13 En annen kilde advarer uttrykkelig om at 81,2-prosenttallet for Fable 5.1 ikke er tydelig støttet av et direkte publisert, modellspesifikt SWE-bench-resultat, og kan skyldes en sammenblanding i aggregering eller versjonstilknytning.
55
Den praktiske konklusjonen er derfor å lese 81,2 prosent som en rapportert leaderboard-verdi, ikke som et endelig, uavhengig replikert mål på grunnmodellen alene.
Terminal-Bench vurderer tekniske agentoppgaver i kommandolinjen, for eksempel å bygge programvare eller trene en maskinlæringsmodell. I motsetning til SWE-bench Verifieds format med sak og patch, prøver testen en mer operativ arbeidsflyt. 38
Den siterte sammenligningen oppgir 55,8 prosent for Claude Fable 5.1 og 37,3 prosent for GPT-5.6 Sol – et forsprang på 18,5 prosentpoeng. 44 Det er meningsfull dokumentasjon på at den rapporterte Claude-konfigurasjonen gjorde det bedre i akkurat denne evalueringen.
Det etablerer likevel ikke en generell rangering av Anthropic, OpenAI, Google, Cognition eller AWS. En slik påstand ville kreve sammenlignbare modeller, samme agentoppsett, like token- og tidsbudsjetter og resultater fra flere uavhengige oppgavesuiter. Det foreliggende kildematerialet gir ikke en slik sammenligning.
Tallene underbygger tre avgrensede påstander:
Tallene viser ikke at Claude pålitelig kan gjennomføre prosjekter som varer i ukevis, forstå udokumenterte interne systemer, ta gode arkitekturvalg eller levere trygt uten menneskelig kontroll. SWE-bench-oppgaver har testbare fasiter. Virkelig utviklingsarbeid omfatter også kravavklaring, avveininger, integrasjon, sikkerhet, utrulling og samarbeid.
SWE-bench Verified var viktig fordi testen gikk videre enn korte kodeoppgaver: Agenten arbeider med reelle kodebaser og saksbeskrivelser, og patchene blir vurdert med tester. 1
38 Anthropic beskriver en framgang fra rundt 40 prosent til over 80 prosent på evalueringen på ett år.
38
For organisasjoner som skal velge utviklerverktøy, er en mer nyttig testpakke:
Anthropic har omtalt både SWE-bench Verified og Terminal-Bench som eksempler på evalueringer av agenter, og har fremhevet Claudes evne til arbeid over lang tid i Claude 4. 38
42 Men kildene her er ikke nok til å fastslå at selskapet formelt har flyttet evalueringsstrategien bort fra SWE-bench og over til mer langsiktige tester.
Claudes rapporterte benchmarkresultater gjør modellen til et av de sterkeste alternativene å vurdere for kodeagenter per september 2026. Den tydeligste utviklingen går fra 49 prosent på SWE-bench Verified tidlig i 2025 til en rapportert 97,0-prosentscore for Opus 5, i tillegg til en rapportert 81,2-prosentsledelse på SWE-bench Pro. 23
9
53
Ikke velg verktøy ut fra én overskriftsscore. Bruk resultatene til å lage en kortliste, og gjennomfør deretter en kontrollert evaluering med representative oppgaver i egne kodebaser. Nær-metning på offentlige benchmarker viser at agentene kan løse mange kjente typer feil – ikke at de alene kan dokumentere pålitelig, autonom programvareutvikling i produksjon.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Claude gikk fra 49,0 prosent på SWE bench Verified tidlig i 2025 til en rapportert topplassering på 97,0 prosent for Opus 5 i én senere oversikt.
Claude gikk fra 49,0 prosent på SWE bench Verified tidlig i 2025 til en rapportert topplassering på 97,0 prosent for Opus 5 i én senere oversikt. SWE bench Verified består av 500 offentlige, menneskefiltrerte GitHub oppgaver, mens SWE bench Pro dekker 1 865 oppgaver fra 41 kodebaser og 123 programmeringsspråk.
Claude Fable 5.1 ble rapportert til 55,8 prosent på Terminal Bench 4.0, mot 37,3 prosent for GPT 5.6 Sol.