Claude 3.5 Sonnet nådde 49,0 procent på SWE bench Verified i början av 2025. Senare rapporterade topplistor 97,0 procent för Claude Opus 5.
Publicerad avRedigerad med GPT-5.6 TerraBilder genererade med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: As of September 2026, how do Anthropic’s Claude models perform across the major SWE-bench coding benchmarks—including the definitions, probl. Article summary: As of September 2026, Claude appears to lead the reported SWE-bench results, but the evidence supports a narrower conclusion than “Anthropic is unambiguously best at software engineering.” SWE-bench Verified is close to . Topic tags: general, general web, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
Claude har gjort en anmärkningsvärd resa i kodningsbenchmark: den uppgraderade Claude 3.5 Sonnet nådde 49,0 procent på SWE-bench Verified i början av 2025. Några månader senare rapporterade Anthropic 72,5 procent för Claude Opus 4 och 72,7 procent för Claude Sonnet 4. Senare topplistor har placerat modeller nära benchmarkets tak. 23
24
9
Det betyder inte att Claude har löst mjukvaruutveckling. Det visar däremot att Claude är mycket konkurrenskraftig – och ofta ledande – i publicerade utvärderingar av kodagenter. När resultaten närmar sig 100 procent på ett begränsat, offentligt test blir den centrala frågan en annan: vilken utvärdering förutsäger bäst hur agenten fungerar i ett företags egna kodbaser, verktyg och granskningsflöden?
| Benchmark | Vad agenten gör | Omfattning och bedömning | Varför det spelar roll |
|---|---|---|---|
| SWE-bench Verified | Får ett verkligt GitHub-ärende och en ögonblicksbild av ett kodförråd, och ska skapa en patch. | 500 mänskligt filtrerade SWE-bench-uppgifter, främst från populära Pythonprojekt med öppen källkod. En uppgift räknas som löst när patchen klarar benchmarkets tester i testmiljön. |
Ett etablerat mått på att lösa konkreta problem i verkliga kodbaser. |
| SWE-bench Pro | Löser svårare och mer långsiktiga uppgifter i kodförråd med ett standardiserat agentramverk. | Uppges omfatta 1 865 uppgifter från 41 kodförråd och 123 programmeringsspråk; mäts ofta som Pass@1. |
Ska vara bredare än Verified och minska risken för kontaminering. |
| Terminal-Bench 4.0 | Utför tekniskt arbete från början till slut i en terminalmiljö. | Uppgifter kräver exempelvis undersökning, kommandon, redigering, testning och återhämtning efter fel – inte bara en patch till ett GitHub-ärende. |
Prövar verktygsanvändning och arbetsflöden som ligger närmare hur kodagenter används i praktiken. |
Anthropic uppgav att den uppgraderade Claude 3.5 Sonnet nådde 49,0 procent på SWE-bench Verified, över dåvarande rapporterade toppresultat på 45 procent. Vid den tidpunkten hade ingen modell passerat 50 procent. 23
37
I maj 2025 rapporterade Anthropic 72,5 procent för Claude Opus 4 och 72,7 procent för Claude Sonnet 4 på SWE-bench Verified. Resultaten rapporterades utan utökat tänkande. 24
Till 2026 hade topplistan förändrats kraftigt. Vals AI anger 97,0 procent för Claude Opus 5. Samma källa uppger att sju utvärderade modeller nådde minst 95 procent och att DeepSeek V4 Pro 0813 nådde 96,4 procent. 9
Det gör formuleringen att Opus 5 ligger kring 96 procent rimlig som kortversion, men inte som ett enda slutgiltigt facit. Resultatet påverkas av modellversion, agentramverk, beräkningsbudget och exakt testupplägg.
På en uppsättning med 500 uppgifter lämnar 97 procent mycket litet utrymme att skilja de främsta systemen åt. Dessutom består Verified av offentliga och ändliga uppgifter från offentliga kodförråd. Benchmarkguiden beskriver därför risken för kontaminering som hög och testet som på väg att mättas. 3
Det gör inte resultatet värdelöst. Det betyder att det främst är ett tecken på att en agent kan lösa denna typ av välspecificerat och testbart ärende – och ett svagare underlag för att förutsäga helt nytt arbete i en privat kodbas som förändras över tid.
SWE-bench Pro presenteras som ett svårare alternativ med bättre skydd mot kontaminering. Den rapporterade omfattningen är 1 865 uppgifter från 41 kodförråd och 123 programmeringsspråk, jämfört med Verifieds 500 mänskligt filtrerade uppgifter med tyngdpunkt på Python. 12
16
En samlad topplista från september 2026 placerar Claude Fable 5.1 på 81,2 procent, före Claude Mythos 5 på 80,3 procent och Claude Fable 5 på 80,0 procent. 53 På just den topplistan innehar Claude de tre främsta platserna.
Här finns dock en viktig reservation: alla Pro-resultat är inte direkt jämförbara. En källa skiljer mellan 59,1 procent som ledande resultat på Scales standardiserade offentliga uppsättning och högre leverantörsaggregerade siffror. Det visar hur mycket agentramverk och rapporteringsmetod kan påverka utfallet. 13 En annan källa varnar uttryckligen för att siffran 81,2 procent för Fable 5.1 saknar tydligt publicerat, modellspecifikt underlag och kan bero på en sammanblandning av versioner eller aggregerade data.
55
Det praktiska sättet att läsa siffran är därför: 81,2 procent är ett rapporterat topplistevärde, inte ett slutgiltigt och oberoende replikerat faktum om basmodellen i sig.
Terminal-Bench mäter tekniskt agentarbete i kommandoradsmiljöer, exempelvis att bygga programvara eller träna en maskininlärningsmodell. I stället för Verifieds format med ärende och patch bedömer testet ett mer operativt arbetsflöde. 38
I den citerade jämförelsen får Claude Fable 5.1 55,8 procent och GPT-5.6 Sol 37,3 procent – en skillnad på 18,5 procentenheter. 44 Det är relevant evidens för att den rapporterade Claude-konfigurationen presterade bättre i just denna utvärdering.
Det bevisar däremot inte en generell rangordning mellan Anthropic, OpenAI, Google, Cognition eller AWS. Ett sådant påstående skulle kräva matchade modeller, samma agentramverk, jämförbara tids- och tokenbudgetar samt resultat från flera oberoende testsviter. Det underlaget finns inte i de tillhandahållna källorna.
De tillgängliga resultaten stöder tre mer begränsade slutsatser:
Däremot visar resultaten inte att Claude kan genomföra flerveckorsprojekt på egen hand, pålitligt förstå odokumenterade interna system, fatta goda arkitekturbeslut eller driftsätta kod säkert utan mänsklig granskning. Verklig mjukvaruutveckling omfattar också kravarbete, avvägningar, integration, säkerhet, driftsättning och samarbete.
SWE-bench Verified var betydelsefullt eftersom det gick längre än korta programmeringspussel: agenten arbetar i riktiga kodförråd med riktiga ärendebeskrivningar och patchen bedöms med tester. 1
38 Men modellerna har enligt Anthropics genomgång gått från omkring 40 procent till över 80 procent på testet på bara ett år.
38
För ett team som ska välja verktyg är en användbar utvärderingsportfölj därför:
Anthropic lyfter både SWE-bench Verified och Terminal-Bench som exempel på agentutvärderingar och har betonat långvarig arbetsförmåga i Claude 4. 38
42 Däremot räcker inte underlaget för att slå fast att företaget formellt har flyttat fokus från SWE-bench till längre, mer öppna utvärderingar.
Claudes rapporterade benchmarkresultat gör modellen till ett av de starkaste alternativen för kodagenter att utvärdera i september 2026. Den tydligaste milstolpen är vägen från 49 procent på SWE-bench Verified i början av 2025 till ett rapporterat topplisteresultat på 97,0 procent för Opus 5, tillsammans med en rapporterad ledning på 81,2 procent på SWE-bench Pro. 23
9
53
Men välj inte verktyg utifrån en enda rubriksiffra. Använd benchmarkresultaten för att göra ett första urval och kör sedan en kontrollerad utvärdering på representativa uppgifter i era egna kodförråd. Nära mättade offentliga benchmark visar att modeller kan lösa många välkända problemtyper – inte att de på egen hand kan bedriva tillförlitlig mjukvaruutveckling i en produktionsorganisation.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Claude 3.5 Sonnet nådde 49,0 procent på SWE bench Verified i början av 2025. Senare rapporterade topplistor 97,0 procent för Claude Opus 5.
Claude 3.5 Sonnet nådde 49,0 procent på SWE bench Verified i början av 2025. Senare rapporterade topplistor 97,0 procent för Claude Opus 5. SWE bench Verified består av 500 offentliga, mänskligt granskade GitHub ärenden, främst från populära Pythonprojekt.
Claude Fable 5.1 rapporteras ha slagit GPT 5.6 Sol med 55,8 mot 37,3 procent på Terminal Bench 4.0.