Claude ging van 49,0% op SWE bench Verified begin 2025 naar een gemelde score van 97,0% voor Opus 5 op een later leaderboard. SWE bench Verified omvat 500 publieke, vooral Python gerichte issue oplossingen en raakt verzadigd; SWE bench Pro is breder en moeilijker, maar resultaten hangen sterk af van de evaluatie opzet.
Gepubliceerd doorBewerkt met GPT-5.6 TerraAfbeeldingen gegenereerd met GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: As of September 2026, how do Anthropic’s Claude models perform across the major SWE-bench coding benchmarks—including the definitions, probl. Article summary: As of September 2026, Claude appears to lead the reported SWE-bench results, but the evidence supports a narrower conclusion than “Anthropic is unambiguously best at software engineering.” SWE-bench Verified is close to . Topic tags: general, general web, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
Claude heeft op programmeerbenchmarks een opvallende sprong gemaakt. De vernieuwde Claude 3.5 Sonnet haalde begin 2025 49% op SWE-bench Verified. Enkele maanden later rapporteerde Anthropic 72,5% voor Claude Opus 4 en 72,7% voor Claude Sonnet 4. Latere leaderboards plaatsen Claude Opus 5 zelfs op 97,0%. 23
24
9
De juiste conclusie is niet dat Claude softwareontwikkeling heeft opgelost. Wel is duidelijk dat Claude zeer competitief is, en vaak bovenaan staat, in publieke evaluaties van code-agents. Nu scores op een eindige, openbare benchmark de 100% naderen, wordt een andere vraag belangrijker: welke test voorspelt het best hoe een agent presteert in uw eigen repositories, toolchain en reviewproces?
| Benchmark | Wat doet de agent? | Omvang en beoordeling | Waarom relevant? |
|---|---|---|---|
| SWE-bench Verified | Krijgt een echt GitHub-issue en een momentopname van een repository, en moet vervolgens een patch maken. | Een door mensen gefilterde set van 500 SWE-bench-taken, vooral uit populaire open-source-Pythonrepositories. Een taak telt als opgelost wanneer de patch de benchmarktests in de evaluatieomgeving doorstaat. |
Een breed erkende test voor het oplossen van issues in echte codebases. |
| SWE-bench Pro | Lost zwaardere, langdurigere repositorytaken op binnen een gestandaardiseerde agent-opzet. | Volgens rapportages 1.865 taken uit 41 repositories, in 123 programmeertalen; vaak gemeten als Pass@1, dus de kans dat de eerste poging slaagt. |
Moet verder gaan dan de publieke, Python-gerichte Verified-taken en het risico op benchmarkvervuiling verkleinen. |
| Terminal-Bench 4.0 | Voert end-to-end technische werkzaamheden uit in een terminal. | Omvat taken die onderzoek, commando's uitvoeren, bestanden aanpassen, testen en herstel vereisen, in plaats van alleen een patch voor een GitHub-issue. |
Toetst operationeel gereedschapsgebruik dat beter aansluit op agentworkflows. |
Anthropic meldde voor de vernieuwde Claude 3.5 Sonnet een score van 49,0% op SWE-bench Verified, boven de toenmalige gerapporteerde recordscore van 45%. Volgens Anthropic had op dat moment nog geen model de grens van 50% gepasseerd. 23
37
In mei 2025 rapporteerde Anthropic 72,5% voor Claude Opus 4 en 72,7% voor Claude Sonnet 4 op SWE-bench Verified. Die resultaten werden zonder extended thinking gerapporteerd. 24
In 2026 zag het leaderboard er heel anders uit. Vals AI rapporteert 97,0% voor Claude Opus 5; zeven geëvalueerde modellen zouden 95% of hoger halen en DeepSeek V4 Pro 0813 staat op 96,4%. 9 De verkorte uitspraak dat Opus 5 “ongeveer 96%” haalt, is dus verdedigbaar als aanduiding van een score in de hoge 90, maar niet als één universeel en doorslaggevend cijfer. Scores hangen mede af van modelversie, agent-opzet, budget en evaluatiemethode.
Bij 97% op een set van 500 taken blijft er nauwelijks ruimte over om grensmodellen onderling scherp te onderscheiden. Bovendien bestaat Verified uit een eindige verzameling publieke taken uit publieke repositories. Benchmarkrichtlijnen duiden de test daarom aan als gevoelig voor contaminatie en verzadiging. 3
Dat maakt de score niet waardeloos. Hij laat vooral zien dat een agent dit type goed omschreven, toetsbaar issue kan oplossen. Hij voorspelt veel minder volledig hoe goed dezelfde agent presteert bij nieuw werk in een private codebase die voortdurend verandert.
SWE-bench Pro wordt gepositioneerd als een moeilijker alternatief dat beter bestand moet zijn tegen contaminatie. De gemelde dekking is 1.865 taken in 41 repositories en 123 programmeertalen, tegenover 500 door mensen gefilterde taken uit vooral populaire Pythonrepositories bij Verified. 12
16
Een geaggregeerd leaderboard uit september 2026 zet Claude Fable 5.1 op 81,2%, vóór Claude Mythos 5 met 80,3% en Claude Fable 5 met 80,0%. 53 Op dat leaderboard bezet Claude de eerste drie plaatsen.
Daar hoort een belangrijk voorbehoud bij: niet alle Pro-scores zijn rechtstreeks vergelijkbaar. Eén bron onderscheidt een leidende score van 59,1% op Scale's gestandaardiseerde publieke set van hogere, geaggregeerde leverancierscijfers. Dat laat zien hoeveel verschil de agent-harnas en rapportagemethode kunnen maken. 13 Een andere bron waarschuwt expliciet dat de 81,2% voor Fable 5.1 niet duidelijk wordt onderbouwd door een rechtstreeks gepubliceerd, modelspecifiek SWE-bench-resultaat; het kan gaan om een aggregatie- of versie-toeschrijvingsprobleem.
55
De praktische lezing: beschouw 81,2% als een gerapporteerde leaderboardwaarde, niet als een definitief, onafhankelijk gerepliceerd feit over alleen het basismodel.
Terminal-Bench beoordeelt technische agenttaken in een command-lineomgeving, zoals software bouwen of een machinelearningmodel trainen. Anders dan de issue-en-patchvorm van SWE-bench Verified test deze benchmark een meer operationele workflow. 38
De aangehaalde vergelijking rapporteert 55,8% voor Claude Fable 5.1 en 37,3% voor GPT-5.6 Sol: een verschil van 18,5 procentpunt. 44 Dat is betekenisvol bewijs dat de gerapporteerde Claude-configuratie op deze evaluatie beter presteerde.
Het bewijst echter geen algemene rangorde tussen Anthropic, OpenAI, Google, Cognition of AWS. Daarvoor zijn vergelijkingen nodig met gematchte modellen, identieke agent-opzetten, vergelijkbare token- en tijdbudgetten, plus resultaten op meerdere onafhankelijke testsuites. Het aangeleverde bewijsmateriaal biedt die brede vergelijking niet.
De beschikbare resultaten ondersteunen drie afgebakende uitspraken:
De resultaten tonen niet aan dat Claude zelfstandig projecten van weken kan afronden, ongedocumenteerde interne systemen betrouwbaar begrijpt, verstandige architectuurkeuzes maakt of zonder review veilig naar productie kan deployen. SWE-bench-taken hebben verifieerbare testuitkomsten; echt engineeringwerk draait daarnaast om requirements achterhalen, afwegingen maken, integratie, beveiliging, deployment en samenwerking.
SWE-bench Verified was waardevol omdat het verder gaat dan korte programmeerpuzzels: agents werken met echte repositories en issuebeschrijvingen, terwijl patches met tests worden beoordeeld. 1
38 Volgens Anthropic gingen modellen op deze evaluatie in één jaar van circa 40% naar meer dan 80%.
38
Voor organisaties is een combinatie van evaluaties daarom nuttiger:
Anthropic noemt zowel SWE-bench Verified als Terminal-Bench voorbeelden van agent-evaluaties en benadrukte bij Claude 4 prestaties op langlopende taken. 38
42 Het aangeleverde materiaal is echter onvoldoende om te concluderen dat Anthropic formeel en organisatiebreed SWE-bench heeft ingeruild voor evaluaties met een langere horizon. Die sterkere stelling blijft onbewezen.
De gerapporteerde benchmarkscores maken Claude per september 2026 tot een van de sterkste code-agents om te evalueren. De duidelijkste mijlpaal is de stap van 49% op SWE-bench Verified begin 2025 naar een gerapporteerde 97,0%-score voor Opus 5, naast een gemelde 81,2%-koppositie op SWE-bench Pro. 23
9
53
Kies een ontwikkeltool niet op basis van één krantenkop of leaderboard. Gebruik benchmarks om een shortlist te maken en voer daarna een gecontroleerde proef uit met representatieve taken in uw eigen repositories. Bijna verzadigde publieke benchmarks tonen dat modellen veel bekende typen issues kunnen oplossen; ze bewijzen op zichzelf niet dat autonome softwareontwikkeling in een productieorganisatie betrouwbaar is.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Claude ging van 49,0% op SWE bench Verified begin 2025 naar een gemelde score van 97,0% voor Opus 5 op een later leaderboard.
Claude ging van 49,0% op SWE bench Verified begin 2025 naar een gemelde score van 97,0% voor Opus 5 op een later leaderboard. SWE bench Verified omvat 500 publieke, vooral Python gerichte issue oplossingen en raakt verzadigd; SWE bench Pro is breder en moeilijker, maar resultaten hangen sterk af van de evaluatie opzet.
De aangehaalde Terminal Bench 4.0 vergelijking geeft Claude Fable 5.1 55,8% tegenover 37,3% voor GPT 5.6 Sol, maar dat is geen algemene ranglijst van AI aanbieders.