Claude stieg von 49,0 % mit dem aktualisierten Claude 3.5 Sonnet Anfang 2025 auf einen gemeldeten Spitzenwert von 97,0 % für Opus 5 bei SWE bench Verified. SWE bench Verified umfasst 500 öffentliche, vor allem Python basierte GitHub Issues und nähert sich der Sättigung.
Veröffentlicht vonBearbeitet mit GPT-5.6 TerraBilder erstellt mit GPT Image 2
Forschungsantwort

Create a landscape editorial hero image for this Studio Global article: As of September 2026, how do Anthropic’s Claude models perform across the major SWE-bench coding benchmarks—including the definitions, probl. Article summary: As of September 2026, Claude appears to lead the reported SWE-bench results, but the evidence supports a narrower conclusion than “Anthropic is unambiguously best at software engineering.” SWE-bench Verified is close to . Topic tags: general, general web, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
Claude hat bei Coding-Benchmarks einen bemerkenswerten Sprung gemacht: Das aktualisierte Claude 3.5 Sonnet erreichte Anfang 2025 49,0 % bei SWE-bench Verified. Wenige Monate später meldete Anthropic für Claude 4 Werte von rund 72,5 % bis 72,7 %. Auf späteren Ranglisten liegen die Spitzenwerte nahe an der Obergrenze des Benchmarks. 23
24
9
Die richtige Schlussfolgerung lautet jedoch nicht, dass Claude Softwareentwicklung „gelöst“ hat. Die Daten zeigen vielmehr: Claude ist bei veröffentlichten Tests für Coding-Agenten sehr konkurrenzfähig und häufig führend. Wenn ein endlicher, öffentlicher Benchmark gegen 100 % läuft, wird eine andere Frage wichtiger: Welche Evaluation sagt die Leistung im eigenen Repository, mit den eigenen Tools und im eigenen Review-Prozess am besten voraus?
| Benchmark | Aufgabe des Agenten | Umfang und Wertung | Warum er relevant ist |
|---|---|---|---|
| SWE-bench Verified | Der Agent erhält ein echtes GitHub-Issue und einen Stand des Repositorys und erstellt einen Patch. | 500 von Menschen gefilterte SWE-bench-Fälle, überwiegend aus populären Open-Source-Python-Repositories. Ein Fall zählt als gelöst, wenn der Patch die Benchmark-Tests im Evaluations-Setup besteht. |
Ein weithin anerkannter Test für die Lösung konkreter Issues in realen Codebasen. |
| SWE-bench Pro | Der Agent bearbeitet schwierigere Aufgaben mit längerem Bearbeitungshorizont in Repositories, unter einem standardisierten Agentengerüst. | Berichtet werden 1.865 Aufgaben aus 41 Repositories in 123 Programmiersprachen; üblich ist die Kennzahl Pass@1. |
Soll über die öffentlichen, Python-lastigen Verified-Aufgaben hinausgehen und das Risiko von Datenkontamination senken. |
| Terminal-Bench 4.0 | Der Agent erledigt technische Aufgaben Ende zu Ende in einer Kommandozeilenumgebung. | Die Aufgaben verlangen Recherche, Befehle, Änderungen, Tests und Fehlerbehebung – nicht nur einen Patch zu einem GitHub-Issue. |
Prüft Tool-Nutzung und operative Arbeitsschritte, die tatsächlichen Agenten-Workflows näherkommen. |
Anthropic berichtete für das aktualisierte Claude 3.5 Sonnet 49,0 % bei SWE-bench Verified – mehr als der zuvor gemeldete Bestwert von 45 %. Damals hatte laut Anthropic noch kein Modell die Marke von 50 % überschritten. 23
37
Im Mai 2025 meldete Anthropic 72,5 % für Claude Opus 4 und 72,7 % für Claude Sonnet 4 bei SWE-bench Verified. Diese Werte wurden ohne „Extended Thinking“ angegeben. 24
Bis 2026 hatte sich das Bild auf den Ranglisten deutlich verändert: Vals AI führt Claude Opus 5 mit 97,0 %. Sieben bewertete Modelle liegen bei mindestens 95 %, DeepSeek V4 Pro 0813 bei 96,4 %. 9 Die Kurzform „Opus 5 bei 96 %“ trifft damit die Größenordnung eines gemeldeten Werts im hohen 90er-Bereich, ist aber keine allein maßgebliche Zahl. Ergebnisse hängen von Modellversion, Agentengerüst, Budget und Evaluationsaufbau ab.
Bei 97 % auf einem Set von 500 Aufgaben bleibt kaum noch Spielraum, um führende Systeme voneinander zu unterscheiden. Außerdem besteht Verified aus einer endlichen Menge öffentlicher Aufgaben aus öffentlichen Repositories. Benchmark-Leitfäden stufen das Kontaminations- und Sättigungsrisiko deshalb als hoch ein. 3
Das macht den Wert nicht wertlos. Er ist ein starkes Signal dafür, dass ein Agent diese Art gut spezifizierter, testbarer Issues lösen kann. Als vollständige Prognose für neue Arbeit in einer privaten, sich wandelnden Codebasis ist er dagegen weniger geeignet.
SWE-bench Pro ist als anspruchsvollere und weniger kontaminationsanfällige Alternative positioniert. Der berichtete Umfang liegt bei 1.865 Aufgaben aus 41 Repositories und 123 Programmiersprachen. Dem stehen bei Verified 500 von Menschen gefilterte Fälle aus populären Python-Repositories gegenüber. 12
16
Auf aggregierten Ranglisten vom September 2026 steht Claude Fable 5.1 mit 81,2 % vor Claude Mythos 5 mit 80,3 % und Claude Fable 5 mit 80,0 %. 53 Dort belegt Claude die ersten drei Plätze.
Eine wichtige Einschränkung bleibt: Pro-Werte sind nicht immer direkt vergleichbar. Eine Quelle unterscheidet zwischen 59,1 % als führendem Wert auf Scales standardisiertem öffentlichen Set und höheren herstellerübergreifend aggregierten Werten. Das verdeutlicht, wie stark Agentengerüst und Berichtsweg das Ergebnis beeinflussen können. 13 Eine weitere Quelle weist ausdrücklich darauf hin, dass die 81,2 % für Fable 5.1 nicht klar durch ein direkt veröffentlichtes modellspezifisches SWE-bench-Ergebnis belegt seien; möglich seien ein Aggregations- oder Versionszuordnungsproblem.
55
Praktisch heißt das: 81,2 % sind als gemeldeter Ranglistenwert zu lesen, nicht als abschließend unabhängig replizierte Eigenschaft des Basismodells allein.
Terminal-Bench bewertet technische Agentenarbeit in einer Kommandozeilenumgebung, etwa das Bauen von Software oder das Trainieren eines Machine-Learning-Modells. Anders als bei SWE-bench Verified geht es nicht primär um ein Issue mit Patch, sondern um einen operativen Ablauf. 38
Im zitierten Vergleich erreicht Claude Fable 5.1 55,8 %, GPT-5.6 Sol 37,3 % – ein Abstand von 18,5 Prozentpunkten. 44 Das ist ein aussagekräftiger Hinweis darauf, dass die gemeldete Claude-Konfiguration in dieser Evaluation besser abschnitt.
Daraus folgt aber kein allgemeines Ranking von Anthropic, OpenAI, Google, Cognition oder AWS. Dafür wären vergleichbare Modelle, identische Agentengerüste, gleiche Token- und Zeitbudgets sowie Ergebnisse aus mehreren unabhängigen Aufgabensuiten nötig. Die vorliegenden Quellen liefern keinen solchen Gesamtvergleich.
Die verfügbaren Daten stützen drei klar abgegrenzte Aussagen:
Nicht belegt ist damit, dass Claude mehrwöchige Projekte autonom abschließen, undokumentierte interne Systeme zuverlässig verstehen, fundierte Architekturentscheidungen treffen oder ohne menschliche Prüfung sicher ausliefern kann. SWE-bench-Aufgaben haben überprüfbare Testergebnisse. Reale Softwareentwicklung umfasst zusätzlich Anforderungsanalyse, Abwägungen, Integration, Sicherheit, Deployment und Zusammenarbeit.
SWE-bench Verified war ein wichtiger Fortschritt gegenüber kurzen Programmier-Rätseln: Agenten arbeiten mit echten Repositories und Issue-Beschreibungen, ihre Patches werden anhand von Tests bewertet. 1
38 Laut Anthropics Erläuterung zu Agenten-Evaluationen stiegen Modelle auf diesem Test binnen eines Jahres von etwa 40 % auf mehr als 80 %.
38
Für die Praxis sollte ein Evaluationspaket deshalb mehrere Ebenen enthalten:
Anthropic nennt SWE-bench Verified und Terminal-Bench selbst Beispiele für Agenten-Evaluationen und betont für Claude 4 die Fähigkeit zu lang laufenden Aufgaben. 38
42 Die vorliegenden Belege reichen jedoch nicht aus, um eine formale unternehmensweite Abkehr von SWE-bench zugunsten von Evaluationen mit längerem Horizont zu behaupten.
Nach den gemeldeten Benchmark-Ergebnissen gehört Claude im September 2026 zu den stärksten Coding-Agenten, die Teams evaluieren sollten. Der deutlichste Meilenstein ist der Weg von 49 % bei SWE-bench Verified Anfang 2025 zu einem gemeldeten Opus-5-Ranglistenwert von 97,0 %, ergänzt um eine gemeldete Führung mit 81,2 % bei SWE-bench Pro. 23
9
53
Für die Tool-Auswahl sollte aber keine einzelne Schlagzeile entscheiden. Diese Werte eignen sich, um Kandidaten einzugrenzen. Anschließend sollte jedes Team einen kontrollierten Test mit repräsentativen Aufgaben aus den eigenen Repositories durchführen. Nahezu gesättigte öffentliche Benchmarks zeigen, dass Modelle viele bekannte Arten von Issues beheben können – sie beweisen für sich allein noch keine verlässliche, autonome Softwareentwicklung in einer Produktionsorganisation.
Studio Global AI
Diese Seite enthält eine quellengestützte Antwort, die Sie in Studio Global fortsetzen können.
Claude stieg von 49,0 % mit dem aktualisierten Claude 3.5 Sonnet Anfang 2025 auf einen gemeldeten Spitzenwert von 97,0 % für Opus 5 bei SWE bench Verified.
Claude stieg von 49,0 % mit dem aktualisierten Claude 3.5 Sonnet Anfang 2025 auf einen gemeldeten Spitzenwert von 97,0 % für Opus 5 bei SWE bench Verified. SWE bench Verified umfasst 500 öffentliche, vor allem Python basierte GitHub Issues und nähert sich der Sättigung.
Der oft zitierte Vergleich von 55,8 % für Claude Fable 5.1 gegenüber 37,3 % für GPT 5.6 Sol bei Terminal Bench 4.0 zeigt einen Vorteil in genau dieser Konfiguration – kein allgemeines Hersteller Ranking.