Claude se podle zveřejněných výsledků posunul z 49,0 % v SWE bench Verified na začátku roku 2025 až k 97,0 % pro Opus 5 v jednom žebříčku. SWE bench Verified obsahuje 500 veřejných, převážně pythonových úloh a blíží se nasycení; širší SWE bench Pro má 1 865 úloh ze 41 repozitářů a 123 programovacích jazyků.
PublikovalUpraveno pomocí GPT-5.6 TerraObrázky vytvořeny pomocí GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: As of September 2026, how do Anthropic’s Claude models perform across the major SWE-bench coding benchmarks—including the definitions, probl. Article summary: As of September 2026, Claude appears to lead the reported SWE-bench results, but the evidence supports a narrower conclusion than “Anthropic is unambiguously best at software engineering.” SWE-bench Verified is close to . Topic tags: general, general web, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
Claude se v publikovaných testech programátorských agentů posunul mimořádně rychle. Vylepšený Claude 3.5 Sonnet dosáhl na začátku roku 2025 49,0 % v SWE-bench Verified. Modely Claude 4 pak dosáhly zhruba 72,5–72,7 % a pozdější žebříček uvádí pro Claude Opus 5 97,0 %. 23
24
9
To ale neznamená, že Claude „vyřešil softwarové inženýrství“. Přesnější závěr zní: Claude patří ke špičce, často na samotný vrchol, v publikovaných hodnoceních kódovacích agentů. Jakmile se výsledky blíží 100 % na konečné veřejné sadě úloh, je důležitější otázka jiná: který test nejlépe předpoví výkon ve vlastním repozitáři, s vlastními nástroji a procesem code review.
| Benchmark | Úkol pro agenta | Rozsah a vyhodnocení | Proč je důležitý |
|---|---|---|---|
| SWE-bench Verified | Agent dostane skutečný GitHub issue a stav repozitáře, poté vytvoří patch. | Jde o 500 lidsky prověřených úloh z původního SWE-bench, zejména z populárních open-source pythonových projektů. Úloha se počítá jako vyřešená, pokud patch projde testy v hodnoticím prostředí. |
Zavedené měřítko schopnosti opravit konkrétní problém v reálném kódu. |
| SWE-bench Pro | Řeší náročnější úlohy v repozitářích s delším pracovním horizontem a jednotným agentním rámcem. | Uvádí se 1 865 úloh ze 41 repozitářů a 123 programovacích jazyků; běžnou metrikou je Pass@1. |
Má rozšířit záběr nad veřejné pythonové úlohy Verified a snížit riziko kontaminace dat. |
| Terminal-Bench 4.0 | Provádí technickou práci od začátku do konce v terminálu. | Úlohy vyžadují zkoumání problému, spouštění příkazů, úpravy souborů, testování i zotavení po neúspěchu – nikoli jen opravu issue formou patche. |
Zachycuje provozní a nástrojové dovednosti bližší skutečnému workflow agenta. |
Anthropic uvedl, že vylepšený Claude 3.5 Sonnet dosáhl 49,0 % v SWE-bench Verified a překonal tehdejší uváděný rekord 45 %. Firma tehdy zároveň upozorňovala, že hranici 50 % ještě žádný model nepřekročil. 23
37
V květnu 2025 Anthropic oznámil 72,5 % pro Claude Opus 4 a 72,7 % pro Claude Sonnet 4. Tyto výsledky byly vykázány bez režimu extended thinking. 24
V roce 2026 už se situace v čele žebříčků výrazně změnila. Vals AI uvádí 97,0 % pro Claude Opus 5; sedm vyhodnocených modelů dosáhlo alespoň 95 % a DeepSeek V4 Pro 0813 dosáhl 96,4 %. 9 Tvrzení „Opus 5 má 96 %“ je tedy rozumné zjednodušení pro výsledek ve vysokých devadesátkách, ne však jediná autoritativní hodnota. Skóre ovlivňuje konkrétní verze modelu, agentní rámec, rozpočet i nastavení evaluace.
U sady o 500 úlohách ponechává 97% výsledek jen malý prostor k rozlišení systémů na hranici možností. Podstatnější je, že Verified tvoří veřejné a konečné úlohy z veřejných repozitářů. Průvodce benchmarky jej popisuje jako test s vysokým rizikem kontaminace a nasycení. 3
Neznamená to, že je skóre bezcenné. Znamená to, že dobře dokládá schopnost řešit tento typ jasně popsaného a testovatelného problému. Mnohem hůře však samo o sobě předpovídá výkon při nové práci v neveřejném a průběžně se měnícím kódu firmy.
SWE-bench Pro je prezentován jako obtížnější alternativa odolnější vůči kontaminaci dat. Uváděný rozsah je 1 865 úloh ve 41 repozitářích a 123 programovacích jazycích, zatímco Verified má 500 lidsky filtrovaných instancí z populárních pythonových projektů. 12
16
Souhrnné žebříčky zveřejněné v září 2026 řadí na první místo Claude Fable 5.1 s 81,2 %, před Claude Mythos 5 s 80,3 % a Claude Fable 5 s 80,0 %. 53 Claude tak v tomto žebříčku obsazuje první tři příčky.
Je tu však zásadní výhrada: výsledky Pro nejsou vždy přímo srovnatelné. Jeden zdroj rozlišuje mezi 59,1 % jako vedoucím výsledkem na standardizované veřejné sadě Scale a vyššími souhrnnými výsledky výrobců. To ukazuje, jak silně mohou výsledek ovlivnit agentní rámec a metodika vykazování. 13 Jiný zdroj výslovně upozorňuje, že hodnota 81,2 % pro Fable 5.1 není jasně podložena přímo zveřejněným výsledkem konkrétního modelu a může jít o problém agregace či přiřazení verze.
55
Praktický závěr: 81,2 % je vykázaná hodnota v žebříčku, nikoli nezpochybnitelný a nezávisle replikovaný výsledek samotného základního modelu.
Terminal-Bench hodnotí technickou práci agenta v prostředí příkazové řádky – například sestavení softwaru nebo trénování modelu strojového učení. Oproti formátu „issue a patch“ v SWE-bench Verified zkoumá provoznější pracovní postup. 38
Citované srovnání uvádí 55,8 % pro Claude Fable 5.1 a 37,3 % pro GPT-5.6 Sol, tedy rozdíl 18,5 procentního bodu. 44 Jde o relevantní důkaz, že vykázaná konfigurace Claude v tomto hodnocení fungovala lépe.
Nejde však o důkaz obecného pořadí Anthropicu, OpenAI, Googlu, Cognitionu a AWS. Takový závěr by vyžadoval porovnat odpovídající modely ve stejném agentním rámci, se stejnými časovými i tokenovými rozpočty a napříč několika nezávislými sadami úloh. Dodané podklady takové srovnání neposkytují.
Dostupné výsledky podporují tři omezená tvrzení:
Tyto výsledky neukazují, že Claude autonomně dokončí několikatýdenní projekt, spolehlivě pochopí nezdokumentovaný interní systém, udělá správná architektonická rozhodnutí nebo bezpečně nasadí změny bez lidské kontroly. Úlohy SWE-bench mají ověřitelný testový výsledek; reálný vývoj navíc zahrnuje hledání požadavků, kompromisy, integraci, bezpečnost, nasazení i spolupráci v týmu.
SWE-bench Verified byl cenný posun oproti krátkým programátorským hádankám: agent pracuje se skutečným repozitářem a popisem problému, přičemž patch se hodnotí testy. 1
38 Anthropic uvádí, že modely v tomto hodnocení postoupily zhruba od 40 % na více než 80 % během jediného roku.
38
Užitečný hodnoticí postup by proto měl kombinovat:
Anthropic označuje SWE-bench Verified i Terminal-Bench za příklady hodnocení agentů a u Claude 4 zdůrazňoval schopnost dlouhé soustředěné práce. 38
42 Dodané podklady ale nestačí k doložení silnějšího tvrzení, že firma formálně přesunula svou celkovou strategii od SWE-bench k testům s delším horizontem.
Vykázané benchmarkové výsledky řadí Claude k nejsilnějším programátorským agentům, které má v září 2026 smysl prověřit. Nejvýraznější milník představuje cesta od 49 % v SWE-bench Verified na začátku roku 2025 k uváděným 97,0 % pro Opus 5 v žebříčku Verified, vedle vykázaného vedení s 81,2 % v SWE-bench Pro. 23
9
53
Při výběru nástroje však nestačí jeden titulkový výsledek. Benchmarky použijte pro užší výběr kandidátů a poté proveďte kontrolované srovnání na úlohách z vlastních repozitářů. Veřejné testy blízko nasycení ukazují, že modely umějí opravit mnoho známých typů problémů; samy o sobě ale nedokazují spolehlivé autonomní softwarové inženýrství v produkční organizaci.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Claude se podle zveřejněných výsledků posunul z 49,0 % v SWE bench Verified na začátku roku 2025 až k 97,0 % pro Opus 5 v jednom žebříčku.
Claude se podle zveřejněných výsledků posunul z 49,0 % v SWE bench Verified na začátku roku 2025 až k 97,0 % pro Opus 5 v jednom žebříčku. SWE bench Verified obsahuje 500 veřejných, převážně pythonových úloh a blíží se nasycení; širší SWE bench Pro má 1 865 úloh ze 41 repozitářů a 123 programovacích jazyků.
Výsledek 55,8 % pro Claude Fable 5.1 proti 37,3 % pro GPT 5.6 Sol v Terminal Bench 4.0 je relevantní dílčí srovnání, ale není to celkové pořadí dodavatelů AI.