Claude przeszedł od 49,0% w SWE bench Verified dla ulepszonego Claude 3.5 Sonnet do zgłaszanego wyniku 97,0% dla Claude Opus 5 na jednym z rankingów. SWE bench Verified obejmuje 500 publicznych, głównie pythonowych zadań naprawy zgłoszeń z GitHuba i zbliża się do nasycenia; SWE bench Pro jest szerszy, ale wyniki sil...
Opublikowane przezEdytowane za pomocą GPT-5.6 TerraObrazy wygenerowane za pomocą GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: As of September 2026, how do Anthropic’s Claude models perform across the major SWE-bench coding benchmarks—including the definitions, probl. Article summary: As of September 2026, Claude appears to lead the reported SWE-bench results, but the evidence supports a narrower conclusion than “Anthropic is unambiguously best at software engineering.” SWE-bench Verified is close to . Topic tags: general, general web, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
Wyniki Claude’a w benchmarkach programistycznych wyglądają imponująco: ulepszony Claude 3.5 Sonnet osiągnął 49,0% w SWE-bench Verified na początku 2025 r.; kilka miesięcy później modele Claude 4 uzyskały około 72,5–72,7%; a późniejsze rankingi podawały rezultaty bliskie maksymalnego wyniku. 23
24
9
Nie oznacza to jednak, że Claude „rozwiązał inżynierię oprogramowania”. Rzetelniejszy wniosek brzmi: Claude jest bardzo konkurencyjnym, a w części opublikowanych ocen także wiodącym agentem programistycznym. Gdy wyniki zbliżają się do 100% na skończonym, publicznym zestawie, kluczowe pytanie brzmi nie „kto ma o punkt więcej?”, lecz który test najlepiej przewiduje pracę w konkretnym repozytorium, z konkretnymi narzędziami i zasadami code review.
| Benchmark | Co robi agent | Zakres i sposób oceny | Dlaczego ma znaczenie |
|---|---|---|---|
| SWE-bench Verified | Dostaje rzeczywiste zgłoszenie z GitHuba oraz stan repozytorium, a następnie tworzy poprawkę. | To ręcznie odfiltrowany zbiór 500 instancji SWE-bench, oparty głównie na popularnych repozytoriach open source w Pythonie. Zadanie uznaje się za rozwiązane, gdy poprawka przejdzie testy w środowisku ewaluacyjnym. |
Jest powszechnie rozpoznawalnym testem rozwiązywania zgłoszeń w rzeczywistym kodzie. |
| SWE-bench Pro | Rozwiązuje trudniejsze, dłuższe zadania w repozytoriach, korzystając ze standaryzowanego szkieletu agenta. | Opisywany jako 1865 zadań z 41 repozytoriów i 123 języków programowania; zwykle oceniany miarą Pass@1. |
Ma wyjść poza publiczne, skoncentrowane na Pythonie zadania z Verified i ograniczać ryzyko zanieczyszczenia danymi treningowymi. |
| Terminal-Bench 4.0 | Wykonuje pełne zadania techniczne w terminalu. | Obejmuje zadania wymagające analizy, wydawania poleceń, edycji, testowania i wychodzenia z błędów, a nie wyłącznie przygotowania patcha do zgłoszenia. |
Sprawdza pracę z narzędziami i operacyjne aspekty bliższe rzeczywistemu przebiegowi pracy agenta. |
Anthropic podał, że ulepszony Claude 3.5 Sonnet osiągnął 49,0% w SWE-bench Verified, wyprzedzając ówczesny zgłaszany rekord 45%. Firma zaznaczała wtedy, że żaden model nie przekroczył jeszcze 50% w tym benchmarku. 23
37
W maju 2025 r. Anthropic podał wyniki 72,5% dla Claude Opus 4 i 72,7% dla Claude Sonnet 4. Zgłoszono je bez trybu extended thinking. 24
Do 2026 r. obraz rankingu wyraźnie się zmienił. Vals AI podaje 97,0% dla Claude Opus 5; siedem ocenionych modeli przekroczyło 95%, a DeepSeek V4 Pro 0813 uzyskał 96,4%. 9 Skrótowe stwierdzenie, że „Opus 5 ma około 96%”, oddaje więc skalę wyniku, ale nie jest jedyną miarodajną wartością. Rezultat zależy od wersji modelu, użytego szkieletu agenta, budżetu obliczeniowego i całej konfiguracji ewaluacji.
W zestawie liczącym 500 zadań wynik 97% pozostawia niewiele miejsca na sensowne rozróżnianie systemów z czołówki. Co ważniejsze, Verified składa się z publicznych, skończonych zadań pochodzących z publicznych repozytoriów. Materiały opisujące benchmark wskazują na wysokie ryzyko zanieczyszczenia oraz nasycenia tego testu. 3
Nie czyni to wyniku bezwartościowym. Oznacza natomiast, że najlepiej traktować go jako dowód, iż agent umie rozwiązywać tę klasę dobrze zdefiniowanych i testowalnych zgłoszeń — a nie jako pełną prognozę jego działania w nowym, prywatnym i stale zmieniającym się kodzie organizacji.
SWE-bench Pro jest przedstawiany jako trudniejsza i bardziej odporna na zanieczyszczenie danych alternatywa. Raportowany zakres to 1865 zadań z 41 repozytoriów, obejmujących 123 języki programowania, wobec 500 ręcznie odfiltrowanych instancji z popularnych repozytoriów pythonowych w Verified. 12
16
Zbiorczy ranking opublikowany we wrześniu 2026 r. wskazuje Claude Fable 5.1 z wynikiem 81,2%, przed Claude Mythos 5 z 80,3% i Claude Fable 5 z 80,0%. 53 W tym zestawieniu Claude zajmuje trzy pierwsze miejsca.
Tu potrzebne jest jednak istotne zastrzeżenie: nie wszystkie wyniki Pro da się porównywać wprost. Jedno ze źródeł odróżnia 59,1% — najlepszy wynik na publicznym, standaryzowanym zestawie Scale — od wyższych wartości w zbiorczych rankingach dostawców. Pokazuje to, jak mocno na rezultat wpływają szkielet agenta i metodologia raportowania. 13 Inne źródło wprost zaznacza, że wynik 81,2% dla Fable 5.1 nie ma jasno wskazanego bezpośrednio opublikowanego, modelowego źródła i może wynikać z agregacji albo błędnego przypisania wersji.
55
Praktyczny wniosek jest prosty: 81,2% należy traktować jako raportowaną wartość rankingową, a nie jako definitywnie potwierdzony, niezależnie zreplikowany rezultat samego modelu bazowego.
Terminal-Bench ocenia pracę technicznego agenta w środowisku wiersza poleceń — na przykład budowanie oprogramowania lub trenowanie modelu uczenia maszynowego. W odróżnieniu od formatu „zgłoszenie i patch” w SWE-bench Verified testuje bardziej operacyjny przebieg pracy. 38
Przywoływane porównanie podaje 55,8% dla Claude Fable 5.1 oraz 37,3% dla GPT-5.6 Sol, czyli różnicę 18,5 punktu procentowego. 44 To istotny dowód, że raportowana konfiguracja Claude’a lepiej poradziła sobie w tej konkretnej ewaluacji.
Nie ustanawia to jednak ogólnego rankingu Anthropic, OpenAI, Google, Cognition czy AWS. Do tak szerokiego wniosku potrzebne byłyby porównania modeli w identycznych szkieletach agentowych, z tymi samymi limitami czasu i tokenów, w kilku niezależnych zestawach zadań. Dostarczone źródła takiego porównania nie przedstawiają.
Dostępne dane wspierają trzy konkretne tezy:
Wyniki te nie dowodzą, że Claude samodzielnie zrealizuje wielotygodniowy projekt, niezawodnie zrozumie nieudokumentowane systemy wewnętrzne, podejmie trafne decyzje architektoniczne albo bezpiecznie wdroży kod bez kontroli człowieka. Zadania SWE-bench mają weryfikowalny wynik testowy. Rzeczywista praca inżynierska obejmuje też odkrywanie wymagań, kompromisy, integrację, bezpieczeństwo, wdrożenia i współpracę zespołową.
SWE-bench Verified był wartościowy, bo wykraczał poza krótkie zadania algorytmiczne: agent pracuje na realnym repozytorium i opisie zgłoszenia, a patch jest oceniany testami. 1
38 Według opisu Anthropic modele przeszły w około rok od wyników rzędu 40% do ponad 80% w tej ewaluacji.
38
Dla zespołu wybierającego narzędzie sensowny zestaw ocen powinien obejmować:
Anthropic wskazuje SWE-bench Verified i Terminal-Bench jako przykłady ewaluacji agentów oraz podkreśla zdolność Claude 4 do długotrwałej pracy. 38
42 Dostarczone źródła nie wystarczają jednak, by potwierdzić mocniejszą tezę o formalnym, firmowym odejściu od SWE-bench na rzecz wyłącznie dłuższych testów agentowych.
Raportowane wyniki czynią Claude’a jedną z najmocniejszych opcji do rozważenia wśród agentów programistycznych na wrzesień 2026 r. Najczytelniejszy kamień milowy to przejście od 49% w SWE-bench Verified na początku 2025 r. do raportowanego wyniku 97,0% dla Opus 5 w rankingu, przy jednoczesnym zgłaszanym prowadzeniu z wynikiem 81,2% w SWE-bench Pro. 23
9
53
Przy wyborze narzędzia nie warto jednak kierować się jednym nagłówkiem. Te wyniki powinny służyć do stworzenia krótkiej listy kandydatów, po czym należy przeprowadzić kontrolowaną ocenę na reprezentatywnych zadaniach we własnych repozytoriach. Publiczne benchmarki bliskie nasycenia pokazują, że modele potrafią naprawiać wiele znanych typów problemów; same w sobie nie dowodzą jeszcze niezawodnej, autonomicznej inżynierii oprogramowania w środowisku produkcyjnym.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Claude przeszedł od 49,0% w SWE bench Verified dla ulepszonego Claude 3.5 Sonnet do zgłaszanego wyniku 97,0% dla Claude Opus 5 na jednym z rankingów.
Claude przeszedł od 49,0% w SWE bench Verified dla ulepszonego Claude 3.5 Sonnet do zgłaszanego wyniku 97,0% dla Claude Opus 5 na jednym z rankingów. SWE bench Verified obejmuje 500 publicznych, głównie pythonowych zadań naprawy zgłoszeń z GitHuba i zbliża się do nasycenia; SWE bench Pro jest szerszy, ale wyniki silnie zależą od metodologii.
W przywołanym porównaniu Terminal Bench 4.0 Claude Fable 5.1 uzyskał 55,8%, wobec 37,3% dla GPT 5.6 Sol — to wynik konkretnej konfiguracji, a nie pełny ranking dostawców AI.