Claude 3.5 Sonnet sai alkuvuonna 2025 SWE bench Verifiedissä 49,0 %. Myöhemmällä Vals AI:n tulostaululla Claude Opus 5:n tulos on 97,0 %, mikä kertoo samalla testin olevan lähellä kyllästymistä.
JulkaisijaMuokattu mallilla GPT-5.6 TerraKuvat luotu mallilla GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: As of September 2026, how do Anthropic’s Claude models perform across the major SWE-bench coding benchmarks—including the definitions, probl. Article summary: As of September 2026, Claude appears to lead the reported SWE-bench results, but the evidence supports a narrower conclusion than “Anthropic is unambiguously best at software engineering.” SWE-bench Verified is close to . Topic tags: general, general web, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
Claudelle raportoidun koodausbenchmark-kehityksen mittakaava on huomattava: päivitetty Claude 3.5 Sonnet ylsi alkuvuonna 2025 SWE-bench Verifiedissä 49 prosenttiin, Claude 4 -mallit noin 72,5–72,7 prosenttiin muutamaa kuukautta myöhemmin, ja myöhemmissä tulostauluissa pisteet ovat nousseet lähes testin maksimiin. 23
24
9
Tästä ei seuraa, että Claude olisi ratkaissut ohjelmistokehityksen. Tarkempi johtopäätös on, että Claude on erittäin kilpailukykyinen – ja usein kärjessä – julkaistuissa koodausagenttien arvioissa. Kun tulokset lähestyvät sataa prosenttia rajallisessa, julkisessa testissä, olennaisempi kysymys on, mikä arvio ennustaa parhaiten toimintaa oman organisaation koodivarastoissa, työkaluissa ja katselmointikäytännöissä.
| Benchmark | Mitä agentti tekee | Kattavuus ja pisteytys | Miksi sillä on merkitystä |
|---|---|---|---|
| SWE-bench Verified | Saa aidon GitHub-ongelman ja tilannekuvan koodivarastosta sekä tuottaa korjauspatchin. | Ihmisten suodattama 500 SWE-bench-tapauksen joukko, pääosin suosituista avoimen lähdekoodin Python-arkistoista. Tapaus ratkaistaan, kun patch läpäisee arviointikehyksen testit. |
Tunnettu mittari oikeiden koodikantojen ongelmien korjaamiseen. |
| SWE-bench Pro | Ratkaisee vaikeampia ja pidempikestoisia arkistotason tehtäviä standardoidussa agenttikehikossa. | Raportoidusti 1 865 tehtävää 41 arkistosta ja 123 ohjelmointikielestä; tavallinen mittari on Pass@1. |
Pyrkii laajentamaan Verifiedin julkisia, Python-painotteisia tehtäviä ja pienentämään kontaminaatioriskiä. |
| Terminal-Bench 4.0 | Hoitaa kokonaisvaltaista teknistä työtä komentoriviympäristössä. | Tehtävät edellyttävät selvittelyä, komentojen ajamista, muokkaamista, testaamista ja virheistä toipumista – eivät vain GitHub-ongelmaan tehtävää patchia. |
Mittaa operatiivista työkalujen käyttöä, joka muistuttaa läheisemmin agenttityönkulkuja. |
Anthropic raportoi päivitetyn Claude 3.5 Sonnetin saavuttaneen 49,0 % SWE-bench Verifiedissä. Se ylitti aiemman raportoidun 45 prosentin kärkisuorituksen. Tuolloin yksikään malli ei ollut vielä ylittänyt 50 prosenttia. 23
37
Toukokuussa 2025 Anthropic raportoi Claude Opus 4:lle 72,5 % ja Claude Sonnet 4:lle 72,7 % SWE-bench Verifiedissä. Tulokset raportoitiin ilman laajennettua päättelyä. 24
Vuoteen 2026 mennessä tulostaulukko oli muuttunut perusteellisesti. Vals AI raportoi Claude Opus 5:lle 97,0 %, ja seitsemän arvioitua mallia ylsi vähintään 95 prosenttiin; DeepSeek V4 Pro 0813 saavutti 96,4 %. 9 Siksi ilmaus ”Opus 5 noin 96 %” on järkevä lyhennys korkeasta, 90 prosentin loppupään tuloksesta, mutta ei yksiselitteinen virallinen luku: pisteisiin vaikuttavat malliversio, agenttikehikko, budjetti ja arviointiasetelma.
500 tehtävän joukossa 97 % jättää kärkimallien välille hyvin vähän erotteluvaraa. Vielä tärkeämpää on, että Verified koostuu julkisista ja rajallisista tehtävistä julkisista koodivarastoista. Benchmark-ohjeistuksissa sen kontaminaatio- ja kyllästymisriskiä pidetään suurena. 3
Tulos ei siis ole merkityksetön. Se on vahvaa näyttöä siitä, että agentti pystyy ratkaisemaan tämänkaltaisia hyvin määriteltyjä ja testattavia ongelmia. Se on heikompaa näyttöä siitä, miten agentti suoriutuu uudesta työstä yksityisessä ja jatkuvasti muuttuvassa koodikannassa.
SWE-bench Pro on asemoitu vaikeammaksi ja kontaminaatiota paremmin vastustavaksi vaihtoehdoksi. Raportoitu kattavuus on 1 865 tehtävää 41 arkistosta ja 123 ohjelmointikielestä, kun taas Verifiedissä on 500 ihmisten suodattamaa tapausta suosituista Python-arkistoista. 12
16
Syyskuun 2026 koontitulostauluilla Claude Fable 5.1 on listattu kärkeen 81,2 prosentilla, ennen Claude Mythos 5:tä (80,3 %) ja Claude Fable 5:tä (80,0 %). 53 Tällä tulostaululla Claude-mallit pitävät kolmea kärkipaikkaa.
Lukuihin liittyy kuitenkin olennainen varaus: kaikki Pro-tulokset eivät ole keskenään suoraan vertailukelpoisia. Yksi lähde erottaa Scalen standardoidussa julkisessa asetelmassa saavutetun 59,1 prosentin kärkituloksen suuremmista toimittajakoosteiden luvuista. Tämä havainnollistaa, kuinka paljon agenttikehikko ja raportointitapa voivat vaikuttaa tulokseen. 13 Toinen lähde varoittaa nimenomaisesti, ettei Fable 5.1:n 81,2 prosentin luku ole selvästi tuettu suoraan julkaistulla mallikohtaisella SWE-bench-tuloksella; kyse voi olla koonnista tai version virheellisestä kohdistamisesta.
55
Käytännön tulkinta on yksinkertainen: 81,2 % on raportoitu tulostaululukema, ei vielä vakiintunut ja riippumattomasti toistettu väite pelkästä perusmallista.
Terminal-Bench arvioi teknistä agenttityötä komentoriviympäristössä – esimerkiksi ohjelmiston rakentamista tai koneoppimismallin kouluttamista. Se eroaa SWE-bench Verifiedin ongelma–patch-muodosta, koska se testaa käytännönläheisempää työnkulkua. 38
Siteeratussa vertailussa Claude Fable 5.1 saa 55,8 % ja GPT-5.6 Sol 37,3 %. Ero on 18,5 prosenttiyksikköä. 44 Se on merkityksellinen näyttö siitä, että raportoitu Claude-kokoonpano suoriutui paremmin juuri tässä arvioinnissa.
Se ei kuitenkaan osoita yleistä paremmuusjärjestystä Anthropicin, OpenAI:n, Googlen, Cognitionin tai AWS:n välillä. Laaja toimittajaväite vaatisi keskenään sovitetut mallit, identtiset agenttikehikot, vertailukelpoiset tokeni- ja aikabudjetit sekä tuloksia useista riippumattomista tehtäväsarjoista. Annettu aineisto ei tarjoa tällaista vertailua.
Saatavilla olevat tulokset tukevat kolmea rajattua väitettä:
Tulokset eivät osoita, että Claude kykenisi itsenäisesti viemään läpi moniviikkoisia projekteja, ymmärtäisi luotettavasti dokumentoimattomia sisäisiä järjestelmiä, tekisi johdonmukaisesti hyviä arkkitehtuuripäätöksiä tai toimittaisi muutoksia turvallisesti ilman ihmiskatselmointia. SWE-bench-tehtävissä onnistuminen voidaan varmistaa testeillä; todellinen ohjelmistotyö sisältää lisäksi vaatimusten selvittämistä, kompromisseja, integraatioita, tietoturvaa, käyttöönottoa ja yhteistyötä.
SWE-bench Verified oli merkittävä, koska se siirsi arviointia lyhyistä ohjelmointipulmista kohti aitoja koodivarastoja ja ongelmakuvauksia: agentin patch arvioidaan testeillä. 1
38 Anthropic on todennut, että mallit ovat nousseet tässä arvioinnissa noin 40 prosentista yli 80 prosenttiin vain vuodessa.
38
Tässä tilanteessa hyödyllinen arviointipino sisältää:
Anthropic on kuvannut sekä SWE-bench Verifiedin että Terminal-Benchin esimerkeiksi agenttiarvioinneista ja korostanut Claude 4:n kykyä pitkäkestoisiin tehtäviin. 38
42 Annetut lähteet eivät kuitenkaan riitä osoittamaan virallista, yhtiötasoista siirtymää SWE-benchistä pidemmän aikajänteen arviointeihin. Vahvempaa väitettä ei pidä esittää varmana.
Claudesta on raportoitujen benchmark-tulosten perusteella tullut yksi vahvimmista arvioitavista koodausagenteista syyskuussa 2026. Selkein virstanpylväs on nousu alkuvuoden 2025 49 prosentista SWE-bench Verifiedissä Opus 5:n raportoituun 97,0 prosentin tulostaulutulokseen sekä SWE-bench Pron raportoituun 81,2 prosentin kärkitulokseen. 23
9
53
Työkalua ei silti kannata valita yhden otsikkoluvun perusteella. Käytä benchmarkeja ehdokkaiden karsintaan ja tee sen jälkeen hallittu arvio omilla, edustavilla tehtävilläsi. Lähes kyllästyneet julkiset testit osoittavat, että mallit pystyvät korjaamaan paljon tunnetun kaltaisia ongelmia – ne eivät yksin todista luotettavaa, autonomista ohjelmistokehitystä tuotanto-organisaatiossa.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Claude 3.5 Sonnet sai alkuvuonna 2025 SWE bench Verifiedissä 49,0 %. Myöhemmällä Vals AI:n tulostaululla Claude Opus 5:n tulos on 97,0 %, mikä kertoo samalla testin olevan lähellä kyllästymistä.
Claude 3.5 Sonnet sai alkuvuonna 2025 SWE bench Verifiedissä 49,0 %. Myöhemmällä Vals AI:n tulostaululla Claude Opus 5:n tulos on 97,0 %, mikä kertoo samalla testin olevan lähellä kyllästymistä. SWE bench Verified mittaa 500 julkisesta Python projektista poimitun GitHub ongelman korjaamista.
Terminal Bench 4.0:ssa Claude Fable 5.1:n raportoitu 55,8 % ylittää GPT 5.6 Solin 37,3 %.