Claude è passato dal 49,0% di Claude 3.5 Sonnet su SWE bench Verified all’inizio del 2025 al 97,0% attribuito a Claude Opus 5 in una classifica del 2026. SWE bench Verified ha 500 problemi pubblici, soprattutto Python, e si avvicina alla saturazione; SWE bench Pro amplia la copertura a 1.865 task, 41 repository e 12...
Pubblicato daModificato con GPT-5.6 TerraImmagini generate con GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: As of September 2026, how do Anthropic’s Claude models perform across the major SWE-bench coding benchmarks—including the definitions, probl. Article summary: As of September 2026, Claude appears to lead the reported SWE-bench results, but the evidence supports a narrower conclusion than “Anthropic is unambiguously best at software engineering.” SWE-bench Verified is close to . Topic tags: general, general web, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
I risultati dichiarati per Claude nei benchmark di programmazione sono impressionanti: Claude 3.5 Sonnet aggiornato raggiunse il 49,0% su SWE-bench Verified all’inizio del 2025; i modelli Claude 4 arrivarono intorno al 72,5%-72,7% pochi mesi dopo; nel 2026 alcune classifiche hanno poi riportato punteggi prossimi al limite del benchmark. 23
24
9
La conclusione corretta, però, non è che Claude abbia «risolto» l’ingegneria del software. È che Claude è diventato molto competitivo — e spesso leader — nelle valutazioni pubblicate sugli agenti di coding. Quando un benchmark pubblico e finito si avvicina al 100%, la domanda più utile diventa un’altra: quale valutazione predice meglio le prestazioni sul repository, sugli strumenti e sul processo di revisione di una specifica azienda?
| Benchmark | Che cosa fa l’agente | Copertura e punteggio | Perché conta |
|---|---|---|---|
| SWE-bench Verified | Riceve una issue reale di GitHub e uno snapshot del repository, quindi produce una patch. | Insieme di 500 istanze di SWE-bench filtrate da revisori umani, tratte soprattutto da popolari repository Python open source. Un task è risolto se la patch supera i test nell’ambiente di valutazione. |
È un test molto noto per la risoluzione di issue in basi di codice reali. |
| SWE-bench Pro | Affronta task più difficili e di più lunga durata nel repository, con una struttura di agente standardizzata. | Vengono riportati 1.865 task da 41 repository, in 123 linguaggi; il risultato è spesso espresso come Pass@1, cioè successo al primo tentativo. |
Punta ad andare oltre i task Python pubblici di Verified e a ridurre il rischio di contaminazione dei dati. |
| Terminal-Bench 4.0 | Esegue lavoro tecnico end-to-end in un ambiente a riga di comando. | Include attività che richiedono indagine, esecuzione di comandi, modifiche, test e recupero dagli errori, non soltanto una patch per una issue GitHub. |
Aggiunge requisiti operativi e di uso degli strumenti più vicini ai flussi di lavoro di un agente. |
Anthropic ha dichiarato che Claude 3.5 Sonnet aggiornato ha ottenuto il 49,0% su SWE-bench Verified, superando il precedente risultato di riferimento del 45%. All’epoca, Anthropic osservava che nessun modello aveva ancora oltrepassato il 50%. 23
37
Nel maggio 2025, Anthropic ha riportato il 72,5% per Claude Opus 4 e il 72,7% per Claude Sonnet 4 su SWE-bench Verified. Quei dati erano indicati come ottenuti senza extended thinking. 24
Nel 2026, il quadro delle classifiche è cambiato radicalmente. Vals AI riporta Claude Opus 5 al 97,0%, con sette modelli valutati al 95% o oltre e DeepSeek V4 Pro 0813 al 96,4%. 9 Dire che Opus 5 è «attorno al 96%» è quindi una sintesi ragionevole di un risultato collocato nella fascia altissima, ma non un numero unico e definitivo: il punteggio dipende dalla versione del modello, dalla configurazione dell’agente, dal budget e dal protocollo di valutazione.
Su un set di 500 task, il 97% lascia margini minimi per distinguere i sistemi di frontiera. Inoltre, Verified è composto da problemi pubblici e finiti, provenienti da repository pubblici. Le guide ai benchmark lo descrivono come esposto a un rischio elevato di contaminazione e di saturazione. 3
Questo non rende il risultato privo di valore. Significa piuttosto che è una buona evidenza della capacità di risolvere questa classe di issue, ben specificate e verificabili tramite test; è meno adatto, invece, a prevedere da solo il rendimento su lavoro inedito all’interno di una codebase privata e in continua evoluzione.
SWE-bench Pro viene presentato come alternativa più difficile e più resistente alla contaminazione. La copertura riportata è di 1.865 task in 41 repository e 123 linguaggi di programmazione, contro le 500 istanze filtrate di Verified, concentrate su repository Python popolari. 12
16
Le classifiche aggregate pubblicate a settembre 2026 indicano Claude Fable 5.1 all’81,2%, davanti a Claude Mythos 5 all’80,3% e Claude Fable 5 all’80,0%. 53 In quella classifica, Claude occupa le prime tre posizioni.
C’è però una precisazione essenziale: non tutti i valori di Pro sono direttamente confrontabili. Una fonte distingue il 59,1% come punteggio leader nel set pubblico standardizzato di Scale da valori aggregati dei fornitori più elevati; è un esempio di quanto la struttura dell’agente e il metodo di rendicontazione possano cambiare il risultato. 13 Un’altra fonte avverte esplicitamente che l’81,2% attribuito a Fable 5.1 non sarebbe chiaramente supportato da un risultato SWE-bench pubblicato e specifico per quel modello, e potrebbe riflettere un problema di aggregazione o attribuzione di versione.
55
In pratica, l’81,2% va letto come valore riportato da una classifica, non come fatto definitivamente consolidato e replicato in modo indipendente sul solo modello di base.
Terminal-Bench valuta il lavoro tecnico degli agenti in una shell, per esempio la compilazione di software o l’addestramento di un modello di machine learning. A differenza del formato issue-e-patch di SWE-bench Verified, misura un flusso operativo più completo. 38
Il confronto citato assegna il 55,8% a Claude Fable 5.1 e il 37,3% a GPT-5.6 Sol: una differenza di 18,5 punti percentuali. 44 È un’indicazione significativa del fatto che la configurazione Claude riportata ha ottenuto un risultato superiore in quella valutazione.
Non dimostra, però, una classifica generale tra Anthropic, OpenAI, Google, Cognition o AWS. Per una conclusione di questo tipo servirebbero modelli confrontati nelle stesse condizioni, identica struttura dell’agente, budget di tempo e token comparabili, oltre a risultati su più suite di test indipendenti. Le fonti disponibili non forniscono quel confronto completo.
Le evidenze disponibili sostengono tre affermazioni misurabili:
Non mostrano che Claude possa completare autonomamente progetti di settimane, comprendere in modo affidabile sistemi interni non documentati, prendere sempre decisioni architetturali corrette o distribuire codice in sicurezza senza revisione umana. I task di SWE-bench hanno esiti verificabili attraverso test; il lavoro ingegneristico reale comprende anche scoperta dei requisiti, compromessi, integrazione, sicurezza, rilascio e collaborazione.
SWE-bench Verified è stato importante perché ha superato i brevi esercizi di programmazione: gli agenti lavorano su repository reali e descrizioni di issue, mentre le patch vengono giudicate dai test. 1
38 Ma, secondo la discussione di Anthropic sulle valutazioni degli agenti, i modelli sono passati in circa un anno da circa il 40% a oltre l’80% su questa prova.
38
A questo punto, una valutazione utile dovrebbe combinare:
Anthropic ha citato sia SWE-bench Verified sia Terminal-Bench come esempi di valutazioni per agenti e ha sottolineato le capacità di Claude 4 sui compiti prolungati. 38
42 Le fonti disponibili, tuttavia, non bastano a dimostrare un cambiamento formale e generalizzato della strategia aziendale, da SWE-bench verso benchmark a orizzonte più lungo. Questa tesi più forte resta quindi non provata.
Le prestazioni riportate rendono Claude una delle opzioni più forti da valutare per gli agenti di coding a settembre 2026. Il passaggio più evidente va dal 49% su SWE-bench Verified all’inizio del 2025 al 97,0% riportato per Opus 5 in una classifica, insieme a un 81,2% riportato come leadership su SWE-bench Pro. 23
9
53
Per scegliere uno strumento, però, non basta un titolo da classifica. I punteggi servono per creare una lista ristretta di candidati; la decisione dovrebbe arrivare dopo una prova controllata su attività rappresentative dei propri repository. I benchmark pubblici quasi saturi mostrano che i modelli sanno correggere molti problemi di tipo noto, ma non dimostrano da soli un’ingegneria del software autonoma e affidabile in produzione.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Claude è passato dal 49,0% di Claude 3.5 Sonnet su SWE bench Verified all’inizio del 2025 al 97,0% attribuito a Claude Opus 5 in una classifica del 2026.
Claude è passato dal 49,0% di Claude 3.5 Sonnet su SWE bench Verified all’inizio del 2025 al 97,0% attribuito a Claude Opus 5 in una classifica del 2026. SWE bench Verified ha 500 problemi pubblici, soprattutto Python, e si avvicina alla saturazione; SWE bench Pro amplia la copertura a 1.865 task, 41 repository e 123 linguaggi.
Il confronto citato su Terminal Bench 4.0 assegna a Claude Fable 5.1 il 55,8%, contro il 37,3% di GPT 5.6 Sol, ma non basta per stabilire una graduatoria generale tra fornitori.