Il modello si comporta bene anche sui benchmark del lavoro di conoscenza: GDPval valuta compiti in dozzine di professioni, tra cui legge, finanza e product management, e GPT-5.5 eguaglia o supera i professionisti in circa l'84,9% dei confronti.
Insieme, questi numeri suggeriscono che GPT-5.5 è particolarmente forte in compiti autonomi multi-step e workflow agentici.
Il Claude Opus 4.7 di Anthropic è ampiamente considerato uno dei modelli più forti per compiti di ingegneria del software.
I suoi risultati più importanti includono:
SWE-bench valuta se un modello riesce a correggere bug reali in repository open-source. Il risultato di 87,6% su SWE-bench Verified di Opus 4.7 rappresenta un miglioramento significativo rispetto al suo predecessore e lo colloca tra i migliori modelli per agenti di coding.
Sebbene il suo punteggio su Terminal-Bench sia inferiore a quello di GPT-5.5, i suoi benchmark incentrati sul coding rimangono tra i più alti nelle comparazioni pubbliche.
Il Gemini 3.5 Flash di Google è insolito perché è posizionato come un modello veloce ed economico piuttosto che come un modello di punta — eppure ottiene risultati competitivi su diversi benchmark agentici.
Risultati riportati:
Google afferma che il modello è circa quattro volte più veloce di modelli comparabili e supera il precedente Gemini 3.1 Pro su diversi benchmark agentici e di coding.
In pratica, il punto di forza principale di Gemini 3.5 Flash è il rapporto velocità-capacità: offre risultati quasi da modello di punta puntando a bassa latenza e carichi di lavoro produttivi.
DeepSeek V4 è notevole perché è uno dei modelli open-weight più capaci mai rilasciati finora.
La famiglia di modelli include due varianti:
Secondo il report tecnico del modello e i riepiloghi dei suoi benchmark, V4-Pro in modalità di ragionamento massimo raggiunge:
Questi risultati lo avvicinano ai principali modelli proprietari in alcuni benchmark di coding.
Tuttavia, una valutazione indipendente del programma CAISI del National Institute of Standards and Technology (NIST) statunitense ha rilevato che le capacità del modello sono indietro rispetto alla frontiera di circa otto mesi, evidenziando un divario tra i risultati auto-dichiarati e quelli indipendenti.
Il Grok 4.3 di xAI rappresenta un grande miglioramento rispetto ai modelli Grok precedenti, specialmente nei benchmark di compiti agentici.
Cifre pubblicate:
Il balzo di oltre 300 Elo su GDPval-AA rispetto alle versioni precedenti di Grok suggerisce un progresso sostanziale nell'automazione di compiti reali.
Tuttavia, le analisi di terze parti generalmente collocano il modello al di sotto dei sistemi più recenti di OpenAI e Anthropic nei benchmark di capacità complessiva.
Osservando queste valutazioni, emerge un quadro coerente:
Tuttavia, queste conclusioni vanno considerate indicazioni di tendenza, non definitive, poiché ogni fornitore enfatizza suite di valutazione diverse.
I confronti basati sui benchmark nell'AI moderna sono sempre più complicati per diversi motivi:
A causa di questi fattori, la vera classifica relativa dei modelli di frontiera diventa spesso chiara solo dopo mesi di test indipendenti.
Le ultime evidenze dei benchmark non mostrano un singolo modello che domina ogni ambito.
Invece, l'attuale frontiera appare specializzata:
Con il convergere dei benchmark indipendenti e l'emergere di test più omogenei, l'ordine esatto di questi sistemi continuerà probabilmente a evolversi.