| GPT-5.5 (Pro) | $30.00 | $180.00 | — | 1M |
| Qwen3.7-Max | $2.50 | $7.50 | $0.25 (90% di sconto) | 1M |
| Kimi K2.6 | $0.60–$0.95 | $3.00–$4.00 | $0.10 | 262K |
| Gemini 3.5 Flash | $1.50 | $9.00 | $0.15 | 1M |
| Grok 4.3 | $1.25 | $2.50 | $0.30 | 1M |
| DeepSeek V4-Flash | $0.14 | $0.28 | $0.0028 | 1M |
| DeepSeek V4-Pro | $0.435 (sconto permanente) | $0.87 (sconto permanente) | $0.0036 | 1M |
Punti Chiave sui Prezzi:
I benchmark sono utili solo se contestualizzati. Abbiamo organizzato i risultati in base a ciò che effettivamente misurano—intelligenza generale, capacità di programmazione e prestazioni agentiche—invece di un singolo, e spesso fuorviante, punteggio composito.
Questa categoria misura la conoscenza pura, la matematica e il ragionamento scientifico.
| Benchmark | Claude Opus 4.8 | GPT-5.5 | DeepSeek V4-Pro | Qwen3.7-Max | Grok 4.3 | Gemini 3.5 Flash |
|---|---|---|---|---|---|---|
| AA Intelligence Index | 61.4 | 60.2 | ~55 | 56.6 | 53 | ~52 |
| GPQA Diamond | 93.6% | — | 90.1% | 92.4% | ||
| AIME / USAMO 2026 (Matematica) | 96.7% | 95.2% | ||||
| HLE (con strumenti) | 57.9% | — | 37.7% | — | — | — |
Claude Opus 4.8 ha aperto un divario piccolo ma significativo su GPT-5.5 nell'intelligenza generale, sostenuto da un impressionante balzo in avanti di 27,4 punti nelle performance matematiche rispetto al suo predecessore . Qwen3.7-Max si distingue come il miglior modello cinese, quasi al livello dei leader nel ragionamento scientifico di livello universitario (GPQA Diamond) .
I benchmark più rilevanti per gli sviluppatori.
| Benchmark | DeepSeek V4-Pro | Kimi K2.6 | GPT-5.5 | Claude Opus 4.8 | Qwen3.7-Max |
|---|---|---|---|---|---|
| SWE-bench Verified | 80.6% | 80.2% | 88.7% | 88.6% | 72.5% |
| SWE-bench Pro | ~58% | 58.6% | 58.6% | 69.2% | |
| LiveCodeBench v6 | 93.5% | 89.6% |
Le performance di programmazione creano una chiara segmentazione. Claude Opus 4.8 e GPT-5.5 sono appaiati al vertice per la correzione generica di bug (SWE-bench Verified), ma Claude prende un vantaggio di oltre 10 punti sul set Pro, molto più difficile . Per l'efficienza pura di programmazione per dollaro speso, DeepSeek V4-Pro è imbattibile, offrendo prestazioni di codifica pari a GPT-5.4 a uno sconto di 30x .
La capacità di un modello di agire indipendentemente in un ambiente reale.
| Benchmark | GPT-5.5 | Gemini 3.5 Flash | Claude Opus 4.8 | Qwen3.7-Max | Grok 4.3 |
|---|---|---|---|---|---|
| GDPval-AA Elo | 1769 | 1656 | 1890 | — | 1500 |
| Terminal-Bench 2.0/2.1 | 82.7% | 76.2% | |||
| τ²-Bench (Rispetto Istruzioni) | — | — | — | — | 98% |
GPT-5.5 mantiene la sua corona come modello più forte per il lavoro agentico in terminale a risposta aperta, ma il superiore punteggio di Claude Opus 4.8 nei compiti reali (GDPval-AA Elo) suggerisce un partner agentico più affidabile e pronto per il business . Grok 4.3 offre un'opzione economica convincente per compiti di rispetto delle istruzioni ad alto volume .
Per la prima volta, i modelli cinesi non competono solo sul prezzo ma anche sulle capacità. Qwen3.7-Max guida tutti i modelli sul benchmark di programmazione agentica SWE-bench Pro al 60.6% . Kimi K2.6 eguaglia le prestazioni di GPT-5.5 sullo stesso test e supera tutti gli altri modelli su Humanity's Last Exam (HLE) con strumenti al 54.0% , sfidando la frontiera americana su compiti di ragionamento fondamentali, abbattendo drasticamente i costi.
Un confronto diretto e completo tra tutti e sette i modelli è attualmente impossibile a causa della comunicazione selettiva dei benchmark da parte dei fornitori . Diversi fattori chiave minano una scelta basata esclusivamente sui numeri:
Le tue priorità dovrebbero dettare la tua scelta:
Per qualsiasi distribuzione critica, esegui test sul tuo carico di lavoro specifico. I benchmark riportati dai fornitori forniscono un utile punto di partenza, non una risposta definitiva.
| — |
| 92.6% |
| — |
| — |
| — |
| — |
| 60.6% |
| — |
| — |
| — |
| 74.6% |
| 69.7% |
| — |