| GPT-5.5 (Pro) | $30.00 | $180.00 | — | 1M |
| Qwen3.7-Max | $2.50 | $7.50 | $0.25 (90 % rabatt) | 1M |
| Kimi K2.6 | $0.60–$0.95 | $3.00–$4.00 | $0.10 | 262K |
| Gemini 3.5 Flash | $1.50 | $9.00 | $0.15 | 1M |
| Grok 4.3 | $1.25 | $2.50 | $0.30 | 1M |
| DeepSeek V4-Flash | $0.14 | $0.28 | $0.0028 | 1M |
| DeepSeek V4-Pro | $0.435 (permanent rabatt) | $0.87 (permanent rabatt) | $0.0036 | 1M |
Sentrale poenger om pris:
Benchmarks er kun nyttige med kontekst. Vi har organisert resultatene etter hva de faktisk måler – generell intelligens, kodingsferdigheter og agent-ytelse – heller enn en enkelt, ofte misvisende, totalscore.
Denne kategorien måler rå kunnskap, matematikk og vitenskapelig resonnering.
| Benchmark | Claude Opus 4.8 | GPT-5.5 | DeepSeek V4-Pro | Qwen3.7-Max | Grok 4.3 | Gemini 3.5 Flash |
|---|---|---|---|---|---|---|
| AA Intelligence Index | 61.4 | 60.2 | ~55 | 56.6 | 53 | ~52 |
| GPQA Diamond | 93.6% | — | 90.1% | 92.4% | ||
| AIME / USAMO 2026 (Matte) | 96.7% | 95.2% | ||||
| HLE (med verktøy) | 57.9% | — | 37.7% | — | — | — |
Claude Opus 4.8 har skapt en liten, men betydelig luke til GPT-5.5 i generell intelligens, støttet av et enormt sprang i matematikk på 27,4 prosentpoeng sammenlignet med forgjengeren . Qwen3.7-Max skiller seg ut som den beste kinesiske modellen og matcher nesten lederne i vitenskapelig resonnering på forskernivå (GPQA Diamond) .
De mest relevante testene for utviklere.
| Benchmark | DeepSeek V4-Pro | Kimi K2.6 | GPT-5.5 | Claude Opus 4.8 | Qwen3.7-Max |
|---|---|---|---|---|---|
| SWE-bench Verified | 80.6% | 80.2% | 88.7% | 88.6% | 72.5% |
| SWE-bench Pro | ~58% | 58.6% | 58.6% | 69.2% | |
| LiveCodeBench v6 | 93.5% | 89.6% |
Kodingsferdighetene skaper et tydelig skille. Claude Opus 4.8 og GPT-5.5 deler førsteplassen for generell feilretting (SWE-bench Verified), men Claude tar en kommanderende ledelse på over 10 poeng på den mye vanskeligere Pro-testen . For ren kodingsytelse per krone er DeepSeek V4-Pro uovertruffen og tilbyr ytelse på nivå med GPT-5.4 til en 30 ganger lavere pris .
En modells evne til å handle selvstendig i et ekte miljø.
| Benchmark | GPT-5.5 | Gemini 3.5 Flash | Claude Opus 4.8 | Qwen3.7-Max | Grok 4.3 |
|---|---|---|---|---|---|
| GDPval-AA Elo | 1769 | 1656 | 1890 | — | 1500 |
| Terminal-Bench 2.0/2.1 | 82.7% | 76.2% | |||
| τ²-Bench (Instruksjonsetterlevelse) | — | — | — | — | 98% |
GPT-5.5 beholder kronen som den sterkeste modellen for åpne terminalbaserte agentoppgaver, men Claude Opus 4.8s overlegne vurdering av oppgaver i den virkelige verden (GDPval-AA Elo) antyder en mer pålitelig, forretningsklar agent-partner . Grok 4.3 tilbyr et overbevisende budsjettalternativ for instruksjonsdrevne oppgaver i stort volum .
For første gang konkurrerer kinesiske modeller ikke bare på pris, men også på kapasitet. Qwen3.7-Max leder alle modeller på den agent-baserte kode-testen SWE-bench Pro med 60,6 % . Kimi K2.6 matcher GPT-5.5s ytelse på den samme testen og leder alle andre modeller på Humanity's Last Exam (HLE) med verktøy med 54,0 % . Dette utfordrer de amerikanske frontfigurene på kjerneferdigheter innen resonnering, samtidig som prisen er dramatisk lavere.
En direkte og fullstendig sammenligning på tvers av alle de syv modellene er for øyeblikket umulig på grunn av at leverandørene rapporterer selektivt på tester . Flere sentrale faktorer undergraver et rent tallbasert valg:
Din prioritet bør avgjøre ditt valg:
For enhver kritisk utrulling, kjør tester på din egen spesifikke arbeidsbelastning. Leverandørenes rapporterte tester gir et nyttig utgangspunkt, men ikke et endelig svar.
| — |
| 92.6% |
| — |
| — |
| — |
| — |
| 60.6% |
| — |
| — |
| — |
| 74.6% |
| 69.7% |
| — |