| GPT-5.5 (Pro) | $30,00 | $180,00 | — | 1M |
| Qwen3.7-Max | $2,50 | $7,50 | $0,25 (90% rabat) | 1M |
| Kimi K2.6 | $0,60–$0,95 | $3,00–$4,00 | $0,10 | 262K |
| Gemini 3.5 Flash | $1,50 | $9,00 | $0,15 | 1M |
| Grok 4.3 | $1,25 | $2,50 | $0,30 | 1M |
| DeepSeek V4-Flash | $0,14 | $0,28 | $0,0028 | 1M |
| DeepSeek V4-Pro | $0,435 (permanent rabat) | $0,87 (permanent rabat) | $0,0036 | 1M |
Nøgleindsigter om priserne:
Benchmarks er kun nyttige med kontekst. Vi har organiseret resultaterne efter, hvad de rent faktisk måler – generel intelligens, kodningsevne og agentisk performance – i stedet for en enkelt, ofte vildledende, samlet score.
Denne kategori måler rå viden, matematik og videnskabelig ræsonnering.
| Benchmark | Claude Opus 4.8 | GPT-5.5 | DeepSeek V4-Pro | Qwen3.7-Max | Grok 4.3 | Gemini 3.5 Flash |
|---|---|---|---|---|---|---|
| AA Intelligence Index | 61,4 | 60,2 | ~55 | 56,6 | 53 | ~52 |
| GPQA Diamond | 93,6% | — | 90,1% | 92,4% | ||
| AIME / USAMO 2026 (Matematik) | 96,7% | 95,2% | ||||
| HLE (med værktøjer) | 57,9% | — | 37,7% | — | — | — |
Claude Opus 4.8 har åbnet et lille, men signifikant hul til GPT-5.5 i generel intelligens, bakket op af et massivt spring på 27,4 procentpoint i matematik-performance sammenlignet med sin forgænger . Qwen3.7-Max skiller sig ud som den bedste kinesiske model og matcher næsten lederne inden for videnskabelig ræsonnering på ph.d.-niveau (GPQA Diamond) .
De mest relevante benchmarks for udviklere.
| Benchmark | DeepSeek V4-Pro | Kimi K2.6 | GPT-5.5 | Claude Opus 4.8 | Qwen3.7-Max |
|---|---|---|---|---|---|
| SWE-bench Verified | 80,6% | 80,2% | 88,7% | 88,6% | 72,5% |
| SWE-bench Pro | ~58% | 58,6% | 58,6% | 69,2% | |
| LiveCodeBench v6 | 93,5% | 89,6% |
Kodningspræstationer skaber en klar opdeling. Claude Opus 4.8 og GPT-5.5 ligger side om side i toppen til generel fejlfinding (SWE-bench Verified), men Claude tager en kommanderende føring på over 10 point på det meget sværere Pro-sæt . For ren kodningseffektivitet per krone er DeepSeek V4-Pro uovertruffen og tilbyder kodningsperformance på niveau med GPT-5.4 til 30 gange lavere pris .
En models evne til at handle selvstændigt i et virkeligt miljø.
| Benchmark | GPT-5.5 | Gemini 3.5 Flash | Claude Opus 4.8 | Qwen3.7-Max | Grok 4.3 |
|---|---|---|---|---|---|
| GDPval-AA Elo | 1769 | 1656 | 1890 | — | 1500 |
| Terminal-Bench 2.0/2.1 | 82,7% | 76,2% | |||
| τ²-Bench (Instruktionsopfølgning) | — | — | — | — | 98% |
GPT-5.5 holder sin krone som den stærkeste model til åbne, terminal-baserede agent-opgaver, men Claude Opus 4.8's overlegne vurdering af opgaver i den virkelige verden (GDPval-AA Elo) antyder en mere pålidelig, forretningsklar agent-partner . Grok 4.3 tilbyder en overbevisende budgetmulighed til højvolumen-opgaver med instruktionsopfølgning .
For første gang konkurrerer kinesiske modeller ikke kun på pris, men på kapacitet. Qwen3.7-Max fører alle modeller på SWE-bench Pro, et agent-benchmark for kodning, med 60,6% . Kimi K2.6 matcher GPT-5.5's præstation på den samme test og fører alle andre modeller på Humanity's Last Exam (HLE) med værktøjer med 54,0% , hvilket udfordrer den amerikanske frontlinje på centrale ræsonneringsopgaver, mens de dramatisk underbyder dem på pris.
En direkte, fuld sammenligning på tværs af alle syv modeller er i øjeblikket umulig på grund af selektiv benchmark-rapportering fra leverandørerne . Flere nøglefaktorer underminerer et rent tal-drevet valg:
Din prioritet bør diktere dit valg:
For enhver kritisk implementering bør du køre tests på din egen specifikke arbejdsbyrde. Leverandør-rapporterede benchmarks giver et nyttigt udgangspunkt, ikke et endegyldigt svar.
| — |
| 92,6% |
| — |
| — |
| — |
| — |
| 60,6% |
| — |
| — |
| — |
| 74,6% |
| 69,7% |
| — |