| GPT-5.5 (Pro) | $30,00 | $180,00 | — | 1M |
| Qwen3.7-Max | $2,50 | $7,50 | $0,25 (90% korting) | 1M |
| Kimi K2.6 | $0,60–$0,95 | $3,00–$4,00 | $0,10 | 262K |
| Gemini 3.5 Flash | $1,50 | $9,00 | $0,15 | 1M |
| Grok 4.3 | $1,25 | $2,50 | $0,30 | 1M |
| DeepSeek V4-Flash | $0,14 | $0,28 | $0,0028 | 1M |
| DeepSeek V4-Pro | $0,435 (permanente korting) | $0,87 (permanente korting) | $0,0036 | 1M |
Belangrijkste kosteninzichten:
Benchmarks zijn alleen nuttig met de juiste context. We hebben de resultaten geordend op wat ze daadwerkelijk meten - algemene intelligentie, codeerkwaliteiten en agentprestaties - in plaats van op één enkele, vaak misleidende, totaalscore.
Deze categorie meet pure kennis, wiskunde en wetenschappelijk redeneren.
| Benchmark | Claude Opus 4.8 | GPT-5.5 | DeepSeek V4-Pro | Qwen3.7-Max | Grok 4.3 | Gemini 3.5 Flash |
|---|---|---|---|---|---|---|
| AA Intelligence Index | 61,4 | 60,2 | ~55 | 56,6 | 53 | ~52 |
| GPQA Diamond | 93,6% | — | 90,1% | 92,4% | ||
| AIME / USAMO 2026 (Wiskunde) | 96,7% | 95,2% | ||||
| HLE (met tools) | 57,9% | — | 37,7% | — | — | — |
Claude Opus 4.8 heeft een kleine maar significante voorsprong op GPT-5.5 in algemene intelligentie, ondersteund door een enorme sprong van 27,4 punten in wiskundige prestaties ten opzichte van zijn voorganger . Qwen3.7-Max valt op als het beste Chinese model en benadert de leiders in wetenschappelijk redeneren op masterniveau (GPQA Diamond) .
De meest relevante benchmarks voor ontwikkelaars.
| Benchmark | DeepSeek V4-Pro | Kimi K2.6 | GPT-5.5 | Claude Opus 4.8 | Qwen3.7-Max |
|---|---|---|---|---|---|
| SWE-bench Verified | 80,6% | 80,2% | 88,7% | 88,6% | 72,5% |
| SWE-bench Pro | ~58% | 58,6% | 58,6% | 69,2% | |
| LiveCodeBench v6 | 93,5% | 89,6% |
Op codeergebied ontstaat een duidelijke tweedeling. Claude Opus 4.8 en GPT-5.5 zijn aan elkaar gewaagd in algemene bugfixing (SWE-bench Verified), maar Claude neemt een aanzienlijke voorsprong van ruim 10 punten op de veel moeilijkere Pro-set . Voor pure codeerefficiëntie per euro is DeepSeek V4-Pro ongeëvenaard en biedt het coderingsprestaties van GPT-5.4-niveau met 30 keer korting .
Het vermogen van een model om zelfstandig te handelen in een realistische omgeving.
| Benchmark | GPT-5.5 | Gemini 3.5 Flash | Claude Opus 4.8 | Qwen3.7-Max | Grok 4.3 |
|---|---|---|---|---|---|
| GDPval-AA Elo | 1769 | 1656 | 1890 | — | 1500 |
| Terminal-Bench 2.0/2.1 | 82,7% | 76,2% | |||
| τ²-Bench (Instructie Volgen) | — | — | — | — | 98% |
GPT-5.5 behoudt zijn titel als sterkste model voor open-ended agentwerk in de terminal, maar Claude Opus 4.8's superieure beoordeling op realistische taken (GDPval-AA Elo) suggereert een betrouwbaardere, bedrijfsklare agentpartner . Grok 4.3 biedt een aantrekkelijke budgetoptie voor grootschalige taken waar het aankomt op het opvolgen van instructies .
Voor het eerst concurreren Chinese modellen niet alleen op prijs, maar ook op capaciteiten. Qwen3.7-Max leidt alle modellen op de SWE-bench Pro agent-coderingsbenchmark met 60,6% . Kimi K2.6 evenaart de prestaties van GPT-5.5 op diezelfde test en leidt op Humanity's Last Exam (HLE) met tools met 54,0% , waarmee het de Amerikaanse topmodellen op kerntaken uitdaagt en tegelijkertijd aanzienlijk goedkoper is.
Een directe, volledige vergelijking van alle zeven modellen is momenteel onmogelijk door de selectieve benchmarkrapportage van leveranciers . Verschillende factoren ondermijnen een keuze die puur op cijfers is gebaseerd:
Jouw prioriteit zou je keuze moeten bepalen:
Voor elke bedrijfskritische implementatie geldt: test op je eigen specifieke workload. Door leveranciers gerapporteerde benchmarks zijn een nuttig startpunt, maar geen definitief antwoord.
| — |
| 92,6% |
| — |
| — |
| — |
| — |
| 60,6% |
| — |
| — |
| — |
| 74,6% |
| 69,7% |
| — |