Gemini 3.1 Pro noteerde 77,1%, een leidende score op deze benchmark die echte probleemoplossing test zonder dat modellen kunnen teruggrijpen op uit het hoofd geleerde antwoorden .
Claude Sonnet scoorde 9,8/10 in een test met 125 realistische taken voor kwaliteit en een menselijke toon, waardoor het het model is dat het prettigst aanvoelt voor algemene gesprekken en schrijven .
De verschillen tussen de topmodellen (GPT-5, Claude Opus 4.x, Gemini 3.x, Grok 4) zijn klein – vaak slechts enkele procentpunten . Stanfords AI Index-rapport 2026 stelt vast dat de prestaties van de top 15 modellen per benchmark slechts 3 procentpunten uiteenliggen
.
'Accuratesse' hangt sterk af van de taak: het beste programmeermodel is niet het beste redeneermodel, en het meest accurate model op benchmarks is niet per se het beste voor jouw specifieke workflow. De juiste keuze hangt volledig af van je primaire gebruiksdoel .