Modellen presterer også sterkt på kunnskapsarbeid-benchmarks: GDPval evaluerer oppgaver på tvers av dusinvis av profesjoner inkludert jus, finans og produktledelse, hvor GPT‑5.5 matcher eller slår fagfolk i omtrent 84,9 % av sammenligningene.
Sammen antyder disse tallene at GPT‑5.5 er spesielt sterk på autonome flertrinnsoppgaver og agentiske arbeidsflyter.
Anthropics Claude Opus 4.7 er allment ansett som en av de sterkeste modellene for programvareutvikling.
De mest fremtredende benchmark-resultatene inkluderer:
SWE‑bench evaluerer om en modell kan fikse reelle feil i åpen kildekode-repositories. Opus 4.7 sin løsning av 87,6 % av SWE‑bench Verified-oppgavene representerer en betydelig forbedring fra forgjengeren og plasserer den blant de beste modellene for kodeagenter.
Selv om Terminal‑Bench-scoren ligger bak GPT‑5.5, forblir dens kodefokuserte benchmarks blant de sterkeste som er rapportert i offentlige sammenligninger.
Googles Gemini 3.5 Flash er uvanlig fordi den er posisjonert som en rask, kostnadseffektiv modell snarere enn en flaggskipmodell — likevel leverer den konkurransedyktige resultater på flere agentiske benchmarks.
Rapporterte resultater inkluderer:
Google sier modellen kjører omtrent fire ganger raskere enn sammenlignbare frontlinjemodeller samtidig som den overgår den tidligere Gemini 3.1 Pro på flere agent- og kodebenchmarks.
I praksis er Gemini 3.5 Flash sin største styrke hastighet-til-ytelse-avveiningen: den leverer nær-flaggskip benchmark-resultater samtidig som den retter seg mot lav latenstid og produksjonsarbeidsbelastninger.
DeepSeek V4 er bemerkelsesverdig fordi den er en av de mest kapable åpen-vekts frontlinjemodellene som er lansert så langt.
Modellfamilien inkluderer to varianter:
I følge modellens tekniske rapport og oppsummeringer av dens benchmarks, oppnår V4‑Pro i maksimal resonneringsmodus:
Disse resultatene plasserer den nær ledende proprietære modeller i noen kodebenchmarks.
En uavhengig evaluering fra USAs National Institute of Standards and Technologys CAISI-program fant imidlertid at modellens evner ligger omtrent åtte måneder bak frontlinjen, noe som fremhever et gap mellom selvrapporterte og uavhengige resultater.
xAIs Grok 4.3 representerer en stor forbedring i forhold til tidligere Grok-modeller, spesielt på agentiske oppgave-benchmarks.
Publiserte tall inkluderer:
Hoppet på mer enn 300 Elo på GDPval‑AA sammenlignet med tidligere Grok-versjoner antyder betydelig fremgang på automatisering av virkelige oppgaver.
Likevel plasserer tredjepartsanalyser generelt modellen under de nyeste OpenAI- og Anthropic-systemene på overordnede evnebenchmarks.
Ser man på tvers av disse evalueringene, fremtrer et konsistent mønster:
Disse konklusjonene bør imidlertid behandles som retningsgivende snarere enn definitive fordi hver leverandør fremhever forskjellige evalueringssuiter.
Benchmark-sammenligninger i moderne KI blir stadig mer komplisert av flere grunner:
På grunn av disse faktorene blir den sanne relative rangeringen av frontlinjemodeller ofte tydeligere først etter måneder med uavhengig testing.
De siste benchmark-bevisene viser ikke en enkelt modell som dominerer alle domener.
I stedet fremstår frontlinjen som spesialisert:
Etter hvert som uavhengige benchmarks konvergerer og mer eple-til-eple-testing dukker opp, vil den nøyaktige rekkefølgen av disse systemene sannsynligvis fortsette å utvikle seg.