Modellen præsterer også stærkt på vidensarbejde-benchmarks: GDPval evaluerer opgaver på tværs af snesevis af professioner, herunder jura, finans og produktledelse, hvor GPT‑5.5 matcher eller slår fagfolk i cirka 84,9 % af sammenligningerne.
Sammenlagt tyder disse tal på, at GPT‑5.5 er særligt stærk til autonome flertrinsopgaver og agentiske workflows.
Anthropics Claude Opus 4.7 anses bredt for at være en af de stærkeste modeller til softwareingeniøropgaver.
Dets mest fremtrædende benchmarkresultater inkluderer:
SWE‑bench evaluerer, om en model kan rette rigtige fejl i open source-lager. Opus 4.7s løsning af 87,6 % af SWE‑bench Verified-opgaver repræsenterer en betydelig forbedring i forhold til forgængeren og placerer den blandt de bedste modeller til kodeagenter.
Mens dens Terminal‑Bench-score halter efter GPT‑5.5, forbliver dens kodningsfokuserede benchmarks blandt de stærkeste rapporteret i offentlige sammenligninger.
Googles Gemini 3.5 Flash er usædvanlig, fordi den er positioneret som en hurtig, omkostningseffektiv model snarere end en flagskibsmodel – alligevel leverer den stadig konkurrencedygtige resultater på flere agentiske benchmarks.
Rapporterede resultater inkluderer:
Google siger, at modellen kører cirka fire gange hurtigere end sammenlignelige frontlinjemodeller, mens den overgår den tidligere Gemini 3.1 Pro på flere agent- og kodningsbenchmarks.
I praksis er Gemini 3.5 Flashs største styrke afvejningen mellem hastighed og kapacitet: den leverer nær-flagskibs benchmarkresultater, mens den er målrettet lav latenstid og produktionsworkloads.
DeepSeek V4 er bemærkelsesværdig, fordi den er en af de mest kapable open-weight-frontlinjemodeller, der hidtil er udgivet.
Modelfamilien inkluderer to varianter:
Ifølge modellens tekniske rapport og oversigter over dens benchmarks opnår V4‑Pro i maksimal ræsonnementstilstand:
Disse resultater placerer den tæt på førende proprietære modeller i nogle kodningsbenchmarks.
En uafhængig evaluering fra det amerikanske National Institute of Standards and Technologys CAISI-program fandt imidlertid, at modellens kapaciteter halter cirka otte måneder bagud i forhold til frontlinjen, hvilket fremhæver et gab mellem selvrapporterede og uafhængige resultater.
xAIs Grok 4.3 repræsenterer en stor forbedring i forhold til tidligere Grok-modeller, især på agentiske opgavebenchmarks.
Offentliggjorte tal inkluderer:
Springet på mere end 300 Elo på GDPval‑AA sammenlignet med tidligere Grok-versioner tyder på betydelige fremskridt inden for virkelighedsnær opgaveautomatisering.
Ikke desto mindre placerer tredjepartsanalyser generelt modellen under de nyeste OpenAI- og Anthropic-systemer på overordnede kapacitetsbenchmarks.
Ser man på tværs af disse evalueringer, fremkommer et konsistent mønster:
Disse konklusioner bør dog betragtes som vejledende snarere end endelige, fordi hver udbyder fremhæver forskellige evalueringssuiter.
Benchmarksammenligninger i moderne AI bliver stadig mere komplicerede af flere årsager:
På grund af disse faktorer bliver den sande relative rangering af frontlinjemodeller ofte kun klar efter måneder med uafhængig test.
Det seneste benchmarkbevis viser ikke én enkelt model, der dominerer alle domæner.
I stedet fremstår frontlinjen specialiseret:
Efterhånden som uafhængige benchmarks konvergerer, og flere appelsin-til-appelsin-test dukker op, vil den nøjagtige rangering af disse systemer sandsynligvis fortsætte med at udvikle sig.