Modellen presterar också starkt på kunskapsarbetstester: GDPval utvärderar uppgifter inom dussintals yrken, från juridik och finans till produktledning. GPT‑5.5 matchar eller slår yrkesverksamma i cirka 84,9 % av jämförelserna.
Sammantaget tyder siffrorna på att GPT‑5.5 är särskilt stark på autonoma flerstegsuppgifter och agenska arbetsflöden.
Anthropics Claude Opus 4.7 betraktas allmänt som en av de starkaste modellerna för mjukvaruutveckling.
Dess mest framträdande benchmarkresultat:
SWE‑bench utvärderar hur väl en modell kan åtgärda verkliga buggar i öppen källkodsprojekt. Opus 4.7:s 87,6 % på SWE‑bench Verified är en betydande förbättring jämfört med föregångaren och placerar den bland de bästa modellerna för kodningsagenter.
Även om Terminal‑Bench-siffran är lägre än GPT‑5.5, är dess kodningscentrerade benchmarkresultat bland de starkaste som rapporterats offentligt.
Googles Gemini 3.5 Flash är ovanlig eftersom den är positionerad som en snabb, kostnadseffektiv modell snarare än ett flaggskepp – men den levererar ändå konkurrenskraftiga resultat på flera agenska benchmarktester.
Rapporterade resultat:
Google uppger att modellen kör ungefär fyra gånger snabbare än jämförbara frontmodeller samtidigt som den överträffar den tidigare Gemini 3.1 Pro på flera agent- och kodningstester.
I praktiken är Gemini 3.5 Flash:s främsta styrka avvägningen mellan hastighet och kapacitet: den levererar resultat nära flaggskeppsmodellerna medan den riktar in sig på låg latens och produktionsarbetsbelastningar.
DeepSeek V4 är anmärkningsvärd eftersom den är en av de mest kapabla modellerna med öppna vikter som hittills släppts.
Modellfamiljen finns i två varianter:
Enligt modellens tekniska rapport och sammanfattningar av dess benchmarkresultat uppnår V4‑Pro i maximalt resonemangsläge:
Dessa resultat placerar den nära ledande proprietära modeller i vissa kodningstester.
En oberoende utvärdering av den amerikanska myndigheten NIST:s CAISI-program visade dock att modellens kapacitet ligger ungefär åtta månader efter frontlinjen, vilket belyser ett gap mellan självrapporterade och oberoende resultat.
xAI:s Grok 4.3 innebär en stor förbättring jämfört med tidigare Grok-modeller, särskilt på agenska benchmarktester.
Publicerade siffror:
Hoppet på mer än 300 Elo på GDPval‑AA jämfört med tidigare Grok-versioner tyder på betydande framsteg inom verklighetsnära automatisering av uppgifter.
Tredjepartsanalyser placerar dock modellen under de nyaste systemen från OpenAI och Anthropic när det gäller övergripande kapacitet.
När man ser över dessa utvärderingar framträder ett konsekvent mönster:
Dessa slutsatser bör dock ses som vägledande snarare än definitiva, eftersom varje tillverkare lyfter fram olika utvärderingssviter.
Benchmarkjämförelser i modern AI blir allt mer komplicerade av flera skäl:
På grund av dessa faktorer blir den verkliga relativa rankningen av frontmodeller ofta tydlig först efter månader av oberoende testning.
De senaste benchmarkbevisen visar ingen enskild modell som dominerar alla områden.
Frontlinjen är istället specialiserad:
I takt med att oberoende benchmarktester konvergerar och fler rena jämförelser dyker upp, kommer den exakta ordningen mellan dessa system sannolikt att fortsätta att utvecklas.