Terminal‑Bench konkrétně měří komplexní vícekrokové workflow v příkazové řádce vyžadující plánování a použití nástrojů, kde GPT‑5.5 se skóre 82,7 % vede srovnávací tabulku zveřejněnou při jeho uvedení .
Model také silně exceluje v benchmarku znalostní práce GDPval, který hodnotí úlohy napříč desítkami profesí včetně práva, financí a produktového managementu – GPT‑5.5 se v přibližně 84,9 % srovnání vyrovná profesionálům nebo je překonává .
Dohromady tato čísla naznačují, že GPT‑5.5 je obzvláště silný v autonomních vícekrokových úlohách a agentních workflow.
Claude Opus 4.7 od Anthropicu je všeobecně považován za jeden z nejsilnějších modelů pro úlohy softwarového inženýrství.
Jeho nejvýraznější výsledky benchmarků zahrnují :
SWE‑bench hodnotí, zda model dokáže opravit reálné chyby v open‑source repozitářích. To, že Opus 4.7 řeší 87,6 % úloh SWE‑bench Verified, představuje výrazné zlepšení oproti svému předchůdci a řadí jej mezi nejlepší modely pro kódovací agenty .
Zatímco jeho skóre v Terminal‑Bench zaostává za GPT‑5.5, jeho kódovací benchmarky zůstávají mezi nejsilnějšími v publikovaných srovnáních .
Gemini 3.5 Flash od Googlu je neobvyklý tím, že je positioningován jako rychlý, nákladově efektivní model, nikoli vlajková loď – přesto dosahuje konkurenceschopných výsledků v několika agentních benchmarcích.
Uváděné výsledky zahrnují :
Google uvádí, že model běží přibližně čtyřikrát rychleji než srovnatelné špičkové modely, přičemž v několika agentních a kódovacích benchmarcích překonává starší Gemini 3.1 Pro .
V praxi je hlavní předností Gemini 3.5 Flash poměr rychlosti a schopností: poskytuje výsledky blížící se vlajkovým lodím, přičemž cílí na nízkou latenci a produkční nasazení.
DeepSeek V4 je pozoruhodný tím, že patří mezi nejschopnější modely s otevřenými váhami, které byly dosud vydány.
Rodina modelů zahrnuje dvě varianty :
Podle technické zprávy modelu a shrnutí jeho benchmarků dosahuje V4‑Pro v režimu maximálního uvažování :
Tyto výsledky jej v některých kódovacích benchmarcích řadí do blízkosti předních proprietárních modelů.
Nezávislé hodnocení programu CAISI amerického Národního institutu pro standardy a technologie (NIST) však zjistilo, že schopnosti modelu zaostávají za špičkou přibližně o osm měsíců, což poukazuje na rozdíl mezi vlastními uváděnými a nezávislými výsledky .
Grok 4.3 od xAI představuje velké zlepšení oproti dřívějším modelům Grok, zejména v agentních benchmarcích.
Publikovaná čísla zahrnují :
Skok o více než 300 Elo bodů na GDPval‑AA ve srovnání s dřívějšími verzemi Grok naznačuje podstatný pokrok v automatizaci úloh reálného světa .
Analýzy třetích stran však model v celkových benchmarkových schopnostech obecně řadí pod nejnovější systémy OpenAI a Anthropicu .
Při pohledu napříč těmito hodnoceními se rýsuje konzistentní vzorec:
Těchto závěrů je však třeba brát spíše jako orientační než definitivní, protože každý výrobce zvýrazňuje jiné vyhodnocovací sady.
Srovnávání benchmarků v moderní AI je stále složitější z několika důvodů:
Kvůli těmto faktorům se skutečné relativní pořadí špičkových modelů často vyjasní až po měsících nezávislého testování.
Nejnovější důkazy z benchmarků neukazují jediný model, který by dominoval každé oblasti.
Místo toho se současná špička zdá být specializovaná:
Jak se budou sbližovat nezávislé benchmarky a objeví se více srovnání jablek s jablky, přesné pořadí těchto systémů se bude pravděpodobně dále vyvíjet.