Claude Opus 4.7 však výrazně vyniká v reálném softwarovém inženýrství. Anthropic uvádí 64,3 % na SWE‑Bench Pro a 87,6 % na SWE‑Bench Verified – benchmarky, které měří, zda model dokáže opravit skutečné problémy v open‑source repozitářích.
Gemini 3.5 Flash od Googlu je pozoruhodný tím, že se svým výkonem mnohem více blíží vlajkovým modelům, než je u „rychlých“ modelů obvyklé. V Google srovnávací tabulce napříč dodavateli dosahuje 76,2 % na Terminal‑Bench 2.1, zatímco GPT‑5.5 má 78,2 % a Claude Opus 4.7 66,1 % na stejné verzi benchmarku.
Grok 4.3 a DeepSeek V4 se řadí hůře kvůli rozdílům v transparentnosti vyhodnocení a metodice.
Výkon v kódování je jednou z nejjasnějších oblastí, kde se modely liší.
Claude Opus 4.7 zde vede nejprůkaznější veřejný signál. Jeho 64,3 % na SWE‑Bench Pro představuje velký skok oproti starším modelům a ukazuje silný výkon při řešení reálných GitHub problémů napříč programovacími jazyky.
GPT‑5.5 od OpenAI dosahuje na stejném benchmarku o něco nižších 58,6 %, ale exceluje v širších inženýrských úlohách, jako jsou terminálové pracovní postupy. Například Terminal‑Bench 2.0 měří komplexní automatizaci příkazové řádky a koordinaci nástrojů, kde GPT‑5.5 vede s 82,7 %.
Gemini 3.5 Flash dosahuje 55,1 % na SWE‑Bench Pro, což je ve srovnání s Opus 4.7 skromný výsledek, ale pozoruhodný pro model „rychlého“ tieru.
Veřejné programátorské benchmarky pro Grok 4.3 jsou méně standardizované. Uváděné metriky zahrnují skóre jako 81 % na IFBench a 98 % na τ²‑Bench (telekomunikační úlohy), ale tato hodnocení měří užší schopnosti a nejsou přímo srovnatelná se SWE‑Bench nebo Terminal‑Bench.
U DeepSeek V4 zůstávají veřejně ověřené programátorské benchmarky omezené. Některá tvrzení pocházejí z interního testování nebo úniků a nebyla nezávisle reprodukována, což činí spolehlivé srovnání obtížným.
Moderní benchmarky stále častěji měří, jak dobře modely koordinují nástroje a provádějí vícekrokové úkoly.
Google uvádí, že Gemini 3.5 Flash vede v několika hodnoceních použití nástrojů, včetně 83,6 % na MCP Atlas a 56,5 % na Toolathlon – benchmarků navržených k měření multi‑nástrojové orchestrace a reálných pracovních postupů.
GPT‑5.5 od OpenAI podává silné výkony v podobných doménách prostřednictvím benchmarků jako GDPval, který měří znalostní práci napříč profesemi a ukazuje 84,9 % výher nebo remíz proti jiným modelům.
Claude Opus 4.7 si také dobře vede v benchmarcích pro ovládání počítače. Jeho 78,0 % na OSWorld‑Verified indikuje silný výkon při obsluze desktopových rozhraní a interakci s nástroji.
Samotné benchmarky nezachycují charakteristiky nasazení.
Grok 4.3 klade důraz na zpracování dlouhého kontextu a nákladovou efektivitu. Dokumentace xAI uvádí 1‑milion‑tokenové kontextové okno a cenu kolem 1,25 USD za milion vstupních tokenů a 2,50 USD za milion výstupních tokenů, což jej staví jako potenciálně levnější volbu pro práci s velkým kontextem.
Gemini 3.5 Flash je navržen jako model s vysokou rychlostí inference a je často popisován jako výrazně rychlejší než vlajkové modely, přičemž zůstává konkurenceschopný v několika agentních benchmarcích.
Modely DeepSeek se obvykle zaměřují na strategie nasazení s otevřenými váhami nebo nižšími náklady, což je může učinit atraktivními pro organizace, které chtějí provozovat výkonné modely lokálně nebo na vlastní infrastruktuře.
Nejvěrohodnější nezávislé posouzení DeepSeek V4 pochází z programu CAISI amerického Národního institutu pro standardy a technologie (NIST).
Podle tohoto hodnocení je DeepSeek V4 nejschopnějším testovaným čínským modelem v oblastech, jako je softwarové inženýrství, kybernetické úlohy a matematika, ale ve schopnostech zaostává za předními modely zhruba o osm měsíců.
Zpráva také uvádí, že interní výsledky benchmarků DeepSeek vypadají silněji než nezávislá měření CAISI, což zdůrazňuje důležitost neutrálního hodnocení při porovnávání modelů napříč laboratořemi.
I při publikovaných číslech je přímé porovnávání modelů obtížné z několika důvodů:
Kvůli těmto problémům je třeba přísné „pořadí 1 až 5“ napříč všemi modely interpretovat opatrně.
Na základě nejsilnějších dostupných veřejných dat:
V praxi „nejlepší“ model silně závisí na konkrétní úloze: programátorští agenti, výzkumní asistenti, analýza dlouhého kontextu a inference citlivá na náklady mohou všechny upřednostňovat různé modely, a to navzdory podobným titulkům v benchmarcích.
Poznámka pro české čtenáře: Uvedené ceny jsou v amerických dolarech (USD). Pro představu, 1 USD odpovídá přibližně 23 CZK. Kontextové okno 1 milion tokenů představuje zhruba 750 000 slov – tedy několik objemných knih.