| GPT-5.5 (Pro) | $30,00 | $180,00 | — | 1M |
| Qwen3.7-Max | $2,50 | $7,50 | $0,25 (90% sleva) | 1M |
| Kimi K2.6 | $0,60–$0,95 | $3,00–$4,00 | $0,10 | 262K |
| Gemini 3.5 Flash | $1,50 | $9,00 | $0,15 | 1M |
| Grok 4.3 | $1,25 | $2,50 | $0,30 | 1M |
| DeepSeek V4-Flash | $0,14 | $0,28 | $0,0028 | 1M |
| DeepSeek V4-Pro | $0,435 (trvalá sleva) | $0,87 (trvalá sleva) | $0,0036 | 1M |
Klíčové postřehy k cenám:
Benchmarky jsou užitečné jen s kontextem. Výsledky jsme uspořádali podle toho, co skutečně měří – obecnou inteligenci, schopnost programování a agentní výkon – namísto jediného, často zavádějícího složeného skóre.
Tato kategorie měří základní znalosti, matematiku a vědecké uvažování.
| Benchmark | Claude Opus 4.8 | GPT-5.5 | DeepSeek V4-Pro | Qwen3.7-Max | Grok 4.3 | Gemini 3.5 Flash |
|---|---|---|---|---|---|---|
| AA Intelligence Index | 61,4 | 60,2 | ~55 | 56,6 | 53 | ~52 |
| GPQA Diamond | 93,6 % | — | 90,1 % | 92,4 % | ||
| AIME / USAMO 2026 (Matematika) | 96,7 % | 95,2 % | ||||
| HLE (s nástroji) | 57,9 % | — | 37,7 % | — | — | — |
Claude Opus 4.8 si vytvořil malý, ale významný náskok před GPT-5.5 v obecné inteligenci, podpořený masivním skokem o 27,4 bodu v matematickém výkonu oproti svému předchůdci . Qwen3.7-Max vyniká jako nejlepší čínský model, který se téměř vyrovná lídrům ve vědeckém uvažování na úrovni doktorského studia (GPQA Diamond) .
Nejrelevantnější benchmarky pro vývojáře.
| Benchmark | DeepSeek V4-Pro | Kimi K2.6 | GPT-5.5 | Claude Opus 4.8 | Qwen3.7-Max |
|---|---|---|---|---|---|
| SWE-bench Verified | 80,6 % | 80,2 % | 88,7 % | 88,6 % | 72,5 % |
| SWE-bench Pro | ~58 % | 58,6 % | 58,6 % | 69,2 % | |
| LiveCodeBench v6 | 93,5 % | 89,6 % |
Výkon v programování vytváří jasné rozdělení. Claude Opus 4.8 a GPT-5.5 jsou na samotné špičce v opravování chyb (SWE-bench Verified), ale Claude si drží masivní náskok přes 10 bodů v mnohem těžší sadě Pro . Pro čistou efektivitu programování za danou cenu je DeepSeek V4-Pro bezkonkurenční, nabízí výkon při programování na úrovni GPT-5.4 s 30násobnou slevou .
Schopnost modelu jednat samostatně v reálném prostředí.
| Benchmark | GPT-5.5 | Gemini 3.5 Flash | Claude Opus 4.8 | Qwen3.7-Max | Grok 4.3 |
|---|---|---|---|---|---|
| GDPval-AA Elo | 1769 | 1656 | 1890 | — | 1500 |
| Terminal-Bench 2.0/2.1 | 82,7 % | 76,2 % | |||
| τ²-Bench (Následování instrukcí) | — | — | — | — | 98 % |
GPT-5.5 si drží korunu jako nejsilnější model pro otevřenou agentní práci v terminálu, ale vynikající hodnocení Claude Opus 4.8 v reálných úkolech (GDPval-AA Elo) naznačuje spolehlivějšího agentního partnera připraveného pro byznys . Grok 4.3 nabízí přesvědčivou levnou variantu pro velkoobjemové úlohy zaměřené na následování instrukcí .
Poprvé v historii čínské modely nekonkurují jen cenou, ale i schopnostmi. Qwen3.7-Max vede všechny modely v agentním benchmarku pro programování SWE-bench Pro s 60,6 % . Kimi K2.6 vyrovnává výkon GPT-5.5 ve stejném testu a vede všechny ostatní modely v testu Humanity's Last Exam (HLE) s nástroji s 54,0 % , čímž vyzývá americkou špičku v klíčových úlohách uvažování, zatímco ji dramaticky podbízí cenou.
Přímé a úplné srovnání napříč všemi sedmi modely je v současné době nemožné kvůli selektivnímu reportování benchmarků ze strany dodavatelů . Volbu založenou čistě na číslech podkopává několik klíčových faktorů:
Vaše priorita by měla diktovat váš výběr:
Pro jakékoli kritické nasazení spouštějte testy na svém vlastním specifickém úkolu. Benchmarky reportované dodavateli poskytují užitečný výchozí bod, nikoli definitivní odpověď.
| — |
| 92,6 % |
| — |
| — |
| — |
| — |
| 60,6 % |
| — |
| — |
| — |
| 74,6 % |
| 69,7 % |
| — |