Gemini 3.1 Pro zaznamenal 77,1 % – vedoucí skóre v testu, který měří skutečné řešení problémů, jež modely nemohou „okoukat“ zpaměti .
Claude Sonnet získal 9,8/10 v testu 125 reálných úkolů, který hodnotí kvalitu a lidský tón – jde o model, který se prostě nejlépe používá pro běžnou konverzaci a psaní .
Rozdíly mezi špičkovými modely (GPT-5, Claude Opus 4.x, Gemini 3.x, Grok 4) jsou nyní velmi malé – často jen pár procentních bodů . Stanfordova zpráva 2026 uvádí, že výkonnost patnácti nejlepších modelů dělí na každém benchmarku pouhé 3 procentní body
.
„Přesnost“ silně závisí na úkolu: nejlepší model na kódování není nejlepší na uvažování a model, který vyhrává benchmarky, nemusí být tím pravým pro vaši konkrétní práci. Správná volba závisí výhradně na tom, k čemu AI potřebujete .