Datum ukončení akce je důležité pro plánování produkčních systémů. Projekt, který během uvedení vypadá mimořádně levně, by měl být před dlouhodobým nasazením přepočítán podle cen platných od roku 2027.
Cena za tokeny navíc představuje jen část nákladů na provoz agenta. Výsledný účet ovlivní délka kontextu, počet volání nástrojů, opakování po chybách, využití kešovaného vstupu, míra uvažování i délka výstupu. Cena benchmarkového úkolu proto není zárukou ceny kompletního produkčního workflow.
Podle nezávislého měření Artificial Analysis dosahuje Gemini 3.7 Flash v Intelligence Indexu skóre 56. Je tak před modelem Claude Sonnet 5 se skóre 55 a těsně za GPT-5.6 Terra se skóre 57.
Nejvýraznějším odlišením je rychlost. Artificial Analysis naměřila přibližně 340 výstupních tokenů za sekundu a průměrný ukazatel času na úkol 1,7. Podle stejného srovnání je Flash při maximálním uvažování zhruba o 40 % rychlejší než GPT-5.6 Terra.
Jde o naměřený výkon modelu či poskytovatele, nikoli o univerzální zkušenost v každé aplikaci. Výslednou odezvu mohou změnit síťové podmínky, směrování u poskytovatele, velikost promptu, prodleva při volání nástrojů i nastavení uvažování.
Google uvádí výrazné zlepšení oproti Gemini 3.6 Flash v softwarovém inženýrství, ladění, řešení chyb, webovém vývoji a agentních úlohách. Mezi citované výsledky patří:
Výsledky ukazují na schopný model pro programování a práci v terminálu, nikoli však na vítěze ve všech kategoriích. GPT-5.6 Terra zůstává v citovaném výsledku Terminal-Bench před ním. Výhodou Flash je především rychlost a nízká úvodní cena.
Při vysoké úrovni uvažování uvádí ARC Prize pro Gemini 3.7 Flash tyto výsledky:
Jde o silná čísla, zvlášť s ohledem na uvedené náklady. Výkon v ARC-AGI ale nelze přímo převést na spolehlivost softwarového agenta. Produkční agent může provést několik volání modelu, použít externí nástroje, opakovat neúspěšné kroky a pracovat s výrazně větším kontextem než benchmarkový úkol.
Tabulka není univerzálním žebříčkem. Benchmarky pocházejí z různých hodnocení a zdroje nedokládají jediný kontrolovaný test všech uvedených modelů. Také ceny mohou odrážet rozdílné podmínky hostingu, slevy nebo dostupnosti.
Dostupná srovnání ukazují na záměrnou volbu pozice. Gemini 3.7 Flash se v citovaném Intelligence Indexu drží blízko špičky, ale nejvyšší skóre nemá: GPT-5.6 Terra je s hodnotou 57 mírně před ním a vede také v uvedeném srovnání Terminal-Bench.
Google místo toho zdůrazňuje kompromis mezi inteligencí, latencí a cenou. Model, který je dostatečně rychlý pro interaktivní vývoj a současně levný pro opakovaná volání, může být pro agentní platformu praktičtější než pomalejší a dražší model vítězící v úzce zaměřeném benchmarku.
To je důležité zejména u programovacích asistentů, automatizovaného řešení problémů, agentů pro webový vývoj a workflow, v nichž model opakovaně načítá kontext, volá nástroje, vyhodnocuje výsledek a pokračuje dalším pokusem.
V srpnu 2026 se tento kompromis dostává do popředí. Qwen3.8-Max přináší silnou konkurenci v agentních a softwarových úlohách, GLM-5.3 a Nemotron 3.5 Lightning tlačí na cenu a efektivitu, zatímco Claude Opus 5 a GPT-5.6 cílí na vyšší úroveň schopností.
Gemini 3.7 Flash je nejlepší chápat jako rychlého a výkonného pracanta, nikoli jako bezkonkurenčně nejchytřejší model. Jeho nejsilnější argument tvoří skóre 56 v Intelligence Indexu, generování rychlostí přibližně 340 tokenů za sekundu, solidní výsledky v programování a agentních úlohách a mimořádně nízká úvodní cena.
Pro vývojáře je hlavní výhrada spíše finanční než technická: sazby 0,75/3,75 USD končí 31. prosince 2026 a od následujícího dne začnou platit standardní ceny 1,50/7,50 USD. Tvrzení Googlu o rekordním růstu se může potvrdit, bez podpůrných údajů však současné důkazy dokazují především strategii udělat z rychlé a dostupné inference výchozí volbu pro vývojáře — nikoli ověřený rekord v adopci modelu.