Datoen er viktig for alle som planlegger en produksjonsløsning. En agent som ser uvanlig billig ut i lanseringsperioden, bør kostnadsberegnes på nytt med 2027-prisene før man bygger en arkitektur som skal leve lenge.
Tokenprisen sier dessuten bare deler av kostnadsbildet. Den faktiske regningen påvirkes blant annet av kontekstlengde, verktøykall, nye forsøk etter feil, hurtigbufret input, hvor mye modellen skal resonnere, og hvor langt svaret blir. Kostnaden per benchmarkoppgave kan derfor ikke brukes som et løfte om hva en komplett produksjonsagent vil koste.
Artificial Analysis har gitt Gemini 3.7 Flash en Intelligence Index-score på 56. Det plasserer modellen foran Claude Sonnet 5 på 55, men like bak GPT-5.6 Terra på 57 i den aktuelle sammenligningen.
Hastighet er derimot modellens tydeligste fortrinn. Artificial Analysis målte omtrent 340 output-tokens i sekundet og en gjennomsnittlig «time per task»-score på 1,7. Ifølge målingen er Flash rundt 40 prosent raskere enn GPT-5.6 Terra med maksimal resonnering.
Tallene beskriver målt modell- eller leverandørytelse, ikke nødvendigvis opplevelsen i alle applikasjoner. Nettverk, leverandørruting, størrelsen på prompten, verktøyenes responstid og valgte innstillinger for resonnering kan påvirke den totale svartiden betydelig.
Google rapporterer store forbedringer sammenlignet med Gemini 3.6 Flash innen programvareutvikling, feilsøking, løsning av issues, webutvikling og agentbaserte arbeidsflyter. Blant de oppgitte resultatene finner vi:
Resultatene peker mot en sterk modell for kode og terminalagenter, men ikke en modell som vinner alt. GPT-5.6 Terra ligger foran på den oppgitte Terminal-Bench-målingen. Flashs tydeligste fordeler er i stedet hastighet og lavere introduksjonspris.
Ved høy resonneringsinnsats rapporterer ARC Prize følgende resultater for Gemini 3.7 Flash:
Dette er sterke resultater, særlig sett opp mot den oppgitte kostnaden per oppgave. Samtidig bør ARC-AGI-resultater tolkes som et signal fra en benchmark, ikke som en direkte prognose for hvor pålitelig en programvareagent blir i praksis. En produksjonsagent kan gjøre flere modellkall, bruke eksterne verktøy, prøve på nytt etter mislykkede handlinger og behandle langt større kontekster enn en enkelt benchmarkoppgave.
Tabellen er ikke en universell rangering. Benchmarkene kommer fra ulike evalueringer, og kildene dokumenterer ikke én kontrollert test der alle modellene er målt under identiske forhold. Prisene kan også gjelde ulike former for hosting, rabatter eller tilgjengelighet.
Sammenligningene peker mot et bevisst valg. Gemini 3.7 Flash ligger nær fronten på den oppgitte Intelligence Index-målingen, men har ikke høyest score: GPT-5.6 Terra ligger litt foran med 57 og leder også den oppgitte Terminal-Bench-sammenligningen.
Google fremhever i stedet balansen mellom intelligens, svartid og kostnad. En modell som er rask nok til interaktiv utvikling og billig nok til gjentatte kall, kan være mer nyttig i en agentplattform enn en dyrere og tregere modell som vinner en smal benchmark.
Det er særlig relevant for kodeassistenter, automatisk løsning av issues, webutviklingsagenter og arbeidsflyter der systemet gjentatte ganger leser kontekst, kaller verktøy, inspiserer resultatet og prøver på nytt.
I lanseringsbølgen i august 2026 skjerpes konkurransen fra flere kanter. Qwen3.8-Max stiller med sterke resultater innen agenter og programvareutvikling, mens GLM-5.3 og Nemotron 3.5 Lightning presser på pris og effektivitet. Claude Opus 5 og GPT-5.6 retter seg mot høyere kapasitet, og Claude Sonnet 5 er et nært alternativ for produksjonsbruk.
Gemini 3.7 Flash bør først og fremst forstås som en rask arbeidshest, ikke som den ubestridt smarteste modellen. Det sterkeste argumentet for modellen er kombinasjonen av Intelligence Index-score på 56, rundt 340 output-tokens i sekundet, solide resultater innen kode og terminalagenter, samt en uvanlig lav introduksjonspris.
For utviklere er den viktigste innvendingen økonomisk snarere enn teknisk: Prisene på 0,75/3,75 dollar utløper 31. desember 2026, og standardprisene på 1,50/7,50 dollar begynner dagen etter.
Google kan godt få rett i at modellen blir raskt tatt i bruk. Men uten tall for faktisk bruk støtter dokumentasjonen foreløpig først og fremst en strategi der rask og rimelig inferens skal bli standard for utviklernes agentløkker – ikke en verifisert rekord for modelladopsjon.