Til sammenligning lanserte Google Gemini 3.7 Flash 13. august til en introduksjonspris på 0,75 dollar per million input-tokens og 3,75 dollar per million output-tokens – halvparten av prisen til forgjengeren Gemini 3.6 Flash, og omtrent en tredjedel av hva Grok 4.6 koster . Introduksjonsprisen gjelder ut 2026; deretter dobles prisen
.
Priskontrasten er tydelig: Grok 4.6 konkurrerer direkte med frontløperne GPT-5.6 Sol og Claude Opus 5 på intelligens, mens Gemini 3.7 Flash er posisjonert som en "arbeidshest" – med ytelse som matcher Claude Sonnet 5 og GPT-5.6 Terra til en betydelig lavere pris .
Grok 4.6 scoret 61 på Artificial Analysis (AA) Intelligence Index, en sammensetning av ni tester . Det er likt med GPT-5.6 Sol Max, ett poeng bak Claude Fable 5 Max (62) og to bak Claude Opus 5 Max (63) – første gang en xAI-modell nådde frontklusteret
.
| Benchmark | Grok 4.6 (High) | Grok 4.5 (High) | GPT-5.6 Sol Max | Fable 5 Max |
|---|---|---|---|---|
| AA Intelligence Index | 61 | 56 | 61 | 62 |
| GDPVal-AA v2 (Elo) | 1753 | 1526 | 1728 | 1741 |
| CursorBench v3.2 | 69,9 % | 66,7 % | 67,2 % | 70,5 % |
| AA-Briefcase | 1577 | – | – | – |
SpaceXAI rapporterte forbedringer fra Grok 4.5 på hver eneste måling, inkludert CursorBench, FrontierCode, APEX-Agents og Terminal-Bench . Uavhengig testing fra Artificial Analysis bekreftet påstandene med en marginal forskjell på 0,08 poeng
.
Grok 4.6s sterkeste uavhengige resultater var på kunnskapsarbeid-evalueringer – den ledet feltet på GDPval-AA v2 (1753 Elo), AA-Briefcase (1577) og Harvey (juridisk benchmark) – noe som tyder på at modellen er spesielt godt egnet for profesjonelle kunnskapsoppgaver . Til tross for å være markedsført som en agentisk kodingsmodell, lå CursorBench v3.2 (69,9 prosent) bak Fable 5 Max (70,5 prosent), men foran GPT-5.6 Sol Max (67,2 prosent)
.
Gemini 3.7 Flash viste også solide forbedringer på kode- og agent-benchmarks. På FrontierCode v1.1 scoret den 43,6 prosent for produksjonsklar kode, opp fra 34,4 prosent for 3.6 Flash og foran Claude Sonnet 5 (42,7 prosent) og GPT-5.6 Terra (41,3 prosent) . Den viste også store hopp på DeepSWE v1.1 (fra 49,0 til 65,3 prosent) og AutomationBench (fra 17,0 til 30,4 prosent)
.
Den største arkitektoniske nyvinningen i Grok 4.6 var et nytt xhigh-resonneringsnivå, en intensiv modus for de vanskeligste agent- og koderoppgavene . Modellen ble optimalisert for langvarig agentutholdenhet – den løser oppgaver på omtrent halvparten så mange trinn som Claude Opus 5 trenger, eller omtrent en fjerdedel av input-tokensene, til den oppgitte prisen
. Dette effektivitetsfortrinnet er trolig dens fremste salgsargument for utviklere som jobber i flertimers kodeøkter
.
SpaceXAI tilskrev forbedringene til en lengre supplerende treningskjøring og betydelig bedre overvåket finjustering og forsterkende læring – ikke til en økning i antall parametere . Modellen beholder samme 1,5 billioner parameters V9-grunnlag som Grok 4.5
.
Gemini 3.7 Flash introduserte på sin side "tilpassbare tenkekonfigurasjoner" for å kontrollere blandingen av kvalitet, kostnad og latens, og var den første Google-modellen som muliggjorde agentisk videobehandling .
Styrker ved Grok 4.6:
Begrensninger ved Grok 4.6:
To dager etter lansering, 14. august 2026, ble Grok 4.6 rullet ut i GitHub Copilot på tvers av alle større utviklingsflater :
GitHubs offisielle endringslogg beskrev den som "designet for agentisk koding og komplekse flertrinns arbeidsflyter" . Den raske integreringen signaliserte sterk etterspørsel fra utviklerplattformer .
Lanseringssekvensen 12.–13. august avslører to distinkte konkurransestrategier:
Grok 4.6 (SpaceXAI) – 2/6 dollar per million tokens – Frontlinjesammensetning (AA Index 61) – 500 000 tokens kontekst – Designet for agentisk koding og kunnskapsarbeid – Oppgaveeffektivitet foran Opus 5
Gemini 3.7 Flash (Google) – 0,75/3,75 dollar per million tokens (introduksjonspris) – Arbeidshestytelse sammenlignbar med Claude Sonnet 5 og GPT-5.6 Terra – 1 million tokens kontekst – Første Gemini-modell med agentisk videobehandling – Driver Gemini Spark
Grok 4.6 konkurrerer på intelligens til nedsatt pris i frontlinjen, mens Gemini 3.7 Flash konkurrerer på pris i arbeidshestsegmentet. Googles beslutning om å tilby Gemini 3.7 Flash til halvparten av forgjengerens pris – og unnlate å gi en lanseringsdato for flaggskipmodellen Pro – tyder på en bevisst strategi for å kapre markedsandeler på arbeidshestnivå .
Grok 4.6 brakte SpaceXAI tilbake til frontlinjen, og matchet GPT-5.6 Sol på sammensatt intelligens til en betydelig lavere pris, med et reelt effektivitetsfortrinn for agentoppgaver. Begrensningene – ingen ledende posisjon på noen enkelt kodebenchmark, noe bak Claude Opus 5 og uendret pris – er reelle, men svekker ikke prestasjonen.
Googles svar, som kom bare 24 timer senere, satte en ny standard for prisdynamikken. Til omtrent en tredjedel av prisen for Grok 4.6 tilbød Gemini 3.7 Flash solid kode- og agentytelse til en arbeidshestpris – og med et kontekstvindu på 1 million tokens. Det konkurransemessige landskapet er nå tydelig todelt: frontlinjeintelligens til rabatt (Grok 4.6) versus arbeidshestytelse til suveren pris (Gemini 3.7 Flash).
Utviklere og bedrifter står overfor et reelt valg – ikke mellom godt og dårlig, men mellom to svært forskjellige verdiforslag. Den raske GitHub Copilot-integrasjonen av Grok 4.6 tyder på at i hvert fall ett av dem allerede har funnet sitt publikum.