Googles Gemini 3.7 Flash, som lanserades den 13 augusti, kom däremot med ett introduktionspris på $0,75 per miljon inmatningstokens och $3,75 per miljon utmatningstokens – hälften av priset för föregångaren Gemini 3.6 Flash, och ungefär en tredjedel av kostnaden för Grok 4.6 . Introduktionspriset gäller till och med den 31 december 2026, då det fördubblas
.
Skillnaden är tydlig: Grok 4.6 tävlar direkt med frontier-modeller som GPT-5.6 Sol och Claude Opus 5 i intelligens, medan Gemini 3.7 Flash positioneras som en ”arbetshäst” – med prestanda jämförbar med Claude Sonnet 5 och GPT-5.6 Terra till betydligt lägre kostnad .
Grok 4.6 uppnådde 61 på Artificial Analysis (AA) Intelligence Index, ett sammanlagt betyg från nio utvärderingar . Det innebar att man nådde samma nivå som GPT-5.6 Sol Max, kom en poäng efter Claude Fable 5 Max (62) och två bakom Claude Opus 5 Max (63) – första gången en modell från xAI nådde frontier-klustret
.
| Benchmark | Grok 4.6 (High) | Grok 4.5 (High) | GPT-5.6 Sol Max | Fable 5 Max |
|---|---|---|---|---|
| AA Intelligence Index | 61 | 56 | 61 | 62 |
| GDPVal-AA v2 (Elo) | 1753 | 1526 | 1728 | 1741 |
| CursorBench v3.2 | 69,9% | 66,7% | 67,2% | 70,5% |
| AA-Briefcase | 1577 | — | — | — |
SpaceXAI rapporterade förbättringar jämfört med Grok 4.5 i samtliga listade utvärderingar, inklusive CursorBench, FrontierCode, APEX-Agents och Terminal-Bench . Oberoende tester från Artificial Analysis bekräftade påståendena inom en marginal på 0,08 poäng
.
Särskilt stark var Grok 4.6 inom kunskapsarbete – den ledde fältet i GDPval-AA v2 (1753 Elo), AA-Briefcase (1577) och Harvey juridik-benchmark, vilket tyder på att modellen är särskilt lämpad för professionella kunskapsuppgifter . Trots att den marknadsförs som en agentisk kodningsmodell, hamnade dess CursorBench v3.2-poäng (69,9 %) efter Fable 5 Max (70,5 %), även om den slog GPT-5.6 Sol Max (67,2 %)
.
Gemini 3.7 Flash visade också starka framsteg inom kodning och agent-benchmarks. På FrontierCode v1.1 nådde den 43,6 % för produktionsklar kodgenerering, upp från 34,4 % för 3.6 Flash och före Claude Sonnet 5 (42,7 %) och GPT-5.6 Terra (41,3 %) . Den visade också stora hopp på DeepSWE v1.1 (49,0 % till 65,3 %) och AutomationBench (17,0 % till 30,4 %)
.
Den stora arkitektoniska nyheten i Grok 4.6 var ett nytt xhigh-resonemangsläge, ett intensivt resonemangsläge designat för de svåraste agent- och kodningsuppgifterna . Modellen optimerades för långvarig agenthållbarhet – den löser uppgifter på ungefär hälften så många steg som Claude Opus 5 behöver, eller ungefär en fjärdedel av inmatningstokens, till det angivna priset
. Denna effektivitetsfördel är troligen dess starkaste säljargument för utvecklare som arbetar med flera timmar långa kodningssessioner
.
SpaceXAI tillskrev förbättringarna i Grok 4.6 en längre kompletterande träningskörning samt avsevärt förbättrad övervakad finjustering och förstärkningsinlärning – inte en ökning av antalet parametrar . Modellen behåller samma V9-grund med 1,5 biljoner parametrar som Grok 4.5
.
Gemini 3.7 Flash introducerade i sin tur ”anpassningsbara tankekonfigurationer” för att styra balansen mellan kvalitet, kostnad och latens, och var den första Google-modellen som möjliggör agentisk videobearbetning .
Styrkor hos Grok 4.6:
Begränsningar hos Grok 4.6:
Två dagar efter lanseringen, den 14 augusti 2026, kom Grok 4.6 ut i GitHub Copilot på alla större utvecklingsytor :
GitHub:s officiella ändringslogg beskrev modellen som ”designad för agentisk kodning och komplexa flerstegsarbetsflöden” . Den snabba integrationen signalerade stark efterfrågan från utvecklarplattformen .
Lanseringssekvensen den 12–13 augusti avslöjar två distinkta konkurrensstrategier:
Grok 4.6 (SpaceXAI) – $2/$6 per MTok – Frontier-komposit (AA Index 61) – 500K kontext – Designad för agentisk kodning och kunskapsarbete – Uppgiftseffektivitetsfördel jämfört med Opus 5
Gemini 3.7 Flash (Google) – $0,75/$3,75 per MTok (introduktionspris) – Prestanda i arbetshästklass jämförbar med Claude Sonnet 5 och GPT-5.6 Terra – 1M kontext – Första Gemini-modellen med agentisk videobearbetning – Driver Gemini Spark
Grok 4.6 tävlar med intelligens till ett rabatterat frontier-pris, medan Gemini 3.7 Flash tävlar med pris till ett rabatterat arbetshästpris. Googles beslut att erbjuda Gemini 3.7 Flash till halva introduktionspriset jämfört med föregångaren – och att inte ange något releasedatum för sin flaggskeppsmodell Pro – tyder på en medveten strategi för att ta marknadsandelar på arbetshästnivån .
Grok 4.6 lyckades föra tillbaka SpaceXAI till frontier-klassen, med samma sammanlagda intelligens som GPT-5.6 Sol till en betydligt lägre kostnad och en verklig effektivitetsfördel för agentuppgifter. Dess begränsningar – att inte leda något enskilt kodningsbenchmark, att ligga efter Claude Opus 5 i sammanlagd intelligens och att hålla priset oförändrat medan rivalerna sänkte – är verkliga men förminskar inte prestationen.
Googles svar, som kom bara 24 timmar senare, omformulerade hela prisdialogen. Till ungefär en tredjedel av kostnaden för Grok 4.6 erbjöd Gemini 3.7 Flash stark kodnings- och agentprestanda till ett arbetshästpris – och med ett kontextfönster på 1 miljon tokens. Konkurrenslandskapet är nu tydligt tudelat: frontier-intelligens till rabattpris (Grok 4.6) kontra arbetshästprestanda till reapris (Gemini 3.7 Flash).
Utvecklare och företag står inför ett genuint val – inte mellan bra och dåligt, utan mellan två mycket olika värdeerbjudanden. Den snabba GitHub Copilot-integrationen av Grok 4.6 tyder på att åtminstone ett av dem redan har hittat sin publik.