Googlen Gemini 3.7 Flash puolestaan julkaistiin 13. elokuuta 2026 johdantohintaan 0,75 dollaria miljoonalta sisääntulotokenilta ja 3,75 dollaria miljoonalta ulostulotokenilta – puolet edeltäjänsä Gemini 3.6 Flash:n hinnasta ja noin kolmannes Grok 4.6:n hinnasta . Tämä johdantohinta on voimassa 31. joulukuuta 2026 asti, minkä jälkeen hinta kaksinkertaistuu
.
Hintaero on dramaattinen: Grok 4.6 kilpailee suoraan kärkimallien, kuten GPT-5.6 Solin ja Claude Opus 5:n, kanssa älykkyydessä, kun taas Gemini 3.7 Flash on sijoitettu työhevostasolle. Se tarjoaa suorituskykyä, joka on verrattavissa Claude Sonnet 5:een ja GPT-5.6 Terraan, mutta merkittävästi halvemmalla .
Grok 4.6 sai 61 pistettä Artificial Analysis (AA) Intelligence Indexistä, joka on yhdeksän eri testin yhdistelmä . Tämä on sama tulos kuin GPT-5.6 Sol Maxilla, yhden pisteen vähemmän kuin Claude Fable 5 Maxilla (62) ja kaksi vähemmän kuin Claude Opus 5 Maxilla (63). Kyseessä on ensimmäinen kerta, kun xAI:n malli on yltänyt kärkijoukkoon
.
| Testi | Grok 4.6 (korkea) | Grok 4.5 (korkea) | GPT-5.6 Sol Max | Fable 5 Max |
|---|---|---|---|---|
| AA Intelligence Index | 61 | 56 | 61 | 62 |
| GDPVal-AA v2 (Elo) | 1753 | 1526 | 1728 | 1741 |
| CursorBench v3.2 | 69,9 % | 66,7 % | 67,2 % | 70,5 % |
| AA-Briefcase | 1577 | — | — | — |
SpaceXAI raportoi parannuksia Grok 4.5:een verrattuna kaikissa listatuissa testeissä, mukaan lukien CursorBench, FrontierCode, APEX-Agents ja Terminal-Bench . Artificial Analysisin riippumaton testaus vahvisti väitteet 0,08 pisteen marginaalilla
.
Erityisen huomionarvoista on, että Grok 4.6:n vahvimmat riippumattomat tulokset tulivat tietotyön arvioinneista – se johti GDPval-AA v2:ssa (1753 Elo), AA-Briefcasessa (1577) ja Harvey-oikeudellisessa vertailuarvossa. Tämä viittaa siihen, että malli sopii erityisen hyvin asiantuntijatehtäviin . Vaikka sitä markkinoidaan agenttisena koodausmallina, sen CursorBench v3.2 -tulos (69,9 %) jäi hiemaan jälkeen Fable 5 Maxista (70,5 %), vaikka se voittikin GPT-5.6 Sol Maxin (67,2 %)
.
Gemini 3.7 Flash puolestaan osoitti vahvoja parannuksia koodaus- ja agenttivertailuissa. FrontierCode v1.1:ssä se sai 43,6 % tuotantovalmiin koodin tuottamisessa, mikä on parannus 3.6 Flashin 34,4 %:sta ja edellä Claude Sonnet 5:tä (42,7 %) ja GPT-5.6 Terraa (41,3 %) . Se osoitti myös suuria harppauksia DeepSWE v1.1:ssä (49,0 % → 65,3 %) ja AutomationBenchissa (17,0 % → 30,4 %)
.
Grok 4.6:n merkittävin arkkitehtoninen lisäys on uusi xhigh-päättelytaso, joka on intensiivinen päättelytila suunniteltu vaativimpiin agentti- ja koodaustehtäviin . Malli on optimoitu pitkäkestoisten agenttien kestävyyteen – se ratkaisee tehtävät noin puolessa siitä kierrosmäärästä, jonka Claude Opus 5 tarvitsee, ja noin neljänneksellä sisääntulotokenien määrästä listahintaan
. Tämä tehokkuusetu on todennäköisesti sen vahvin myyntivaltti kehittäjille, jotka tekevät monituntisia koodaussessioita
.
SpaceXAI kertoi, että Grok 4.6:n parannukset johtuvat pidemmästä täydentävästä harjoitusajosta sekä merkittävästi parannetusta ohjatusta hienosäädöstä ja vahvistusoppimisesta – eivät parametrimäärän kasvattamisesta . Malli käyttää samaa 1,5 biljoonan parametrin V9-pohjaa kuin Grok 4.5
.
Gemini 3.7 Flash puolestaan esitteli ”mukautettavat ajattelukokoonpanot”, joiden avulla voidaan hallita laadun, kustannusten ja viiveen yhdistelmää. Se on myös ensimmäinen Google-malli, joka mahdollistaa agenttisen videonkäsittelyn .
Grok 4.6:n vahvuudet:
Grok 4.6:n heikkoudet:
Kaksi päivää julkaisun jälkeen, 14. elokuuta 2026, Grok 4.6 otettiin käyttöön GitHub Copilotissa kaikilla tärkeimmillä kehitysalustoilla :
GitHubin virallinen muutosloki kuvasi mallia ”suunniteltu agenttiseen koodaukseen ja monimutkaisiin monivaiheisiin työnkulkuihin” . Nopea integraatio osoitti vahvaa kehittäjäalustojen kysyntää mallille .
Elokuun 12.–13. päivän julkaisusarja paljastaa kaksi erillistä kilpailustrategiaa:
Grok 4.6 (SpaceXAI) – 2/6 dollaria per miljoona tokenia – Huipputason yhdistelmä (AA-indeksi 61) – 500 000 tokenin konteksti – Suunniteltu agenttiseen koodaukseen ja tietotyöhön – Tehokkuusetu Opus 5:een verrattuna
Gemini 3.7 Flash (Google) – 0,75/3,75 dollaria per miljoona tokenia (johdantohinta) – Työhevostason suorituskyky, joka on verrattavissa Claude Sonnet 5:een ja GPT-5.6 Terraan – 1 miljoonan tokenin konteksti-ikkuna – Ensimmäinen Gemini-malli agenttisella videonkäsittelyllä – Toimii Gemini Sparkin voimanlähteenä
Grok 4.6 kilpailee älykkyydellä alennushintaan kärkimallien tasolla, kun taas Gemini 3.7 Flash kilpailee hinnalla työhevostason alennuksella. Googlen päätös tarjota Gemini 3.7 Flash puoleen edeltäjänsä johdantohinnasta – ja olla kertomatta lippulaivamallinsa Pro-julkaisupäivää – viittaa tarkoitukselliseen strategiaan markkinaosuuden valtaamiseksi työhevostasolla .
Grok 4.6 palautti SpaceXAI:n onnistuneesti huipputasolle, saavuttaen GPT-5.6 Solin yhdistelmä-älykkyyden merkittävästi halvemmalla ja todellisella tehokkuusedulla agenttitehtävissä. Sen rajoitukset – ei ykkönen yhdessäkään koodausvertailussa, jäljessä Claude Opus 5:stä yhdistelmä-älykkyydessä ja hinnoittelun pitäminen ennallaan kilpailijoiden leikatessa hintoja – ovat todellisia, mutta eivät vähennä saavutuksen merkitystä.
Googlen vastaus, joka saapui vain 24 tuntia myöhemmin, muutti koko hintakeskustelun. Noin kolmanneksella Grok 4.6:n hinnasta Gemini 3.7 Flash tarjosi vahvaa koodaus- ja agenttisuorituskykyä työhevostason hintapisteessä – ja lisäksi 1 miljoonan tokenin konteksti-ikkunalla. Kilpailutilanne on nyt selvästi kaksijakoinen: huipputason älykkyyttä alennuksella (Grok 4.6) versus työhevostason suorituskykyä varastamalla (Gemini 3.7 Flash).
Kehittäjät ja yritykset kohtaavat aidon valinnan – ei hyvän ja huonon välillä, vaan kahden hyvin erilaisen arvolupauksen välillä. Grok 4.6:n nopea GitHub Copilot -integrointi viittaa siihen, että ainakin toinen niistä on jo löytänyt yleisönsä.