| Størrelse på forespørselen | Input | Bufret input | Output |
|---|---|---|---|
| Under 200 000 input-tokens | 2 dollar | 0,50 dollar | 6 dollar |
| 200 000 tokens eller mer | 4 dollar | 1 dollar | 12 dollar |
Det sentrale planleggingspunktet er terskelen på 200 000 tokens. Når forespørselen havner i kategorien for lang kontekst, gjelder den høyere prisen. Team som jevnlig sender store kodebaser, dokumentmengder eller samtalehistorikk til en agent, bør derfor beregne kostnader ut fra denne terskelen – ikke bare ut fra den annonserte startprisen på 2 dollar for input og 6 dollar for output per million tokens.
Bufret input kan redusere inputkostnaden, men løser ikke problemet med ukontrollert kontekstvekst. Et fornuftig produksjonsoppsett bør følge med på promptstørrelse, hvor ofte cache kan gjenbrukes, lengden på svarene og hvilken kvalitetsgevinst den ekstra konteksten faktisk gir.
xAI har rapportert at Grok 4.6 oppnådde 70,8 prosent i CursorBench 3.2 med «extra high thinking». Til sammenligning ble Fable 5 Max rapportert til 70,5 prosent, samtidig som xAI hevdet at Grok 4.6 kostet omtrent en sjettedel så mye per fullførte oppgave.
Det er en interessant lanseringspåstand, men forskjellen er bare 0,3 prosentpoeng. Resultatet er dessuten rapportert av leverandøren selv. Det bør derfor ses som et signal om at modellen fortjener videre testing – ikke som bevis på at den vil slå konkurrentene på virksomhetens egne kodebaser, verktøy, krav til svartid eller stabilitet.
Andre publiserte sammenligninger viser også andre resultater. Én sammenligningstabell oppgir for eksempel 69,9 prosent i CursorBench. Slike variasjoner kan skyldes ulik bruk av instrukser, testoppsett, modellinnstillinger og tidspunkt for evalueringen. Bedrifter bør derfor gjenta testene på representative oppgaver før de trekker konklusjoner.
Grok 4.6 ble gjort tilgjengelig gjennom xAI API-et og distribuert via flere utvikler- og skyplattformer, blant annet Cursor, GitHub Copilot, Amazon Bedrock, OpenRouter, Vercel og Cloudflare. Amazon kunngjorde tilgjengelighet i Bedrock 19. august, én uke etter den første lanseringen.
Vertex AI gir en annen type tilgang. For en Google Cloud-kunde handler fordelen ikke bare om å få enda et API-endepunkt, men om å kunne evaluere modellen i et etablert kontrollmiljø for skybruk, tilgang og kostnader. Det kan redusere friksjonen for team som allerede håndterer AI-eksperimenter, tillatelser og budsjetter gjennom Google Cloud.
En markedsplass- eller plattformintegrasjon fjerner likevel ikke behovet for modellvalg. Før en pilot går over i produksjon, må team undersøke regional tilgjengelighet, kvoter, databehandling, tjenesteforventninger, verktøystøtte, overvåking og feilhåndtering. At Grok 4.6 er merket Preview på Googles plattform, er i seg selv en grunn til å behandle de første implementeringene som kontrollerte evalueringer – ikke som en garanti for permanent produksjonstilgjengelighet.
En praktisk evaluering bør dekke fire områder:
Lanseringen i Vertex AI handler mindre om ett enkelt benchmark-tall enn om å gjøre Grok 4.6 tilgjengelig der utviklere allerede arbeider. Modellen kombinerer et stort kontekstvindu og agentrettede funksjoner med en pris som kan gjøre det attraktivt å eksperimentere. Den raske utrullingen til API-er, utviklingsverktøy, vertsplattformer og skymarkedsplasser reduserer samtidig terskelen for å prøve modellen.
For bedriftskunder er konklusjonen derfor betinget: Grok 4.6 er nå enklere å evaluere i Google Cloud, men verdien vil avhenge av resultatene på egne arbeidsoppgaver, økonomien i forespørsler med lang kontekst og om egenskapene ved Preview-tjenesten passer virksomhetens krav til styring og sikkerhet. Den rapporterte benchmark-fordelen er verdt å undersøke – men ikke å ta for gitt som et varig konkurransefortrinn.