| Forespørgslens størrelse | Input | Cachet input | Output |
|---|---|---|---|
| Under 200.000 inputtokens | 2 USD | 0,50 USD | 6 USD |
| 200.000 tokens eller mere | 4 USD | 1 USD | 12 USD |
Den afgørende detalje er, at langkontekstprisen gælder, når en forespørgsel når båndet på mindst 200.000 inputtokens. Teams, der ofte sender store kodebaser, dokumentmængder eller lange samtalehistorikker til en agent, bør derfor budgettere ud fra denne grænse – ikke kun ud fra overskriftsprisen på 2 USD for input og 6 USD for output.
Caching kan sænke prisen på inputdelen, men fjerner ikke behovet for at holde styr på kontekstens størrelse. I en produktionsløsning bør man måle promptlængde, genbrug af cache, outputlængde og den faktiske kvalitetsgevinst ved mere kontekst, før man øger modellens kontekstbudget.
xAI oplyste, at Grok 4.6 opnåede 70,8 procent på CursorBench 3.2 med “extra high thinking”, sammenlignet med de rapporterede 70,5 procent for Fable 5 Max. Samtidig hævdede xAI, at Grok 4.6 kostede cirka en sjettedel så meget pr. gennemført opgave.
Det er et interessant lanceringstal, men forskellen er kun 0,3 procentpoint, og sammenligningen stammer fra en leverandørrapporteret benchmark. Resultatet bør derfor ses som et signal om, at modellen er værd at teste – ikke som dokumentation for, at Grok 4.6 vil slå konkurrerende modeller på virksomhedens egne kodebaser, værktøjer, svartidskrav eller stabilitetsmål.
Andre offentliggjorte sammenligninger giver et mere nuanceret billede. I en sammenligningstabel blev Grok 4.6 eksempelvis angivet til 69,9 procent på CursorBench. Benchmarkresultater kan variere afhængigt af prompts, testværktøjer, modelindstillinger og måletidspunkt. Virksomheder bør derfor gentage sammenligningen på repræsentative og helst anonymiserede opgaver.
Grok 4.6 blev ud over xAI’s API gjort tilgængelig gennem flere udvikler- og cloudkanaler, blandt andet Cursor, GitHub Copilot, Amazon Bedrock, OpenRouter, Vercel og Cloudflare. Amazon annoncerede tilgængelighed på Bedrock den 19. august, en uge efter den oprindelige lancering.
Vertex AI giver en anden type adgang. For en Google Cloud-kunde handler fordelen ikke blot om endnu et API-endepunkt, men om muligheden for at evaluere modellen i et eksisterende kontrol- og indkøbsmiljø. Det kan mindske friktionen for teams, der allerede håndterer AI-eksperimenter, tilladelser og udgifter gennem Google Cloud.
En administreret marketplace- eller platformsløsning fjerner dog ikke arbejdet med modelvalg. Før en test bliver til en produktionsløsning, bør teams undersøge regional tilgængelighed, kvoter, datahåndtering, serviceforventninger, værktøjsadfærd, overvågning og fejlhåndtering. At Grok 4.6 står som Preview på Googles platform, er i sig selv en grund til at behandle de første implementeringer som kontrollerede evalueringer frem for at antage, at tjenesten allerede har permanent produktionsstatus.
En praktisk evaluering bør især fokusere på fire områder:
Lanceringen på Vertex AI handler i højere grad om distribution end om ét enkelt benchmarktal. Grok 4.6 kombinerer et stort kontekstvindue og agentorienterede funktioner med en pris, der skal gøre det attraktivt at eksperimentere. Samtidig gør den hurtige udbredelse via API’er, udviklingsværktøjer, hostede platforme og cloudmarkedspladser det lettere for udviklere at prøve modellen dér, hvor de allerede arbejder.
For enterprise-kunder er konklusionen derfor betinget: Grok 4.6 er nu lettere at evaluere i Google Cloud, men værdien afhænger af resultater på virksomhedens egne opgaver, økonomien ved lang kontekst og af, om Preview-tjenestens egenskaber passer til organisationens krav til sikkerhed og styring. Benchmark-forspringet er værd at undersøge – men ikke værd at betragte som en varig fordel uden egne test.