| Syötteen koko | Syöte | Välimuistissa oleva syöte | Tuloste |
|---|---|---|---|
| Alle 200 000 syötetokenia | 2 dollaria | 0,50 dollaria | 6 dollaria |
| Vähintään 200 000 tokenia | 4 dollaria | 1 dollari | 12 dollaria |
Suunnittelun kannalta olennaista on, että pitkän kontekstin hinta koskee pyyntöjä, jotka yltävät vähintään 200 000 tokenin luokkaan. Jos agentti lähettää toistuvasti kokonaisia koodivarastoja, asiakirjoja tai pitkiä keskusteluhistorioita, kustannukset kannattaa laskea tämän rajan perusteella – ei pelkästään näkyvästi ilmoitettujen 2 dollarin syöte- ja 6 dollarin tulostehintojen mukaan.
Välimuisti voi pienentää syöteosan kustannuksia, mutta se ei poista tarvetta hallita kontekstin kasvua. Tuotantokäytössä on järkevää mitata syötteen koko, välimuistin hyödyntäminen, tulosteen pituus ja lisäkontekstin todellinen laatuvaikutus ennen konteksti-ikkunan kasvattamista.
xAI ilmoitti Grok 4.6:n saavuttaneen CursorBench 3.2 -testissä 70,8 prosentin tuloksen asetuksella ”extra high thinking”. Vertailussa Fable 5 Maxin ilmoitettu tulos oli 70,5 prosenttia. xAI väitti lisäksi, että yhden valmiin tehtävän kustannus oli noin kuudesosa.
Kyseessä on huomionarvoinen julkaisuväite, mutta ero on vain 0,3 prosenttiyksikköä ja vertailu perustuu toimittajan ilmoittamaan benchmark-tulokseen. Sitä kannattaa pitää perusteena lisätesteille, ei todisteena siitä, että Grok 4.6 päihittäisi kilpailijat yrityksen omissa koodivarastoissa, työkaluissa, viivetavoitteissa tai luotettavuusvaatimuksissa.
Myös laajempi vertailukuva edellyttää malttia. Muissa julkaistuissa vertailuissa tulokset vaihtelevat testin ja kokoonpanon mukaan; yhdessä vertailutaulukossa Grok 4.6:n CursorBench-tulos on 69,9 prosenttia. Benchmark-tuloksiin vaikuttavat esimerkiksi kehotteet, testauskehikko, malliasetukset ja arvioinnin ajankohta. Siksi yritysten kannattaa toistaa vertailu omilla, käyttötapauksia edustavilla tehtävillään.
Grok 4.6 tuli saataville xAI:n API:n kautta, ja sitä jaettiin kehittäjä- ja pilvikanaviin, kuten Cursor, GitHub Copilot, Amazon Bedrock, OpenRouter, Vercel ja Cloudflare. Amazon ilmoitti Bedrock-saatavuudesta 19. elokuuta, viikon kuluttua alkuperäisestä julkaisusta.
Vertex AI tarjoaa tähän erilaisen yhteyspisteen. Google Cloud -asiakkaalle kyse ei ole vain uudesta päätepisteestä, vaan mahdollisuudesta arvioida mallia tutussa pilven hallintaympäristössä ja hankintaprosessissa. Tämä voi vähentää vaihtamisen kitkaa organisaatioissa, jotka hallitsevat tekoälykokeiluja, käyttöoikeuksia ja kustannuksia jo Google Cloudin kautta.
Hallittu markkinapaikkareitti ei kuitenkaan poista mallivalinnan vaatimaa työtä. Ennen tuotantokäyttöä on tarkistettava muun muassa alueellinen saatavuus, kiintiöt, datan käsittely, palvelua koskevat odotukset, työkalujen toiminta, havainnointi ja virhetilanteet. Lisäksi Google ilmoittaa Grok 4.6:n julkaisuvaiheeksi Previewn, joten ensimmäiset käyttöönotot kannattaa nähdä rajattuina arviointeina, ei oletusarvoisesti pysyvänä tuotantopalveluna.
Käytännön arvioinnissa kannattaa keskittyä neljään alueeseen:
xAI:n Vertex AI -julkaisussa on kyse vähemmän yksittäisestä benchmark-luvusta ja enemmän siitä, että Grok 4.6 tulee saataville siellä, missä kehittäjät jo rakentavat. Malli yhdistää suuren konteksti-ikkunan ja agenttikäyttöön suunnattuja ominaisuuksia kokeiluja houkuttelevaan lähtöhintaan. Samalla nopea eteneminen API-rajapinnoille, ohjelmointiympäristöihin, isännöityihin alustoihin ja pilvimarkkinapaikoille madaltaa kokeilemisen kynnystä.
Yritysasiakkaan kannalta vahvin johtopäätös on silti ehdollinen: Grok 4.6:ta on nyt helpompi arvioida Google Cloudissa, mutta sen arvo riippuu todellisista työkuormista, pitkien kontekstien taloudesta ja siitä, sopivatko Preview-palvelun ominaisuudet organisaation hallintavaatimuksiin. Ilmoitettu benchmark-johto on tutkimisen arvoinen – ei vielä etu, johon kannattaisi suhtautua pysyvänä.