Reitittimen on tarkoitus valita edullisin ylläpitäjän hyväksymä malli, joka pystyy luotettavasti suorittamaan tehtävän. Rutiininomaiset, toistuvat tai muuten yksinkertaiset pyynnöt voidaan ohjata tehokkaille avoimille malleille. Monimutkaista päättelyä vaativat tehtävät puolestaan voidaan siirtää esimerkiksi Anthropicin, OpenAI:n tai Googlen frontier-malleille.
Automaattinen valinta ei ole pakollinen. Organisaatio voi lukita sovelluksen käyttämään tiettyä mallia tai rajata automaattisen reityksen piirissä olevien mallien joukkoa.
Snowflaken mukaan reititys voi noudattaa myös datan sijaintia koskevia vaatimuksia ja muita hallintakäytäntöjä. Palvelu voi lisäksi tallentaa tiedon siitä, mikä malli kunkin pyynnön käsitteli. Tämä tekee ominaisuudesta kiinnostavan kustannustenhallinnan lisäksi organisaatioille, jotka tarvitsevat auditoitavan mallinvalintaprosessin.
Snowflake kuvasi kaksi tapaa arvioida, tarvitseeko tehtävä tehokkaampaa mallia.
niin sanotussa advisor-mallissa pienempi malli yrittää suorittaa tehtävän ensin. Jos se ei pysty tekemään työtä riittävän hyvin, se voi kutsua suuremman mallin työkaluksi ja jatkaa tämän avulla.
Tavoitteena on välttää frontier-mallien hinta silloin, kun pienempi malli riittää, mutta säilyttää samalla reitti vaikeampia tapauksia varten.
Erillinen luokittelija voi hyödyntää aiempien kyselyiden malleja tunnistaakseen suoraviivaiset pyynnöt ja ohjata ne yksinkertaisemmille malleille. Käytännössä järjestelmä voi siis joko aloittaa pienellä mallilla ja kasvattaa kapasiteettia tarvittaessa tai luokitella pyynnön jo ennen mallin valintaa.
Käytännön kannalta ratkaisevaa ei kuitenkaan ole pelkästään se, valitseeko järjestelmä halvemman mallin. Epäonnistunut ensimmäinen yritys, eskalointi tai uusi yritys voi lisätä tokenien määrää, viivettä ja järjestelmän monimutkaisuutta.
Snowflake kertoo saavuttaneensa sisäisessä dbt-putkien työkuormassa jopa kolminkertaisen token-tehokkuuden, kun dynaaminen reititys tuotti frontier-mallien jatkuvaan käyttöön verrattavaa laatua. Erillisessä koodaustyökuorman testissä yhtiö sanoo kehitystiimien säilyttäneen pull request -tuottavuutensa noin 25 prosenttia pienemmällä token-määrällä.
Lukuja on syytä pitää yhtiön omiin sisäisiin arviointeihin perustuvina tuloksina, ei riippumattomasti vahvistettuina asiakastuloksina. Tulokset voivat myös vaihdella huomattavasti työkuorman mukaan. Toistuvissa data- ja ohjelmistokehitystehtävissä hyvin toimiva reititin ei välttämättä tuota samoja tuloksia pitkän kontekstin tutkimuksessa, monivaiheisessa työkalujen käytössä tai korkean riskin päätöksissä.
Asiakkaalle hyödyllisin mittari ei siksi ole yksinään säästettyjen tokenien määrä. Olennaisempaa on onnistuneesti suoritetun ja hyväksytyn tehtävän kustannus, jota arvioidaan yhdessä laadun, viiveen, luotettavuuden ja ihmisen tekemän korjaustyön kanssa.
Snowflake laajentaa Cortex AI:n kautta saatavilla olevaa mallivalikoimaa DeepSeek-V4-Flash 0731- ja Z.ai:n GLM-5.3-malleilla. DeepSeek-V4-Flash 0731 on ilmoitettu yksityiseen esikatseluun, myös CoCo-tuotteessa. GLM-5.3:n kerrotaan tulevan yksityiseen esikatseluun myöhemmin saatavuuden mukaan.
Snowflaken mukaan DeepSeek-V4-Flash saavutti ADE-bench-testissä 74,4 prosentin tuloksen yhtiön sisäisessä arvioinnissa, jossa CoCo toimi agentin testikehyksenä. Yhtiö viittasi myös aiempaan GLM-5.2-mallin testiin, jossa tulos oli 66 prosenttia ja tokenien kulutus kyseisen vertailun pienin. GLM-5.2:n tulosta ei pidä tulkita GLM-5.3:n julkaistuksi arviointitulokseksi.
Laajempi avoimien mallien valikoima tukee Snowflaken reitystrategiaa: mitä enemmän malleja on tarjolla, sitä useammin tehtävän vaatimukset voidaan sovittaa kustannuksiin ja suorituskykyyn. Samalla asiakkaat saavat vaihtoehtoja tunnetuimpien frontier-mallien rinnalle.
Snowflaken tärkein erotteluväite liittyy siihen, että reititys ja mallien käyttö kytkeytyvät yhtiön olemassa olevaan hallittuun data-ympäristöön. Snowflake kertoo tarjoavansa uudet avoimet mallit itse sen sijaan, että se vain välittäisi kolmannen osapuolen ohjelmointirajapintakutsuja. Yhtiön mukaan data, päättelyyn käytettävä laskenta, mallipainot ja agenttien orkestrointi toimivat Snowflaken tietoturvakehyksen sisällä. Se viittaa myös nykyisiin roolipohjaisiin käyttöoikeuksiin ja auditointimekanismeihin.
Kyse on Snowflaken omasta arkkitehtuuriväitteestä, ei jokaisen käyttöönottotavan automaattisesta takuusta. Asiakkaan on edelleen tarkistettava muun muassa käytetty alue, datan sijaintia koskevat vaatimukset, sopimusehdot, lokituskäytännöt ja se, mitkä mallit ovat todellisuudessa sallittuja tietyssä työkuormassa.
Lupaus on vahvimmillaan organisaatioille, jotka säilyttävät hallittua analytiikkadataa ja tekoälysovelluksia jo Snowflakessa. Tällöin hyöty ei rajoitu halvempaan malliin, vaan mallivalinnasta voi tulla osa samaa käyttöoikeuksien ja auditoinnin kokonaisuutta, jota käytetään datan hallintaan.
Mallireititys ei ole Snowflaken yksinoikeus. Esimerkiksi Amazon Bedrock tarjoaa älykkään prompt-reityksen palvelimettoman päätepisteen kautta. Se ohjaa pyynnöt saman malliperheen perustamallien välillä ennustetun vastauslaadun ja kustannusten perusteella.
Merkityksellisempi vertailukohta on se, missä reityspäätös, hallintakäytännöt, mallien suoritus, pääsy dataan ja laskutuksen seuranta tapahtuvat. Snowflake korostaa tiiviisti integroitua hallitun datan aluetta. Muut yhdyskäytävät voivat painottaa laajempaa toimittajavalikoimaa, liikenteenhallintaa, vikasietoisuutta tai siirrettävyyttä. Kyse on erilaisista arkkitehtuuriprioriteeteista, ei vain siitä, millä tuotteella "on reititys".
Ostajan kannattaa arvioida ratkaisua toimintaympäristön perusteella:
Automaattista reitystä pitäisi verrata kiinteään frontier-malliin edustavilla tuotantotyökuormilla. Seurattavia mittareita ovat ainakin:
Snowflake sanoo, ettei se veloita reityspäätöksestä erikseen, vaan laskuttaa tokenien käytön perusteella. Eskaloinnit ja uusintayritykset voivat silti kasvattaa kokonaiskulutusta ja viivettä. Oikea hyväksymiskriteeri onkin se, pienentääkö reititys hyväksytyn lopputuloksen kustannusta samalla, kun sovelluksen laatu- ja hallintavaatimukset säilyvät.
Snowflaken ilmoitus yhdistää kaksi muutosta: hyväksyttyjen mallien dynaamisen valinnan ja Cortex AI:n mallivalikoiman laajentamisen. Ominaisuuden odotetaan tulevan pian yksityiseen esikatseluun. DeepSeek-V4-Flash 0731 on jo ilmoitettu yksityiseen esikatseluun, kun taas GLM-5.3:n saatavuus tulee myöhemmin.
Strategisesti kiinnostavinta ei ole ajatus siitä, että helpot pyynnöt lähetetään halvemmille malleille. Se on jo yleinen lähestymistapa. Snowflake yrittää tehdä mallivalinnasta osan omaa hallittua data- ja tietoturvakehystään.
Yhtiön raportoima kolminkertainen token-tehokkuus on lupaava, mutta asiakkaiden kannattaa testata ominaisuutta omilla työkuormillaan. Menestystä pitäisi mitata token-säästöjen sijaan päästä päähän -kustannuksilla, laadulla, viiveellä, luotettavuudella ja ihmisen tekemän korjaustyön määrällä.