Snowflake kondigt dynamische modelroutering aan voor Cortex AI Gateway; een private preview wordt binnenkort verwacht. Eenvoudige of repetitieve taken kunnen naar efficiënte modellen gaan, terwijl complexe redeneertaken worden doorgestuurd naar frontiermodellen.
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Snowflake announce about dynamic model routing in its Cortex AI Gateway—including its private-preview status, goal of automatically. Article summary: Snowflake announced dynamic model routing for Cortex AI Gateway, planned for private preview, to select the least-cost administrator-approved model that can meet a task’s quality requirement. Its main differentiation cla. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Snowflake heeft dynamische modelroutering aangekondigd voor Cortex AI Gateway. De functie moet per taak bepalen welk goedgekeurd AI-model het meest geschikt is, in plaats van elke aanvraag standaard naar hetzelfde krachtige model te sturen. De technologie wordt naar verwachting binnenkort beschikbaar als private preview en is dus nog geen algemeen verkrijgbare productrelease.
De belofte is eenvoudig: gebruik goedkopere, efficiënte modellen wanneer die een taak goed aankunnen en zet krachtigere modellen alleen in wanneer complexer redeneerwerk nodig is. Snowflake noemt dat ‘intelligence efficiency’: niet de prijs van afzonderlijke modeltokens staat centraal, maar de kosten van een zakelijk resultaat dat daadwerkelijk goed wordt afgerond.
Dynamische modelroutering komt beschikbaar via Cortex AI Gateway en wordt geïntegreerd in Snowflake CoCo en CoWork. Ook AI-agents van derden die via de gateway zijn verbonden, kunnen de functie gebruiken. Klanten kunnen zelf vastleggen welke modellen mogen worden ingezet en welke afwegingen voor een applicatie het zwaarst wegen, zoals kosten, kwaliteit of latency.
De router moet vervolgens het goedkoopste model kiezen dat volgens het systeem met voldoende zekerheid aan de kwaliteitseisen kan voldoen. Eenvoudige, routinematige of repetitieve verzoeken kunnen naar efficiënte open modellen gaan. Taken die diepere analyse vereisen, kunnen worden doorgestuurd naar frontiermodellen van onder meer Anthropic, OpenAI en Google. Organisaties houden ook handmatige controle: ze kunnen een model vastzetten of de lijst met toegestane modellen beperken.
Volgens Snowflake kan de router bovendien rekening houden met eisen rond dataresidentie en governance. Het systeem registreert welk model voor elke aanvraag is gekozen. Daardoor gaat de functie niet alleen over kostenbeheersing, maar ook over een controleerbaar proces voor modelselectie.
Snowflake beschrijft twee manieren om te bepalen hoeveel modelcapaciteit een taak nodig heeft.
Bij het zogenoemde advisor-patroon probeert eerst een kleiner model de taak uit te voeren. Lukt dat niet goed genoeg, dan kan dit model een groter model als hulpmiddel aanroepen en daarna verdergaan. Zo hoeven bedrijven niet voor elke eenvoudige vraag het tarief van een frontiermodel te betalen, terwijl er wel een escalatieroute beschikbaar blijft voor moeilijkere opdrachten.
Een afzonderlijke classifier kan patronen uit historische aanvragen gebruiken om eenvoudige verzoeken te herkennen. Die worden vervolgens naar lichtere modellen gestuurd. In de praktijk ontstaan daarmee twee routes: het systeem kan klein beginnen en opschalen als dat nodig is, of de aanvraag vooraf classificeren en meteen een passend model selecteren.
De belangrijkste operationele vraag is niet alleen of de router een goedkoper model kiest, maar of de volledige taak daardoor beter uitpakt. Een mislukte eerste poging, escalatie of nieuwe poging kan extra tokens, vertraging en technische complexiteit veroorzaken.
Snowflake meldt in een interne test met een dbt-pipeline een tot drie keer hogere tokenefficiëntie wanneer dynamische routering een vergelijkbare kwaliteit opleverde als het gebruik van uitsluitend frontiermodellen. In een aparte test met programmeerwerk zouden engineeringteams dezelfde doorvoer van pull requests hebben behouden met ongeveer 25 procent minder tokens.
Deze cijfers zijn door Snowflake zelf gerapporteerde resultaten uit interne evaluaties. Ze zijn niet onafhankelijk bevestigd in klantomgevingen. Bovendien kunnen de uitkomsten sterk verschillen per workload. Een router die goed presteert bij repetitieve data-engineering- of programmeertaken kan andere resultaten geven bij onderzoek met lange context, complex toolgebruik of beslissingen met een hoog risico.
Voor klanten is ‘bespaarde tokens’ daarom geen afdoende maatstaf. Relevanter is de prijs van een succesvol afgeronde en geaccepteerde taak, gemeten naast kwaliteit, latency, betrouwbaarheid en menselijke nabewerking.
Snowflake breidt het modelaanbod binnen Cortex AI uit met DeepSeek-V4-Flash 0731 en Z.ai’s GLM-5.3. DeepSeek-V4-Flash 0731 is aangekondigd voor een private preview, ook binnen CoCo. GLM-5.3 zou binnenkort volgen, afhankelijk van de beschikbaarheid van het model.
Snowflake zegt dat DeepSeek-V4-Flash in interne tests met CoCo als agentomgeving 74,4 procent scoorde op ADE-bench. Het bedrijf verwijst daarnaast naar eerdere tests met GLM-5.2, niet GLM-5.3, waarin een score van 66 procent werd gemeld bij het laagste tokengebruik in die benchmark. Die GLM-5.2-uitkomst mag daarom niet worden gelezen als een gepubliceerde evaluatie van GLM-5.3.
Een groter aanbod aan open modellen ondersteunt de routeringsstrategie. Hoe meer modellen beschikbaar zijn, hoe meer mogelijkheden er zijn om de vereisten van een taak te koppelen aan een geschikte verhouding tussen prijs en prestaties. Klanten krijgen bovendien meer keuze naast de bekendste frontieraanbieders.
Snowflakes belangrijkste onderscheidende claim is dat modeltoegang en routering worden gekoppeld aan de bestaande omgeving voor beheerde data. Het bedrijf zegt de nieuwe open modellen zelf aan te bieden in plaats van alleen een API van een derde partij door te sturen. Data, inferentie-infrastructuur, modelgewichten en de orkestratie van agents zouden binnen Snowflakes beveiligingsgrens blijven. Ook wijst Snowflake op bestaande toegangscontrole op basis van rollen en auditmogelijkheden.
Dat is een architectuurclaim van Snowflake, geen universele garantie voor iedere implementatie. Klanten moeten zelf controleren hoe de opzet uitpakt voor hun regio, dataresidentie, contractvoorwaarden, logging en de modellen die voor een specifieke workload daadwerkelijk zijn toegestaan.
De propositie is vooral interessant voor organisaties die hun beheerde analytische data en AI-applicaties al in Snowflake onderbrengen. In dat geval gaat de meerwaarde verder dan een goedkoper model kiezen: modelselectie kan onderdeel worden van hetzelfde controle- en auditkader als de toegang tot data.
Modelroutering is geen uniek Snowflake-concept. Amazon Bedrock biedt bijvoorbeeld intelligente promptroutering via één serverloos endpoint. Dat endpoint verdeelt aanvragen over foundationmodellen binnen dezelfde modelfamilie op basis van de voorspelde kwaliteit en kosten.
Het belangrijkere onderscheid is waar de routeringsbeslissing, governance, modeluitvoering, datatoegang en facturatie-informatie samenkomen. Snowflake legt de nadruk op een strak geïntegreerde grens rond beheerde data. Andere gateways kunnen juist meer nadruk leggen op providerkeuze, verkeersbeheer, failover of overdraagbaarheid. Dat zijn verschillende architectuurprioriteiten, niet simpelweg de vraag welk product ‘routering’ heeft.
Voor inkopers en architectuurteams komt de keuze grofweg hierop neer:
Een serieuze evaluatie moet automatische routering vergelijken met een vaste baseline, bijvoorbeeld steeds hetzelfde frontiermodel, op representatieve productieworkloads. Meet ten minste:
Snowflake zegt geen afzonderlijke kosten voor de routeringsbeslissing in rekening te brengen en in plaats daarvan tokengebruik te factureren. Toch kunnen escalaties en retries het totale verbruik en de latency verhogen. Het juiste criterium is daarom of routering de kosten van een geaccepteerd eindresultaat verlaagt, zonder de kwaliteits- en governance-eisen van de applicatie aan te tasten.
Snowflakes aankondiging bestaat uit twee ontwikkelingen: automatische selectie uit een reeks goedgekeurde modellen en een uitbreiding van het modelaanbod binnen Cortex AI. De dynamische routering wordt binnenkort in private preview verwacht. DeepSeek-V4-Flash 0731 is al voor private preview aangekondigd; GLM-5.3 volgt later, afhankelijk van beschikbaarheid.
De strategische kern is niet alleen dat eenvoudige taken naar goedkopere modellen kunnen gaan. Snowflake probeert die beslissing onder te brengen binnen dezelfde beheerde data- en beveiligingsgrens die bedrijven al gebruiken. De gemelde verbetering van tot drie keer in tokenefficiëntie is veelbelovend, maar organisaties zullen de technologie op hun eigen workloads moeten testen. Uiteindelijk tellen niet alleen minder tokens, maar vooral lagere kosten per afgeronde taak, behoud van kwaliteit, voorspelbare latency, betrouwbaarheid en minder menselijke correctie.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Snowflake kondigt dynamische modelroutering aan voor Cortex AI Gateway; een private preview wordt binnenkort verwacht.
Snowflake kondigt dynamische modelroutering aan voor Cortex AI Gateway; een private preview wordt binnenkort verwacht. Eenvoudige of repetitieve taken kunnen naar efficiënte modellen gaan, terwijl complexe redeneertaken worden doorgestuurd naar frontiermodellen.
Beheerders kunnen goedgekeurde modellen, prioriteiten zoals kosten en latency, dataresidentie en audit logging instellen.