Router má vybírat nejlevnější modelem schválený systém, který podle něj dokáže požadavek s dostatečnou jistotou splnit. Jednoduché, opakující se nebo méně náročné úkoly mohou zamířit k efektivním open modelům, zatímco složitější požadavky na uvažování k pokročilým modelům od společností jako Anthropic, OpenAI a Google. Organizace si přitom mohou zachovat ruční kontrolu: konkrétní model lze „připnout“ nebo omezit seznam kandidátů namísto použití automatického výběru.
Snowflake uvádí, že směrování může zohlednit požadavky na umístění dat a pravidla řízení přístupu. Systém má také zaznamenávat, který model byl pro daný požadavek vybrán. To zvyšuje význam funkce nejen pro snižování nákladů, ale i pro auditovatelnost rozhodování o použití modelů.
Snowflake popsal dva mechanismy, které mají rozhodovat o tom, zda úkol potřebuje výkonnější model.
U takzvaného advisor pattern se nejprve pokusí úkol vyřešit menší model. Pokud práci nedokáže dokončit dostatečně dobře, může jako nástroj přivolat větší model a pokračovat s jeho pomocí. Cílem je neplatit cenu pokročilého modelu u požadavků, které zvládne menší systém, a zároveň zachovat možnost eskalace u složitějších případů.
Samostatný klasifikátor může využívat vzory z historických dotazů a rozpoznat požadavky, které jsou zpravidla přímočaré. Ty pak pošle jednodušším modelům ještě před samotným zpracováním. Vedle eskalace během práce tak vzniká druhá cesta: systém může buď začít u menšího modelu a v případě potřeby postoupit výš, nebo požadavek nejprve zařadit a podle toho vybrat model.
Provozní otázka ale zní, zda celý proces skutečně zlepší výsledek, nikoli pouze zda vybere levnější model. Neúspěšný první pokus, eskalace nebo opakování požadavku mohou zvýšit počet tokenů, prodloužit odezvu a přidat další technickou složitost.
Snowflake uvádí až trojnásobnou efektivitu využití tokenů při interním testu agenta pro tvorbu dbt pipeline, pokud dynamické směrování dosahovalo srovnatelné kvality jako použití výhradně pokročilých modelů. V samostatném testu zaměřeném na programování podle společnosti inženýrské týmy zachovaly počet dokončených pull requestů při přibližně o 25 % nižší spotřebě tokenů.
Jde o interní výsledky uváděné samotným Snowflake, nikoli o nezávisle ověřené výsledky zákazníků. Výkon se navíc může výrazně lišit podle typu úlohy. Router dobře fungující u opakujících se datových nebo programátorských úkolů nemusí dosahovat stejných výsledků při dlouhém kontextu, složité práci s nástroji nebo u rozhodnutí s vysokým rizikem.
Nejlepší metrikou proto není samotný počet ušetřených tokenů. Důležitější je cena za úspěšně dokončený a přijatý úkol, měřená společně s kvalitou, latencí, spolehlivostí a množstvím lidských oprav.
Snowflake rozšiřuje nabídku modelů v Cortex AI o DeepSeek-V4-Flash 0731 a GLM-5.3 od společnosti Z.ai. DeepSeek-V4-Flash 0731 byl oznámen pro neveřejný náhled, včetně integrace do CoCo. GLM-5.3 má do neveřejného náhledu dorazit později podle dostupnosti.
Snowflake uvádí, že DeepSeek-V4-Flash dosáhl při interním testování s CoCo jako agentním prostředím skóre 74,4 % v benchmarku ADE-bench. U GLM citoval dřívější test modelu GLM-5.2, nikoli GLM-5.3, se skóre 66 % a nejnižší spotřebou tokenů v daném benchmarku. Výsledek GLM-5.2 proto nelze považovat za zveřejněné hodnocení modelu GLM-5.3.
Větší počet dostupných open modelů podporuje samotnou logiku směrování: čím širší je výběr, tím více možností má systém sladit požadavky úkolu s vhodným poměrem ceny a výkonu. Zákazníci navíc získají alternativy k nejznámějším poskytovatelům pokročilých modelů.
Nejsilnější odlišovací argument Snowflake nespočívá v samotné myšlence směrování. Firma zdůrazňuje, že výběr modelu a jeho používání propojuje se svým již existujícím prostředím pro řízení dat. Tvrdí, že nové open modely obsluhuje sama, nikoli pouze jako proxy pro API třetí strany, a že data, výpočet pro inferenci, váhy modelů i orchestraci agentů fungují uvnitř bezpečnostního perimetru Snowflake. Společnost poukazuje také na existující řízení přístupu podle rolí a auditní mechanismy.
Jde o architektonické tvrzení Snowflake, nikoli o univerzální záruku pro každé nasazení. Zákazníci si stále musí ověřit podrobnosti důležité pro své prostředí – například region nasazení, požadavky na umístění dat, smluvní podmínky, podobu logování a skutečný seznam modelů povolených pro konkrétní zátěž.
Tento přístup může být nejzajímavější pro organizace, které už mají řízená analytická data i AI aplikace v Snowflake. V takovém případě nejde jen o výběr levnějšího modelu. Gateway může udělat z volby modelu součást stejného kontrolního a auditního rámce, který firma používá pro přístup k datům.
Dynamické směrování není výhradně doménou Snowflake. Například Amazon Bedrock nabízí inteligentní směrování promptů prostřednictvím bezserverového endpointu, který posílá požadavky mezi základními modely v rámci stejné modelové rodiny podle předpokládané kvality odpovědi a nákladů.
Smysluplnější srovnání proto neřeší jen otázku, kdo umí vybrat levnější model. Důležité je, kde se spravuje rozhodnutí o směrování, pravidla řízení, přístup k datům, samotné spuštění modelu a přehled o účtování. Snowflake zdůrazňuje těsně integrovanou hranici mezi řízenými daty a AI. Jiné gateway mohou více sázet na širší výběr poskytovatelů, správu provozu, přepínání při výpadku nebo přenositelnost. Jde o odlišné architektonické priority, ne o jednoduchý souboj o to, kdo „má routing“.
Pro zákazníka se volba typicky odvíjí od provozního prostředí:
Seriózní test by měl automatické směrování porovnat s pevně zvoleným pokročilým modelem na reprezentativních produkčních úlohách. Sledovat by se mělo přinejmenším:
Snowflake uvádí, že za samotné rozhodnutí o směrování neúčtuje samostatný poplatek a účtuje spotřebu tokenů. Eskalace a opakované pokusy však mohou celkovou spotřebu i latenci zvýšit. Správným kritériem proto je, zda směrování sníží cenu přijatého výsledku a současně zachová požadovanou kvalitu a úroveň řízení.
Oznámení Snowflake kombinuje dvě změny: automatický výběr mezi schválenými modely a rozšíření nabídky modelů dostupných uvnitř Cortex AI. Dynamické směrování má brzy vstoupit do neveřejného náhledu. DeepSeek-V4-Flash 0731 už byl pro tento režim oznámen, zatímco GLM-5.3 má následovat podle dostupnosti.
Nejzajímavější strategický argument Snowflake není nový. Jednodušší požadavky posílat levnějším modelům se snaží nabídnout více platforem. Snowflake chce ale toto rozhodování umístit přímo do svého řízeného datového a bezpečnostního prostředí. Uváděný trojnásobný nárůst efektivity tokenů je slibný, zákazníci by však měli funkci otestovat na vlastních datech a úlohách. Rozhodovat by měli podle celkových nákladů, kvality, latence, spolehlivosti a množství lidských oprav – ne podle úspory tokenů samotné.