Sistem ini direka untuk memilih model paling berpatutan yang telah diluluskan oleh pentadbir dan yang diyakini mampu menyelesaikan tugasan. Permintaan rutin, berulang atau kurang kompleks boleh dihantar kepada model terbuka yang lebih cekap. Sebaliknya, tugasan yang memerlukan penaakulan lebih mendalam boleh diarahkan kepada model frontier daripada penyedia seperti Anthropic, OpenAI dan Google.
Organisasi juga tidak semestinya perlu menyerahkan semua keputusan kepada automasi. Mereka boleh menetapkan satu model secara manual atau mengehadkan senarai model yang layak digunakan.
Menurut Snowflake, sistem ini turut mengambil kira keperluan lokasi penyimpanan data dan dasar tadbir urus, selain merekod model yang dipilih bagi setiap permintaan. Ini menjadikan ciri tersebut relevan bukan sahaja untuk mengawal perbelanjaan AI, tetapi juga bagi organisasi yang memerlukan proses pemilihan model yang boleh diaudit.
Snowflake menerangkan dua mekanisme utama.
Dalam corak penasihat (advisor pattern), model yang lebih kecil akan cuba menyelesaikan tugasan terlebih dahulu. Jika hasilnya tidak memadai, model tersebut boleh memanggil model yang lebih besar sebagai alat dan meneruskan tugasan.
Pendekatan ini bertujuan mengelakkan kos model frontier untuk tugasan yang sebenarnya boleh diselesaikan oleh model kecil, sambil mengekalkan laluan eskalasi apabila tugasan menjadi lebih sukar.
Mekanisme kedua menggunakan pengelas yang mempelajari corak daripada pertanyaan terdahulu. Ia boleh mengenal pasti permintaan mudah dan menghantarnya kepada model yang lebih ringkas sebelum model utama dipilih.
Ringkasnya, sistem boleh bermula dengan model kecil dan meningkat kepada model lebih berkuasa apabila perlu, atau mengelaskan permintaan terlebih dahulu bagi menentukan model yang sesuai.
Namun, ukuran penting bukan sekadar sama ada sistem memilih model yang lebih murah. Percubaan pertama yang gagal, eskalasi, panggilan tambahan atau percubaan semula boleh meningkatkan jumlah token, kependaman dan kerumitan kejuruteraan.
Snowflake melaporkan sehingga 3× kecekapan token dalam beban kerja dalaman yang melibatkan saluran paip dbt, apabila penghalaan dinamik menghasilkan kualiti yang setanding dengan penggunaan model frontier sahaja. Dalam ujian berasingan bagi beban kerja pengekodan, syarikat itu berkata pasukan kejuruteraan mengekalkan kadar penghasilan pull request sambil menggunakan kira-kira 25% lebih sedikit token.
Angka ini perlu dibaca sebagai hasil penilaian dalaman yang dilaporkan oleh vendor, bukannya keputusan pelanggan yang telah disahkan secara bebas. Prestasinya juga mungkin berbeza mengikut jenis tugasan. Sistem yang berkesan untuk tugas kejuruteraan data atau pengekodan berulang mungkin menghasilkan keputusan berbeza bagi penyelidikan dengan konteks panjang, penggunaan alat yang kompleks atau keputusan berisiko tinggi.
Justeru, metrik paling berguna bukan “jumlah token yang dijimatkan” semata-mata. Organisasi patut mengukur kos bagi setiap tugasan yang berjaya disiapkan dan diterima, bersama kualiti, kependaman, kebolehpercayaan serta kerja pembetulan oleh manusia.
Snowflake sedang memperluas senarai model yang tersedia melalui Cortex AI dengan DeepSeek-V4-Flash 0731 dan GLM-5.3 daripada Z.ai. DeepSeek-V4-Flash 0731 diumumkan untuk pratonton persendirian, termasuk dalam CoCo. GLM-5.3 pula dikatakan akan menyusul, tertakluk kepada ketersediaan model.
Snowflake melaporkan bahawa DeepSeek-V4-Flash mencatat skor 74.4% dalam ADE-bench melalui ujian dalaman yang menggunakan CoCo sebagai rangka kerja ejen. Syarikat itu turut memetik ujian terdahulu terhadap GLM-5.2, bukan GLM-5.3, dengan skor yang dilaporkan sebanyak 66% serta jejak penggunaan token paling rendah dalam penanda aras tersebut. Keputusan GLM-5.2 itu tidak boleh dianggap sebagai penilaian yang diterbitkan untuk GLM-5.3.
Lebih banyak pilihan model memberi lebih banyak peluang untuk memadankan keperluan tugasan dengan gabungan kos dan prestasi yang sesuai. Ia juga mengurangkan kebergantungan pelanggan kepada beberapa penyedia model frontier yang paling dikenali.
Hujah pembezaan utama Snowflake ialah penghalaan dan akses modelnya berkait rapat dengan persekitaran data yang telah ditadbir urus. Syarikat itu berkata ia menyediakan model terbuka baharu tersebut sendiri, bukannya sekadar bertindak sebagai proksi kepada API pihak ketiga. Data, pengkomputeran inferens, pemberat model dan penyelarasan ejen dikatakan beroperasi dalam perimeter keselamatan Snowflake, bersama kawalan akses berasaskan peranan dan mekanisme audit sedia ada.
Namun, ini ialah dakwaan seni bina daripada Snowflake, bukan jaminan sejagat untuk setiap pelaksanaan. Pelanggan masih perlu menyemak butiran yang berkaitan dengan persekitaran mereka—termasuk rantau penggunaan, keperluan lokasi data, terma kontrak, tingkah laku log dan model yang benar-benar layak digunakan bagi sesuatu beban kerja.
Nilai pendekatan ini paling jelas untuk organisasi yang telah menyimpan data analitik terkawal dan membangunkan aplikasi AI dalam Snowflake. Dalam keadaan itu, manfaatnya bukan sekadar memilih model yang lebih murah. Pemilihan model boleh dijadikan sebahagian daripada kerangka kawalan akses dan audit yang sama seperti yang digunakan untuk data.
Penghalaan model bukan ciri unik Snowflake. Sebagai contoh, Amazon Bedrock menawarkan intelligent prompt routing melalui satu titik akhir tanpa pelayan. Perkhidmatan itu menghala permintaan antara model asas dalam keluarga model yang sama berdasarkan jangkaan kualiti respons dan kos.
Perbandingan yang lebih bermakna ialah tentang lokasi keputusan penghalaan, dasar tadbir urus, pelaksanaan model, akses data dan keterlihatan bil. Snowflake menekankan sempadan data yang dikawal rapat dalam platformnya, manakala gateway lain mungkin lebih mengutamakan pilihan penyedia yang luas, pengurusan trafik, pemulihan apabila berlaku kegagalan atau kemudahalihan.
Bagi pembeli, keputusan sepatutnya bergantung pada persekitaran operasi:
Penilaian yang serius perlu membandingkan penghalaan automatik dengan penggunaan satu model frontier tetap, menggunakan beban kerja yang menyerupai operasi sebenar. Antara perkara yang patut diukur ialah:
Snowflake berkata ia tidak mengenakan caj berasingan untuk keputusan penghalaan dan sebaliknya mengebil penggunaan token. Walau bagaimanapun, eskalasi dan percubaan semula masih boleh meningkatkan jumlah penggunaan serta kependaman. Ukuran penerimaan yang tepat ialah sama ada penghalaan mengurangkan kos bagi hasil yang diterima, sambil mengekalkan tahap kualiti dan tadbir urus yang diperlukan aplikasi.
Pengumuman Snowflake menggabungkan dua langkah: pemilihan dinamik antara model yang telah diluluskan dan peluasan pilihan model dalam Cortex AI. Ciri penghalaan itu dijangka hadir dalam pratonton persendirian, manakala DeepSeek-V4-Flash 0731 telah diumumkan untuk pratonton persendirian dan GLM-5.3 akan menyusul tertakluk kepada ketersediaan.
Sudut strategik paling kuat Snowflake bukanlah idea asas menghantar tugasan mudah kepada model yang lebih murah—konsep itu sudah digunakan dalam pasaran. Sebaliknya, syarikat itu cuba meletakkan keputusan tersebut dalam sempadan data dan keselamatan Snowflake yang dikawal urus.
Dakwaan kecekapan token sehingga 3× kelihatan menjanjikan, tetapi organisasi perlu mengujinya terhadap beban kerja sendiri. Kejayaan patut dinilai berdasarkan kos hujung ke hujung, kualiti, kependaman, kebolehpercayaan dan kos pembetulan manusia—bukan pengurangan token semata-mata.