Snowflakeは、Cortex AI Gatewayに動的モデルルーティングを追加すると発表しました。機能は近日中にプライベートプレビューへ移行する予定で、一般提供済みの機能ではありません。[1][8][10] 単純・反復的な処理は効率的なモデルに、より深い推論が必要な処理はAnthropic、OpenAI、Googleなどのフロンティアモデルに振り分けられます。[1][2] Snowflakeは、dbtパイプラインの社内テストで最大3倍のトークン効率、コーディング作業のテストで約25%少ないトークン使用量を報告しています。ただし、いずれも同社による内部評価です。[1]
研究の答え

Create a landscape editorial hero image for this Studio Global article: What did Snowflake announce about dynamic model routing in its Cortex AI Gateway—including its private-preview status, goal of automatically. Article summary: Snowflake announced dynamic model routing for Cortex AI Gateway, planned for private preview, to select the least-cost administrator-approved model that can meet a task’s quality requirement. Its main differentiation cla. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Snowflakeは、AIエージェントやアプリケーションからのリクエストを、毎回同じ高性能モデルへ送るのではなく、タスクごとに適切な承認済みモデルへ振り分ける「動的モデルルーティング」を発表しました。対象はCortex AI Gatewayで、機能は近日中にプライベートプレビューへ移行する予定です。したがって、現時点では一般提供済みの製品機能ではなく、発表段階の新機能です。
Snowflakeが掲げる狙いは、単に1トークンあたりの価格を下げることではありません。タスクを許容できる品質で完了させるために必要な知能の水準だけを使い、ビジネス成果1件あたりのコストを最適化することです。同社はこの考え方を「インテリジェンス・エフィシェンシー(intelligence efficiency)」と呼んでいます。
動的モデルルーティングはCortex AI Gatewayを通じて提供され、SnowflakeのAI製品であるCoCoとCoWorkにも統合されます。Cortex AI Gatewayに接続されたサードパーティー製のAIエージェントも、この機能を利用できるとSnowflakeは説明しています。
利用企業は、ルーティング候補として認めるモデルを指定できるほか、コスト、品質、レイテンシーのどれを重視するかといった方針も設定できます。ルーターは、管理者が承認したモデルの中から、タスクを十分な品質で完了できると判断した最も安価なモデルを選ぶことを目指します。
たとえば、定型的な分類、反復的なデータ処理、比較的単純な生成タスクは効率的なオープンモデルに任せます。一方、複雑な推論や難易度の高いエージェント処理は、Anthropic、OpenAI、Googleなどが提供するフロンティアモデルへ振り向けます。
自動化を常に使う必要はありません。利用企業は特定のモデルを固定したり、候補となるモデルを絞り込んだりすることで、手動に近い運用も維持できます。
さらにSnowflakeは、ルーティングがデータレジデンシー要件やガバナンスポリシーを考慮し、各リクエストで選択されたモデルを記録できると説明しています。これにより、動的ルーティングはAI利用料の管理だけでなく、モデル選択を監査可能なプロセスにする仕組みとしても位置づけられます。
Snowflakeは、タスクにどの程度のモデル性能が必要かを判断する方法として、主に2つの仕組みを説明しています。
アドバイザーパターンでは、まず小規模なモデルがタスクを試みます。十分に処理できない場合は、より大きなモデルをツールとして呼び出し、処理を継続します。
この方式なら、小規模モデルで対応できるリクエストにフロンティアモデルの料金を支払わずに済みます。同時に、難しいタスクを上位モデルへ引き継ぐエスカレーション経路も確保できます。
ただし、最初の試行が失敗したり、上位モデルへの切り替えや再試行が発生したりすれば、トークン数、処理時間、システムの複雑さが増える可能性があります。
もう1つは、過去のクエリに見られるパターンを学習した分類器を使い、比較的簡単なリクエストを事前に判別して、シンプルなモデルへ送る方法です。
つまり、システムには「まず小さなモデルで試して必要なら引き上げる」経路と、「リクエストを先に分類して適切なモデルを選ぶ」経路が用意されます。重要なのは、安いモデルを選べたかではなく、最終的なタスクの結果が改善したかどうかです。
Snowflakeは、dbtパイプラインを扱う社内ワークロードで、フロンティアモデルだけを使った場合と同等の品質を保ちながら、動的ルーティングによって最大3倍のトークン効率を実現したと報告しています。また、別のコーディング・ワークロードのテストでは、エンジニアリングチームがプルリクエストの処理量を維持しつつ、トークン使用量を約25%削減したとしています。
ただし、これらはSnowflakeが実施した社内評価であり、顧客環境で独立検証された結果ではありません。反復的なデータエンジニアリングやコーディング作業で有効だったルーターが、長いコンテキストを扱う調査、複雑なツール呼び出し、リスクの高い意思決定でも同じ成果を出すとは限りません。
企業が見るべき指標は、単純な「削減トークン数」ではありません。品質、レイテンシー、信頼性、人による修正を含め、承認可能な成果を1件完了するための総コストを測る必要があります。
Snowflakeは、Cortex AIで利用できるモデルの選択肢も広げます。追加されるのはDeepSeek-V4-Flash 0731と、Z.aiのGLM-5.3です。DeepSeek-V4-Flash 0731はCoCoを含むプライベートプレビューで提供され、GLM-5.3は提供可能になり次第、プライベートプレビューへ追加される予定です。
Snowflakeによると、CoCoをエージェント実行基盤として使った社内テストで、DeepSeek-V4-FlashはADE-benchで74.4%を記録しました。一方、GLMについて同社が示したのはGLM-5.3ではなく、以前に行ったGLM-5.2のテスト結果で、スコアは66%、同ベンチマークで最も少ないトークン使用量だったとされています。このGLM-5.2の結果を、GLM-5.3の評価結果と解釈してはいけません。
利用できるモデルが増えれば、タスクの要求水準とコスト、性能の組み合わせを細かく合わせやすくなります。Anthropic、OpenAI、Googleといった既存のフロンティアモデルだけでなく、オープンモデルも候補に加わることで、ルーティングの選択肢そのものが広がります。
Snowflakeの主な差別化ポイントは、モデルの振り分け機能そのものではありません。ルーティングとモデル利用を、Snowflakeがすでに提供している統制されたデータ環境に結び付ける点です。
同社は、新たに追加するオープンモデルを単に第三者APIへ中継するのではなく、自社で提供すると説明しています。データ、推論用コンピュート、モデルの重み、エージェントのオーケストレーションがSnowflakeのセキュリティ境界内で動作し、既存のロールベースアクセス制御(RBAC)や監査機能も利用できるという主張です。
もっとも、これはSnowflakeによるアーキテクチャ上の説明であり、すべての導入環境に対する一律の保証ではありません。企業は、実際の導入リージョン、データレジデンシー要件、契約条件、ログの扱い、ワークロードごとに利用可能なモデルを確認する必要があります。
Snowflakeをすでに分析データやAIアプリケーションの基盤として利用している企業にとっては、モデルを安く選べること以上の意味があります。データアクセスと同じ統制・監査の枠組みの中で、モデル選択も管理できる可能性があるためです。
モデルルーティングという発想自体はSnowflake独自のものではありません。たとえばAmazon BedrockのIntelligent Prompt Routingは、同じモデルファミリー内の基盤モデル間でリクエストを振り分け、予測される応答品質とコストの最適化を目指します。
DatabricksのUnity AI Gatewayも、モデルやMCPサービスへのリクエストを中央の制御プレーンからルーティングし、複数プロバイダーにまたがる容量、可用性、支出を管理する仕組みです。 Google CloudのAPI Gatewayは、OpenAI互換のリクエストを受け、設定したGemini Enterprise Agent Platformのモデルエンドポイントへ転送する管理レイヤーとして機能します。
NVIDIAのNeMo Switchyardは、特定のプロバイダーに依存しないSDK・ルーティング層として、利用可能なモデルを定義し、選択したエンドポイントへの呼び出しを管理します。 OpenRouterは、複数のモデルプロバイダーを集約し、可用性や価格などに基づいてプロバイダーを選択する仕組みを提供しています。
したがって、比較すべきなのは「どのサービスが安いモデルを選べるか」だけではありません。次の要素が、どこで管理・実行されるのかが重要です。
Snowflakeは、ガバナンスされたデータ環境との緊密な統合を重視します。一方、より中立的なゲートウェイは、複数クラウドや複数プロバイダー間の柔軟性を重視する傾向があります。どちらが優れているかではなく、企業の運用基盤に合うかどうかが判断の軸になります。
導入前には、自動ルーティングを固定したフロンティアモデルの構成と比較し、実際の本番ワークロードに近いデータで評価する必要があります。少なくとも、次の項目を測定すべきです。
Snowflakeは、ルーティング判断そのものに別料金を課さず、トークン消費に基づいて請求すると説明しています。それでも、エスカレーションや再試行が増えれば、総トークン数と処理時間は増加します。評価の基準は、トークン数が減ったかではなく、品質とガバナンスの要件を満たした成果を、より低い総コストで完了できたかどうかです。
今回の発表は、2つの動きを組み合わせたものです。1つは、承認済みモデルの中からタスクごとに利用モデルを自動選択する動的ルーティング。もう1つは、Cortex AIで利用できるモデルの拡充です。動的モデルルーティングは近日中にプライベートプレビューへ移行する予定で、DeepSeek-V4-Flash 0731はプライベートプレビュー、GLM-5.3は提供可能になり次第のプレビュー開始とされています。
簡単なリクエストを安価なモデルへ送り、難しい処理だけを高性能モデルに任せるという考え方自体は新しくありません。Snowflakeの戦略的な特徴は、その判断を同社の統制されたデータとセキュリティの境界内に置こうとしている点です。
Snowflakeが報告した最大3倍のトークン効率は注目に値しますが、企業がその数字をそのまま導入効果とみなすべきではありません。自社のワークロードを使って、エンドツーエンドのコスト、品質、レイテンシー、信頼性、人による修正量を検証することが、導入判断の前提になります。
Studio Global AI
このページにはソースに裏付けされた回答が含まれており、Studio Global 内で続行できます。
Snowflakeは、Cortex AI Gatewayに動的モデルルーティングを追加すると発表しました。機能は近日中にプライベートプレビューへ移行する予定で、一般提供済みの機能ではありません。[1][8][10]
Snowflakeは、Cortex AI Gatewayに動的モデルルーティングを追加すると発表しました。機能は近日中にプライベートプレビューへ移行する予定で、一般提供済みの機能ではありません。[1][8][10] 単純・反復的な処理は効率的なモデルに、より深い推論が必要な処理はAnthropic、OpenAI、Googleなどのフロンティアモデルに振り分けられます。[1][2]
Snowflakeは、dbtパイプラインの社内テストで最大3倍のトークン効率、コーディング作業のテストで約25%少ないトークン使用量を報告しています。ただし、いずれも同社による内部評価です。[1]