Snowflake анонсувала динамічну маршрутизацію моделей для Cortex AI Gateway; приватний попередній перегляд очікується найближчим часом. Система має спрямовувати рутинні запити до ефективніших моделей, а складні завдання з глибоким міркуванням — до frontier моделей, зберігаючи контроль над дозволеними моделями, регіон...
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Snowflake announce about dynamic model routing in its Cortex AI Gateway—including its private-preview status, goal of automatically. Article summary: Snowflake announced dynamic model routing for Cortex AI Gateway, planned for private preview, to select the least-cost administrator-approved model that can meet a task’s quality requirement. Its main differentiation cla. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Snowflake анонсувала динамічну маршрутизацію моделей у Cortex AI Gateway — функцію, яка має автоматично обирати схвалену AI-модель для кожного завдання, а не надсилати всі запити до однієї найдорожчої моделі. Реліз поки що не є загальнодоступним: приватний попередній перегляд очікується найближчим часом.
Ідея проста: якщо з конкретним запитом впорається компактніша й дешевша модель, немає сенсу витрачати ресурси frontier-моделі. Натомість завдання, що потребують складнішого міркування, можна передавати потужнішим моделям від Anthropic, OpenAI або Google. Snowflake називає такий підхід «інтелектуальною ефективністю» — оптимізацією вартості завершеного бізнес-завдання, а не лише ціни окремих токенів.
Динамічна маршрутизація буде доступна через Cortex AI Gateway та інтегрована у продукти Snowflake CoCo і CoWork. Її також зможуть використовувати сторонні AI-агенти, підключені через цей шлюз. Клієнти зможуть визначати перелік дозволених моделей і задавати пріоритети для конкретного застосунку чи робочого навантаження: вартість, якість, швидкість або затримку відповіді.
За задумом Snowflake, маршрутизатор обиратиме найдоступнішу модель із дозволеного переліку, яка, за його оцінкою, достатньо надійно виконає завдання. Повторювані та нескладні операції можуть передаватися ефективним відкритим моделям, тоді як складні сценарії — frontier-моделям.
Автоматичний режим не є обов’язковим. Адміністратор може зафіксувати конкретну модель або звузити перелік кандидатів. Система також має враховувати вимоги до локалізації даних, політики управління доступом і записувати, яку модель було обрано для кожного запиту.
Snowflake описала два основні механізми.
У сценарії advisor pattern менша модель спершу намагається виконати завдання. Якщо її можливостей недостатньо, вона може викликати потужнішу модель як інструмент і продовжити роботу з її допомогою. Це дає змогу не оплачувати frontier-модель для кожного простого запиту, але залишає шлях до ескалації у складніших випадках.
Окремий класифікатор може аналізувати закономірності в попередніх запитах і заздалегідь визначати, які з них є типовими та нескладними. Такі запити можна одразу направляти до простішої моделі.
На практиці це означає два різні підходи: система може або почати з компактної моделі й підвищити рівень у разі потреби, або класифікувати запит ще до вибору моделі. Водночас дешевший перший виклик не гарантує дешевшого результату: ескалації, повторні спроби та невдалі виклики інструментів збільшують кількість токенів і затримку.
У внутрішньому тестуванні на робочому навантаженні зі створення dbt-конвеєрів Snowflake зафіксувала до 3× вищу ефективність використання токенів, коли динамічна маршрутизація забезпечувала якість, порівнянну з постійним використанням frontier-моделей. В іншому тесті з програмування інженерні команди зберегли темп роботи з pull request, використовуючи приблизно на 25% менше токенів.
Це результати внутрішніх оцінювань, оприлюднені самою Snowflake, а не незалежно підтверджені показники клієнтів. Вони можуть суттєво відрізнятися залежно від сценарію: маршрутизатор, який добре працює на повторюваних завданнях із data engineering або програмування, не обов’язково покаже такий самий результат у дослідницьких запитах із великим контекстом, складним використанням інструментів чи ризиковими рішеннями.
Тому головний показник — не кількість зекономлених токенів сама по собі. Важливіше вимірювати вартість успішно виконаного й прийнятого завдання разом із якістю, затримкою, надійністю та обсягом ручних виправлень.
Snowflake розширює набір моделей у Cortex AI двома відкритими моделями: DeepSeek-V4-Flash 0731 і Z.ai GLM-5.3. DeepSeek-V4-Flash 0731 уже анонсована для приватного попереднього перегляду, зокрема в CoCo. GLM-5.3 має з’явитися в приватному preview пізніше — за умови доступності моделі.
Snowflake повідомила, що DeepSeek-V4-Flash набрала 74,4% у внутрішньому тестуванні ADE-bench, де CoCo використовувався як агентське середовище. Також компанія навела результат попереднього тестування GLM-5.2 — 66% і найменше використання токенів у цьому бенчмарку. Цей показник стосується GLM-5.2, а не GLM-5.3, тому його не слід трактувати як оцінку новішої моделі.
Більший пул моделей посилює саму ідею маршрутизації: що більше доступних варіантів, то легше підібрати баланс між вимогами завдання, якістю та витратами. Для клієнтів це також означає ширший вибір за межами найвідоміших frontier-постачальників.
Ключова диференціація Snowflake полягає не в самій ідеї маршрутизації, а в тому, де вона відбувається. Компанія заявляє, що самостійно обслуговує нові відкриті моделі, а не просто проксує API стороннього постачальника. За її описом, дані, обчислення для інференсу, ваги моделей та оркестрація агентів працюють у межах периметра безпеки Snowflake, доповнюючись наявними засобами рольового доступу й аудиту.
Це архітектурна заява Snowflake, а не універсальна гарантія для будь-якої конфігурації. Перед впровадженням клієнтам потрібно перевірити регіон розгортання, вимоги до резидентності даних, умови договору, поведінку журналів і фактичний перелік моделей, доступних для конкретного навантаження.
Перевага такого підходу найбільш очевидна для організацій, які вже зберігають керовані аналітичні дані та розгортають AI-застосунки в Snowflake. У цьому випадку шлюз стає не лише інструментом економії, а й частиною тієї самої системи контролю та аудиту, що регулює доступ до даних.
Динамічна маршрутизація не є унікальною функцією Snowflake. Наприклад, Amazon Bedrock пропонує Intelligent Prompt Routing — безсерверну кінцеву точку, яка розподіляє запити між фундаментальними моделями в межах однієї модельної родини, прогнозуючи баланс якості та вартості.
Databricks через Unity AI Gateway централізовано маршрутизує запити до моделей і MCP-сервісів, надаючи контроль над місткістю, доступністю та витратами між постачальниками.
Підхід Google Cloud API Gateway більше нагадує керований шар трафіку для OpenAI-сумісних запитів, який спрямовує їх до визначених кінцевих точок моделей Gemini Enterprise Agent Platform. NVIDIA NeMo Switchyard позиціонується як провайдер-незалежний SDK і шар маршрутизації, а OpenRouter — як агрегатор моделей і постачальників із власними правилами вибору та балансування.
Тому практичне питання для покупця звучить не як «хто вміє обирати дешевшу модель?», а як де саме розміщені управління даними, політики маршрутизації, виконання моделей і деталізація рахунків.
Тестувати маршрутизацію варто на реальних або репрезентативних виробничих сценаріях, порівнюючи її з базовим варіантом, де всі запити обробляє одна frontier-модель. Варто відстежувати щонайменше:
Snowflake заявляє, що не стягуватиме окрему плату саме за рішення маршрутизатора, а тарифікуватиме спожиті токени. Однак ескалації та повторні спроби все одно можуть збільшити загальне споживання й затримку. Отже, коректний критерій приймання — зниження вартості прийнятого результату без погіршення якості та вимог до управління даними.
Анонс Snowflake поєднує два кроки: автоматичний вибір між схваленими моделями та розширення набору моделей у Cortex AI. Динамічна маршрутизація має перейти до приватного preview найближчим часом; DeepSeek-V4-Flash 0731 уже заявлена для такого доступу, тоді як GLM-5.3 очікується пізніше — залежно від доступності.
Найсильніша стратегічна теза Snowflake — не в тому, що прості запити можна надсилати дешевшим моделям. Це вже загальний напрям розвитку AI-шлюзів. Її ставка полягає в тому, щоб зробити вибір моделі частиною керованого середовища даних і безпеки Snowflake.
Заявлене підвищення ефективності до 3× виглядає багатообіцяльно, але остаточний висновок мають дати власні тести. Для бізнесу важливі не токени самі по собі, а наскрізна вартість, якість, швидкість, надійність і обсяг людських виправлень.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Snowflake анонсувала динамічну маршрутизацію моделей для Cortex AI Gateway; приватний попередній перегляд очікується найближчим часом.
Snowflake анонсувала динамічну маршрутизацію моделей для Cortex AI Gateway; приватний попередній перегляд очікується найближчим часом. Система має спрямовувати рутинні запити до ефективніших моделей, а складні завдання з глибоким міркуванням — до frontier моделей, зберігаючи контроль над дозволеними моделями, регіонами розміщення даних і журналами ви...
Компанія також розширює Cortex AI моделями DeepSeek V4 Flash 0731 і Z.ai GLM 5.3 та заявляє про до 3× ефективніше використання токенів у внутрішньому тестуванні.