По замыслу Snowflake, маршрутизатор будет выбирать самую доступную из одобренных администратором моделей, которая с достаточной уверенностью способна выполнить задачу. Повторяющиеся и относительно простые запросы можно будет отправлять к эффективным открытым моделям, а задачи, требующие сложного рассуждения, — к передовым моделям Anthropic, OpenAI и Google. При этом автоматический режим не обязателен: организация сможет закрепить конкретную модель или сократить список допустимых вариантов.
Маршрутизация, как утверждает Snowflake, также учитывает требования к размещению данных и политики управления доступом, а выбранная для каждого запроса модель записывается в журнал. Поэтому функция предназначена не только для контроля расходов, но и для создания проверяемого процесса выбора моделей.
Snowflake описала два механизма, которые определяют, насколько сложная модель нужна для конкретной задачи.
В режиме advisor pattern сначала работает небольшая модель. Если она не может корректно выполнить задачу, то вызывает более крупную модель как инструмент и продолжает работу уже с её помощью. Такой сценарий позволяет не оплачивать использование передовой модели там, где достаточно более простой, но сохраняет путь для эскалации сложных запросов.
Отдельный классификатор может анализировать закономерности в исторических запросах и заранее распознавать типовые задачи, направляя их к простым моделям. Таким образом, у системы появляются два параллельных сценария: начать с небольшой модели и при необходимости перейти к более мощной либо определить подходящую модель ещё до выполнения запроса.
Однако важен не сам факт выбора дешёвой модели, а итоговый результат всей задачи. Неудачная первая попытка, повторный вызов или переход на более мощную модель могут увеличить расход токенов, задержку и сложность сопровождения.
Snowflake сообщила о повышении эффективности использования токенов до 3 раз во внутреннем тесте с dbt-конвейером, когда динамическая маршрутизация обеспечила сопоставимое качество по сравнению с использованием только передовых моделей. В отдельном тесте с задачами программирования, по данным компании, инженерные команды сохранили прежний объём pull request’ов, сократив расход токенов примерно на 25%.
Эти показатели следует воспринимать как заявленные Snowflake результаты внутренних оценок, а не как независимо подтверждённые показатели клиентов. Эффект может заметно отличаться в зависимости от нагрузки. Маршрутизатор, хорошо работающий с повторяющимися задачами в инженерии данных или программировании, может показать иные результаты при исследовательской работе с длинным контекстом, сложным использованием инструментов или ответственными решениями.
Поэтому наиболее полезный показатель — не количество сэкономленных токенов само по себе, а стоимость успешно завершённой и принятой задачи с учётом качества, задержки, надёжности и объёма ручных исправлений.
Snowflake расширяет набор моделей в Cortex AI, добавляя DeepSeek-V4-Flash 0731 и GLM-5.3 от Z.ai. DeepSeek-V4-Flash 0731 уже анонсирована для закрытого предварительного тестирования, в том числе в CoCo. GLM-5.3 должна появиться в таком режиме позднее — при условии доступности модели.
Snowflake сообщила, что DeepSeek-V4-Flash получила 74,4% в тесте ADE-bench, проведённом внутри компании с использованием CoCo в качестве среды для ИИ-агента. Кроме того, компания сослалась на более раннюю оценку GLM-5.2, а не GLM-5.3: эта модель набрала заявленные 66% и показала наименьший расход токенов в данном тесте. Результат GLM-5.2 нельзя считать опубликованной оценкой GLM-5.3.
Расширение пула открытых моделей поддерживает саму идею маршрутизации: чем больше доступных вариантов, тем проще сопоставить требования задачи с нужным сочетанием стоимости и качества. Для клиентов это также означает более широкий выбор за пределами наиболее известных поставщиков передовых моделей.
Главное отличие Snowflake видит не в самой возможности выбирать модели, а в том, что маршрутизация и доступ к ним связаны с уже существующей средой управления данными. Компания утверждает, что самостоятельно предоставляет новые открытые модели, а не просто проксирует сторонний API. По её заявлению, данные, вычислительные ресурсы для инференса, веса моделей и оркестрация агентов работают внутри периметра безопасности Snowflake, где уже действуют ролевой контроль доступа и механизмы аудита.
Это архитектурное заявление Snowflake, а не универсальная гарантия для любой конфигурации. Клиентам всё равно потребуется проверить параметры конкретного развертывания: регион, требования к локализации данных, условия договора, правила журналирования и перечень моделей, разрешённых для выбранной нагрузки.
Наиболее убедительно такой подход выглядит для организаций, которые уже хранят управляемые аналитические данные и запускают ИИ-приложения в Snowflake. В этом случае ценность заключается не только в выборе более дешёвой модели: правила маршрутизации могут стать частью той же системы контроля и аудита, которая регулирует доступ к данным.
Маршрутизация моделей не является уникальной функцией Snowflake. Например, Amazon Bedrock предлагает интеллектуальную маршрутизацию запросов через бессерверную конечную точку: она направляет запросы между фундаментальными моделями внутри одного семейства, ориентируясь на прогнозируемое качество ответа и стоимость.
Для заказчика важнее сравнивать не наличие маршрутизации как таковой, а место, где находятся политика управления, доступ к данным, выполнение моделей, правила выбора и прозрачность биллинга. Snowflake делает акцент на тесной интеграции с управляемым контуром данных. Другие шлюзы могут отдавать приоритет независимости от поставщика, отказоустойчивости, управлению трафиком или переносимости между облаками. Это разные архитектурные приоритеты, а не простой вопрос о том, «есть ли у продукта маршрутизация».
Практический выбор можно сформулировать так:
Корректный тест должен сравнивать автоматическую маршрутизацию с фиксированной передовой моделью на типичных производственных нагрузках. Минимальный набор показателей включает:
Snowflake заявляет, что не взимает отдельную плату за само решение о маршрутизации и выставляет счёт за потребление токенов. Но эскалации и повторные попытки всё равно могут увеличить общий расход и задержку. Поэтому правильный критерий — снижение стоимости принятого результата при сохранении требований к качеству и управлению, а не сокращение числа токенов любой ценой.
Анонс Snowflake объединяет два направления: автоматический выбор одобренной модели для каждой задачи и расширение списка моделей, доступных внутри Cortex AI. Функцию динамической маршрутизации компания рассчитывает вскоре перевести в закрытое предварительное тестирование; DeepSeek-V4-Flash 0731 уже заявлена для private preview, а GLM-5.3 должна появиться позднее — при условии доступности.
Стратегическая сила предложения Snowflake не столько в общей идее отправлять простые запросы к дешёвым моделям. Гораздо важнее попытка встроить это решение в управляемый контур данных и безопасности платформы. Заявленная трёхкратная эффективность использования токенов выглядит многообещающе, но на практике клиентам нужно проверять маршрутизацию на собственных нагрузках и оценивать не только расход токенов, но и конечную стоимость, качество, задержку, надёжность и объём ручных исправлений.