Xiaowei — не отдельное AI приложение, а встроенный в WeChat помощник: он принимает текстовые и голосовые команды, работает с функциями мессенджера и запускает мини программы. В рабочей версии Xiaowei, по опубликованным данным, используется WeLM 80B: 80 млрд параметров в общей совокупности, около 3 млрд активных на к...
Ответ на исследование

Create a landscape editorial hero image for this Studio Global article: How has WeChat’s gray tested Xiaowei assistant evolved from a native text and voice based agent embedded in WeChat—distinct from standalone. Article summary: Xiaowei’s significance is less that it is another chatbot than that it is being positioned as an in context agent inside WeChat: users can invoke it by text or voice, communicate with contacts, and launch mini programs r. Topic tags: general web, llm, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts
Главная особенность Xiaowei не в том, что WeChat выпустил ещё один чат-бот. Важнее другое: помощника пытаются встроить прямо в привычный контекст приложения. Пользователь может обратиться к Xiaowei текстом или голосом, попросить связаться с контактом, выполнить действие внутри WeChat или открыть нужную мини-программу — не переходя в отдельное AI-приложение вроде Yuanbao. 15
17
19
Иными словами, Tencent, похоже, делает ставку не на конкурирующий «суперприложению» самостоятельный чат, а на ИИ как интерфейс к уже существующей сети людей, сервисов и мини-программ WeChat. Это пока стратегический вывод, а не подтверждённая дорожная карта продукта.
История WeLM началась с опубликованной в 2022 году китайской языковой модели на 10 млрд параметров. Ей приписывали сильные результаты в 18 задачах, однако именно эти детали бенчмарков не удалось независимо подтвердить по доступным материалам. Поэтому их корректнее воспринимать как часть заявленной линии развития WeLM, а не как самостоятельно проверенный результат.
Следующий публично описанный этап — WeLM-80B. У модели 80 млрд параметров в общей совокупности, но на обработку одного токена активируется примерно 3 млрд. По опубликованным данным, WeLM-80B обучалась на корпусе объёмом менее 14 трлн токенов и поддерживает рассуждение, мультиязычное понимание и контекстное окно размером 128K токенов. 7
11
Именно эту модель связывают с работающей версией Xiaowei. Ей приписывают диалоговые ответы и поиск, вызов базовых функций WeChat, а также запуск сервисов мини-программ. 8
9
Более крупная WeLM-617B пока не считается полностью развёрнутой моделью Xiaowei. В ней 617 млрд параметров, из которых при обработке каждого токена активны около 23 млрд. Разработчики позиционируют её для задач, требующих более глубокого общего понимания и логического вывода: интеллектуальной разработки мини-программ и автоматической генерации инструментов для Xiaowei. 8
9
12
WeLM-80B и WeLM-617B используют логику разреженной архитектуры MoE — Mixture of Experts, или «смеси экспертов». В такой системе маршрутизатор для каждого токена выбирает лишь небольшую часть специализированных экспертных сетей. Поэтому модель может хранить большой общий пул параметров, но не выполнять вычисления со всеми ими одновременно.
Для WeLM-80B это означает: при общей ёмкости в 80 млрд параметров вычислительная нагрузка на один токен ближе к пути примерно из 3 млрд активных параметров. Аналогично, WeLM-617B не обязана задействовать все 617 млрд параметров при каждом шаге генерации. 7
8
Для экосистемы масштаба WeChat это особенно важно. Помощнику предстоит обрабатывать множество частых и не всегда сложных запросов: поиск, сообщения, навигацию по сервисам, вызовы инструментов и мини-программ. Чем меньше активных вычислений требуется для одного запроса, тем выше потенциальная пропускная способность, ниже задержка и умереннее стоимость обслуживания при массовом использовании. 7
8
Но есть важная оговорка: «3 млрд активных параметров» не означает, что 80-миллиардная MoE-модель обходится ровно как плотная модель на 3 млрд параметров. Все экспертные веса по-прежнему нужно где-то хранить и размещать. Остаются затраты на память, маршрутизацию, распределение нагрузки и обмен данными между устройствами. Преимущество прежде всего заключается в снижении арифметических вычислений на токен — это делает массовый инференс более реалистичным, но не бесплатным.
Параллельно команда WeLM исследует другой путь масштабирования — Hidden Decoding. Вместо простого увеличения глубины или ширины Transformer-модели этот подход расширяет каждый входной токен до нескольких внутренних потоков. Для потоков используются отдельные представления, а промежуточные key-value-состояния сохраняются как контекст для дальнейших вычислений. 2
13
Смысл в том, чтобы дать модели больше скрытых вычислений на один внешне генерируемый токен, не увеличивая основной Transformer за счёт дополнительных слоёв или ширины. Пользователь по-прежнему получает обычную последовательность ответа, но внутри каждого токена может происходить больше работы.
В сопоставимых экспериментах команда сообщила, что варианты WeLM-HD4-80B и WeLM-HD4-617B превзошли соответствующие базовые версии без Hidden Decoding. 1
12 Это не доказывает автоматически улучшение пользовательского опыта Xiaowei: экспериментальные модели и продуктовый сервис — не одно и то же. Однако результат показывает, что метод рассматривается как потенциальный способ наращивать способности уже крупных MoE-моделей.
У Hidden Decoding есть очевидная инженерная проблема. Если каждый токен превратить в n потоков и разрешить всем потокам полноценно взаимодействовать, стоимость межпоточного внимания может расти примерно квадратично по n.
Stream-Factorized Attention решает эту задачу разделением режимов внимания. Большинство слоёв работает преимущественно внутри каждого потока, а смешивание информации между потоками разрешается лишь в ограниченном числе слоёв. Благодаря этому дополнительная стоимость внимания растёт ближе к линейной, а не к квадратичной зависимости от числа потоков. Tencent указывает, что именно такая конструкция делает Hidden Decoding пригодным для обучения и обслуживания MoE-моделей масштаба 100B+. 5
Это особенно важно для WeChat: на практике недостаточно придумать метод, который повышает качество на тестовом наборе. Его необходимо обучать, размещать на вычислительной инфраструктуре и применять с приемлемой задержкой в сервисе, которым потенциально пользуются сотни миллионов или миллиарды людей.
Связка разреженной MoE-архитектуры и Hidden Decoding указывает на возможную многоуровневую модель работы. Для повседневных запросов можно использовать более экономичный маршрут класса 80B-A3B — то есть с 80 млрд общих и примерно 3 млрд активных параметров. Более сложные задачи могут передаваться более мощной модели или получать дополнительный скрытый вычислительный бюджет.
Такой подход позволяет разделить сценарии:
Если Tencent надёжно реализует разрешения, идентификацию пользователя, платежи, API мини-программ, контроль ошибок и согласие на выполнение действий, Xiaowei сможет превращать естественный язык в цепочку операций внутри уже существующей среды WeChat: найти, выбрать, вызвать и завершить действие.
В этом и состоит потенциальная стратегическая ценность проекта. Пользователю не обязательно переходить в новый AI-сервис: ИИ может стать командным слоем поверх общения, поиска, платежей, транспорта и других функций, которые уже собраны в WeChat. Однако это именно вывод из направления развития технологий и заявленных сценариев, а не подтверждение того, что все перечисленные возможности уже доступны или будут запущены для всех пользователей.
Studio Global AI
На этой странице есть ответ, подтвержденный источником, который вы можете продолжить внутри Studio Global.
Xiaowei — не отдельное AI приложение, а встроенный в WeChat помощник: он принимает текстовые и голосовые команды, работает с функциями мессенджера и запускает мини программы.
Xiaowei — не отдельное AI приложение, а встроенный в WeChat помощник: он принимает текстовые и голосовые команды, работает с функциями мессенджера и запускает мини программы. В рабочей версии Xiaowei, по опубликованным данным, используется WeLM 80B: 80 млрд параметров в общей совокупности, около 3 млрд активных на каждый токен, обучение на менее чем 14 трлн токенов и контекст до 128K.
WeLM 617B с 617 млрд общих и примерно 23 млрд активных параметров пока находится в разработке и предназначена для более сложных задач экосистемы WeChat.