Xiaowei n’est pas présenté comme un chatbot autonome, mais comme un assistant intégré à WeChat, capable de répondre par texte ou par voix, d’utiliser des fonctions natives et de lancer des mini programmes. WeLM 80B, déjà déployé pour Xiaowei, totalise 80 milliards de paramètres, mais n’en active qu’environ 3 milliar...
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: How has WeChat’s gray tested Xiaowei assistant evolved from a native text and voice based agent embedded in WeChat—distinct from standalone. Article summary: Xiaowei’s significance is less that it is another chatbot than that it is being positioned as an in context agent inside WeChat: users can invoke it by text or voice, communicate with contacts, and launch mini programs r. Topic tags: general web, llm, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts
Le plus important, avec Xiaowei, n’est pas l’arrivée d’un chatbot de plus. C’est le choix de Tencent de placer l’IA à l’intérieur de WeChat, au plus près des conversations, des contacts, des services et des mini-programmes déjà utilisés au quotidien.
Testé auprès d’un nombre limité d’utilisateurs, l’assistant peut être sollicité par écrit ou à la voix. Il est conçu pour répondre à des questions, effectuer des recherches, utiliser certaines fonctions natives de WeChat, communiquer avec des contacts et ouvrir des mini-programmes sans obliger l’utilisateur à basculer vers une application d’IA distincte, comme Yuanbao. 15
17
19
La trajectoire remonte au WeLM présenté en 2022, un modèle chinois dense de 10 milliards de paramètres dont les performances ont été rapportées sur 18 tâches. Ces résultats établissent la filiation technique de la famille WeLM, même si les détails exacts de ces benchmarks n’ont pas pu être vérifiés indépendamment à partir des sources consultées.
L’étape aujourd’hui la plus concrète est WeLM-80B. Le modèle compte 80 milliards de paramètres au total, mais seulement environ 3 milliards sont activés pour chaque token. Il a été entraîné sur moins de 14 000 milliards de tokens et ses capacités annoncées comprennent le raisonnement, la compréhension multilingue et une fenêtre de contexte de 128K. 7
11
Selon les informations publiées, WeLM-80B alimente Xiaowei pour le dialogue, la recherche, l’appel de fonctions natives de WeChat et l’accès aux services proposés par les mini-programmes. 8
9
Tencent prépare également WeLM-617B, un modèle de 617 milliards de paramètres dont environ 23 milliards seraient activés à chaque token. Cette version conserve la logique du mélange d’experts, ou MoE (Mixture of Experts), mais vise un niveau de compréhension et de raisonnement supérieur.
Point essentiel : WeLM-617B est encore présenté comme étant en développement. Il ne faut donc pas le considérer comme un modèle déjà déployé dans Xiaowei. Son objectif annoncé est de prendre en charge des tâches plus complexes dans l’écosystème WeChat, notamment le développement intelligent de mini-programmes et la génération d’outils destinés à l’assistant. 8
9
12
Dans un modèle MoE, un routeur sélectionne, pour chaque token, un petit nombre de réseaux experts parmi un ensemble beaucoup plus vaste. WeLM-80B peut ainsi disposer d’un réservoir de capacité de 80 milliards de paramètres tout en effectuant un calcul par token plus proche d’un chemin d’environ 3 milliards de paramètres. De la même manière, WeLM-617B n’a pas besoin d’exécuter ses 617 milliards de paramètres à chaque étape.
Cette différence entre paramètres totaux et paramètres activés est décisive pour un service destiné à traiter un très grand nombre de requêtes : recherches, messages, navigation dans des services ou appels d’outils. Une activation réduite peut améliorer le débit, la latence et le coût de l’inférence, tout en conservant une réserve d’experts spécialisés. 7
8
Il ne faut toutefois pas en déduire qu’un modèle MoE de 80B coûte exactement comme un modèle dense de 3B. Les poids des experts doivent toujours être stockés et répartis sur l’infrastructure. Ils engendrent aussi des coûts de mémoire, de routage et de communication entre accélérateurs. Le gain concerne surtout la quantité de calcul arithmétique effectuée pour chaque token : il rend le traitement massif plus réaliste, mais ne le rend pas gratuit.
L’équipe WeLM explore une autre piste avec Hidden Decoding. Au lieu d’augmenter la profondeur ou la largeur du Transformer, la méthode transforme chaque token d’entrée en plusieurs flux internes, dotés d’embeddings distincts. Les états intermédiaires de ces flux sont ensuite conservés dans le contexte via le cache clé-valeur, ou KV cache.
L’idée est de donner au modèle davantage de calcul latent pour chaque token généré publiquement, sans agrandir le cœur du Transformer. Dans des expériences comparatives, les variantes WeLM-HD4-80B et WeLM-HD4-617B ont obtenu de meilleurs résultats que leurs modèles de référence dépourvus de Hidden Decoding. 1
2
13
Cette approche pourrait devenir très coûteuse si chaque flux devait se concentrer pleinement sur tous les autres. Avec n flux, l’attention croisée risquerait en effet de croître approximativement comme le carré de n.
Le Stream-Factorized Attention constitue la réponse proposée par l’équipe. La plupart des couches effectuent leur attention à l’intérieur de chaque flux, tandis que seules quelques couches autorisent un mélange entre les flux. Le coût additionnel de l’attention se rapproche ainsi d’une progression linéaire plutôt que quadratique avec le nombre de flux. Tencent présente cette organisation comme l’un des éléments qui rendent Hidden Decoding entraînable et exploitable sur des modèles MoE dépassant 100 milliards de paramètres. 5
Pris ensemble, le MoE et le Hidden Decoding dessinent une architecture à plusieurs niveaux : un modèle relativement économe pour les interactions fréquentes et simples, puis des modèles plus puissants ou davantage de calcul latent pour la planification, la sélection d’outils et les tâches en plusieurs étapes.
C’est là que Xiaowei se distingue d’une application d’IA autonome. Sa valeur potentielle ne réside pas uniquement dans sa capacité à produire une réponse, mais dans son accès au tissu fonctionnel de WeChat : identité, conversations, services, mini-programmes et, selon les autorisations accordées, opérations nécessitant des contrôles supplémentaires.
À terme, le parcours pourrait ressembler à ceci : comprendre une intention, choisir le bon service, l’appeler, puis mener l’action à son terme. L’utilisateur n’aurait plus nécessairement à chercher le bon menu ou le bon mini-programme. Mais cette conclusion reste une déduction stratégique à partir des orientations techniques et des fonctions annoncées, et non une feuille de route produit confirmée.
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
Xiaowei n’est pas présenté comme un chatbot autonome, mais comme un assistant intégré à WeChat, capable de répondre par texte ou par voix, d’utiliser des fonctions natives et de lancer des mini programmes.
Xiaowei n’est pas présenté comme un chatbot autonome, mais comme un assistant intégré à WeChat, capable de répondre par texte ou par voix, d’utiliser des fonctions natives et de lancer des mini programmes. WeLM 80B, déjà déployé pour Xiaowei, totalise 80 milliards de paramètres, mais n’en active qu’environ 3 milliards par token.
WeLM 617B atteint 617 milliards de paramètres au total et environ 23 milliards activés par token.