Xiaowei se está probando como un asistente nativo dentro de WeChat: acepta instrucciones por texto o voz y puede comunicarse con contactos o activar miniprogramas. WeLM 80B, el modelo que ya se ha desplegado para Xiaowei, reúne 80.000 millones de parámetros, pero activa aproximadamente 3.000 millones por token.
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: How has WeChat’s gray tested Xiaowei assistant evolved from a native text and voice based agent embedded in WeChat—distinct from standalone. Article summary: Xiaowei’s significance is less that it is another chatbot than that it is being positioned as an in context agent inside WeChat: users can invoke it by text or voice, communicate with contacts, and launch mini programs r. Topic tags: general web, llm, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts
La relevancia de Xiaowei no está únicamente en que sea otro asistente conversacional. Tencent lo está probando como un agente nativo dentro de WeChat, capaz de recibir instrucciones por texto o voz, interactuar con contactos y abrir servicios integrados en miniprogramas sin obligar al usuario a cambiar de aplicación. 15
En otras palabras, la apuesta parece ser convertir la IA en una interfaz para la red que WeChat ya posee: personas, servicios, pagos, búsquedas y miniprogramas. Es una estrategia distinta de lanzar una aplicación de IA independiente, como Yuanbao, y pedir a los usuarios que adopten un destino digital nuevo.
La familia WeLM tiene un antecedente importante: en 2022 se presentó un modelo chino denso de 10.000 millones de parámetros, cuya documentación pública informó de buenos resultados en 18 tareas. Sin embargo, esos detalles concretos de evaluación no han podido verificarse de forma independiente a partir de las fuentes recuperadas, por lo que conviene tratarlos como parte de la trayectoria histórica del proyecto, no como una comparación de rendimiento confirmada aquí.
El paso actual más claro es WeLM-80B. El modelo suma 80.000 millones de parámetros, pero activa aproximadamente 3.000 millones para cada token. También se ha informado de un entrenamiento con menos de 14 billones de tokens, capacidades de razonamiento y comprensión multilingüe, además de una ventana de contexto de 128K. 7
11
Según las informaciones disponibles, WeLM-80B ya impulsa a Xiaowei en tareas como conversación, búsqueda, llamadas a funciones nativas de WeChat y activación de servicios mediante miniprogramas. 8
9
WeLM-617B conserva la misma lógica de eficiencia, pero amplía considerablemente la capacidad total: 617.000 millones de parámetros, con unos 23.000 millones activados por token. El modelo sigue descrito como en desarrollo, no como una versión completamente desplegada de Xiaowei. 8
9
12
Su objetivo sería afrontar tareas más complejas dentro del ecosistema de WeChat: una comprensión general y un razonamiento más sólidos, el desarrollo inteligente de miniprogramas y la generación de herramientas complementarias para Xiaowei. 8
9
12
La diferencia entre ambas versiones sugiere una posible división del trabajo: WeLM-80B para solicitudes rápidas y habituales, y el modelo de 617.000 millones para procesos que exigen más planificación, código, selección de herramientas o varios pasos consecutivos. Esa lectura es una inferencia basada en los usos anunciados; no constituye una hoja de ruta de producto confirmada.
WeLM utiliza una arquitectura de mezcla de expertos, conocida como MoE por sus siglas en inglés. En lugar de ejecutar toda la red para cada token, un sistema de enrutamiento selecciona solo un pequeño grupo de expertos especializados.
Así, WeLM-80B puede mantener una reserva de capacidad equivalente a 80.000 millones de parámetros, pero realizar cada paso con un recorrido activo cercano a 3.000 millones. WeLM-617B, del mismo modo, no tendría que ejecutar sus 617.000 millones de parámetros en cada token: activaría aproximadamente 23.000 millones. 7
8
Esta diferencia es especialmente importante para un asistente integrado en una plataforma de uso masivo. Muchas solicitudes —buscar información, enviar un mensaje, localizar un servicio o abrir un miniprograma— son breves y frecuentes. Reducir el número de parámetros que participan en cada paso puede mejorar el rendimiento, la latencia y el coste de servicio, al tiempo que conserva una capacidad total mucho mayor para tareas especializadas.
Pero hay un matiz esencial: 3.000 millones de parámetros activos no significa que un modelo MoE de 80.000 millones cueste exactamente lo mismo que uno denso de 3.000 millones. Los pesos de todos los expertos deben almacenarse y distribuirse. Eso implica costes de memoria, colocación, enrutamiento y comunicación entre dispositivos. La ventaja principal está en reducir el cálculo aritmético por token y hacer más viable la inferencia a gran volumen; no en volverla gratuita.
La otra línea de investigación de WeLM es Hidden Decoding. En vez de aumentar simplemente la profundidad o la anchura del Transformer, el método expande cada token de entrada en varios flujos internos, con tablas de embeddings independientes, y conserva los estados intermedios de clave y valor —el llamado KV cache— como contexto.
El resultado buscado es que cada token disponga de más cálculo latente antes de producir la siguiente salida, sin añadir capas ni ensanchar el tronco principal del Transformer. 2 En experimentos comparativos, el equipo informó de mejoras de las variantes HD4 tanto sobre la versión de 80B como sobre la de 617B frente a sus líneas base correspondientes.
1
12
La idea puede entenderse como una forma de “pensar más” dentro de la misma secuencia visible: el usuario no recibe necesariamente más tokens de razonamiento, pero el modelo obtiene estados internos adicionales con los que procesar cada entrada.
Expandir cada token en n flujos tendría un inconveniente inmediato. Si todos los flujos pudieran atender libremente a todos los demás en cada capa, el coste de la atención entre flujos crecería aproximadamente de forma cuadrática con n.
Stream-Factorized Attention aborda ese problema limitando la interacción. La mayor parte de las capas trabaja dentro de cada flujo, mientras que solo unas pocas permiten mezclar información entre flujos. De este modo, el coste adicional de atención se acerca más a un crecimiento lineal que a uno cuadrático.
Tencent presenta este diseño como la pieza de ingeniería que permite entrenar y servir Hidden Decoding a escala de modelos MoE de más de 100.000 millones de parámetros. En las pruebas divulgadas, WeLM-HD4-80B y WeLM-HD4-617B superaron a sus respectivas líneas base autorregresivas en los experimentos comparativos del equipo. 1
3
La combinación de una arquitectura MoE muy dispersa y más cálculo oculto apunta a un modelo operativo por niveles:
En el escenario más ambicioso, el usuario podría pasar de “buscar” a “decidir”, “activar” y “completar” sin navegar manualmente por menús y aplicaciones internas. Xiaowei funcionaría entonces como una capa de control sobre las capacidades que WeChat ya ofrece, en lugar de exigir la migración a una nueva superaplicación de IA.
Ese futuro dependerá de aspectos que van más allá del modelo: permisos, identidad, pagos, APIs de miniprogramas, controles de fiabilidad y consentimiento del usuario. La tecnología puede hacer más natural la interacción, pero la conversión de una conversación en acciones reales exige que esas salvaguardas estén bien diseñadas.
Por ahora, la conclusión más prudente es que Xiaowei representa una dirección estratégica clara: la IA integrada en el contexto de una plataforma existente. WeLM-80B aporta la eficiencia necesaria para las tareas cotidianas; WeLM-617B y Hidden Decoding exploran cómo elevar la capacidad para trabajos más difíciles sin asumir el coste de ejecutar un modelo gigantesco de forma totalmente densa en cada solicitud.
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
Xiaowei se está probando como un asistente nativo dentro de WeChat: acepta instrucciones por texto o voz y puede comunicarse con contactos o activar miniprogramas.
Xiaowei se está probando como un asistente nativo dentro de WeChat: acepta instrucciones por texto o voz y puede comunicarse con contactos o activar miniprogramas. WeLM 80B, el modelo que ya se ha desplegado para Xiaowei, reúne 80.000 millones de parámetros, pero activa aproximadamente 3.000 millones por token.
WeLM 617B eleva el total a 617.000 millones de parámetros y activa unos 23.000 millones por token; todavía figura como un modelo en desarrollo.