O Xiaowei está sendo testado em pequena escala dentro do WeChat e aceita comandos por texto ou voz, podendo acessar funções nativas e serviços de miniaplicativos. O WeLM 80B tem 80 bilhões de parâmetros no total, mas ativa cerca de 3 bilhões por token; o modelo já foi associado ao funcionamento do Xiaowei.
Resposta de pesquisa

Create a landscape editorial hero image for this Studio Global article: How has WeChat’s gray tested Xiaowei assistant evolved from a native text and voice based agent embedded in WeChat—distinct from standalone. Article summary: Xiaowei’s significance is less that it is another chatbot than that it is being positioned as an in context agent inside WeChat: users can invoke it by text or voice, communicate with contacts, and launch mini programs r. Topic tags: general web, llm, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts
O ponto mais importante do Xiaowei não é ser apenas mais um chatbot. O assistente está sendo posicionado dentro do próprio WeChat, com interação por texto ou voz e acesso a recursos da plataforma, contatos e miniaplicativos. Em vez de levar o usuário para um destino separado de IA, a proposta é permitir que ele peça algo em linguagem natural e continue dentro do ecossistema que já usa. 15
Essa diferença separa o Xiaowei de aplicativos independentes, como o Yuanbao. A aposta estratégica parece ser usar a IA como uma nova interface para a rede de pessoas, serviços e miniaplicativos do WeChat — uma interpretação sobre o posicionamento do produto, não um roteiro oficial confirmado.
A linhagem do WeLM remonta ao modelo chinês de 10 bilhões de parâmetros apresentado em 2022. Relatos da época apontaram desempenho forte em 18 tarefas, mas os detalhes exatos desses resultados não puderam ser verificados de forma independente a partir das fontes consultadas. 4
A etapa atualmente mais clara é o WeLM-80B, modelo com 80 bilhões de parâmetros totais e cerca de 3 bilhões de parâmetros ativados por token. Segundo as informações divulgadas, ele foi treinado com menos de 14 trilhões de tokens e oferece recursos de raciocínio, compreensão multilíngue e uma janela de contexto de 128 mil tokens. 7
11
O WeLM-80B já foi associado ao Xiaowei para tarefas como conversas, buscas, chamadas de funções nativas do WeChat e abertura de serviços de miniaplicativos. 8
9
O próximo nível é o WeLM-617B. O modelo soma 617 bilhões de parâmetros, mas ativa aproximadamente 23 bilhões a cada token, também seguindo a lógica de uma arquitetura esparsa de Mixture of Experts — ou MoE, mistura de especialistas. Ele ainda é descrito como estando em desenvolvimento, portanto não deve ser tratado como um modelo já totalmente implantado no Xiaowei. 8
9
12
A intenção declarada é usar essa escala maior em tarefas mais complexas do ecossistema, como compreensão e raciocínio avançados, desenvolvimento inteligente de miniaplicativos e geração de ferramentas para o próprio Xiaowei. 8
9
12
Em um modelo MoE, um mecanismo de roteamento seleciona apenas alguns especialistas para processar cada token. Assim, o WeLM-80B mantém um conjunto de capacidade equivalente a 80 bilhões de parâmetros, mas realiza cada etapa de inferência por um caminho próximo de 3 bilhões de parâmetros ativos. O mesmo princípio vale para o WeLM-617B: os 617 bilhões não precisam ser executados integralmente a cada token.
Essa diferença é especialmente relevante para um assistente integrado a uma plataforma de uso frequente. Buscas rápidas, mensagens, navegação por serviços e chamadas de ferramentas podem parecer tarefas pequenas isoladamente, mas se tornam uma carga enorme quando são repetidas em escala de centenas de milhões ou bilhões de usuários. Menos parâmetros ativos por token podem melhorar a vazão, reduzir a latência e tornar o custo de atendimento mais administrável, preservando ao mesmo tempo uma reserva ampla de especialistas. 7
8
Há, porém, uma ressalva importante: dizer que o WeLM-80B ativa 3 bilhões de parâmetros não significa que ele tenha exatamente o mesmo custo de um modelo denso de 3 bilhões. Os pesos dos especialistas continuam exigindo memória, distribuição entre dispositivos, roteamento e comunicação entre máquinas. O ganho principal está na redução da quantidade de operações aritméticas realizadas por token — não em tornar a inferência gratuita.
O grupo também apresentou o Hidden Decoding, uma forma de ampliar a computação latente sem simplesmente tornar o Transformer mais profundo ou mais largo. O método expande cada token de entrada em vários fluxos internos, com embeddings independentes, e mantém os estados intermediários de chave e valor — o chamado KV cache — como parte do contexto. 1
Na prática, cada token recebe mais espaço para processamento dentro do modelo antes de gerar a saída visível. A técnica tenta aumentar a capacidade de raciocínio por token sem adicionar camadas ou aumentar a largura do tronco principal do Transformer.
Nos testes comparativos divulgados pela equipe, as versões WeLM-HD4-80B e WeLM-HD4-617B, com fator de expansão igual a quatro, superaram suas respectivas versões autorregressivas sem Hidden Decoding. 1
6 Isso não significa, por si só, que o método já esteja presente em toda a experiência do Xiaowei; os resultados descrevem modelos experimentais e uma direção de escalabilidade.
Expandir cada token para vários fluxos poderia elevar rapidamente o custo da atenção. Se todos os fluxos trocassem informação entre si em todas as camadas, o custo adicional tenderia a crescer de forma aproximadamente quadrática em relação ao número de fluxos.
O Stream-Factorized Attention contorna esse problema mantendo a maior parte da atenção dentro de cada fluxo e permitindo a mistura entre fluxos apenas em algumas camadas. Com isso, o custo adicional de atenção se aproxima mais de um crescimento linear do que de um crescimento quadrático. A equipe da Tencent afirma que essa escolha de engenharia é o que torna o Hidden Decoding treinável e utilizável em modelos MoE com mais de 100 bilhões de parâmetros.
A combinação entre MoE esparso e Hidden Decoding aponta para uma operação em camadas. Um modelo como o WeLM-80B poderia atender interações rotineiras e muito numerosas, enquanto uma versão mais capaz — ou com mais computação oculta — ficaria reservada para planejamento, seleção de ferramentas, geração de código e fluxos de várias etapas.
Se aspectos como permissões, identidade, pagamentos, APIs de miniaplicativos, consentimento do usuário e controles de confiabilidade forem bem resolvidos, o Xiaowei poderá converter uma intenção expressa em linguagem natural em uma sequência de ações dentro do WeChat: encontrar, decidir, acionar e concluir.
É essa possibilidade que diferencia a estratégia de simplesmente lançar mais um aplicativo de IA. O valor potencial não estaria apenas em responder perguntas, mas em operar sobre a infraestrutura que o usuário já acessa para conversar, buscar serviços e executar tarefas. Por enquanto, essa é uma inferência estratégica baseada nas capacidades e nos modelos divulgados — não uma confirmação de que todos esses recursos estarão disponíveis em uma versão pública ou universal do Xiaowei.
Studio Global AI
Esta página inclui uma resposta baseada na fonte que você pode continuar em Studio Global.
O Xiaowei está sendo testado em pequena escala dentro do WeChat e aceita comandos por texto ou voz, podendo acessar funções nativas e serviços de miniaplicativos.
O Xiaowei está sendo testado em pequena escala dentro do WeChat e aceita comandos por texto ou voz, podendo acessar funções nativas e serviços de miniaplicativos. O WeLM 80B tem 80 bilhões de parâmetros no total, mas ativa cerca de 3 bilhões por token; o modelo já foi associado ao funcionamento do Xiaowei.
O WeLM 617B, ainda em desenvolvimento, amplia a capacidade total para 617 bilhões de parâmetros, com cerca de 23 bilhões ativados por token.