Xiaowei wordt kleinschalig getest als native AI assistent in WeChat. Gebruikers kunnen via tekst of stem communiceren, contacten benaderen en mini programma’s starten zonder naar een losse AI app te gaan.
Research answer

Create a landscape editorial hero image for this Studio Global article: How has WeChat’s gray tested Xiaowei assistant evolved from a native text and voice based agent embedded in WeChat—distinct from standalone. Article summary: Xiaowei’s significance is less that it is another chatbot than that it is being positioned as an in context agent inside WeChat: users can invoke it by text or voice, communicate with contacts, and launch mini programs r. Topic tags: general web, llm, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts
Xiaowei is vooral interessant omdat het geen nieuwe chatbotbestemming naast WeChat wil zijn. De assistent wordt juist ín de app geplaatst: gebruikers kunnen hem via tekst of stem aanspreken, met contacten communiceren en mini-programma’s openen. 15 De strategische inzet lijkt daarmee eerder AI als bedieningslaag voor WeChats bestaande netwerk van mensen, diensten en mini-programma’s dan een rechtstreeks alternatief voor zelfstandige apps zoals Yuanbao.
De ontwikkeling bouwt voort op WeLM, het taalmodel dat WeChats AI-team al langer ontwikkelt. De in 2022 gepresenteerde Chinese WeLM-versie met 10 miljard parameters vormt de historische basis van die modelreeks. Er werd gemeld dat dit model sterk presteerde op 18 taken, maar die precieze benchmarkdetails konden op basis van de geraadpleegde bronnen niet onafhankelijk worden geverifieerd.
De huidige, voor Xiaowei relevante stap is WeLM-80B. Dit model heeft in totaal 80 miljard parameters, maar activeert per token ongeveer 3 miljard parameters. Volgens de beschikbare informatie is het getraind op minder dan 14 biljoen tokens en beschikt het over mogelijkheden voor redeneren, meertalige taalverwerking en een contextvenster van 128K tokens. 7
11
WeLM-80B zou Xiaowei aandrijven voor gesprekken en zoekopdrachten, maar ook voor het aanroepen van oorspronkelijke WeChat-functies en mini-programma’s. 8
9 Daarmee verschuift de rol van een taalmodel: het hoeft niet alleen een antwoord te formuleren, maar moet ook kunnen bepalen welke functie of dienst de gebruiker vervolgens nodig heeft.
De volgende modeltrap is WeLM-617B. Die versie bevat 617 miljard parameters en activeert er tijdens een inferentie ongeveer 23 miljard. Het model gebruikt eveneens een sparse Mixture-of-Experts-architectuur, maar wordt nog als ‘in ontwikkeling’ omschreven. Het is daarom niet correct om WeLM-617B te beschouwen als een volledig uitgerolde Xiaowei-versie. 8
9
12
De beoogde toepassing ligt bij zwaardere taken binnen het WeChat-ecosysteem. Daarbij worden onder meer intelligente ontwikkeling van mini-programma’s en het automatisch genereren van hulpmiddelen voor Xiaowei genoemd. 8
9
12 De gedachte is dus niet simpelweg: één zo groot mogelijk model voor elke vraag. Eenvoudige, veelvoorkomende interacties kunnen bij een efficiëntere variant blijven; complexere opdrachten zouden naar een krachtiger model of een intensievere redeneerroute kunnen gaan.
Bij een Mixture-of-Experts-model bestaat het totale parameterbestand uit meerdere gespecialiseerde ‘experts’. Een router selecteert per token slechts een kleine groep daarvan. WeLM-80B kan zo een capaciteitspool van 80 miljard parameters hebben, terwijl de berekening per token dichter bij een pad van ongeveer 3 miljard actieve parameters ligt. Bij WeLM-617B worden niet alle 617 miljard parameters voor elk token uitgevoerd.
Dat verschil is cruciaal voor een ingebouwde assistent die grote aantallen korte verzoeken moet verwerken: zoeken, een bericht opstellen, een contact benaderen, een dienst vinden of een mini-programma starten. Minder actieve berekening per token kan de doorvoer verhogen en de latentie en serverkosten verlagen, terwijl het model toegang houdt tot een veel grotere verzameling gespecialiseerde capaciteit. 7
8
Daarbij hoort wel een belangrijke nuance. ‘3 miljard actieve parameters’ betekent niet dat een model met 80 miljard parameters precies even goedkoop is als een dicht model met 3 miljard parameters. De volledige expertgewichten moeten nog altijd worden opgeslagen en verdeeld. Ook routering, geheugenbeheer en communicatie tussen chips brengen kosten met zich mee. De belangrijkste winst zit in de lagere rekenlast per token; het maakt grootschalige verwerking aannemelijker, maar niet gratis.
Het WeLM-team onderzoekt daarnaast Hidden Decoding als een andere manier om modelcapaciteit op te schalen. In plaats van de Transformer-basis simpelweg dieper of breder te maken, wordt elk invoertoken uitgebreid naar meerdere interne stromen. Die stromen gebruiken afzonderlijke embeddings en hun tussenliggende key-value-states blijven als context beschikbaar. Zo krijgt elk extern gegenereerd token meer latente berekening, zonder dat de hoofdarchitectuur met extra Transformerlagen of een grotere breedte moet worden uitgebreid. 2
13
In vergelijkende experimenten meldt het team dat de HD4-versies van zowel het 80B- als het 617B-model beter presteerden dan hun overeenkomstige modellen zonder Hidden Decoding. 1
12 Dat zijn resultaten uit de tests van het team en geen garantie dat elke Xiaowei-gebruiker deze modellen of verbeteringen al krijgt.
Zonder aanvullende optimalisatie zou het opsplitsen van elk token in bijvoorbeeld (n) stromen de aandachtberekening snel duur maken. Vooral informatie-uitwisseling tussen alle stromen kan ongeveer kwadratisch groeien met (n).
Stream-Factorized Attention beperkt daarom de meeste aandachtberekening tot afzonderlijke stromen. Slechts in een beperkt aantal lagen mogen de stromen onderling informatie uitwisselen. Volgens Tencent brengt dat de extra aandachtkosten dichter bij een lineaire groei en maakt het Hidden Decoding daardoor trainbaar en inzetbaar bij MoE-modellen van meer dan 100 miljard parameters. 5
Samen wijzen sparse MoE en Hidden Decoding op een mogelijk gelaagd bedrijfsmodel. Een efficiënte WeLM-80B-A3B-achtige route kan alledaagse, zeer frequente verzoeken afhandelen. Een krachtiger model of meer verborgen berekening kan worden ingezet voor plannen met meerdere stappen, complexere toolkeuze, codegeneratie en het bouwen van nieuwe mini-programma’s.
Als rechtenbeheer, identiteit, betalingen, API’s van mini-programma’s, betrouwbaarheid en toestemming van gebruikers goed worden geregeld, kan Xiaowei natuurlijke taal omzetten in handelingen binnen de bestaande WeChat-omgeving: vinden, beslissen, aanroepen en afronden. De gebruiker hoeft dan niet eerst naar een aparte AI-superapp over te stappen.
Dat laatste is een strategische gevolgtrekking, geen bevestigde productroute. De kern van de ontwikkeling is wel duidelijk: WeChat probeert AI niet alleen als gesprekspartner toe te voegen, maar als een interface waarmee gebruikers toegang krijgen tot de functies en diensten die al in het platform aanwezig zijn.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Xiaowei wordt kleinschalig getest als native AI assistent in WeChat. Gebruikers kunnen via tekst of stem communiceren, contacten benaderen en mini programma’s starten zonder naar een losse AI app te gaan.
Xiaowei wordt kleinschalig getest als native AI assistent in WeChat. Gebruikers kunnen via tekst of stem communiceren, contacten benaderen en mini programma’s starten zonder naar een losse AI app te gaan. De modelreeks loopt van het in 2022 gepresenteerde Chinese WeLM model met 10 miljard parameters naar WeLM 80B, waarvan per token ongeveer 3 miljard parameters actief zijn.
WeLM 617B telt 617 miljard parameters, maar activeert er per token ongeveer 23 miljard.