Xiaowei testes i begrænset skala som en indbygget WeChat assistent, der kan bruges med tekst eller stemme og udføre opgaver via WeChats funktioner og mini apps. WeLM 80B har 80 milliarder parametre, men aktiverer cirka 3 milliarder pr.
Research answer

Create a landscape editorial hero image for this Studio Global article: How has WeChat’s gray tested Xiaowei assistant evolved from a native text and voice based agent embedded in WeChat—distinct from standalone. Article summary: Xiaowei’s significance is less that it is another chatbot than that it is being positioned as an in context agent inside WeChat: users can invoke it by text or voice, communicate with contacts, and launch mini programs r. Topic tags: general web, llm, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts
Det mest interessante ved Xiaowei er ikke, at WeChat får endnu en chatbot. Det er, at Tencent placerer AI’en inde i den app, hvor brugerne allerede skriver med kontakter, finder information og bruger tjenester.
Xiaowei er i begrænset test og kan aktiveres med tekst eller stemme. Ifølge de tilgængelige oplysninger skal assistenten blandt andet kunne kommunikere med kontakter, bruge indbyggede WeChat-funktioner og åbne mini-apps – altså små tjenester, der kører inde i WeChat. 15
17
19
Det peger på en anden strategi end at lancere endnu en selvstændig AI-app som Yuanbao. I stedet forsøger WeChat at gøre naturligt sprog til en genvej ind i platformens eksisterende netværk af mennesker, tjenester og mini-apps.
WeLM-familien har rødder tilbage til en kinesisk sprogmodel på 10 milliarder parametre, som blev omtalt i 2022. Den blev rapporteret som stærk på 18 opgaver, men de præcise benchmarkresultater kan ikke uafhængigt bekræftes ud fra de kilder, der ligger til grund for denne gennemgang. 4
Det tydeligste nyere skridt er WeLM-80B. Modellen har i alt 80 milliarder parametre, men er bygget som en meget sparsom blanding-af-eksperter-model, eller sparse MoE. Ved hvert token aktiveres cirka 3 milliarder parametre. Modellen er ifølge WeLM-materialet trænet på færre end 14 billioner tokens og forbindes med evner inden for ræsonnement, flersproget forståelse og et kontekstvindue på 128K tokens. 7
11
WeLM-80B er rapporteret som den model, der driver Xiaoweis samtaler, søgninger, kald til WeChat-funktioner og åbning af mini-app-tjenester. 8
9
Den næste model i familien er WeLM-617B. Den rummer 617 milliarder parametre i alt og aktiverer omkring 23 milliarder ved hvert token. Den bruger samme grundidé: en stor samlet kapacitet, men kun en del af modellen arbejder på den enkelte beregning.
WeLM-617B er dog fortsat beskrevet som under udvikling og bør derfor ikke omtales som en fuldt implementeret Xiaowei-model. Planen er at bruge den til mere krævende opgaver i WeChat-økosystemet, blandt andet stærkere generel forståelse og logisk ræsonnement, intelligent udvikling af mini-apps og automatisk generering af værktøjer til Xiaowei. 8
9
12
I en MoE-model fungerer et router-system som en slags trafikleder. For hvert token vælger det kun et mindre antal specialiserede ekspertnetværk i stedet for at aktivere hele modellen.
Det betyder, at WeLM-80B kan have en samlet parameterpulje på 80 milliarder, men udføre beregninger, der i højere grad svarer til den aktive sti på cirka 3 milliarder parametre pr. token. Tilsvarende behøver WeLM-617B ikke bruge alle 617 milliarder parametre for hvert eneste token.
Det er vigtigt, hvis en assistent skal håndtere enorme mængder hverdagsforespørgsler: søgninger, beskeder, navigation i tjenester og kald til værktøjer. Den lavere aktive beregningsmængde kan forbedre gennemløb, svartid og driftsøkonomi, samtidig med at modellen stadig har adgang til en større pulje af specialiseret kapacitet. 7
8
Der er dog en vigtig nuance: 3 milliarder aktive parametre gør ikke en 80B-MoE-model lige så billig som en tæt, eller dense, 3B-model. Alle ekspertvægtene skal fortsat lagres og placeres på hardware, og routing samt kommunikation mellem enheder koster også ressourcer. Fordelen ligger især i mindre aritmetisk beregning pr. token – ikke i, at modellen bliver gratis at drive.
WeLM-teamet undersøger også en metode kaldet Hidden Decoding. I stedet for primært at gøre Transformer-modellen dybere eller bredere udvider metoden hvert input-token til flere interne strømme med separate embeddings. De mellemliggende strømme gemmes i modellens key-value-cache og kan bruges som kontekst under beregningen.
På den måde kan hvert token få mere latent, intern beregning, uden at hovedmodellens Transformer-rygrad nødvendigvis skal have flere lag eller større bredde. 2
13
I sammenlignelige forsøg rapporterer teamet, at HD4-versionerne af både 80B- og 617B-modellerne klarede sig bedre end deres tilsvarende modeller uden Hidden Decoding. 1
12
En naiv udvidelse af hvert token til n interne strømme kunne få opmærksomhedsberegningen til at vokse omtrent kvadratisk med n. Det ville hurtigt blive dyrt ved meget store modeller.
Derfor introducerer teamet Stream-Factorized Attention. De fleste lag arbejder primært inden for hver enkelt strøm, mens kun nogle få lag blander information på tværs af strømme. Ifølge Tencent bringer det den ekstra opmærksomhedsomkostning tættere på lineær vækst end kvadratisk vækst og gør Hidden Decoding mulig at træne og betjene ved MoE-modeller i 100B+-klassen. 5
Kombinationen af sparse MoE og Hidden Decoding peger mod en modelopdeling i flere niveauer:
Hvis tilladelser, brugerens samtykke, sikkerhed, betalingsfunktioner, API’er og fejlhåndtering bliver designet ordentligt, kan Xiaowei i princippet oversætte en almindelig besked til en hel kæde af handlinger: finde, vurdere, åbne og gennemføre.
Det er den strategiske forskel på Xiaowei og en traditionel selvstændig chatbot. Brugeren behøver ikke nødvendigvis forlade WeChat for at få et svar eller udføre en opgave. AI’en kan i stedet blive et naturligt betjeningslag oven på den platform, brugeren allerede befinder sig på.
Det sidste er dog en strategisk vurdering – ikke en bekræftet produktplan. Xiaowei er fortsat i test, og WeLM-617B er stadig under udvikling.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Xiaowei testes i begrænset skala som en indbygget WeChat assistent, der kan bruges med tekst eller stemme og udføre opgaver via WeChats funktioner og mini apps.
Xiaowei testes i begrænset skala som en indbygget WeChat assistent, der kan bruges med tekst eller stemme og udføre opgaver via WeChats funktioner og mini apps. WeLM 80B har 80 milliarder parametre, men aktiverer cirka 3 milliarder pr. token og er ifølge rapporterne allerede taget i brug i Xiaowei.
WeLM 617B har 617 milliarder parametre og cirka 23 milliarder aktive pr. token, men er fortsat under udvikling og er ikke bekræftet som fuldt udrullet i Xiaowei.