Xiaowei är inte tänkt som ännu en fristående chattbot, utan som en inbyggd agent i WeChat som kan ta emot text och röst, kommunicera med kontakter och starta miniprogram. WeLM 80B har 80 miljarder parametrar totalt, men aktiverar ungefär 3 miljarder per token.
Research answer

Create a landscape editorial hero image for this Studio Global article: How has WeChat’s gray tested Xiaowei assistant evolved from a native text and voice based agent embedded in WeChat—distinct from standalone. Article summary: Xiaowei’s significance is less that it is another chatbot than that it is being positioned as an in context agent inside WeChat: users can invoke it by text or voice, communicate with contacts, and launch mini programs r. Topic tags: general web, llm, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts
Det mest intressanta med Xiaowei är inte att WeChat får ännu en chattbot. Poängen är att AI-assistenten byggs in i själva appen. I det begränsade testet kan användare kommunicera med Xiaowei via text eller röst, kontakta andra och starta miniprogram – utan att lämna WeChat för en separat AI-tjänst. 15
Det pekar mot en annan strategi än fristående appar som Yuanbao: AI ska fungera som ett gränssnitt till WeChats befintliga nätverk av människor, tjänster och miniprogram.
WeLM-familjens historia går tillbaka till en kinesisk språkmodell på 10 miljarder parametrar, som lanserades 2022 och enligt tidigare uppgifter presterade starkt i 18 uppgifter. De exakta benchmarkresultaten har dock inte kunnat verifieras självständigt i det material som ligger till grund för denna genomgång.
Det tydligaste aktuella steget är WeLM-80B. Modellen har totalt 80 miljarder parametrar, men är byggd som en gles Mixture-of-Experts-modell, eller MoE. Vid varje token aktiveras ungefär 3 miljarder parametrar. Den har tränats på färre än 14 biljoner tokens och uppges ha stöd för resonemang, flerspråkig förståelse och ett kontextfönster på 128 000 tokens. 7
11
WeLM-80B har rapporterats vara den modell som används för Xiaowei, bland annat för samtal, sökning, anrop av WeChat-funktioner och start av miniprogram. 8
9
Nästa nivå är WeLM-617B. Den har 617 miljarder parametrar totalt och omkring 23 miljarder aktiva parametrar per token. Modellen använder samma grundidé med gles MoE-beräkning, men beskrivs fortfarande som under utveckling och ska därför inte betraktas som en fullt driftsatt Xiaowei-modell. 8
9
12
Tanken är att WeLM-617B ska hantera mer krävande uppgifter i WeChat-ekosystemet. Det handlar bland annat om starkare generell språkförståelse och logiskt resonemang, intelligent utveckling av miniprogram och automatisk generering av verktyg för Xiaowei. 8
9
12
I en MoE-modell finns många så kallade expertnätverk, men en router väljer bara ut ett mindre antal för varje token. WeLM-80B kan därför ha en parameterbank på 80 miljarder parametrar, samtidigt som beräkningen för varje token ligger närmare en väg med 3 miljarder aktiva parametrar. På motsvarande sätt behöver WeLM-617B inte använda alla 617 miljarder parametrar vid varje steg.
Det är avgörande för en tjänst som ska hantera mycket stora mängder vardagliga förfrågningar: sökningar, meddelanden, navigering mellan tjänster och anrop av verktyg. Lägre aktiv beräkning kan förbättra genomströmning och svarstider samt minska kostnaden per förfrågan, samtidigt som modellen fortfarande har tillgång till en stor och specialiserad total kapacitet. 7
8
Det finns dock en viktig brasklapp. ”3 miljarder aktiva parametrar” betyder inte att en MoE-modell på 80 miljarder kostar exakt lika mycket att köra som en tät modell på 3 miljarder parametrar. Alla expertvikter måste fortfarande lagras och hanteras, vilket medför kostnader för minne, placering, routing och kommunikation mellan olika beräkningsenheter. Vinsten ligger främst i mindre aritmetisk beräkning per token – inte i att modellen blir gratis att köra.
WeLM-teamet undersöker också Hidden Decoding som ett sätt att skala modellens kapacitet. I stället för att göra Transformer-modellen djupare eller bredare expanderas varje inmatad token till flera interna strömmar, med separata embedding-tabeller. Mellanströmmarnas så kallade KV-tillstånd sparas och används som kontext.
På så sätt kan varje token få mer latent, intern beräkning utan att den huvudsakliga Transformer-ryggraden behöver byggas ut. 2
13 I jämförbara experiment uppger teamet att HD4-versionerna av både 80B- och 617B-modellerna presterade bättre än motsvarande modeller utan Hidden Decoding.
1
12
Utmaningen är att naivt införa flera strömmar skulle kunna göra uppmärksamhetsberäkningen ungefär kvadratisk i antalet strömmar. Stream-Factorized Attention är lösningen som föreslås här: de flesta lager arbetar främst inom varje enskild ström, medan bara ett fåtal lager blandar information mellan strömmarna. Den extra kostnaden kan därmed hållas närmare linjär än kvadratisk i förhållande till antalet strömmar. Tencent beskriver detta som en förutsättning för att Hidden Decoding ska kunna tränas och köras i MoE-modeller på över 100 miljarder parametrar. 5
Tillsammans pekar den glesa MoE-arkitekturen och Hidden Decoding mot en modell med flera kapacitetsnivåer. En effektiv WeLM-80B-A3B-liknande modell kan ta hand om rutinmässiga och frekventa interaktioner, medan större modeller eller mer intern beräkning reserveras för planering, verktygsval och arbetsflöden i flera steg.
Om behörigheter, identitet, betalningar, API:er för miniprogram, driftsäkerhet och användarens samtycke utformas på ett robust sätt, skulle Xiaowei kunna omvandla en instruktion på naturligt språk till en handling i WeChat: hitta, fatta beslut, starta och slutföra.
Det skulle göra AI till ett operativt lager ovanpå WeChats befintliga ekosystem – snarare än till ännu en fristående superapp som kräver att användarna byter miljö. Det är dock en strategisk slutsats utifrån den tekniska riktningen, inte en bekräftad produktplan.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Xiaowei är inte tänkt som ännu en fristående chattbot, utan som en inbyggd agent i WeChat som kan ta emot text och röst, kommunicera med kontakter och starta miniprogram.
Xiaowei är inte tänkt som ännu en fristående chattbot, utan som en inbyggd agent i WeChat som kan ta emot text och röst, kommunicera med kontakter och starta miniprogram. WeLM 80B har 80 miljarder parametrar totalt, men aktiverar ungefär 3 miljarder per token.
WeLM 617B har 617 miljarder parametrar totalt och cirka 23 miljarder aktiva per token, men beskrivs fortfarande som under utveckling.