Xiaowei se testuje přímo ve WeChatu a přijímá textové i hlasové příkazy. Dokáže pracovat s funkcemi aplikace, komunikací a miniaplikacemi, takže uživatel nemusí přecházet do samostatné AI služby.
Research answer

Create a landscape editorial hero image for this Studio Global article: How has WeChat’s gray tested Xiaowei assistant evolved from a native text and voice based agent embedded in WeChat—distinct from standalone. Article summary: Xiaowei’s significance is less that it is another chatbot than that it is being positioned as an in context agent inside WeChat: users can invoke it by text or voice, communicate with contacts, and launch mini programs r. Topic tags: general web, llm, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts
Význam Xiaowei nespočívá jen v tom, že Tencent přidává do své aplikace dalšího konverzačního asistenta. Podstatnější je jeho umístění: Xiaowei vzniká přímo uvnitř WeChatu, nikoli jako samostatná aplikace typu Yuanbao. Uživatel s ním může komunikovat textem nebo hlasem, pracovat s kontakty, využívat nativní funkce WeChatu a spouštět miniaplikace – tedy drobné služby fungující přímo v platformě. 15
17
19
Strategie tak podle dostupných informací nesměřuje primárně k vytvoření dalšího AI cíle, kam by lidé chodili pouze klást otázky. Spíše jde o přirozené jazykové rozhraní k existující síti lidí, služeb a miniaplikací. Uživatel by například nemusel ručně procházet nabídky a služby, ale mohl by svůj záměr popsat běžnou větou a nechat Xiaowei provést další kroky.
Vývoj WeLM má podle dostupných materiálů delší historii. V roce 2022 se objevila čínská hustá varianta s 10 miliardami parametrů, která měla dosahovat silných výsledků v 18 úlohách. Přesné podrobnosti těchto historických benchmarků se však z dodaných zdrojů nepodařilo nezávisle ověřit.
Nejlépe doloženým současným krokem je WeLM-80B. Jde o model s celkovou kapacitou 80 miliard parametrů, přičemž při zpracování jednoho tokenu se aktivují přibližně 3 miliardy. Podle zveřejněných údajů byl trénován na méně než 14 bilionech tokenů a nabízí schopnosti v oblasti uvažování, vícejazyčného porozumění a práci s kontextem o délce 128K tokenů. 7
11
WeLM-80B byl podle zpráv nasazen jako model pohánějící Xiaowei. Asistent ho využívá pro konverzaci a vyhledávání, volání funkcí WeChatu i spouštění služeb miniaplikací. 8
9
Další úroveň představuje WeLM-617B. Ten má celkem 617 miliard parametrů, ale na jeden token aktivuje přibližně 23 miliard. Model je stále popisován jako rozpracovaný, nikoli jako plně nasazená verze Xiaowei. Jeho zamýšleným úkolem je posílit obecné porozumění a logické uvažování u složitějších úkolů v ekosystému WeChatu – například při inteligentním vývoji miniaplikací nebo automatickém vytváření nástrojů pro Xiaowei. 8
9
12
WeLM-80B i WeLM-617B využívají logiku řídké architektury Mixture of Experts, zkráceně MoE. Model se skládá z většího počtu specializovaných „expertů“ a směrovací mechanismus pro každý token vybere jen jejich část.
WeLM-80B tak může mít k dispozici kapacitu 80 miliard parametrů, ale při konkrétním kroku provádí výpočty přibližně na třímiliardové aktivní trase. U modelu WeLM-617B se podobný princip uplatňuje na 617 miliardách celkových parametrů a přibližně 23 miliardách aktivních parametrů na token. 7
8
To je důležité zejména u asistenta, který má obsluhovat velké množství častých požadavků: vyhledávání, zprávy, navigaci ke službám nebo volání nástrojů. Menší aktivní výpočetní část může zlepšit propustnost, zkrátit odezvu a snížit náklady na inference, aniž by se model musel vzdát široké zásoby specializovaných parametrů. 7
8
Je však důležité nepřekládat údaj „3 miliardy aktivních parametrů“ jako tvrzení, že provoz 80miliardového MoE modelu stojí přesně stejně jako provoz hustého 3miliardového modelu. Všechny expertní váhy je stále nutné uložit a obsluhovat. Zůstávají také náklady na umístění modelu, směrování a komunikaci mezi zařízeními. Hlavní úspora se týká především aritmetických výpočtů pro každý token. Díky tomu je inference ve vysokém provozu realističtější, nikoli bezplatná.
Tencentův tým zkoumá také metodu nazvanou Hidden Decoding. Ta nejde tradiční cestou, tedy prostým přidáním dalších vrstev nebo rozšířením hlavního Transformeru. Místo toho rozšíří jeden vstupní token do několika interních proudů, z nichž každý používá vlastní embeddingy, a mezistavy těchto proudů zachovává v kontextu prostřednictvím KV cache.
Výsledkem má být více latentních výpočtů na jeden navenek generovaný token, aniž by bylo nutné zvětšit hlavní páteř modelu. 2
13 V porovnávacích experimentech tým uvádí, že varianty WeLM-HD4-80B a WeLM-HD4-617B překonaly odpovídající modely bez Hidden Decoding.
1
12
Problémem by bylo, kdyby se každý token jednoduše násobil několika proudy a všechny proudy spolu v každé vrstvě plně komunikovaly. Náklady na vzájemnou pozornost by pak s počtem proudů rostly přibližně kvadraticky.
Stream-Factorized Attention proto ponechává většinu vrstev pracovat uvnitř jednotlivých proudů a směšování mezi proudy povoluje pouze v několika vrstvách. Dodatečné náklady na pozornost se tím podle popisu přibližují lineárnímu růstu namísto kvadratického. Tencent uvádí, že právě tento návrh pomáhá učit a provozovat Hidden Decoding u MoE modelů ve škále nad 100 miliard parametrů. 5
Kombinace sparse MoE a Hidden Decoding naznačuje víceúrovňový provozní model. Pro rutinní a velmi časté interakce může být vhodnější úspornější konfigurace třídy WeLM-80B-A3B. Náročnější plánování, výběr nástrojů a vícekrokové pracovní postupy by mohly využívat větší model nebo více interního výpočtu.
Pokud Tencent dobře nastaví oprávnění, identitu uživatele, platby, rozhraní miniaplikací, spolehlivost a souhlas s prováděním akcí, mohl by Xiaowei převádět přirozený jazyk do konkrétních kroků napříč existujícím WeChatem: najít, rozhodnout, spustit a dokončit.
Právě v tom spočívá rozdíl oproti samostatné AI superaplikaci. Xiaowei nemusí uživatele přesvědčovat, aby opustil prostředí, kde už komunikuje a využívá služby. Může se stát inteligentní vrstvou nad platformou, kterou už používá. To je ovšem strategický závěr vyplývající z dostupných informací, nikoli potvrzený produktový plán.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Xiaowei se testuje přímo ve WeChatu a přijímá textové i hlasové příkazy. Dokáže pracovat s funkcemi aplikace, komunikací a miniaplikacemi, takže uživatel nemusí přecházet do samostatné AI služby.
Xiaowei se testuje přímo ve WeChatu a přijímá textové i hlasové příkazy. Dokáže pracovat s funkcemi aplikace, komunikací a miniaplikacemi, takže uživatel nemusí přecházet do samostatné AI služby. WeLM 80B má celkem 80 miliard parametrů, ale při zpracování jednoho tokenu aktivuje přibližně 3 miliardy.
WeLM 617B má 617 miliard parametrů a zhruba 23 miliard aktivních parametrů na token.