Xiaowei ist als nativer Assistent direkt in WeChat eingebettet und per Text oder Sprache erreichbar. Das eingesetzte WeLM 80B verfügt über 80 Milliarden Gesamtparameter, aktiviert pro Token aber nur rund 3 Milliarden.
Forschungsantwort

Create a landscape editorial hero image for this Studio Global article: How has WeChat’s gray tested Xiaowei assistant evolved from a native text and voice based agent embedded in WeChat—distinct from standalone. Article summary: Xiaowei’s significance is less that it is another chatbot than that it is being positioned as an in context agent inside WeChat: users can invoke it by text or voice, communicate with contacts, and launch mini programs r. Topic tags: general web, llm, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts
Die wichtigste Entwicklung bei Xiaowei ist nicht die nächste Chatbot-Oberfläche, sondern der Ort, an dem der Assistent arbeitet: direkt innerhalb von WeChat. Nutzer können ihn per Text oder Sprache ansprechen, mit Kontakten interagieren, WeChat-Funktionen auslösen und Mini-Programme starten, ohne in eine separate KI-App wechseln zu müssen. 15
17
19
Damit verfolgt Tencent offenbar einen anderen Ansatz als bei einer eigenständigen Anwendung wie Yuanbao. Xiaowei soll nicht primär ein weiteres Ziel für Fragen und Antworten werden, sondern eine natürliche Bedienschicht über dem bestehenden WeChat-Netzwerk aus Personen, Diensten und Mini-Programmen. Diese strategische Einordnung ist eine Schlussfolgerung aus den bisher beschriebenen Funktionen – keine bestätigte Produkt-Roadmap.
Die Modellfamilie WeLM reicht zu einem 2022 vorgestellten chinesischen Modell mit 10 Milliarden Parametern zurück. Für dieses Modell wurde eine starke Leistung bei 18 Aufgaben berichtet; die konkreten Benchmark-Angaben lassen sich anhand der hier ausgewerteten Quellen allerdings nicht unabhängig überprüfen. 4
Der aktuelle, für Xiaowei relevante Schritt ist WeLM-80B. Das Modell besitzt insgesamt 80 Milliarden Parameter, aktiviert bei der Verarbeitung eines einzelnen Tokens aber nur ungefähr 3 Milliarden. Nach Angaben aus dem WeLM-Umfeld wurde es mit weniger als 14 Billionen Tokens trainiert und soll unter anderem Schlussfolgerungen, mehrsprachiges Verständnis sowie ein Kontextfenster von 128K Tokens unterstützen. 11
WeLM-80B wurde als Modell beschrieben, das Xiaowei für Dialoge und Suche, den Aufruf nativer WeChat-Funktionen sowie den Zugriff auf Mini-Programm-Dienste antreibt. 8
9
12 Für Nutzer bedeutet das im Idealfall: Nicht mehr durch Menüs suchen, sondern einfach formulieren, was erledigt werden soll.
Die zweite angekündigte Ausbaustufe heißt WeLM-617B. Sie umfasst 617 Milliarden Gesamtparameter und aktiviert pro Inferenzschritt rund 23 Milliarden Parameter. Das Modell nutzt ebenfalls eine Mixture-of-Experts-Architektur, ist aber weiterhin als in Entwicklung befindlich beschrieben und sollte deshalb nicht als vollständig in Xiaowei ausgerollt gelten. 8
9
12
Sein vorgesehenes Einsatzgebiet liegt bei anspruchsvolleren Aufgaben im WeChat-Ökosystem: stärkeres allgemeines Verständnis und logisches Schlussfolgern, die intelligente Entwicklung von Mini-Programmen sowie die automatische Erstellung von Werkzeugen für Xiaowei. 8
9
14
Die Aufteilung deutet auf ein abgestuftes Modellangebot hin: WeLM-80B für häufige, vergleichsweise standardisierte Interaktionen und ein leistungsfähigeres Modell für komplexe Planung, Code, Tool-Auswahl und mehrstufige Abläufe. Das größere Modell ist also nicht einfach nur eine größere Version für jede Anfrage.
Bei einem Sparse-MoE-Modell besteht die Parameterkapazität aus vielen spezialisierten „Experten“. Ein Router wählt für jedes Token nur einen kleinen Teil dieser Experten aus. WeLM-80B kann dadurch einen Parameterpool von 80 Milliarden vorhalten, während pro Token ungefähr der Rechenpfad von 3 Milliarden Parametern aktiv ist. Bei WeLM-617B werden nicht alle 617 Milliarden Parameter für jedes Token ausgeführt, sondern etwa 23 Milliarden. 7
8
Das ist für einen Dienst mit sehr vielen Nutzern besonders relevant. Einzelne Anfragen wie eine Suche, eine Nachricht, die Navigation zu einem Service oder ein Tool-Aufruf mögen jeweils wenig spektakulär sein. In großer Zahl erzeugen sie jedoch eine erhebliche Inferenzlast. Weniger aktive Parameter pro Token können den Durchsatz erhöhen, die Antwortzeiten stabilisieren und die Kosten des laufenden Betriebs begrenzen, während die gesamte Modellkapazität für unterschiedliche Aufgaben verfügbar bleibt. 7
8
Dabei ist „3 Milliarden aktiv“ nicht gleichbedeutend mit den Kosten eines dichten 3B-Modells. Die übrigen Expertengewichte müssen weiterhin gespeichert, verteilt und verwaltet werden. Außerdem entstehen Kosten durch Routing, die Platzierung der Experten und die Kommunikation zwischen verschiedenen Beschleunigern. Der wesentliche Vorteil liegt vor allem in weniger Rechenoperationen pro Token – nicht in einem kostenlosen Betrieb.
Mit Hidden Decoding untersucht das WeLM-Team eine weitere Möglichkeit, Modellleistung zu steigern. Statt den zentralen Transformer einfach tiefer oder breiter zu machen, wird jedes Eingabe-Token in mehrere interne Ströme aufgeteilt. Diese Ströme verwenden eigene Einbettungen; ihre Zwischenzustände und Key-Value-Caches bleiben als Kontext erhalten. So kann ein Token zusätzliche latente Berechnung durchlaufen, bevor daraus nach außen ein Token erzeugt wird. 2
Der Ansatz soll damit mehr interne Rechenschritte ermöglichen, ohne die Hauptarchitektur proportional zu vergrößern. In Vergleichsexperimenten berichtet das Team, dass sowohl WeLM-HD4-80B als auch WeLM-HD4-617B ihre jeweiligen Modelle ohne Hidden Decoding übertrafen. Beide Varianten arbeiteten mit einem Expansionsfaktor von vier; die aktivierten Transformer-Parameter pro Token blieben dabei unverändert. 1
3
Eine naive Umsetzung wäre teuer: Werden jedes Token und jeder interne Strom miteinander in Beziehung gesetzt, könnte der zusätzliche Aufwand mit der Zahl der Ströme ungefähr quadratisch wachsen. Genau hier setzt Stream-Factorized Attention an.
Die meisten Schichten rechnen überwiegend innerhalb des jeweiligen Stroms. Nur einige wenige Schichten erlauben eine Mischung zwischen den Strömen. Nach Darstellung des Teams sinkt der zusätzliche Aufmerksamkeitsaufwand dadurch von einer quadratischen Größenordnung näher an eine lineare Skalierung mit der Zahl der Ströme. Das soll Hidden Decoding auch bei MoE-Modellen mit mehr als 100 Milliarden Parametern trainier- und betreibbar machen. 5
Sparse MoE und Hidden Decoding ergänzen sich zu einem möglichen Betriebsmodell: Ein effizientes WeLM-80B-A3B ähnliches System übernimmt die alltäglichen, massenhaft auftretenden Interaktionen. Für schwierige Aufgaben könnten größere Modelle oder zusätzliche interne Rechenschritte zugeschaltet werden.
Der entscheidende Schritt wäre dann nicht die Ausgabe einer besonders langen Antwort, sondern die zuverlässige Ausführung einer Absicht: etwas finden, eine Entscheidung vorbereiten, den passenden Dienst aufrufen und den Vorgang abschließen. Xiaowei könnte so als Verbindung zwischen natürlicher Sprache und den bereits vorhandenen WeChat-Funktionen dienen.
Ob daraus tatsächlich eine solche Betriebsebene für WeChat wird, hängt allerdings nicht nur vom Modell ab. Berechtigungen, Identität, Zahlungen, Mini-Programm-Schnittstellen, Fehlertoleranz und die Zustimmung der Nutzer müssen ebenso zuverlässig funktionieren. Die bisher bekannten technischen Arbeiten zeigen vor allem, wie Tencent Kapazität und Rechenaufwand skalieren will. Sie bestätigen noch keine vollständige, öffentlich verfügbare Super-App-Strategie.
Studio Global AI
Diese Seite enthält eine quellengestützte Antwort, die Sie in Studio Global fortsetzen können.
Xiaowei ist als nativer Assistent direkt in WeChat eingebettet und per Text oder Sprache erreichbar.
Xiaowei ist als nativer Assistent direkt in WeChat eingebettet und per Text oder Sprache erreichbar. Das eingesetzte WeLM 80B verfügt über 80 Milliarden Gesamtparameter, aktiviert pro Token aber nur rund 3 Milliarden.
Die Sparse MoE Architektur reduziert vor allem den Rechenaufwand pro Token. Das kann Durchsatz, Latenz und Betriebskosten bei sehr vielen täglichen Anfragen verbessern – beseitigt aber nicht den Speicher und Kommunika...