Xiaowei jest testowany jako natywny asystent wewnątrz WeChat, obsługiwany tekstem i głosem. Linia WeLM obejmuje wcześniejszy, gęsty model 10B z 2022 roku, wdrożony WeLM 80B z około 3 mld aktywnych parametrów na token oraz rozwijany WeLM 617B z około 23 mld aktywnych parametrów.
Research answer

Create a landscape editorial hero image for this Studio Global article: How has WeChat’s gray tested Xiaowei assistant evolved from a native text and voice based agent embedded in WeChat—distinct from standalone. Article summary: Xiaowei’s significance is less that it is another chatbot than that it is being positioned as an in context agent inside WeChat: users can invoke it by text or voice, communicate with contacts, and launch mini programs r. Topic tags: general web, llm, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts
Xiaowei — którego nazwa bywa zapisywana także jako Xiao Wei — jest testowany w ograniczonej skali jako natywny asystent wbudowany bezpośrednio w WeChat, czyli chińską wersję platformy znanej na rynkach międzynarodowych jako WeChat. Użytkownik może komunikować się z nim tekstem lub głosem. Asystent ma pomagać nie tylko w rozmowie i wyszukiwaniu informacji, ale także w obsłudze funkcji WeChat, komunikowaniu się ze znajomymi oraz uruchamianiu miniprogramów — lekkich aplikacji działających wewnątrz WeChat. 15
17
19
To zasadnicza różnica względem samodzielnych aplikacji AI, takich jak Yuanbao. Xiaowei nie musi być osobnym miejscem, do którego użytkownik przechodzi po poradę. Jego rolą ma być raczej naturalny interfejs do już istniejącej sieci ludzi, usług i miniprogramów WeChat. Innymi słowy: zamiast otwierać kolejne menu, użytkownik może wyrazić intencję, a asystent spróbuje przełożyć ją na działanie w ekosystemie aplikacji.
Rozwój WeLM sięga opublikowanego w 2022 roku chińskiego modelu o 10 mld parametrów. W materiałach dotyczących jego następcy wspomina się o dobrych wynikach na 18 zadaniach, jednak dokładnych szczegółów tego zestawienia nie udało się niezależnie potwierdzić na podstawie dostępnych źródeł. 4
Nowszym, ujawnionym etapem jest WeLM-80B. Model ma łącznie około 80 mld parametrów, ale przy przetwarzaniu pojedynczego tokena aktywuje około 3 mld z nich. Według opublikowanych informacji trenowano go na zbiorze obejmującym mniej niż 14 bln tokenów. Model ma obsługiwać m.in. rozumowanie, rozumienie wielu języków oraz kontekst o długości 128 tys. tokenów. 7
11
WeLM-80B został wskazany jako model napędzający Xiaowei. Ma odpowiadać za rozmowę i wyszukiwanie, wywoływanie podstawowych funkcji WeChat oraz korzystanie z usług miniprogramów. 8
9
Kolejny poziom stanowi WeLM-617B — model o 617 mld parametrów, z których przy jednym kroku obliczeń aktywnych ma być około 23 mld. Także on korzysta z architektury Mixture of Experts (MoE), czyli „mieszanki ekspertów”.
Ważne zastrzeżenie: WeLM-617B jest opisywany jako model w fazie rozwoju, a nie jako w pełni wdrożona wersja Xiaowei. Jego planowane zastosowania obejmują trudniejsze zadania w ekosystemie WeChat, takie jak inteligentne tworzenie miniprogramów oraz generowanie narzędzi współpracujących z Xiaowei. 8
9
12
Podział ról jest więc dość czytelny: WeLM-80B ma obsługiwać częste, codzienne interakcje, natomiast większy model ma być przeznaczony do bardziej złożonego rozumienia, wnioskowania, tworzenia kodu i wieloetapowych działań.
W gęstym modelu wszystkie główne parametry uczestniczą w przetwarzaniu każdego tokena. W modelu MoE działa router, który dla danego tokena wybiera tylko niewielką część wyspecjalizowanych sieci — tak zwanych ekspertów.
Dlatego WeLM-80B może oferować pulę o pojemności 80 mld parametrów, a jednocześnie wykonywać obliczenia bliższe ścieżce z około 3 mld aktywnych parametrów na token. W WeLM-617B podobna zasada oznacza 617 mld parametrów łącznie i około 23 mld aktywnych podczas pojedynczego kroku. 7
8
Ma to znaczenie przy asystencie działającym w aplikacji o bardzo dużej skali. Pojedyncze zadania — wyszukanie informacji, wysłanie wiadomości, przejście do usługi czy wywołanie miniprogramu — mogą być proste, ale ich liczba może być ogromna. Mniejsza liczba aktywnych parametrów może poprawiać przepustowość i opóźnienia oraz ograniczać koszt obsługi, a zarazem zachować dostęp do dużej puli wyspecjalizowanych ekspertów.
Nie oznacza to jednak, że model 80B jest dokładnie tak tani jak gęsty model 3B. Wszystkie wagi ekspertów nadal trzeba przechowywać i odpowiednio rozmieścić. Pozostają też koszty routingu, pamięci oraz komunikacji między urządzeniami. Korzyść dotyczy przede wszystkim mniejszej liczby operacji wykonywanych dla każdego tokena — a nie darmowego skalowania.
WeChat rozwija również metodę Hidden Decoding, która ma zwiększać ilość ukrytych obliczeń bez prostego dokładania kolejnych warstw lub poszerzania głównego modelu Transformer.
W uproszczeniu jeden token wejściowy jest rozwijany do kilku wewnętrznych strumieni. Każdy z nich korzysta z osobnych reprezentacji, a stany pośrednie — w tym informacje przechowywane w pamięci KV — pozostają dostępne jako kontekst dla dalszych obliczeń. Model może dzięki temu wykonać więcej pracy w przestrzeni ukrytej, zanim wygeneruje kolejny token widoczny dla użytkownika. 1
2
W opisanych eksperymentach warianty WeLM-HD4-80B i WeLM-HD4-617B, wykorzystujące cztery strumienie, poprawiły wyniki względem odpowiadających im bazowych modeli autoregresyjnych. 1
6
To podejście różni się od klasycznego zwiększania skali. Zamiast budować Transformer coraz głębszy lub szerszy, zespół próbuje zwiększyć „głębokość rozumowania” poprzez dodatkową pracę wykonywaną wewnątrz reprezentacji tokenów.
Na tym polega główne wyzwanie systemowe: jeśli każdy token zostanie zamieniony na n strumieni, naiwny mechanizm uwagi mógłby zwiększyć koszt interakcji między nimi w przybliżeniu kwadratowo względem n.
Stream-Factorized Attention ogranicza ten problem. Większość warstw analizuje informacje w obrębie własnego strumienia, a mieszanie danych między strumieniami odbywa się tylko w wybranych warstwach. Dzięki temu dodatkowy koszt uwagi rośnie bliżej liniowo niż kwadratowo wraz z liczbą strumieni. Według zespołu WeChat właśnie taki podział ma umożliwiać trenowanie i obsługiwanie Hidden Decoding przy skali modeli MoE przekraczającej 100 mld parametrów.
Połączenie rzadkiego MoE i Hidden Decoding sugeruje model działania oparty na kilku poziomach. W przypadku rutynowych, masowych interakcji można używać efektywnej ścieżki klasy WeLM-80B-A3B. Bardziej wymagające zadania — planowanie, wybór narzędzi, generowanie kodu czy wieloetapowa obsługa usługi — mogą trafiać do większego modelu albo otrzymywać więcej ukrytego czasu obliczeniowego.
Jeśli odpowiednio rozwiązane zostaną kwestie uprawnień, tożsamości użytkownika, płatności, dostępu do API miniprogramów, niezawodności i zgody na wykonywanie działań, Xiaowei może stać się warstwą operacyjną nad istniejącym WeChat. Użytkownik nie musiałby wtedy myśleć o tym, który miniprogram otworzyć ani gdzie znajduje się konkretna funkcja. Wystarczyłoby przejść przez kolejne etapy: znajdź, zdecyduj, uruchom, zakończ.
To jednak wciąż wniosek strategiczny, a nie potwierdzona mapa drogowa produktu. Na obecnym etapie wiadomo przede wszystkim, że Xiaowei jest ograniczenie testowany, WeLM-80B został powiązany z jego działaniem, a WeLM-617B pozostaje w fazie rozwoju. 8
9
12
15
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Xiaowei jest testowany jako natywny asystent wewnątrz WeChat, obsługiwany tekstem i głosem.
Xiaowei jest testowany jako natywny asystent wewnątrz WeChat, obsługiwany tekstem i głosem. Linia WeLM obejmuje wcześniejszy, gęsty model 10B z 2022 roku, wdrożony WeLM 80B z około 3 mld aktywnych parametrów na token oraz rozwijany WeLM 617B z około 23 mld aktywnych parametrów.
Rzadka architektura MoE pozwala przechowywać dużą pulę wyspecjalizowanych parametrów, a przy każdym tokenie uruchamiać tylko ich część.