Xiaowei задуманий не як ще один окремий чат бот, а як вбудований у WeChat агент: він приймає текстові й голосові команди, працює з функціями месенджера та запускає мініпрограми. WeLM 80B уже пов’язують із тестовою версією Xiaowei.
Research answer

Create a landscape editorial hero image for this Studio Global article: How has WeChat’s gray tested Xiaowei assistant evolved from a native text and voice based agent embedded in WeChat—distinct from standalone. Article summary: Xiaowei’s significance is less that it is another chatbot than that it is being positioned as an in context agent inside WeChat: users can invoke it by text or voice, communicate with contacts, and launch mini programs r. Topic tags: general web, llm, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts
Значення Xiaowei полягає не в тому, що WeChat створює ще один сервіс для запитань і відповідей. Асистента позиціонують як агента, вбудованого безпосередньо в контекст WeChat: користувач може звернутися до нього текстом або голосом, спілкуватися з контактами, викликати базові функції месенджера та запускати мініпрограми, не переходячи до окремого AI-застосунку. 15
Саме цим Xiaowei відрізняється від автономних продуктів на кшталт Yuanbao. Потенційна стратегія Tencent полягає не у створенні ще одного «суперзастосунку», а в тому, щоб перетворити AI на природний інтерфейс до вже наявної мережі людей, сервісів і мініпрограм WeChat.
Історія WeLM почалася з китайської щільної моделі на 10 мільярдів параметрів, представленої у 2022 році. У матеріалах про неї йдеться про сильні результати на 18 завданнях, однак саме ці деталі бенчмарків не вдалося незалежно підтвердити серед отриманих джерел.
Наступний чітко заявлений етап — WeLM-80B. Це модель із загальним пулом у 80 мільярдів параметрів, але приблизно 3 мільярди з них активуються під час обробки кожного токена. Для неї також заявлено навчання на корпусі обсягом менш як 14 трильйонів токенів, здатності до міркування, багатомовного розуміння та контекстне вікно на 128K токенів. 7
11
За доступними повідомленнями, саме WeLM-80B уже розгорнули для Xiaowei. Модель має підтримувати діалог і пошук, викликати нативні функції WeChat та відкривати сервіси мініпрограм. 8
9
Наступна сходинка — WeLM-617B: 617 мільярдів параметрів загалом і близько 23 мільярдів активних на кожен токен. Водночас це важливе уточнення: модель поки описують як таку, що перебуває в розробці, а не як повністю розгорнуту версію Xiaowei. Її призначенням називають складніші завдання екосистеми WeChat — посилене загальне розуміння й логічне міркування, інтелектуальну розробку мініпрограм і автоматичне створення інструментів для Xiaowei. 8
9
12
WeLM-80B і WeLM-617B використовують логіку розрідженої архітектури суміші експертів — sparse Mixture of Experts, або MoE. У такій моделі маршрутизатор для кожного токена обирає лише невелику частину спеціалізованих експертних блоків.
Тому WeLM-80B може зберігати місткість моделі на рівні 80 мільярдів параметрів, але виконувати обчислення ближче до траєкторії приблизно з 3 мільярдами активних параметрів на токен. Аналогічно, WeLM-617B не повинна задіювати всі 617 мільярдів параметрів для кожного окремого кроку. 7
8
Для асистента, який має обробляти величезну кількість повсякденних запитів — пошук, повідомлення, навігацію сервісами та виклики інструментів, — це особливо важливо. Менша кількість активних обчислень може підвищити пропускну здатність, зменшити затримку відповіді та зробити обслуговування дешевшим, водночас зберігаючи доступ до широкого набору спеціалізованих можливостей.
Однак «3 мільярди активних параметрів» не означає, що така модель коштує рівно стільки ж, скільки щільна модель на 3 мільярди. Усі експертні ваги все одно потрібно зберігати й розміщувати в інфраструктурі, а маршрутизація та обмін даними між пристроями створюють додаткові витрати. Основний виграш полягає у зменшенні арифметичних операцій на кожен токен. Це робить високонавантажений inference реалістичнішим, але не безкоштовним.
Команда WeLM паралельно досліджує інший спосіб масштабування — Hidden Decoding. Замість того щоб просто робити Transformer глибшим або ширшим, метод розгортає один вхідний токен у кілька внутрішніх потоків із незалежними embedding-таблицями та зберігає проміжні KV-стани цих потоків як контекст.
У результаті модель може виконувати більше прихованих обчислень на один токен, який бачить користувач, не збільшуючи основний Transformer-бекбон. 2
13 У зіставних експериментах команда повідомила, що версії WeLM-HD4-80B і WeLM-HD4-617B перевершили відповідні базові моделі без Hidden Decoding.
1
12
Ідея нагадує перенесення частини міркування з видимого ланцюжка відповідей у внутрішній простір моделі. Для користувача це потенційно означає більш здатного агента без обов’язкового збільшення кількості тексту, який модель генерує назовні.
Якщо просто розмножити кожен токен на n потоків, взаємна увага між усіма потоками швидко стала б надто дорогою: її додаткова складність зростала б приблизно квадратично — як n².
Stream-Factorized Attention розв’язує цю проблему системно. Більшість шарів працює переважно всередині кожного потоку, а змішування інформації між потоками дозволяється лише в обмеженій кількості шарів. Завдяки цьому додаткові витрати на attention наближаються до лінійного зростання за n, а не до квадратичного.
Саме така оптимізація, за описом Tencent, робить Hidden Decoding придатним для навчання та обслуговування MoE-моделей масштабу понад 100 мільярдів параметрів. 1
У поєднанні sparse MoE та Hidden Decoding вимальовується багаторівнева модель роботи:
Це потенційно змінює саму роль AI в екосистемі. Замість того щоб просити користувача перейти до окремого AI-суперзастосунку, WeChat може зробити асистента командним шаром над чатами, мініпрограмами та іншими функціями платформи.
Втім, це стратегічний висновок, а не підтверджена дорожня карта продукту. Для такого сценарію потрібні надійні API мініпрограм, коректне керування дозволами, ідентифікацією та платежами, захист від помилкових дій, контроль доступу й чітка згода користувача. Якщо ці умови буде виконано, Xiaowei може стати не просто чат-ботом, а операційним шаром, через який люди взаємодіятимуть із повсякденною інфраструктурою WeChat.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Xiaowei задуманий не як ще один окремий чат бот, а як вбудований у WeChat агент: він приймає текстові й голосові команди, працює з функціями месенджера та запускає мініпрограми.
Xiaowei задуманий не як ще один окремий чат бот, а як вбудований у WeChat агент: він приймає текстові й голосові команди, працює з функціями месенджера та запускає мініпрограми. WeLM 80B уже пов’язують із тестовою версією Xiaowei. Модель має 80 мільярдів параметрів, але на кожен токен активує приблизно 3 мільярди; заявлені можливості включають міркування, багатомовне розуміння та контекст до...
WeLM 617B має 617 мільярдів параметрів і близько 23 мільярдів активних на токен, однак поки що перебуває в розробці та орієнтований на складніші завдання екосистеми WeChat.