Xiaowei không chỉ là một chatbot khác: đây là trợ lý AI được nhúng trực tiếp trong WeChat, cho phép người dùng tương tác bằng văn bản hoặc giọng nói, liên lạc với bạn bè và mở mini program mà không cần rời ứng dụng. WeLM 80B có tổng cộng 80 tỷ tham số nhưng chỉ kích hoạt khoảng 3 tỷ tham số cho mỗi token; mô hình đã...
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: How has WeChat’s gray tested Xiaowei assistant evolved from a native text and voice based agent embedded in WeChat—distinct from standalone. Article summary: Xiaowei’s significance is less that it is another chatbot than that it is being positioned as an in context agent inside WeChat: users can invoke it by text or voice, communicate with contacts, and launch mini programs r. Topic tags: general web, llm, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts
Điểm đáng chú ý của Xiaowei không nằm ở việc WeChat có thêm một chatbot. Ý nghĩa lớn hơn là Tencent đang thử đặt AI vào ngay ngữ cảnh sử dụng quen thuộc của người dùng: bên trong ứng dụng nhắn tin, thanh toán và dịch vụ vốn đã có sẵn.
Xiaowei đang được thử nghiệm theo hình thức giới hạn trong WeChat. Người dùng được cấp quyền có thể tương tác bằng văn bản hoặc giọng nói, liên lạc với danh bạ và gọi các mini-program — những ứng dụng nhỏ chạy bên trong WeChat — thay vì phải chuyển sang một điểm đến AI riêng biệt. 15
17
19
Vì vậy, hướng đi này khác với việc tung ra một ứng dụng AI độc lập như Yuanbao. Về mặt chiến lược, Xiaowei có thể được xem như một giao diện ngôn ngữ tự nhiên cho mạng lưới con người, dịch vụ và mini-program mà WeChat đã xây dựng.
WeLM có nguồn gốc từ mô hình ngôn ngữ tiếng Trung 10 tỷ tham số được giới thiệu năm 2022. Một số tài liệu mô tả mô hình này có kết quả tích cực trên 18 tác vụ, nhưng các chi tiết benchmark cụ thể đó không thể được xác minh độc lập từ những nguồn hiện có. 4
Bước tiến được công bố rõ hơn hiện nay là WeLM-80B. Mô hình có tổng cộng 80 tỷ tham số, nhưng chỉ kích hoạt khoảng 3 tỷ tham số cho mỗi token. WeLM-80B được huấn luyện trên chưa đầy 14 nghìn tỷ token và được giới thiệu với các năng lực như suy luận, hiểu đa ngôn ngữ và hỗ trợ ngữ cảnh dài 128K token. 7
11
Theo các thông tin được công bố, WeLM-80B đã được triển khai cho trợ lý Xiaowei, hỗ trợ hội thoại và tìm kiếm, gọi các chức năng gốc của WeChat cũng như mở các dịch vụ mini-program. 8
9
12
WeLM-617B mở rộng quy mô lên 617 tỷ tham số, nhưng chỉ kích hoạt khoảng 23 tỷ tham số trong mỗi lần suy luận. Mô hình này cũng sử dụng kiến trúc Mixture-of-Experts, hay MoE — mô hình hỗn hợp chuyên gia — và hiện vẫn được mô tả là đang phát triển, chưa phải phiên bản Xiaowei đã được triển khai đại trà. 8
9
12
Mục tiêu của WeLM-617B là xử lý những nhiệm vụ khó hơn trong hệ sinh thái WeChat, chẳng hạn tăng cường khả năng hiểu và suy luận tổng quát, hỗ trợ phát triển mini-program thông minh và tự tạo công cụ cho Xiaowei. 8
9
14
Có thể hình dung hai cấp độ như sau:
Đây là cách phân tầng năng lực để cân bằng giữa tốc độ, chi phí và độ phức tạp của tác vụ; không nên hiểu rằng WeLM-617B đã được đưa vào vận hành đầy đủ trong Xiaowei.
Trong mô hình MoE, một bộ định tuyến sẽ chọn một nhóm nhỏ các “chuyên gia” để xử lý từng token, thay vì kích hoạt toàn bộ mạng lưới cho mọi bước. Nhờ vậy, WeLM-80B có thể sở hữu kho năng lực tương đương 80 tỷ tham số nhưng lượng tính toán trên mỗi token gần với nhánh khoảng 3 tỷ tham số. WeLM-617B cũng không cần thực thi toàn bộ 617 tỷ tham số trong từng lần phản hồi.
Điều này quan trọng khi trợ lý phải xử lý khối lượng lớn yêu cầu lặp đi lặp lại: tìm kiếm, gửi tin nhắn, tra cứu dịch vụ, mở mini-program hoặc thực hiện lệnh gọi công cụ. Số tham số được kích hoạt thấp hơn có thể giúp cải thiện thông lượng, độ trễ và chi phí phục vụ, đồng thời vẫn giữ lại một không gian tham số lớn để các chuyên gia đảm nhiệm những loại tác vụ khác nhau. 7
8
Tuy nhiên, “3 tỷ tham số được kích hoạt” không có nghĩa WeLM-80B tốn chi phí y hệt một mô hình đặc dày 3 tỷ tham số. Toàn bộ trọng số chuyên gia vẫn cần được lưu trữ, phân bổ lên thiết bị và điều phối. Hệ thống còn phải chịu chi phí định tuyến cũng như trao đổi dữ liệu giữa các thiết bị. Lợi ích chính của MoE thưa là giảm lượng phép tính trên từng token, khiến suy luận ở quy mô rất lớn khả thi hơn — chứ không phải miễn phí.
Bên cạnh MoE, nhóm WeLM đang nghiên cứu một hướng mở rộng khác mang tên Hidden Decoding.
Thay vì làm Transformer sâu hơn hoặc rộng hơn, phương pháp này mở rộng mỗi token đầu vào thành nhiều luồng tính toán nội bộ. Mỗi luồng có bảng embedding riêng, trong khi các trạng thái key-value trung gian được giữ lại làm ngữ cảnh. Nhờ đó, một token có thể nhận thêm năng lực tính toán trong không gian ẩn mà không cần phình to phần thân Transformer chính. 1
2
Trong các thí nghiệm đối sánh, nhóm nghiên cứu cho biết các phiên bản WeLM-HD4-80B và WeLM-HD4-617B đều cải thiện so với những mô hình nền tương ứng không dùng Hidden Decoding. 1
6
Ý tưởng này có một lợi thế đáng chú ý: mô hình có thể thực hiện nhiều tính toán tiềm ẩn hơn cho mỗi token được phát ra bên ngoài, thay vì buộc người dùng phải chờ một chuỗi suy luận dài được sinh tuần tự.
Nếu mỗi token được nhân thành (n) luồng và mọi luồng đều phải chú ý lẫn nhau ở mọi lớp, chi phí attention giữa các luồng sẽ tăng gần theo (n^2). Khi đó, Hidden Decoding sẽ trở nên quá đắt đỏ ở quy mô mô hình hàng trăm tỷ tham số.
Stream-Factorized Attention xử lý vấn đề bằng cách để phần lớn các lớp chỉ thực hiện attention bên trong từng luồng. Chỉ một số lớp được phép trộn thông tin giữa các luồng. Thiết kế này đưa phần chi phí bổ sung từ mức tăng gần bậc hai về gần tuyến tính theo số luồng, qua đó giúp Hidden Decoding có thể được huấn luyện và phục vụ ở quy mô MoE trên 100 tỷ tham số.
Nói đơn giản, Hidden Decoding tìm cách tăng lượng “tính toán ngầm”, còn Stream-Factorized Attention tìm cách ngăn chi phí kết nối giữa các luồng tăng quá nhanh.
Khi kết hợp MoE thưa với Hidden Decoding, WeChat có thể hướng tới một mô hình vận hành phân tầng:
Trong kịch bản đó, người dùng không cần biết dịch vụ mình đang dùng nằm trong mini-program nào, phải mở menu nào hay cần chuyển qua bao nhiêu màn hình. Họ chỉ cần nêu mục đích; Xiaowei sẽ tìm, lựa chọn, gọi đúng công cụ và hoàn tất tác vụ trong phạm vi quyền được cấp.
Đây là điểm khiến Xiaowei có thể trở thành một lớp điều khiển bằng AI cho WeChat, thay vì chỉ là một sản phẩm hỏi đáp. Nếu Tencent thiết kế tốt cơ chế cấp quyền, danh tính, thanh toán, sự đồng ý của người dùng, API mini-program và các lớp kiểm soát độ tin cậy, AI có thể được đặt lên trên toàn bộ bề mặt dịch vụ hiện hữu của WeChat.
Dù vậy, kết luận rằng Xiaowei chắc chắn sẽ trở thành “hệ điều hành AI” vẫn là một suy luận chiến lược, chưa phải lộ trình sản phẩm đã được Tencent xác nhận.
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
Xiaowei không chỉ là một chatbot khác: đây là trợ lý AI được nhúng trực tiếp trong WeChat, cho phép người dùng tương tác bằng văn bản hoặc giọng nói, liên lạc với bạn bè và mở mini program mà không cần rời ứng dụng.
Xiaowei không chỉ là một chatbot khác: đây là trợ lý AI được nhúng trực tiếp trong WeChat, cho phép người dùng tương tác bằng văn bản hoặc giọng nói, liên lạc với bạn bè và mở mini program mà không cần rời ứng dụng. WeLM 80B có tổng cộng 80 tỷ tham số nhưng chỉ kích hoạt khoảng 3 tỷ tham số cho mỗi token; mô hình đã được triển khai để hỗ trợ Xiaowei trò chuyện, tìm kiếm và gọi các chức năng của WeChat.
WeLM 617B có 617 tỷ tham số, trong đó khoảng 23 tỷ được kích hoạt mỗi lần suy luận, nhưng hiện vẫn đang trong quá trình phát triển và hướng tới các tác vụ phức tạp hơn như xây dựng mini program thông minh.