Xiaowei ialah pembantu AI asli dalam WeChat yang boleh diakses melalui teks atau suara, berkomunikasi dengan kenalan dan melancarkan mini program tanpa memerlukan pengguna berpindah ke aplikasi AI berasingan. WeLM 80B mempunyai 80 bilion parameter keseluruhan tetapi hanya kira kira 3 bilion diaktifkan bagi setiap to...
Research answer

Create a landscape editorial hero image for this Studio Global article: How has WeChat’s gray tested Xiaowei assistant evolved from a native text and voice based agent embedded in WeChat—distinct from standalone. Article summary: Xiaowei’s significance is less that it is another chatbot than that it is being positioned as an in context agent inside WeChat: users can invoke it by text or voice, communicate with contacts, and launch mini programs r. Topic tags: general web, llm, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts
Jika pembantu AI biasa meminta pengguna meninggalkan aplikasi untuk mendapatkan jawapan atau menjalankan tugasan, Xiaowei mengambil pendekatan yang berbeza. Ia dibina terus ke dalam WeChat—dikenali sebagai Weixin di China—dan sedang diuji secara terhad kepada sebilangan pengguna.
Pengguna boleh berinteraksi dengannya melalui teks atau suara. Selain menjawab soalan dan membuat carian, Xiaowei dilaporkan boleh menggunakan fungsi asli WeChat, berkomunikasi dengan kenalan serta mengaktifkan pelbagai perkhidmatan mini-program. 15
Maksudnya, Xiaowei bukan sekadar satu lagi aplikasi chatbot yang bersaing dengan aplikasi kendiri seperti Yuanbao. Ia lebih menyerupai lapisan arahan di atas rangkaian sosial, perkhidmatan dan mini-program yang sudah wujud dalam WeChat.
Keluarga WeLM mempunyai sejarah yang lebih panjang daripada ujian Xiaowei semasa. Model WeLM berparameter 10 bilion yang diperkenalkan pada 2022 dilaporkan menunjukkan prestasi kukuh dalam 18 tugasan bahasa Cina. Namun, butiran penanda aras khusus itu tidak dapat disahkan secara bebas berdasarkan sumber yang diperoleh.
Perkembangan yang lebih jelas didedahkan baru-baru ini ialah WeLM-80B. Model ini mempunyai 80 bilion parameter keseluruhan, menggunakan pendekatan campuran pakar atau Mixture-of-Experts (MoE), dan mengaktifkan kira-kira 3 bilion parameter bagi setiap token. Ia dilatih menggunakan kurang daripada 14 trilion token serta dilaporkan menyokong penaakulan, pemahaman pelbagai bahasa dan konteks sepanjang 128K token. 7
11
WeLM-80B telah dilaporkan digunakan untuk menggerakkan Xiaowei dalam tugasan seperti perbualan, carian, panggilan fungsi asli WeChat dan pengaktifan perkhidmatan mini-program. 8
9
Model yang lebih besar, WeLM-617B, mempunyai 617 bilion parameter keseluruhan dan kira-kira 23 bilion parameter aktif bagi setiap token. Bagaimanapun, model ini masih dalam pembangunan dan tidak sepatutnya dianggap sebagai model Xiaowei yang telah digunakan secara menyeluruh. Sasaran awalnya ialah tugasan ekosistem WeChat yang lebih kompleks, termasuk pembangunan mini-program secara pintar dan penjanaan alat untuk Xiaowei. 8
9
12
Dalam model MoE, sistem penghala memilih sekumpulan kecil “pakar” yang paling sesuai untuk memproses setiap token. Oleh itu, WeLM-80B boleh memiliki kapasiti keseluruhan 80 bilion parameter, tetapi pengiraan bagi setiap token lebih hampir kepada laluan sekitar 3 bilion parameter aktif. Prinsip yang sama digunakan pada WeLM-617B: tidak kesemua 617 bilion parameter perlu digunakan untuk setiap token.
Reka bentuk ini penting bagi pembantu yang perlu mengendalikan permintaan ringkas tetapi sangat kerap—seperti membuat carian, menghantar mesej, mencari perkhidmatan atau memanggil alat—pada skala ratusan juta hingga bilion pengguna. Pengiraan aktif yang lebih rendah berpotensi meningkatkan kadar pemprosesan, mengurangkan kependaman dan menurunkan kos penyampaian model, sambil mengekalkan akses kepada kumpulan pakar yang lebih besar. 7
8
Namun, angka “3 bilion parameter aktif” tidak bermakna kos WeLM-80B sama tepat dengan model padat 3 bilion parameter. Kesemua berat model masih perlu disimpan dan diurus. Ini membawa kos dari segi memori, penempatan model, proses penghalaan serta komunikasi antara peranti. Kelebihan utamanya ialah pengurangan pengiraan aritmetik bagi setiap token—bukan menjadikan inferens percuma.
Pasukan WeLM turut mengkaji pendekatan Hidden Decoding, yang cuba meningkatkan keupayaan model tanpa sekadar menambah kedalaman atau kelebaran rangka utama Transformer.
Dalam kaedah ini, satu token input dikembangkan menjadi beberapa aliran dalaman. Setiap aliran mempunyai pembenaman tersendiri, manakala keadaan perantaraan dan cache kunci-nilai atau KV dikekalkan sebagai konteks. Hasilnya, satu token boleh menerima lebih banyak pengiraan tersembunyi sebelum model menghasilkan token seterusnya—tanpa perlu menambah lapisan Transformer atau menjadikan rangka utamanya lebih lebar. 2
13
Dalam eksperimen perbandingan yang menggunakan asas model sama, pasukan tersebut melaporkan bahawa versi HD4 bagi WeLM-80B dan WeLM-617B mengatasi garis dasar masing-masing tanpa Hidden Decoding. 1
12
Mengembangkan setiap token kepada n aliran secara naif akan menyebabkan kos perhatian rentas aliran meningkat kira-kira secara kuadratik mengikut n. Itu boleh menjadi terlalu mahal apabila digunakan pada model MoE berskala lebih 100 bilion parameter.
Stream-Factorized Attention menangani masalah ini dengan mengekalkan kebanyakan lapisan perhatian dalam aliran masing-masing, dan hanya membenarkan percampuran antara aliran pada beberapa lapisan terpilih. Menurut Tencent, pendekatan ini menjadikan Hidden Decoding lebih praktikal untuk dilatih dan disampaikan pada skala MoE 100B ke atas, dengan pertambahan kos perhatian yang lebih hampir kepada pertumbuhan linear. 5
Gabungan MoE yang jarang dan Hidden Decoding mencadangkan pendekatan berperingkat:
Jika kawalan kebenaran, identiti pengguna, pembayaran, API mini-program, kebolehpercayaan sistem dan persetujuan pengguna direka dengan baik, Xiaowei berpotensi menukar arahan bahasa biasa kepada tindakan dalam WeChat: mencari sesuatu, membuat keputusan, memanggil perkhidmatan dan melengkapkan tugasan.
Itulah perbezaan strategiknya. Tencent tidak semestinya perlu melancarkan satu lagi “super-app” AI dan meminta pengguna berpindah ke platform baharu. Sebaliknya, AI boleh menjadi antara muka kepada graf manusia, perkhidmatan dan mini-program yang sudah digunakan dalam WeChat. Walau bagaimanapun, gambaran ini ialah kesimpulan strategik berdasarkan arah teknologi yang didedahkan, bukannya pelan produk rasmi yang telah disahkan.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Xiaowei ialah pembantu AI asli dalam WeChat yang boleh diakses melalui teks atau suara, berkomunikasi dengan kenalan dan melancarkan mini program tanpa memerlukan pengguna berpindah ke aplikasi AI berasingan.
Xiaowei ialah pembantu AI asli dalam WeChat yang boleh diakses melalui teks atau suara, berkomunikasi dengan kenalan dan melancarkan mini program tanpa memerlukan pengguna berpindah ke aplikasi AI berasingan. WeLM 80B mempunyai 80 bilion parameter keseluruhan tetapi hanya kira kira 3 bilion diaktifkan bagi setiap token, dan telah dilaporkan digunakan untuk menggerakkan Xiaowei.
WeLM 617B yang masih dalam pembangunan meningkatkan skala kepada 617 bilion parameter keseluruhan, dengan kira kira 23 bilion parameter aktif bagi setiap token.