Xiaowei sedang menjalani uji abu abu terbatas di WeChat dan dapat digunakan lewat teks maupun suara untuk menjalankan fungsi WeChat serta memanggil mini program. WeLM 80B memiliki 80 miliar parameter, tetapi hanya sekitar 3 miliar yang diaktifkan untuk setiap token; model ini dilaporkan telah digunakan untuk menduku...
Jawaban penelitian

Create a landscape editorial hero image for this Studio Global article: How has WeChat’s gray tested Xiaowei assistant evolved from a native text and voice based agent embedded in WeChat—distinct from standalone. Article summary: Xiaowei’s significance is less that it is another chatbot than that it is being positioned as an in context agent inside WeChat: users can invoke it by text or voice, communicate with contacts, and launch mini programs r. Topic tags: general web, llm, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts
Tencent sedang menguji Xiaowei secara terbatas sebagai asisten AI native yang tertanam langsung di dalam WeChat. Pengguna dapat berinteraksi melalui teks atau suara, berkomunikasi dengan kontak, menjalankan fungsi bawaan WeChat, serta membuka layanan mini-program tanpa berpindah ke aplikasi AI mandiri. 15
17
19
Di sinilah letak perbedaan strategisnya dengan aplikasi standalone seperti Yuanbao. Xiaowei diposisikan bukan sebagai tujuan AI terpisah, melainkan sebagai antarmuka percakapan untuk mengakses jaringan orang, layanan, dan mini-program yang sudah ada di WeChat. Dengan kata lain, pengguna cukup menyampaikan maksud—mencari sesuatu, mengirim pesan, atau menggunakan sebuah layanan—lalu Xiaowei membantu menavigasi dan mengeksekusinya.
Keluarga WeLM berawal dari model bahasa Mandarin berukuran 10 miliar parameter yang diperkenalkan pada 2022. Model tersebut dilaporkan memiliki performa kuat pada 18 tugas, tetapi detail angka benchmark tersebut belum dapat diverifikasi secara independen dari sumber yang tersedia. 4
Perkembangan yang lebih jelas terlihat pada WeLM-80B. Model ini memiliki total 80 miliar parameter, dengan sekitar 3 miliar parameter yang aktif pada setiap token. WeLM-80B dilatih menggunakan kurang dari 14 triliun token dan dilaporkan memiliki kemampuan penalaran, pemahaman multibahasa, serta jendela konteks 128K. 7
11
Menurut laporan yang mengutip materi WeChat, WeLM-80B telah diterapkan untuk mendukung Xiaowei dalam percakapan dan pencarian, pemanggilan fungsi native WeChat, serta akses ke berbagai layanan mini-program. 8
9
12
WeLM-617B membawa skala model jauh lebih besar: 617 miliar parameter secara total, dengan sekitar 23 miliar parameter aktif untuk setiap token. Model ini menggunakan arsitektur sparse Mixture-of-Experts atau MoE, tetapi masih disebut berada dalam tahap pengembangan dan tidak boleh dianggap sebagai model Xiaowei yang sudah diterapkan sepenuhnya. 8
12
Targetnya juga berbeda. WeLM-617B diarahkan untuk kebutuhan ekosistem WeChat yang lebih rumit, seperti pemahaman umum dan penalaran yang lebih kuat, pengembangan mini-program secara cerdas, serta pembuatan alat bantu untuk Xiaowei. 8
9
12
Pemisahan ini menunjukkan kemungkinan pola bertingkat: WeLM-80B menangani interaksi yang sering terjadi dan relatif rutin, sementara model yang lebih besar disiapkan untuk perencanaan, pembuatan kode, pemilihan alat, dan alur kerja multi-langkah yang lebih kompleks. Namun, pembagian tersebut merupakan pembacaan strategis atas arah teknologinya, bukan roadmap produk yang telah dikonfirmasi.
Pada model MoE, sebuah router memilih sebagian kecil jaringan “ahli” untuk memproses setiap token. Karena itu, WeLM-80B dapat memiliki kumpulan kapasitas hingga 80 miliar parameter, tetapi komputasi aktifnya per token lebih dekat ke jalur sekitar 3 miliar parameter. Prinsip yang sama berlaku pada WeLM-617B: tidak semua 617 miliar parameter harus dijalankan untuk setiap token. 7
8
Hal ini penting untuk asisten yang harus menangani permintaan berfrekuensi tinggi—seperti pencarian, pesan, navigasi layanan, dan pemanggilan alat—dari basis pengguna yang sangat besar. Jumlah parameter aktif yang lebih rendah berpotensi meningkatkan throughput, mengurangi latensi, dan menekan biaya penyajian model, sembari tetap menyediakan kapasitas spesialisasi yang lebih luas di dalam kumpulan parameter tersebut.
Namun, “3 miliar parameter aktif” bukan berarti biaya WeLM-80B sama persis dengan model dense berukuran 3 miliar parameter. Bobot seluruh expert tetap perlu disimpan dan ditempatkan di infrastruktur. Sistem juga harus menanggung biaya memori, routing, penyeimbangan beban, dan komunikasi ant perangkat. Keuntungan utamanya adalah berkurangnya operasi aritmetika per token—bukan berarti inferensi menjadi gratis.
Selain sparse MoE, tim WeLM mengeksplorasi pendekatan bernama Hidden Decoding. Alih-alih sekadar membuat Transformer lebih dalam atau lebih lebar, metode ini mengembangkan setiap token masukan menjadi beberapa aliran internal dengan tabel embedding terpisah. Cache key-value dari aliran antara kemudian dipertahankan sebagai konteks. 2
Dengan mekanisme tersebut, satu token dapat memperoleh lebih banyak komputasi internal sebelum menghasilkan token keluaran berikutnya. Backbone Transformer utama tidak perlu ditambah lapisan atau diperlebar, sehingga kapasitas penalaran laten dapat ditingkatkan tanpa mengikuti seluruh biaya memori dan komputasi dari model yang lebih besar secara konvensional.
Dalam eksperimen yang membandingkan model secara berpasangan, tim melaporkan bahwa WeLM-HD4-80B dan WeLM-HD4-617B mengungguli baseline masing-masing yang tidak menggunakan Hidden Decoding pada benchmark yang sama. 1
6
Tantangan utamanya adalah biaya perhatian. Jika setiap token diperbanyak menjadi (n) aliran dan seluruh aliran saling memperhatikan di setiap lapisan, biaya interaksi lintas aliran dapat tumbuh mendekati kuadratik terhadap (n). Pada skala MoE di atas 100 miliar parameter, pendekatan naif seperti itu akan sulit dilatih dan disajikan kepada pengguna.
Stream-Factorized Attention mengatasi masalah ini dengan mempertahankan sebagian besar attention di dalam aliran masing-masing. Hanya sejumlah kecil lapisan yang mengizinkan pencampuran informasi antarialiran. Dengan demikian, biaya tambahan attention dapat ditekan agar lebih mendekati pertumbuhan linear, bukan kuadratik. Desain inilah yang disebut sebagai salah satu kunci agar Hidden Decoding tetap dapat dilatih dan disajikan pada skala MoE besar. 1
Jika digabungkan, sparse MoE dan Hidden Decoding mengarah pada visi yang lebih luas daripada sekadar chatbot dengan skor benchmark tinggi. WeChat dapat menggunakan model yang efisien untuk permintaan rutin, lalu mengalokasikan kapasitas model atau komputasi laten yang lebih besar untuk tugas yang membutuhkan penalaran dan perencanaan.
Dalam skenario ideal, pengguna tidak perlu mengetahui mini-program mana yang harus dibuka, menu apa yang harus dipilih, atau layanan mana yang menyediakan fungsi tertentu. Mereka cukup menyampaikan tujuan dalam bahasa alami. Xiaowei kemudian dapat membantu menjalankan rangkaian: menemukan, memutuskan, memanggil, lalu menyelesaikan.
Potensi tersebut bergantung pada hal-hal nonmodel yang sama pentingnya: izin pengguna, identitas, pembayaran, API mini-program, keandalan eksekusi, perlindungan data, dan mekanisme konfirmasi sebelum tindakan berisiko dilakukan. Jika lapisan-lapisan itu dirancang dengan baik, AI dapat menjadi cara baru untuk mengoperasikan ekosistem WeChat yang sudah ada—bukan alasan bagi pengguna untuk pindah ke aplikasi super-AI yang berdiri sendiri.
Untuk saat ini, Xiaowei masih berada dalam pengujian terbatas dan WeLM-617B masih dalam pengembangan. Jadi, gambaran WeChat sebagai sistem operasi berbasis AI merupakan arah teknologi dan inferensi strategis, bukan konfirmasi bahwa seluruh roadmap tersebut sudah diwujudkan. 12
15
Studio Global AI
Halaman ini berisi jawaban yang didukung sumber yang dapat Anda lanjutkan di dalam Studio Global.
Xiaowei sedang menjalani uji abu abu terbatas di WeChat dan dapat digunakan lewat teks maupun suara untuk menjalankan fungsi WeChat serta memanggil mini program.
Xiaowei sedang menjalani uji abu abu terbatas di WeChat dan dapat digunakan lewat teks maupun suara untuk menjalankan fungsi WeChat serta memanggil mini program. WeLM 80B memiliki 80 miliar parameter, tetapi hanya sekitar 3 miliar yang diaktifkan untuk setiap token; model ini dilaporkan telah digunakan untuk mendukung Xiaowei.
WeLM 617B memiliki 617 miliar parameter dengan sekitar 23 miliar parameter aktif per token, tetapi masih dalam tahap pengembangan untuk tugas ekosistem yang lebih kompleks.