Xiaowei को अलग चैटबॉट ऐप के बजाय WeChat के भीतर मौजूद AI एजेंट के रूप में सीमित स्तर पर टेस्ट किया जा रहा है। यूज़र टेक्स्ट या आवाज़ से इसे चला सकते हैं, संदेश भेज सकते हैं और मिनी प्रोग्राम्स शुरू कर सकते हैं। [15] WeLM 80B में कुल 8000 करोड़ पैरामीटर हैं, लेकिन हर टोकन पर लगभग 300 करोड़ पैरामीटर ही सक्रिय होते हैं...
शोध उत्तर

Create a landscape editorial hero image for this Studio Global article: How has WeChat’s gray tested Xiaowei assistant evolved from a native text and voice based agent embedded in WeChat—distinct from standalone. Article summary: Xiaowei’s significance is less that it is another chatbot than that it is being positioned as an in context agent inside WeChat: users can invoke it by text or voice, communicate with contacts, and launch mini programs r. Topic tags: general web, llm, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts
Xiaowei की असली अहमियत यह नहीं है कि WeChat ने एक और चैटबॉट बना दिया है। बड़ा बदलाव यह है कि AI को अलग ऐप के रूप में खोलने के बजाय सीधे WeChat के भीतर रखा जा रहा है। सीमित ‘ग्रे-स्केल’ टेस्ट में यूज़र इसे टेक्स्ट या आवाज़ से इस्तेमाल कर सकते हैं, संपर्कों से संवाद कर सकते हैं और मिनी-प्रोग्राम्स व दूसरी WeChat सेवाओं को शुरू कर सकते हैं। 15
इसका मतलब है कि Tencent का संभावित दांव किसी अलग AI सुपर-ऐप को Yuanbao की तरह खड़ा करना नहीं, बल्कि WeChat में पहले से मौजूद लोगों, सेवाओं और मिनी-प्रोग्राम्स के विशाल नेटवर्क के लिए AI को एक आसान इंटरफेस बनाना है।
WeLM परिवार की शुरुआती कड़ी 2022 में सामने आया 10 अरब पैरामीटर वाला चीनी भाषा मॉडल था। उपलब्ध संदर्भ इसे 18 कार्यों पर मजबूत प्रदर्शन करने वाला मॉडल बताते हैं, लेकिन उन सभी बेंचमार्क नतीजों का स्वतंत्र सत्यापन यहां उपलब्ध स्रोतों से नहीं हो सका। 4
अब WeLM का फोकस केवल सवालों के जवाब देने पर नहीं, बल्कि एजेंट, टूल-कॉलिंग और WeChat के भीतर काम पूरा कराने पर है। इसका व्यावहारिक रूप WeLM-80B में दिखता है।
WeLM-80B में कुल 80 अरब यानी 8000 करोड़ पैरामीटर हैं, लेकिन हर टोकन को प्रोसेस करते समय लगभग 3 अरब यानी 300 करोड़ पैरामीटर सक्रिय होते हैं। इसे Sparse Mixture-of-Experts (MoE) डिजाइन के रूप में समझा जा सकता है: मॉडल में कई ‘एक्सपर्ट’ नेटवर्क मौजूद रहते हैं, पर राउटर हर टोकन के लिए उनमें से केवल एक छोटे हिस्से को चुनता है।
रिपोर्टों के अनुसार, इस मॉडल को 14 ट्रिलियन से कम टोकन पर प्रशिक्षित किया गया है और इसमें reasoning, बहुभाषी समझ तथा 128K-कॉन्टेक्स्ट क्षमता बताई गई है। 7
11 WeLM-80B को Xiaowei के संवाद, खोज, WeChat के मूल फ़ंक्शन्स को कॉल करने और मिनी-प्रोग्राम सेवाओं को शुरू करने के लिए तैनात किए जाने की जानकारी दी गई है।
8
9
WeLM-617B कुल 617 अरब यानी 61,700 करोड़ पैरामीटर का मॉडल है। इसमें प्रत्येक टोकन पर लगभग 23 अरब यानी 2300 करोड़ पैरामीटर सक्रिय होने की बात कही गई है। यह भी Sparse MoE दृष्टिकोण अपनाता है, लेकिन इसे Xiaowei के पूरी तरह तैनात मॉडल के रूप में नहीं समझना चाहिए—उपलब्ध जानकारी के अनुसार यह अभी विकासाधीन है। 8
9
12
इसका लक्ष्य अधिक कठिन इकोसिस्टम कार्यों के लिए सामान्य समझ और तार्किक reasoning को मजबूत करना है। इनमें स्मार्ट मिनी-प्रोग्राम विकसित करना और Xiaowei के लिए सहायक टूल स्वतः तैयार करना शामिल हैं। 8
9
12
WeChat जैसे प्लेटफॉर्म पर AI का इस्तेमाल कभी-कभार होने वाले लंबे सवालों तक सीमित नहीं रहेगा। सहायक को खोज, संदेश, सेवा-नेविगेशन, कॉल और टूल-कॉल जैसे छोटे-छोटे अनुरोध लगातार संभालने पड़ सकते हैं। जब ऐसे अनुरोध बहुत बड़ी यूज़र संख्या से आते हैं, तब हर टोकन पर पूरा 80B या 617B मॉडल चलाना बेहद महंगा और संसाधन-गहन हो सकता है।
Sparse MoE में कुल पैरामीटर मॉडल की संभावित क्षमता और विशेषज्ञता का भंडार दिखाते हैं, जबकि सक्रिय पैरामीटर हर टोकन पर होने वाली मुख्य गणना का बेहतर संकेत देते हैं। इसलिए 80B मॉडल लगभग 3B सक्रिय पथ के आसपास की गणना करते हुए बड़े मॉडल-पूल की क्षमता तक पहुंच सकता है। इसी तरह, 617B मॉडल को हर टोकन पर उसके सभी 617B पैरामीटर चलाने की जरूरत नहीं होती। 7
8
इससे उच्च वॉल्यूम वाले इस्तेमाल में throughput बढ़ाने, latency घटाने और serving cost को नियंत्रित करने में मदद मिल सकती है। हालांकि, ‘3B active’ का अर्थ यह नहीं है कि 80B MoE मॉडल की कुल लागत बिल्कुल dense 3B मॉडल जितनी ही होगी। सभी एक्सपर्ट वेट्स को मेमोरी में रखना, उन्हें अलग-अलग डिवाइस पर बांटना, रूटिंग करना और डिवाइसों के बीच डेटा भेजना फिर भी महंगा हो सकता है। लाभ मुख्य रूप से हर टोकन पर होने वाली arithmetic computation में कमी का है—यह AI serving को अधिक व्यावहारिक बनाता है, मुफ्त नहीं।
WeLM टीम जिस दूसरी दिशा पर काम कर रही है, वह Hidden Decoding है। इसमें Transformer को और गहरा या चौड़ा करने के बजाय एक इनपुट टोकन को कई आंतरिक स्ट्रीम में फैलाया जाता है। हर स्ट्रीम की अपनी embedding होती है और मध्यवर्ती स्ट्रीमों के key-value states को आगे के संदर्भ के रूप में रखा जाता है। इस तरह बाहरी रूप से एक टोकन तैयार करते हुए मॉडल को भीतर अधिक गणना का अवसर मिलता है, बिना मुख्य Transformer backbone में नई परतें या अधिक चौड़ाई जोड़े।
टीम के मिलान किए गए प्रयोगों में HD4 रूपों—WeLM-HD4-80B और WeLM-HD4-617B—ने अपने संबंधित बिना-Hidden-Decoding बेसलाइन से बेहतर प्रदर्शन किया। 1
6
यदि हर टोकन को n स्ट्रीम में फैलाकर हर स्ट्रीम को हर दूसरी स्ट्रीम से पूरी तरह attention कराया जाए, तो cross-stream attention की लागत लगभग n² की दर से बढ़ सकती है। यही तरीका बड़े मॉडल पर बहुत महंगा पड़ता।
Stream-Factorized Attention अधिकांश परतों में attention को उसी स्ट्रीम के भीतर सीमित रखता है और केवल कुछ परतों में अलग-अलग स्ट्रीमों के बीच सूचना का आदान-प्रदान कराता है। इससे अतिरिक्त attention लागत n के साथ लगभग रैखिक रखने का लक्ष्य हासिल होता है। Tencent के तकनीकी विवरण के अनुसार, यही डिजाइन Hidden Decoding को 100B-प्लस MoE पैमाने पर train और serve करने योग्य बनाने में मदद करता है।
Sparse MoE और Hidden Decoding को साथ देखें तो एक स्तरित संचालन मॉडल की तस्वीर बनती है। रोज़मर्रा के, बार-बार होने वाले कामों के लिए अपेक्षाकृत दक्ष WeLM-80B-A3B जैसा रास्ता इस्तेमाल किया जा सकता है। अधिक जटिल planning, सही टूल चुनने और कई चरणों वाले workflow के लिए बड़े मॉडल या अतिरिक्त hidden computation का सहारा लिया जा सकता है।
अगर अनुमति-प्रणाली, पहचान, भुगतान, मिनी-प्रोग्राम API, विश्वसनीयता नियंत्रण और यूज़र की सहमति को ठीक तरह से डिजाइन किया जाए, तो Xiaowei प्राकृतिक भाषा में दिए निर्देशों को WeChat के मौजूदा ढांचे में कार्रवाई में बदल सकता है—मसलन, जानकारी ढूंढना, विकल्प तय करना, सही सेवा शुरू करना और काम पूरा करना।
यही इसे एक सामान्य चैटबॉट से अलग बनाता है: यूज़र को किसी नए AI ऐप में जाकर अपना डिजिटल संदर्भ दोबारा बनाने की जरूरत नहीं पड़ेगी। फिर भी यह एक रणनीतिक संभावना है, घोषित उत्पाद रोडमैप नहीं। Xiaowei अभी सीमित परीक्षण में है और WeLM-617B को भी उपलब्ध जानकारी में विकासाधीन बताया गया है।
Studio Global AI
इस पृष्ठ में एक स्रोत-समर्थित उत्तर शामिल है जिसे आप Studio Global के अंदर जारी रख सकते हैं।
Xiaowei को अलग चैटबॉट ऐप के बजाय WeChat के भीतर मौजूद AI एजेंट के रूप में सीमित स्तर पर टेस्ट किया जा रहा है। यूज़र टेक्स्ट या आवाज़ से इसे चला सकते हैं, संदेश भेज सकते हैं और मिनी प्रोग्राम्स शुरू कर सकते हैं। [15]
Xiaowei को अलग चैटबॉट ऐप के बजाय WeChat के भीतर मौजूद AI एजेंट के रूप में सीमित स्तर पर टेस्ट किया जा रहा है। यूज़र टेक्स्ट या आवाज़ से इसे चला सकते हैं, संदेश भेज सकते हैं और मिनी प्रोग्राम्स शुरू कर सकते हैं। [15] WeLM 80B में कुल 8000 करोड़ पैरामीटर हैं, लेकिन हर टोकन पर लगभग 300 करोड़ पैरामीटर ही सक्रिय होते हैं। यह मॉडल Xiaowei के संवाद, खोज और WeChat सेवाओं के इस्तेमाल को चला रहा है। [8][9]
WeLM 617B में कुल 61,700 करोड़ पैरामीटर और प्रति टोकन लगभग 2300 करोड़ सक्रिय पैरामीटर हैं। यह अभी विकासाधीन है और जटिल कामों, जैसे स्मार्ट मिनी प्रोग्राम विकास और Xiaowei के लिए टूल बनाने, पर केंद्रित है। [8][9][12]