China Telecom AI के इस ओपन वेट मॉडल में कुल करीब 29 अरब पैरामीटर हैं, लेकिन एक टोकन पर लगभग 4 अरब सक्रिय होते हैं। इसका मूल कॉन्टेक्स्ट विंडो 256K टोकन का है। हर टोकन के लिए 64 रूटेड एक्सपर्ट में से चार चुने जाते हैं; एक साझा एक्सपर्ट भी काम करता है। मॉडल के वेट Hugging Face पर Apache 2.0 लाइसेंस के तहत उपलब्ध हैं।...
प्रकाशितकर्ताGPT-6 Sol से संपादितGPT Image 2 से चित्र बनाए गए
शोध उत्तर

Create a landscape editorial hero image for this Studio Global article: What is China Telecom AI’s open-sourced Xing4.0-29B-A4B agentic Mixture-of-Experts model, and what are its parameter count, active experts,. Article summary: Xing4.0-29B-A4B is China Telecom AI’s open-weight Mixture-of-Experts language model for coding and other multi-step agent tasks. It has about 29 billion parameters in total, but activates about 4 billion for each token—n. Topic tags: general, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, click
Xing4.0-29B-A4B, China Telecom AI का ओपन-वेट Mixture-of-Experts (MoE) भाषा मॉडल है। इसे कोडिंग और ऐसे एजेंट कार्यों के लिए पेश किया गया है जिनमें कई चरणों में योजना बनानी या टूल इस्तेमाल करने हों। नाम का ‘29B-A4B’ हिस्सा अहम फर्क बताता है: मॉडल में कुल करीब 29 अरब पैरामीटर हैं, जबकि प्रत्येक टोकन पर लगभग 4 अरब सक्रिय होते हैं। इसका मतलब यह नहीं कि मॉडल चलाने के लिए केवल 4 अरब पैरामीटर ही स्टोर करने होंगे। 1
10
मॉडल में 64 रूटेड एक्सपर्ट और एक साझा एक्सपर्ट है। हर टोकन के लिए 64 में से चार रूटेड एक्सपर्ट चुने जाते हैं और साझा एक्सपर्ट भी भाग लेता है। इसका मूल कॉन्टेक्स्ट विंडो 256K टोकन है—यानी लगभग 2.56 लाख टोकन। इसे 512K टोकन तक बढ़ाने की बात कही गई है, लेकिन 512K इसकी मूल सीमा नहीं है। 1
2
मॉडल की बनावट में multi-head latent attention (MLA), manifold-constrained hyper-connections (mHC) और multi-token prediction (MTP) शामिल हैं। उपलब्ध विवरणों के अनुसार, MLA का उद्देश्य अटेंशन कैश की मांग घटाना, mHC का प्रशिक्षण को स्थिर रखने में मदद करना और MTP का कई टोकन के जनरेशन में उपयोग करना है। 1
5
प्रशिक्षण Huawei Ascend हार्डवेयर पर MindSpore इकोसिस्टम का इस्तेमाल करके किया गया। डेवलपरों के मुताबिक, MoE संचार में सुधार, चुनिंदा पुनर्गणना, ग्राफ-ऑपरेटर फ्यूजन और विशेष Ascend C ऑपरेटरों से तैयार-उपलब्ध आधारभूत सेटअप के मुकाबले प्रशिक्षण थ्रूपुट लगभग 96% बढ़ा। यह प्रशिक्षण प्रक्रिया का रिपोर्ट किया गया सुधार है; इससे उपयोगकर्ताओं को मॉडल चलाते समय 96% अधिक गति मिलने का निष्कर्ष नहीं निकलता। 5
13
मॉडल के वेट Hugging Face पर XingChen-AGI/Xing4.0-29B-A4B नाम से Apache 2.0 लाइसेंस के तहत उपलब्ध हैं। मॉडल सामग्री में Transformers और vLLM के इस्तेमाल के निर्देश हैं। इन्फरेंस और डिप्लॉयमेंट के लिए SGLang तथा KTransformers, और फाइन-ट्यूनिंग के लिए LLaMA-Factory तथा MindFormers का समर्थन भी बताया गया है। OpenCode, Claude Code, OpenClaw और Hermes जैसे एजेंट फ्रेमवर्क के लिए अनुकूलन की सूचना दी गई है। 12
13
8
रिपोर्ट किए गए स्कोर में SWE-bench Verified पर 75.00, Terminal-Bench 2.1 पर 57.50 और SuperCLUE के एजेंट मूल्यांकन में 93.52 शामिल हैं। ये आंकड़े मॉडल सामग्री और रिलीज़ की कवरेज से आते हैं; इन्हें स्वतंत्र रूप से दोहराए गए नतीजे नहीं मानना चाहिए। 6
19
8
China Telecom का कहना है कि कम-बिट क्वांटाइजेशन और मेमोरी ऑप्टिमाइजेशन से GPU मेमोरी का इस्तेमाल करीब 15 GB तक आ सकता है; दूसरी कवरेज इस आंकड़े को 4-बिट संस्करण से जोड़ती है। यह हर सेटअप के लिए गारंटी नहीं है। किसी खास GPU पर मॉडल चलेगा या नहीं, यह परखते समय क्वांटाइजेशन, रनटाइम सेटिंग और इस्तेमाल किए जाने वाले कॉन्टेक्स्ट की लंबाई भी देखनी होगी। 6
8
Studio Global AI
इस पृष्ठ में एक स्रोत-समर्थित उत्तर शामिल है जिसे आप Studio Global के अंदर जारी रख सकते हैं।
China Telecom AI के इस ओपन वेट मॉडल में कुल करीब 29 अरब पैरामीटर हैं, लेकिन एक टोकन पर लगभग 4 अरब सक्रिय होते हैं। इसका मूल कॉन्टेक्स्ट विंडो 256K टोकन का है।
China Telecom AI के इस ओपन वेट मॉडल में कुल करीब 29 अरब पैरामीटर हैं, लेकिन एक टोकन पर लगभग 4 अरब सक्रिय होते हैं। इसका मूल कॉन्टेक्स्ट विंडो 256K टोकन का है। हर टोकन के लिए 64 रूटेड एक्सपर्ट में से चार चुने जाते हैं; एक साझा एक्सपर्ट भी काम करता है। मॉडल के वेट Hugging Face पर Apache 2.0 लाइसेंस के तहत उपलब्ध हैं।
लगभग 96% बेहतर प्रशिक्षण थ्रूपुट और करीब 15 GB GPU मेमोरी के आंकड़े खास परिस्थितियों से जुड़े दावे हैं, हर उपयोगकर्ता के सेटअप में मिलने वाले परिणाम नहीं।