يضم النموذج نحو 29 مليار معامل إجمالًا، لكنه يفعّل قرابة 4 مليارات لكل رمز؛ وهذا لا يعني أن تشغيله يتطلب تخزين 4 مليارات معامل فقط. يختار لكل رمز أربعة من 64 خبيرًا موجّهًا، إلى جانب خبير مشترك.
نشر بواسطةتم التحرير باستخدام GPT-6 Solتم إنشاء الصور باستخدام GPT Image 2
إجابة البحث

Create a landscape editorial hero image for this Studio Global article: What is China Telecom AI’s open-sourced Xing4.0-29B-A4B agentic Mixture-of-Experts model, and what are its parameter count, active experts,. Article summary: Xing4.0-29B-A4B is China Telecom AI’s open-weight Mixture-of-Experts language model for coding and other multi-step agent tasks. It has about 29 billion parameters in total, but activates about 4 billion for each token—n. Topic tags: general, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, click
إذا كنت تقيّم نموذجًا لتطوير مساعد برمجي يستطيع تنفيذ مهام على عدة خطوات واستدعاء الأدوات، فإن Xing4.0-29B-A4B من شركة تشاينا تيليكوم للذكاء الاصطناعي يستحق النظر. إنه نموذج لغوي مفتوح الأوزان يعتمد بنية «مزيج الخبراء» (MoE): يضم نحو 29 مليار معامل إجمالًا، لكنه يفعّل قرابة 4 مليارات معامل عند معالجة كل رمز. الرقم الثاني يصف مقدار ما يُفعَّل في الخطوة الواحدة، ولا يعني أن نشر النموذج يحتاج إلى تخزين 4 مليارات معامل فقط. 1
10
يضم النموذج 64 خبيرًا موجّهًا وخبيرًا مشتركًا. ولكل رمز، يختار أربعة من الخبراء الموجّهين، ويشارك الخبير المشترك أيضًا في المعالجة. أما نافذة السياق الأصلية فتبلغ 256 ألف رمز؛ وتصف المواد المنشورة إمكان تمديدها إلى 512 ألف رمز، لكن الرقم الأكبر ليس طول النافذة الأصلية. 1
2
يجمع التصميم بين الانتباه الكامن متعدد الرؤوس (MLA) لتقليل متطلبات ذاكرة الانتباه، والوصلات الفائقة المقيّدة بمنوع رياضي (mHC) للمساعدة في استقرار التدريب، والتنبؤ بعدة رموز (MTP) لدعم توليد الرموز المتعددة. 1
5
دُرّب النموذج على عتاد Huawei Ascend ضمن منظومة MindSpore. ويقول مطوّروه إن تحسين الاتصال بين خبراء MoE، وإعادة الحساب الانتقائية، ودمج عمليات الرسم البياني الحسابي، ومشغّلات مخصّصة بلغة Ascend C، رفعت إنتاجية التدريب بنحو 96% مقارنة بإعداد أساسي غير محسّن. هذه نسبة مُعلنة لتحسين نظام التدريب، وليست وعدًا بأن الاستدلال سيكون أسرع بنسبة 96% لدى المستخدم. 5
13
تتوفر الأوزان على Hugging Face باسم XingChen-AGI/Xing4.0-29B-A4B وبترخيص Apache 2.0. تعرض مواد النموذج طريقة استخدامه عبر Transformers وvLLM، وتشمل أدوات الاستدلال والنشر المدعومة بحسب المواد المنشورة SGLang وKTransformers. وللضبط الدقيق، ترد أداتا LLaMA-Factory وMindFormers، مع مواءمات مُعلنة لأطر الوكلاء OpenCode وClaude Code وOpenClaw وHermes. 12
13
8
تتضمن النتائج المنشورة 75.00 على اختبار SWE-bench Verified، و57.50 على Terminal-Bench 2.1، و93.52 في تقييم الوكلاء ضمن SuperCLUE. مصدر هذه الأرقام مواد النموذج والتغطية المرتبطة بإطلاقه؛ ولا ينبغي التعامل معها بوصفها نتائج أُعيد إنتاجها بصورة مستقلة. 6
19
8
وتقول تشاينا تيليكوم إن التكميم منخفض الدقة وتحسين الذاكرة قد يخفضان استخدام ذاكرة بطاقة الرسوميات إلى نحو 15 غيغابايت؛ وتربط تغطيات أخرى هذا الرقم بنسخة مكمّمة إلى 4 بت. إنه تقدير مُعلن لسيناريو نشر، لا ضمان بأن النموذج سيلائم كل بطاقة أو إعداد. عند تقييم إمكانية تشغيله محليًا، تهمّ طريقة التكميم، وإعدادات بيئة التشغيل، وطول السياق المستخدم. 6
8
Studio Global AI
تتضمن هذه الصفحة إجابة مدعومة بالمصدر يمكنك المتابعة داخل Studio Global.
يضم النموذج نحو 29 مليار معامل إجمالًا، لكنه يفعّل قرابة 4 مليارات لكل رمز؛ وهذا لا يعني أن تشغيله يتطلب تخزين 4 مليارات معامل فقط.
يضم النموذج نحو 29 مليار معامل إجمالًا، لكنه يفعّل قرابة 4 مليارات لكل رمز؛ وهذا لا يعني أن تشغيله يتطلب تخزين 4 مليارات معامل فقط. يختار لكل رمز أربعة من 64 خبيرًا موجّهًا، إلى جانب خبير مشترك. نافذة السياق الأصلية 256 ألف رمز، مع إمكانية تمديد مُعلنة إلى 512 ألفًا.
الأوزان متاحة على Hugging Face بترخيص Apache 2.0؛ أما نتائج الاختبارات واستهلاك ذاكرة الرسوميات المعلن، فلم يُتحقق منها بصورة مستقلة هنا.