Il modello MoE ha circa 29 miliardi di parametri totali, ma ne attiva circa 4 miliardi per token: questo non significa che basti memorizzarne 4 miliardi. Seleziona quattro dei 64 esperti instradati, oltre a un esperto condiviso; la finestra di contesto nativa è di 256.000 token.
Pubblicato daModificato con GPT-6 SolImmagini generate con GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is China Telecom AI’s open-sourced Xing4.0-29B-A4B agentic Mixture-of-Experts model, and what are its parameter count, active experts,. Article summary: Xing4.0-29B-A4B is China Telecom AI’s open-weight Mixture-of-Experts language model for coding and other multi-step agent tasks. It has about 29 billion parameters in total, but activates about 4 billion for each token—n. Topic tags: general, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, click
Xing4.0-29B-A4B è un modello linguistico a pesi disponibili pubblicamente di China Telecom AI, pensato per la programmazione e per agenti software che svolgono compiti in più passaggi. Usa un’architettura Mixture-of-Experts (MoE): dei circa 29 miliardi di parametri complessivi, ne attiva circa 4 miliardi per ogni token elaborato. È una distinzione importante per capire il calcolo richiesto, ma non vuol dire che per installarlo sia sufficiente conservare soltanto 4 miliardi di parametri. 1
10
Il modello dispone di 64 esperti instradati e di un esperto condiviso. Per ogni token seleziona quattro esperti instradati, ai quali si aggiunge quello condiviso. La finestra di contesto nativa è di 256.000 token; i 512.000 token sono indicati come possibilità di estensione, non come dimensione nativa. 1
2
Il progetto combina multi-head latent attention (MLA), manifold-constrained hyper-connections (mHC) e multi-token prediction (MTP). Nella descrizione tecnica, MLA serve a ridurre le esigenze di memoria della cache dell’attenzione, mHC a favorire la stabilità dell’addestramento e MTP alla generazione di più token. 1
5
L’addestramento è avvenuto su hardware Huawei Ascend con l’ecosistema MindSpore. Secondo gli sviluppatori, interventi sulle comunicazioni tra esperti MoE, il ricalcolo selettivo, la fusione delle operazioni e operatori Ascend C dedicati hanno aumentato il throughput di addestramento di circa il 96% rispetto alla configurazione di base. Non è una misura di inferenza più veloce del 96% per chi usa il modello. 5
13
I pesi sono disponibili su Hugging Face come XingChen-AGI/Xing4.0-29B-A4B, con licenza Apache 2.0. La pagina del modello mostra esempi d’uso con Transformers e vLLM; la compatibilità dichiarata per l’inferenza comprende anche SGLang e KTransformers. Per il fine-tuning sono indicati LLaMA-Factory e MindFormers, mentre sono riportati adattamenti per i framework per agenti OpenCode, Claude Code, OpenClaw e Hermes. 12
13
8
Tra i risultati riportati figurano 75,00 su SWE-bench Verified, 57,50 su Terminal-Bench 2.1 e 93,52 nella valutazione degli agenti di SuperCLUE. Sono cifre presenti nei materiali sul modello e nella copertura della sua uscita: non vanno scambiate per risultati riprodotti in modo indipendente. 6
19
8
China Telecom dichiara inoltre che quantizzazione a bassa precisione e ottimizzazioni della memoria possono ridurre l’uso di memoria GPU a circa 15 GB; altre fonti associano questa cifra a una versione a 4 bit. È una stima per una configurazione di distribuzione, non la promessa che il modello entrerà nella memoria di qualsiasi GPU: contano la quantizzazione scelta, le impostazioni del software di inferenza e la lunghezza del contesto utilizzato. 6
8
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Il modello MoE ha circa 29 miliardi di parametri totali, ma ne attiva circa 4 miliardi per token: questo non significa che basti memorizzarne 4 miliardi.
Il modello MoE ha circa 29 miliardi di parametri totali, ma ne attiva circa 4 miliardi per token: questo non significa che basti memorizzarne 4 miliardi. Seleziona quattro dei 64 esperti instradati, oltre a un esperto condiviso; la finestra di contesto nativa è di 256.000 token.
Il guadagno del 96% riguarda la velocità di addestramento dichiarata dagli sviluppatori.