Model ma około 29 mld parametrów, z czego na token aktywuje około 4 mld. Natywne okno kontekstowe wynosi 256 tys. Wagi są dostępne na Hugging Face na licencji Apache 2.0.
Opublikowane przezEdytowane za pomocą GPT-6 SolObrazy wygenerowane za pomocą GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is China Telecom AI’s open-sourced Xing4.0-29B-A4B agentic Mixture-of-Experts model, and what are its parameter count, active experts,. Article summary: Xing4.0-29B-A4B is China Telecom AI’s open-weight Mixture-of-Experts language model for coding and other multi-step agent tasks. It has about 29 billion parameters in total, but activates about 4 billion for each token—n. Topic tags: general, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, click
Xing4.0-29B-A4B to model językowy China Telecom AI z otwartymi wagami, przeznaczony m.in. do programowania i wieloetapowych zadań wykonywanych przez agentów AI. Wykorzystuje architekturę mixture of experts (MoE), czyli „mieszankę ekspertów”: ma około 29 mld parametrów łącznie, lecz podczas przetwarzania pojedynczego tokenu aktywuje około 4 mld. Nie oznacza to, że do uruchomienia wystarczy przechować w pamięci tylko 4 mld parametrów. 1
10
Model obejmuje 64 ekspertów wybieranych dynamicznie oraz jednego współdzielonego. Dla każdego tokenu wybieranych jest czterech ekspertów z pierwszej grupy; uczestniczy też ekspert współdzielony. Natywne okno kontekstowe wynosi 256 tys. tokenów. Możliwość rozszerzenia go do 512 tys. to osobna deklaracja, a nie wartość natywna. 1
2
Projekt łączy trzy rozwiązania: MLA (multi-head latent attention), które ma ograniczać zapotrzebowanie na pamięć podręczną mechanizmu uwagi; mHC (manifold-constrained hyper-connections), służące stabilizacji treningu; oraz MTP (multi-token prediction), związane z przewidywaniem wielu tokenów. 1
5
Do treningu wykorzystano układy Huawei Ascend i ekosystem MindSpore. Według twórców dostrojenie komunikacji między ekspertami MoE, selektywne ponowne obliczenia, łączenie operatorów oraz własne operatory Ascend C zwiększyły przepustowość treningu o około 96% względem konfiguracji bazowej. Nie jest to obietnica, że model będzie o 96% szybciej odpowiadał użytkownikom. 5
13
Wagi udostępniono na Hugging Face w repozytorium XingChen-AGI/Xing4.0-29B-A4B na licencji Apache 2.0. Materiały modelu pokazują użycie Transformers i vLLM; deklarowana obsługa uruchamiania obejmuje także SGLang i KTransformers. Do dostrajania wskazano LLaMA-Factory i MindFormers, a dostosowanie do pracy agentowej zgłoszono dla OpenCode, Claude Code, OpenClaw i Hermes. 12
13
8
Podawane wyniki to 75,00 w SWE-bench Verified, 57,50 w Terminal-Bench 2.1 i 93,52 w ocenie zdolności agentowych SuperCLUE. Pochodzą z materiałów o modelu i relacji z jego premiery; nie należy przedstawiać ich jako wyników niezależnie potwierdzonych testów. 6
19
8
China Telecom twierdzi również, że kwantyzacja do niskiej precyzji i optymalizacja pamięci mogą obniżyć zużycie pamięci GPU do około 15 GB. Inne doniesienia odnoszą tę wartość do wersji 4-bitowej. To deklaracja dotycząca określonego sposobu wdrożenia, nie gwarancja działania w każdej konfiguracji. Przy wyborze karty graficznej znaczenie mają m.in. wariant kwantyzacji, ustawienia środowiska uruchomieniowego i długość używanego kontekstu. 6
8
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Model ma około 29 mld parametrów, z czego na token aktywuje około 4 mld. Natywne okno kontekstowe wynosi 256 tys.
Model ma około 29 mld parametrów, z czego na token aktywuje około 4 mld. Natywne okno kontekstowe wynosi 256 tys. Wagi są dostępne na Hugging Face na licencji Apache 2.0. Wyniki testów i zużycie około 15 GB pamięci GPU to deklaracje, których nie należy traktować jako gwarancji dla każdego wdrożenia.