Xing4.0 29B A4B має близько 29 млрд параметрів загалом, але для кожного токена активує приблизно 4 млрд. Модель має контекстне вікно на 256 тис.
ОпублікувавВідредаговано за допомогою GPT-6 SolЗображення створено за допомогою GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is China Telecom AI’s open-sourced Xing4.0-29B-A4B agentic Mixture-of-Experts model, and what are its parameter count, active experts,. Article summary: Xing4.0-29B-A4B is China Telecom AI’s open-weight Mixture-of-Experts language model for coding and other multi-step agent tasks. It has about 29 billion parameters in total, but activates about 4 billion for each token—n. Topic tags: general, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, click
Xing4.0-29B-A4B — мовна модель із відкритими вагами від China Telecom AI, орієнтована на програмування та багатоетапні завдання для ШІ-агентів. Вона використовує архітектуру суміші експертів (MoE): із приблизно 29 млрд параметрів на кожному кроці обробки токена активуються близько 4 млрд. Це зменшує обсяг обчислень на крок, але не означає, що під час розгортання потрібно зберігати лише активні параметри. 1
10
У Xing4.0-29B-A4B є 64 експерти, між якими модель маршрутизує запити, та один спільний експерт. Для кожного токена вона обирає чотирьох із 64; спільний експерт також бере участь в обробці. Базове контекстне вікно становить 256 тис. токенів. Розробники описують можливість розширення до 512 тис., але це не базовий розмір вікна. 1
2
Архітектура поєднує MLA — механізм уваги, покликаний зменшити вимоги до кешу під час роботи з контекстом, mHC — підхід для стабілізації навчання, і MTP — передбачення кількох токенів. 1
5
Модель навчали на обладнанні Huawei Ascend із використанням екосистеми MindSpore. За даними розробників, налаштування обміну даними між експертами MoE, вибіркове повторне обчислення, об’єднання операцій та власні оператори Ascend C підвищили пропускну здатність навчання приблизно на 96% порівняно з базовою конфігурацією без цих оптимізацій. Це заявлений приріст під час навчання, а не обіцянка на 96% швидшої роботи моделі після запуску. 5
13
Ваги опубліковано на Hugging Face як XingChen-AGI/Xing4.0-29B-A4B за ліцензією Apache 2.0. У матеріалах моделі наведено приклади для Transformers і vLLM; також заявлено підтримку SGLang та KTransformers для запуску, LLaMA-Factory і MindFormers для донавчання, а також адаптації для агентних інструментів OpenCode, Claude Code, OpenClaw і Hermes. 12
13
8
Для моделі повідомляють результати 75,00 у SWE-bench Verified, 57,50 у Terminal-Bench 2.1 та 93,52 в агентному оцінюванні SuperCLUE. Ці числа походять із матеріалів про модель і висвітлення її випуску: їх не варто сприймати як незалежно відтворені результати. 6
19
8
China Telecom також заявляє, що низькобітне квантування та оптимізація пам’яті дають змогу знизити використання відеопам’яті приблизно до 15 ГБ; інші матеріали пов’язують цю цифру з 4-бітною версією. Це характеристика певного способу розгортання, а не гарантія для кожного комп’ютера. Перед локальним запуском слід врахувати формат квантування, налаштування середовища та бажану довжину контексту. 6
8
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Xing4.0 29B A4B має близько 29 млрд параметрів загалом, але для кожного токена активує приблизно 4 млрд.
Xing4.0 29B A4B має близько 29 млрд параметрів загалом, але для кожного токена активує приблизно 4 млрд. Модель має контекстне вікно на 256 тис. токенів, доступна на Hugging Face за ліцензією Apache 2.0; результати тестів і заяву про використання близько 15 ГБ відеопам’яті слід оцінювати з урахуванням умов запуску.