Xing4.0 29B A4B có khoảng 29 tỷ tham số tổng nhưng chỉ kích hoạt khoảng 4 tỷ tham số cho mỗi token; điều đó không có nghĩa chỉ cần lưu 4 tỷ tham số khi triển khai. Mô hình có 64 chuyên gia được định tuyến và một chuyên gia dùng chung, hỗ trợ ngữ cảnh gốc 256K token; trọng số được cung cấp trên Hugging Face theo giấy...
Đăng bởiBiên tập bằng GPT-6 SolHình ảnh được tạo bằng GPT Image 2
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: What is China Telecom AI’s open-sourced Xing4.0-29B-A4B agentic Mixture-of-Experts model, and what are its parameter count, active experts,. Article summary: Xing4.0-29B-A4B is China Telecom AI’s open-weight Mixture-of-Experts language model for coding and other multi-step agent tasks. It has about 29 billion parameters in total, but activates about 4 billion for each token—n. Topic tags: general, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, click
Điểm dễ gây nhầm lẫn nhất trong tên Xing4.0-29B-A4B là hai con số: mô hình ngôn ngữ dạng mixture-of-experts (MoE) của China Telecom AI có khoảng 29 tỷ tham số tổng, nhưng chỉ kích hoạt khoảng 4 tỷ tham số cho mỗi token. Mô hình được định hướng cho lập trình và các tác vụ AI phải thực hiện nhiều bước, chẳng hạn lập kế hoạch rồi gọi công cụ. Việc chỉ kích hoạt một phần tham số mỗi bước không có nghĩa hệ thống triển khai chỉ cần lưu 4 tỷ tham số. 1
10
MoE có thể hiểu là kiến trúc chia mô hình thành nhiều nhóm tham số, gọi là chuyên gia. Xing4.0-29B-A4B có 64 chuyên gia được định tuyến và một chuyên gia dùng chung. Với mỗi token, mô hình chọn bốn chuyên gia được định tuyến; chuyên gia dùng chung cũng tham gia xử lý. Cửa sổ ngữ cảnh gốc là 256K token, còn 512K là mức được mô tả là có thể mở rộng, không phải cấu hình gốc. 1
2
Thiết kế của mô hình kết hợp MLA (cơ chế chú ý đa đầu với biểu diễn tiềm ẩn), mHC (kết nối siêu cấp có ràng buộc manifold) và MTP (dự đoán nhiều token). Theo tài liệu được công bố, MLA nhằm giảm nhu cầu bộ nhớ đệm cho cơ chế chú ý, mHC hỗ trợ ổn định huấn luyện, còn MTP phục vụ việc dự đoán nhiều token. 1
5
Mô hình được huấn luyện bằng phần cứng Huawei Ascend trong hệ sinh thái MindSpore. Nhóm phát triển cho biết các tối ưu về truyền thông giữa chuyên gia MoE, tính toán lại có chọn lọc, hợp nhất toán tử và toán tử Ascend C tùy chỉnh đã giúp thông lượng huấn luyện tăng khoảng 96% so với cấu hình mặc định. Đây là số liệu về quá trình huấn luyện do bên phát triển báo cáo, không phải tuyên bố rằng người dùng sẽ suy luận nhanh hơn 96%. 5
13
Trọng số có trên Hugging Face tại XingChen-AGI/Xing4.0-29B-A4B, theo giấy phép Apache 2.0. Tài liệu mô hình có hướng dẫn dùng Transformers và vLLM; các tài liệu liên quan còn nêu hỗ trợ suy luận, triển khai với SGLang và KTransformers. Với tinh chỉnh mô hình, nhóm phát triển liệt kê LLaMA-Factory và MindFormers. Các bản điều chỉnh cho khung tác nhân AI được báo cáo gồm OpenCode, Claude Code, OpenClaw và Hermes. 12
13
8
Các kết quả được công bố gồm 75,00 điểm trên SWE-bench Verified, 57,50 trên Terminal-Bench 2.1 và 93,52 ở phần đánh giá tác nhân AI của SuperCLUE. Đây là số liệu từ tài liệu mô hình và các bài viết về đợt phát hành, không nên xem là kết quả đã được kiểm chứng độc lập. 6
19
8
China Telecom cũng cho biết lượng tử hóa độ chính xác thấp kết hợp tối ưu bộ nhớ có thể đưa mức dùng bộ nhớ đồ họa (VRAM) xuống khoảng 15 GB; một số bài viết gắn con số này với phiên bản 4-bit. Đó là tuyên bố về một cách triển khai, không phải mức VRAM bảo đảm trên mọi máy. Khi cân nhắc chạy mô hình tại chỗ, cần tính đến kiểu lượng tử hóa, cấu hình phần mềm suy luận và độ dài ngữ cảnh dự định sử dụng. 6
8
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
Xing4.0 29B A4B có khoảng 29 tỷ tham số tổng nhưng chỉ kích hoạt khoảng 4 tỷ tham số cho mỗi token; điều đó không có nghĩa chỉ cần lưu 4 tỷ tham số khi triển khai.
Xing4.0 29B A4B có khoảng 29 tỷ tham số tổng nhưng chỉ kích hoạt khoảng 4 tỷ tham số cho mỗi token; điều đó không có nghĩa chỉ cần lưu 4 tỷ tham số khi triển khai. Mô hình có 64 chuyên gia được định tuyến và một chuyên gia dùng chung, hỗ trợ ngữ cảnh gốc 256K token; trọng số được cung cấp trên Hugging Face theo giấy phép Apache 2.0.
Mức tăng thông lượng huấn luyện khoảng 96%, các điểm benchmark và mức dùng VRAM khoảng 15 GB đều là số liệu được công bố, không phải bảo đảm cho mọi cấu hình.