Xing4.0-29B-A4B는 차이나텔레콤 AI가 코딩과 다단계 에이전트 작업을 겨냥해 공개한 전문가 혼합(MoE) 언어 모델이다. 이름의 ‘29B’와 ‘A4B’는 각각 전체 매개변수 약 290억 개와 토큰을 처리할 때 활성화되는 매개변수 약 40억 개를 가리킨다. 40억 개만 활성화된다는 뜻이 모델의 전체 가중치 중 40억 개만 저장하면 된다는 뜻은 아니다.
1
10
전문가 구성과 문맥 길이
모델에는 입력에 따라 선택되는 경로 지정 전문가 64개와 공유 전문가 1개가 있다. 토큰마다 경로 지정 전문가 4개가 선택되고 공유 전문가도 처리에 참여한다. 기본 문맥 창은 **25만 6,000토큰(256K)**이다. 자료에 나온 **51만 2,000토큰(512K)**은 기본 지원 길이가 아니라 확장 가능하다는 설명이다.
1
2
Ascend에서 어떻게 학습했나
구조에는 다중 헤드 잠재 어텐션인 MLA, 매니폴드 제약 하이퍼커넥션인 mHC, 다중 토큰 예측인 MTP가 결합됐다. 공개된 설명에 따르면 MLA는 어텐션 캐시 부담을 줄이고, mHC는 학습 안정성을 높이는 데 쓰이며, MTP는 다중 토큰 생성과 관련된다.
1
5
학습에는 화웨이 Ascend 하드웨어와 MindSpore 생태계가 사용됐다. 개발사 자료는 MoE 통신 조정, 선택적 재계산, 그래프·연산자 융합, 자체 Ascend C 연산자 등을 적용해 기본 설정 대비 학습 처리량이 약 96% 증가했다고 밝힌다. 이는 학습 시스템에 관한 보고치다. 이용자의 추론 속도가 96% 빨라진다는 의미는 아니다.
5
13
가중치는 어디서 받고, 어떤 도구를 쓰나
가중치는 허깅페이스의 XingChen-AGI/Xing4.0-29B-A4B에서 Apache 2.0 라이선스로 제공된다. 모델 자료에는 Transformers와 vLLM 사용법이 나와 있다. 추론·배포 도구로는 SGLang과 KTransformers도 지원 대상으로 소개되며, 미세조정 도구로는 LLaMA-Factory와 MindFormers가 제시된다. OpenCode, Claude Code, OpenClaw, Hermes 같은 에이전트 프레임워크를 위한 적응 작업도 보고됐다.
12
13
8
점수와 ‘15GB’ 주장을 읽는 법
공개된 성능 수치는 SWE-bench Verified 75.00점, Terminal-Bench 2.1 57.50점, SuperCLUE 에이전트 평가 93.52점이다. 모델 자료와 출시 관련 보도에 나온 수치이며, 여기서 독립적으로 재현된 결과로 받아들여서는 안 된다.
6
19
8
차이나텔레콤은 저비트 양자화와 메모리 최적화를 적용하면 GPU 메모리 사용량을 약 15GB로 낮출 수 있다고 설명한다. 다른 보도는 이 수치를 4비트 양자화 버전에 적용한다. 모든 환경에서 15GB면 충분하다는 보장은 아니다. 실제 배포 가능 여부를 판단할 때는 양자화 방식, 실행 설정, 사용할 문맥 길이를 함께 확인해야 한다.
6
8