ZGCM-1-7B의 관전 포인트는 벤치마크 점수만이 아니다. 중국의 중관춘 아카데미와 중관춘 인공지능연구소 연구진이 공개한 이 모델은 수학 문제를 추론하고, 필요할 때 도구로 정보를 찾는 방식을 연구할 수 있도록 설계됐다. 최종 가중치와 함께 훈련 과정의 자료도 제공한다는 점에서 비교·검증을 위한 공개 기준 모델로 주목할 만하다.
2
4
하나의 모델로 두 가지 응답 방식
ZGCM-1-7B는 매개변수 73억 9,000만 개의 밀집형 디코더 전용 트랜스포머다. 명시된 문맥 길이는 256K 토큰이며, 답을 내기 전 추론 단계를 거치는 thinking 모드와 바로 답하는 직접 응답 모드를 모두 지원한다. 연구자는 모델을 바꾸지 않고 두 응답 방식의 차이를 살펴볼 수 있다.
2
4
구조적으로는 게이트가 적용된 슬라이딩 윈도 어텐션 층과 전체 어텐션 층을 번갈아 배치했다. 모델 소개 자료 한 곳은 각각 27개 층과 5개 층으로 설명한다. 연구진이 제시한 전체 어텐션 방식과의 비교에서는 KV 캐시 사용량이 6.4분의 1로 줄고, 256K 문맥에서 처리량이 3.94배 높아졌다. 이는 해당 비교 조건에서 측정한 결과이지, 어떤 장비에서나 같은 속도 향상을 보장한다는 뜻은 아니다.
4
10
공개된 것은 최종 가중치만이 아니다
공개된 훈련 방식은 사전학습, 긴 문맥을 단계적으로 다루는 중간 훈련, 일반 작업과 에이전트형 작업을 위한 지도 미세조정으로 이어진다. 안정적인 FP8 Muon 옵티마이저를 사용하고, 중간 훈련에서는 문맥을 16K·64K·256K 단계로 확장한다. 도구와 주고받은 상호작용 기록은 마르코프 결정 과정(MDP)의 상태 전이 형태로 재구성했다. 연구진이 보고한 중간 훈련 규모는 6,000억 토큰이다.
1
2
10
프로젝트는 데이터셋과 중간 체크포인트도 공개했다. 별도 보도에는 훈련 코드·설정과 로그의 공개도 소개돼 있다. 예컨대 ‘16K 데이터 단계’ 체크포인트에는 실제 훈련 문맥 길이와 그때까지의 누적 중간 훈련 토큰 수가 기록돼 있다. 이름에 붙은 16K를 해당 체크포인트의 실제 훈련 문맥 길이로 곧바로 해석해서는 안 된다. 이런 자료는 최종 모델만 배포한 경우보다 훈련 경로를 자세히 살펴보는 데 도움이 된다.
2
3
6
9
연구진은 데이터 선별과 컴퓨팅 클러스터 운영 등에 연구자가 지휘하는 AI 에이전트가 참여했다고 설명한다. 다만 이를 에이전트가 모델을 독자적으로 설계·검증했다거나, 성능 향상에 기여한 비율이 측정됐다는 의미로 받아들일 근거는 없다.
2
8
점수와 라이선스, 어떻게 읽어야 하나
공개된 평가 결과는 MATH-500 97.13%, AIME 2026 75.00%, 검색 관련 평가인 WebWalkerQA 63.09%, **BrowseComp 19.43%**다. 반면 공개 비교표에서 AIME 2024와 AIME 2025는 다른 비교 모델에 뒤졌다. 연구진은 또 AdamW/BF16 기준 방식보다 사전학습에서 같은 손실값에 도달하는 데 걸린 시간이 약 4.2분의 1이었다고 보고했다. 점수와 효율 수치는 각각의 평가 설정과 비교 기준에 묶여 있으므로, 모든 실제 검색 작업에서 동일한 성능을 뜻하지는 않는다.
7
10
라이선스는 자료별로 구분해야 한다. 모델 목록에는 MIT 라이선스가 표시돼 있다. 논문 페이지의 CC BY 4.0 표시는 논문에 관한 것으로, 이를 모델 라이선스로 혼동해서는 안 된다. 모델·데이터 등 실제 사용할 자료에 붙은 조건을 각각 확인하는 편이 안전하다.
2
7
1
직접 시험하려면 모델 목록에 나온 zgcagi/ZGCM-1-7B용 Transformers 텍스트 생성 예제를 참고할 수 있다. 이 예제는 trust_remote_code=True를 사용하므로 활성화 전에 저장소의 사용자 정의 코드를 검토해야 한다. 제공된 자료만으로는 최종 모델 실행에 필요한 최소 GPU·메모리 용량이나 필수 패키지 버전을 확정할 수 없다. 중간 체크포인트의 점검 환경을 최종 모델의 실행 요건으로 옮겨 적어서도 안 된다.
2
19