2026년 8월 26일, 지푸 AI(Zhipu AI·Z.ai)는 개발자 플랫폼에서 정체를 숨긴 채 화제를 모은 익명 모델 **‘Ox Alpha’**가 자사의 GLM-5.3-Flash였다고 공개했다. 중국어권 커뮤니티에서 ‘뉴라이(牛来)’라는 이름으로 불린 이 모델은 정식 발표 전 익명으로 실사용 테스트를 거친 오픈 웨이트 기반의 네이티브 멀티모달 혼합 전문가(MoE) 모델이다.
1
4
6
5일 만에 50조 토큰…익명 테스트가 만든 이례적 사용량
Ox Alpha는 OpenRouter와 OpenCode에서 회사 로고나 공식 발표 없이 무료에 가깝게 제공됐다. 그 결과 사용량은 공개 시점 기준 5일 만에 50조 토큰을 넘어섰다는 보도가 나왔고, 이후 집계에서는 6일 동안 60조 토큰 이상을 처리한 것으로 전해졌다. 두 플랫폼의 사용량 순위에서도 선두에 올랐으며, 한때 비교 대상인 딥시크 계열 모델의 사용량을 두 배 이상 웃돌았다는 보도도 있었다.
3
이는 단순히 모델 성능만으로 설명하기 어려운 규모다. 낮은 가격, 익명성, 개발자 플랫폼에 바로 연결할 수 있는 접근성이 동시에 작용하면서 전 세계 개발자들이 실제 추론 작업에 모델을 대거 투입한 것으로 해석할 수 있다. 다만 각 플랫폼의 집계 기준과 비교 기간이 완전히 동일한지는 제공된 자료만으로 확인하기 어렵다.
중국산 칩 10만 개 이상으로 서비스를 운영했다는 주장
지푸 AI는 익명 테스트 기간의 서비스가 10만 개가 넘는 중국산 AI 칩으로 구성된 클러스터에서 전부 운영됐다고 밝혔다. 또한 소프트웨어 최적화를 거친 뒤 하드웨어 효율과 토큰당 비용이 주류 엔비디아 GPU와 비교 가능한 수준에 도달했다고 주장했다.
3
6
다만 칩 제조사와 모델명은 공식적으로 공개되지 않았다. 화웨이, 무어 스레드, 하이곤 등이 공급사일 가능성이 있다는 보도가 있었지만, 이는 확인되지 않은 추정이며 지푸 AI의 공식 확인으로 볼 수 없다.
40
이 발표가 의미하는 바를 ‘중국이 엔비디아 하드웨어 전반을 따라잡았다’고 확대 해석해서는 안 된다. 또한 중국산 칩을 사용하는 모든 AI 서비스의 추론 비용이 엔비디아 GPU와 같다는 뜻도 아니다. 이번 사례가 보여주는 것은 대규모 글로벌 추론 작업을 비(非)엔비디아 기반의 중국산 하드웨어 스택에서도 수행할 수 있다는 점, 그리고 이를 위해 상당한 시스템 엔지니어링이 필요하다는 점이다.
3
6
CUDA 의존도를 낮출 수 있다는 신호
이번 실험은 엔비디아의 CUDA 생태계가 가진 강점을 없애지는 않는다. CUDA는 여전히 폭넓은 개발자 기반과 도구, 라이브러리, 학습용 생태계를 갖고 있다. 그러나 특정 모델과 실제 운영 환경에서는 모델에 맞춘 소프트웨어 스택과 추론 엔진이 CUDA 의존도를 일부 줄일 수 있다는 가능성을 보여준다.
지푸 AI가 사용한 것으로 알려진 엔진은 SGLang을 기반으로 하며, 다음과 같은 최적화 기법을 적용했다.
- W8A8 양자화
- INT8·FP8·BF16을 혼합한 캐시 양자화
- 노드 내부 텐서 병렬화
- Encode–Prefill–Decode(EPD) 분리 구조
- 긴 컨텍스트 환경을 고려한 메모리·통신·스케줄링 최적화
이 구조는 최대 100만 토큰에 이르는 컨텍스트에서 메모리 용량과 대역폭, 칩 간 통신 부담을 관리하기 위한 것이다. 지푸 AI는 이러한 변경을 통해 초기 기준선과 비교해 종단 간 서비스 성능이 약 3배 향상됐다고 밝힌 것으로 전해졌다.
4
7
SGLang의 후속 문서에도 FP8 캐시 구성이 BF16 비교 구성보다 높은 처리량과 더 큰 캐시 용량을 보였다는 수치가 제시돼 있다. 다만 이 문서는 지푸 AI가 주장한 ‘3배 향상’을 독립적으로 검증한 감사 보고서는 아니다.
2
GLM-5.3-Flash의 사양과 성능 포지셔닝
GLM-5.3-Flash는 총 3,200억 개 파라미터를 갖지만, 토큰을 처리할 때는 약 180억 개 파라미터만 활성화하는 구조다. 컨텍스트 윈도는 1,048,576토큰으로, 긴 문서와 대규모 코드베이스를 한 번에 다루는 작업을 겨냥한다.
5
7
또한 네이티브 멀티모달 모델로서 텍스트뿐 아니라 이미지와 영상 등 다양한 입력을 처리하는 GLM-5 계열의 첫 모델로 소개됐다.
4
5
Artificial Analysis Intelligence Index에서는 57점을 기록해 해당 지표에서 Claude Opus 4.8과 같은 점수를 받은 것으로 보고됐다. 하지만 이는 하나의 종합 지표에서 나타난 점수 동률일 뿐, 모든 벤치마크나 실제 에이전트 작업에서 두 모델의 성능이 같다는 의미는 아니다.
1
지푸 AI는 GLM-5.3-Flash를 딥시크 V4 Flash·Pro 같은 효율형 최상위권 모델과 경쟁하는 제품으로 포지셔닝하면서도 더 낮은 추론 가격을 내세웠다. 다만 제공된 자료만으로는 두 딥시크 변형 모델과의 벤치마크별 성능 비교를 정확히 검증하기 어렵다.
가격은 입력 0.15달러, 출력 0.50달러
지푸 AI가 제시한 API 가격은 다음과 같다.
- 입력: 100만 토큰당 0.15달러
- 출력: 100만 토큰당 0.50달러
1
당시 보도는 이를 GLM-5.3 가격의 약 10분의 1, Claude Opus 4.8 가격의 약 40분의 1 수준으로 표현했다. 그러나 실제 배수는 입력과 출력 중 어느 쪽을 비교하는지, 컨텍스트 길이 구간과 요금제가 무엇인지에 따라 달라질 수 있다.
1
결국 이번 공개의 핵심은 단순히 ‘새 모델이 나왔다’는 데 있지 않다. 익명 모델로 실제 개발자 트래픽을 먼저 받아 성능과 인프라를 시험한 뒤, 그 모델이 지푸 AI의 GLM-5.3-Flash였음을 밝힌 사건이다. 동시에 대규모 추론에서는 칩 자체의 성능뿐 아니라 양자화, 병렬화, 캐시 관리, 통신 구조를 함께 최적화하는 시스템 설계가 비용과 처리량을 좌우한다는 점도 부각됐다.