2026년 8월 26일, 일주일 가까이 개발자 커뮤니티의 추측을 불러온 모델의 정체가 밝혀졌다. Z.ai는 OpenRouter와 OpenCode에서 익명으로 제공되던 Ox Alpha가 자사의 GLM-5.3-Flash였다고 공식 확인했다.
15
40
GLM-5.3-Flash는 GLM-5 제품군 최초의 네이티브 멀티모달 모델이다. 텍스트뿐 아니라 이미지와 동영상을 이해하고, 코딩과 장시간 실행되는 에이전트 작업을 주요 용도로 내세운다. 약 100만 토큰의 긴 컨텍스트와 오픈 웨이트, 낮은 API 가격을 한데 묶었다는 점이 핵심이다.
1
2
3
하지만 이번 출시의 의미는 모델 사양에만 있지 않다. Z.ai는 먼저 출처를 숨긴 채 무료로 모델을 풀어 실제 개발자 작업에 투입했다. 이후 모델의 이름과 가중치를 공개했다. 이 과정에서 Z.ai는 대규모 서비스 환경을 시험하고, 사용 패턴과 피드백을 얻으면서 정식 출시 전 제품에 대한 관심까지 키울 수 있었다.
GLM-5.3-Flash는 어떤 모델인가
GLM-5.3-Flash는 총 3,200억 개 파라미터, 토큰당 180억 개 활성 파라미터를 사용하는 혼합 전문가(Mixture-of-Experts·MoE) 모델이다. 모든 파라미터를 매번 계산하는 대신 필요한 전문가 일부만 활성화하는 구조여서, 대규모 모델의 성능을 유지하면서 추론 비용을 낮추는 데 초점을 맞춘다.
1
3
입력은 텍스트·이미지·동영상이며 출력은 텍스트다. Z.ai 문서는 설계상 컨텍스트 창을 100만 토큰으로 설명하고, OpenRouter에는 1,310,720토큰으로 표시돼 있다. 플랫폼에 따라 표기된 한도가 다를 수 있다는 뜻이다.
1
2
3
40
가중치는 MIT 라이선스로 공개됐다. 따라서 폐쇄형 API에서만 사용할 수 있는 모델보다 자체 호스팅이나 여러 제공업체를 활용한 배포를 검토하기가 상대적으로 쉽다. 익명 프리뷰가 종료된 뒤에는 OpenRouter에도 GLM-5.3-Flash라는 공식 이름으로 등록됐다.
3
4
8
이 모델은 8월 초 발표된 더 큰 GLM-5.3과 같은 제품이 아니다. 당시 보도에 따르면 GLM-5.3-Flash는 320B-A18B 규모의 별도 저비용 SKU이며, 743B 기반으로 소개된 GLM-5.3 라인과 구분된다.
10
성능 수치는 유망하지만, 대부분 회사 발표다
Z.ai는 GLM-5.3-Flash가 GLM-5.2보다 높은 성능을 내면서도 서비스 비용은 낮췄다고 주장한다. 공개된 수치 가운데 하나는 DeepSWE v1.1 점수로, GLM-5.3-Flash가 63.4점, GLM-5.2가 46.2점을 기록했다는 내용이다. Z.ai의 내부 코딩 벤치마크에서는 GLM-5.3-Flash가 29.0점, Claude Opus 4.8이 29.5점이었다고 밝혔다.
3
16
다만 이는 독립 기관이 동일한 조건에서 재현한 결과가 아니라 Z.ai가 공개한 비교다. 벤치마크의 세부 정의, 프롬프트, 평가 설정, 재현 가능성에 따라 결과는 달라질 수 있다. 따라서 현재 확인할 수 있는 가장 안전한 결론은 Z.ai가 훨씬 낮은 비용으로 강력한 코딩·에이전트 성능을 주장하고 있다는 정도다. 이 수치만으로 GLM-5.3-Flash가 폐쇄형 최첨단 모델을 확실히 넘어섰다고 보기는 어렵다.
무료 프리뷰에서 유료 API로
Ox Alpha가 특히 주목받은 이유는 익명 모델이면서 무료로 사용 가능했다는 점이다. 그러나 모델에 공식 이름이 붙은 8월 26일, 이 무료 프리뷰 단계는 끝났다. Z.ai가 제시한 정식 가격은 입력 100만 토큰당 0.15달러, 출력 100만 토큰당 0.50달러다.
1
3
출시 직후 OpenRouter에는 입력 0.075달러, 출력 0.25달러라는 더 낮은 가격이 표시됐다. 이는 Z.ai의 정식 가격과 플랫폼 차원의 프로모션 가격을 구분해야 한다는 의미다. 무료 익명 프리뷰, Z.ai의 정식 가격, OpenRouter의 출시 할인은 서로 다른 접근 조건이다.
2
가격은 단순한 숫자 이상의 의미를 갖는다. 코딩 에이전트는 긴 문맥과 많은 출력 토큰을 반복적으로 사용하기 때문에, 모델 선택에서 작은 벤치마크 점수 차이보다 토큰 비용·지연시간·배포 방식이 더 중요한 경우가 많다.
중국산 AI 가속기에서 돌아간다는 신호
Z.ai는 GLM-5.3-Flash가 중국산 AI 가속기만으로 구동됐다고 밝혔다.
15 관련 보도에 따르면 Z.ai는 SGLang을 기반으로 자체 서빙 시스템을 구축하고, 양자화·텐서 병렬화·혼합 캐시 형식·레이어 분할 등을 적용했다. 인코딩, 프리필, 디코딩을 별도 작업 풀로 나누는 ‘Encode–Prefill–Decode’ 구조도 활용한 것으로 전해졌다.
25
이는 중국 내 하드웨어 제약을 감안해 대규모 멀티모달 모델의 서비스 효율을 끌어올리려는 접근이다. Z.ai는 앞서 GLM 계열 학습에 엔비디아 하드웨어 없이 화웨이 어센드 프로세서를 사용했다고 밝혀 왔다. 또한 Z.ai가 미국 상무부의 수출 제한 대상인 Entity List에 올라 있어 엔비디아 H100·H200·B200 접근이 제한된다는 보도도 있다.
26
다만 중국산 가속기에서의 구동 주장은 회사 발표와 업계 보도에 기반한 내용이지, 하드웨어 성능을 독립적으로 감사한 비교 결과는 아니다. 그럼에도 확인 가능한 전략적 메시지는 분명하다. Z.ai가 엔비디아의 최신 데이터센터 GPU에 의존하지 않고도 대규모 멀티모달 모델의 서비스 인프라를 구축할 수 있다고 내세우고 있다는 점이다.
‘익명 출시’라는 스텔스 플레이북
Ox Alpha의 공개 방식은 의도적인 스텔스 출시로 보인다. 먼저 유능한 모델을 출처 없이 공개하고, 인기 있는 코딩 경로를 통해 무료로 제공한 뒤, 실제 사용량과 개발자 피드백을 확보하고 나서 제품의 이름을 공개하는 방식이다.
Z.ai는 앞서 Pony Alpha라는 이름으로 비슷한 테스트를 진행한 사례와 연결돼 언급돼 왔다. 커뮤니티 이용자들은 토크나이저 특성, 동영상 처리 방식, API 오류 패턴 등을 분석하며 Ox Alpha의 제작사를 추적했다.
7
11
13
출시 당시 사용량과 개발자 반응에 관한 보도도 이어졌다. 일부 자료는 OpenCode 사용자 50만 3,000명 이상과 44조 개 토큰 처리량, 유명 개발자들의 호평을 언급했지만, 해당 수치와 인용문을 모두 독립적으로 확인할 수 있는 자료는 제한적이다. 따라서 이런 내용은 감사된 채택 지표라기보다 출시 기간의 보도로 보는 편이 신중하다.
14
결국 Ox Alpha는 단순한 익명 모델이 아니었다. 무료 제공을 통해 실제 코딩 에이전트 트래픽을 확보한 대규모 부하 테스트였고, 동시에 정식 출시를 위한 화제성 높은 제품 실험이었다.
경쟁 구도에서의 의미
이번 출시가 Z.ai가 모든 영역에서 OpenAI나 Anthropic을 앞섰다는 뜻은 아니다. 현재 공개된 자료만으로 폐쇄형 최첨단 모델과의 전면적인 우위를 입증할 수는 없다.
다만 GLM-5.3-Flash는 한 제품 안에 여러 압박 요인을 결합했다. 네이티브 멀티모달 입력, 약 100만 토큰의 긴 컨텍스트, MIT 라이선스 오픈 웨이트, 코딩·에이전트 작업 최적화, 낮은 API 가격이 그것이다.
15
40
개발자 입장에서는 모델을 바꾸거나 여러 제공업체를 병행하는 비용이 낮아지고, 자체 호스팅을 선택할 여지도 커진다. 반대로 폐쇄형 모델 제공업체에는 가격과 수익성 압박이 커질 수 있다. 특히 코딩 에이전트 시장에서는 순위표의 1~2점 차이만큼이나 토큰 비용, 지연시간, 배포 통제권, 하드웨어 접근성이 중요하기 때문이다.
Ox Alpha의 진짜 메시지는 ‘익명 모델이 최강 모델이었다’는 데 있지 않다. 저렴하고, 개방돼 있으며, 실제 개발 환경에서 충분히 쓸 수 있는 모델을 어떻게 빠르게 검증하고 시장에 투입할 것인가에 대한 Z.ai의 실험이 성공적으로 주목받았다는 데 있다.