Ox Alpha는 2026년 8월 20일 OpenRouter와 OpenCode에 무료·무개발사 표기로 등장했고, 8월 26일 Z.ai가 GLM 5.3 Flash라고 확인했다. GLM 5.3 Flash는 총 3200억 개 파라미터 중 토큰당 180억 개를 활성화하는 MoE 모델로, 100만 토큰 컨텍스트와 텍스트·이미지·영상 입력을 지원한다.
연구 답변

Create a landscape editorial hero image for this Studio Global article: What is Z.ai’s GLM-5.3-Flash, and how did it resolve the week-long mystery surrounding the anonymously released “Ox Alpha” model—covering it. Article summary: GLM-5.3-Flash is Z.ai (Zhipu AI)’s open-weight, natively multimodal GLM-5 model—and the company confirmed on August 26 that it was the previously anonymous “Ox Alpha.” The reveal turned a six-day public stress test into . Topic tags: general, general web, user generated, documentation, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
6일 동안 개발자들은 ‘Ox Alpha’라는 강력한 AI 모델을 사용하면서도 제작자가 누구인지 알지 못했다. 이 모델은 2026년 8월 20일 OpenRouter와 OpenCode에 개발사 표기 없이 무료로 등장했다. 1,048,576토큰의 컨텍스트 창과 텍스트·이미지·영상 입력을 내세우면서 코딩 에이전트와 장시간 작업에 빠르게 활용됐다. 2
5
9
그리고 8월 26일, Z.ai가 정체를 직접 공개했다. Ox Alpha는 중국 기업 Zhipu AI가 국제 브랜드 Z.ai로 선보인 GLM-5.3-Flash였다. 익명의 공개 테스트는 단순한 해프닝이 아니라, 실제 개발자 트래픽을 활용한 사전 검증이자 제품 출시 전략이었던 셈이다. 5
9
Ox Alpha는 OpenRouter와 OpenCode에서 이름만 공개된 채 서비스됐다. 가격은 0달러였고, 컨텍스트 한도는 1,048,576토큰이었다. 텍스트뿐 아니라 이미지와 영상도 입력할 수 있어 개발자들은 대규모 코드 저장소 분석, 터미널 작업, 브라우저 기반 에이전트, 장문 문서 처리 등에 모델을 투입했다. 4
5
8
커뮤니티는 모델의 정체를 추적하기 시작했다. GLM 계열과 비슷한 토크나이저 동작과 API 오류 메시지 패턴 등이 단서로 거론됐고, Zhipu AI가 개발사일 가능성이 커졌다. Z.ai는 8월 26일 Ox Alpha가 GLM-5.3-Flash였다고 확인하면서, 공식 출시 전에 익명으로 실제 사용 피드백을 수집하려 했다고 설명했다. 5
9
사용량도 이례적으로 컸다. 당시 공개된 여러 집계에는 6일 동안 42조 토큰을 처리했다는 수치와 약 44조 토큰, OpenCode 사용자 50만3,000명이라는 수치가 각각 등장한다. 측정 시점과 집계 기준이 서로 다르므로, 이를 하나의 독립적으로 검증된 단일 수치로 받아들여서는 안 된다. 8
11
16
GLM-5.3-Flash는 코딩, 장시간 이어지는 에이전트 작업, 멀티모달 워크플로를 겨냥한 오픈 웨이트 모델이다. Z.ai는 이 모델을 GLM-5 제품군 최초의 네이티브 멀티모달 모델이라고 설명한다. 100만 토큰에 이르는 컨텍스트 창을 활용하면 하나의 작업 안에 대규모 코드베이스, 문서, 스크린샷 등 다양한 입력을 함께 넣을 수 있다. 7
20
핵심 구조는 총 3200억 개 파라미터를 갖춘 전문가 혼합(Mixture of Experts·MoE) 모델이다. 이 가운데 토큰 하나를 처리할 때 실제로 활성화되는 파라미터는 180억 개다. 모델 전체에는 방대한 학습 능력을 담되, 각 토큰은 그중 일부 전문가 경로만 거치도록 설계한 방식이다. 6
20
또한 Z.ai는 희소 어텐션과 선형 어텐션을 결합한 하이브리드 구조를 적용해 추론 과정의 연산량과 키-값 캐시 요구량을 줄였다고 밝혔다. 총 파라미터 수만 보면 결코 작은 모델은 아니지만, 토큰마다 수행하는 계산을 줄여 더 낮은 서비스 비용을 목표로 한다는 점이 ‘Flash’라는 이름의 배경이다.
다만 실제 속도와 비용은 모델 구조만으로 결정되지 않는다. 사용되는 가속기, 서빙 소프트웨어, 배치 처리 방식, 동시 요청 수와 작업 유형에 따라 결과는 달라질 수 있다.
Z.ai는 GLM-5.3-Flash가 DeepSWE v1.1에서 63.4점을 기록했으며, GLM-5.2의 46.2점보다 높았다고 발표했다. 또한 자체 평가에서 클로드 오퍼스 4.8과 비교한 점수는 29.0 대 29.5였다고 밝혔다. 7
8
이 수치는 참고할 만한 신호지만, 모델의 전반적인 품질 순위를 확정하는 자료는 아니다. DeepSWE 결과는 기업이 발표한 벤치마크 수치이고, 클로드와의 비교는 내부 평가로 설명됐다. 프롬프트, 사용 도구, 에이전트 구성, 테스트 데이터와 채점 방식이 달라지면 결과도 크게 달라질 수 있다.
개발자 관점에서 더 중요한 질문은 특정 벤치마크 점수보다 실제 워크플로에 잘 맞는지다. GLM-5.3-Flash는 대규모 저장소를 읽고, 화면이나 이미지 정보를 참고하며, 긴 시간 이어지는 에이전트 작업을 수행하도록 설계됐다. 실제 도입 시에는 성능 점수뿐 아니라 도구 사용의 안정성, 응답 지연, 오류 복구 능력과 반복 작업의 신뢰성을 함께 확인해야 한다.
Z.ai가 발표한 API 정가는 다음과 같다.
이후 문서에는 한시적인 50% 프로모션 가격도 표시됐다. 프로모션 기간에는 입력 가격이 0.075달러, 출력 가격이 0.25달러로 낮아진다. 2
모델 가중치는 Hugging Face에 MIT 라이선스로 공개됐다. 일반적으로 MIT 라이선스는 상업적 재사용과 수정에 비교적 폭넓은 권한을 제공한다. 다만 실제 배포를 준비하는 팀은 모델 저장소의 라이선스 원문, 의존성, 하드웨어 요구사항, 별도 사용 조건과 배포 의무를 확인해야 한다. 2
9
Z.ai 문서에는 GLM-5.3-Flash가 개발자용 API와 코딩 플랜 생태계에서 제공된다고 나와 있다. API는 텍스트·이미지·오디오·영상·파일 입력과 도구 사용을 지원하는 멀티모달 채팅 완성 형식을 설명하고 있다. 17
20
21
이번 공개에는 모델 성능과 별개로 또 하나의 중요한 이야기가 따라붙었다. Z.ai는 익명 상태였던 Ox Alpha의 트래픽이 전부 중국산 AI 가속기에서 처리됐으며, 맞춤형 SGLang 기반 서빙 스택을 사용했다고 밝혔다. 회사의 기술 자료는 중국 내 하드웨어에서 추론 효율을 높이기 위한 배포였다고 설명한다.
일부 2차 보도는 맞춤형 스택이 엔드투엔드 성능을 3배 높였다는 주장도 전한다. 그러나 사용된 가속기 종류와 규모, 성능 비교의 정확한 기준, 해외 부품과의 독립성은 현재 확인 가능한 자료만으로 독립 검증되지 않았다. 10
이 주장이 사실로 확인된다면 미국의 반도체 수출 통제 아래 중국이 자체 하드웨어로 고성능 AI 서비스를 운영할 수 있는지를 보여주는 전략적 사례가 될 수 있다. 하지만 현재로서는 중국산 가속기가 글로벌 AI 인프라 격차를 해소했다는 결론보다는, 중요한 의미를 가진 기업 발표로 보는 편이 정확하다.
Ox Alpha 방식은 일반적인 출시보다 더 거칠고 현실적인 사용자 반응을 얻을 수 있었다. 사용자는 마케팅 자료나 개발사 이름이 아니라, 무료이면서 실제 코딩 작업에 쓸 만하다는 이유로 모델을 시험했다. Z.ai는 이런 방식으로 공식 공개 전에 현실적인 피드백을 모았다고 밝혔다. 5
9
이 전략은 오픈 웨이트 배포와도 잘 맞는다. 자유롭게 실험할 수 있는 가중치, 낮은 API 가격, 폭넓은 개발자 접근성을 함께 제공하면 모델을 직접 시험하는 사용자가 늘고, 기존의 폐쇄형 구독 모델과 다른 방식으로 생태계를 확장할 수 있다.
Zhipu AI가 과거에도 ‘Pony Alpha’라는 익명 모델 실험을 진행했다는 보고가 있어 이번 시도가 완전히 새로운 발상은 아닐 가능성이 있다. 다만 이전 프로젝트에 관한 공개 자료는 제한적이다.
GLM-5.3-Flash가 곧바로 Z.ai의 종합적인 프런티어 우위를 증명하는 것은 아니다. 현재 확인되는 근거는 공개된 제품 사양, 큰 관심을 끈 공개 프리뷰, 그리고 회사가 발표한 벤치마크와 인프라 주장이다. 코딩, 멀티모달 추론, 도구 사용, 지연 시간, 안정성에 대한 독립적이고 재현 가능한 평가가 더 필요하다.
그럼에도 경쟁 신호는 분명하다. 100만 토큰 컨텍스트, 네이티브 멀티모달 입력, 오픈 웨이트, 토큰 100만 개당 센트 단위에 가까운 API 가격을 함께 제시한 모델은 고가의 폐쇄형 AI 서비스에 비용 압박을 가한다. OpenAI와 Anthropic 같은 기업의 모델과 단순히 점수를 비교하는 것을 넘어, 어떤 수준의 성능을 어느 가격에 제공할 수 있는지가 경쟁의 핵심이 되고 있다.
이번 사례는 익명 프리뷰가 실제 부하 테스트와 사용자 확보를 동시에 수행할 수 있다는 점도 보여줬다. Ox Alpha의 미스터리는 풀렸다. 그것은 Z.ai의 GLM-5.3-Flash였다. 이제 남은 질문은 정체가 아니라 실용성이다. 무료 공개 테스트에서 화제가 된 저비용·장문 컨텍스트 모델이 반복 가능하고 안정적인 실제 업무에서도 같은 약속을 지킬 수 있을지가 관건이다.
Studio Global AI
이 페이지에는 Studio Global 내에서 계속할 수 있는 소스 기반 답변이 포함되어 있습니다.
Ox Alpha는 2026년 8월 20일 OpenRouter와 OpenCode에 무료·무개발사 표기로 등장했고, 8월 26일 Z.ai가 GLM 5.3 Flash라고 확인했다.
Ox Alpha는 2026년 8월 20일 OpenRouter와 OpenCode에 무료·무개발사 표기로 등장했고, 8월 26일 Z.ai가 GLM 5.3 Flash라고 확인했다. GLM 5.3 Flash는 총 3200억 개 파라미터 중 토큰당 180억 개를 활성화하는 MoE 모델로, 100만 토큰 컨텍스트와 텍스트·이미지·영상 입력을 지원한다.
Z.ai는 DeepSWE v1.1에서 63.4점을 기록했다고 밝혔지만, 클로드 오퍼스 4.8과의 비교를 포함한 성능 수치는 회사 발표에 기반하므로 독립 검증이 필요하다.