2026년 8월 20일 무료 익명 모델로 등장한 Ox Alpha는 8월 26일 Zhipu AI의 GLM 5.3 Flash로 확인됐다. GLM 5.3 Flash는 코딩과 시각적 프로그래밍, 장시간 에이전트 작업을 겨냥한 모델로, 총 3,200억 개 파라미터 중 토큰당 180억 개만 활성화하는 MoE 구조를 사용한다.
연구 답변

Create a landscape editorial hero image for this Studio Global article: What is Zhipu AI’s GLM-5.3-Flash—the model previously released anonymously on OpenRouter as “Ox Alpha”—and how did its August 20, 2026 blind. Article summary: GLM-5.3-Flash is Zhipu AI’s (Z.ai’s) open-weight, natively multimodal mixture-of-experts model—the system anonymously trialed as “Ox Alpha” before Zhipu identified it on August 26. It is designed chiefly for coding, GUI/. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
GLM-5.3-Flash는 개발자 사이에서 정체를 숨긴 채 먼저 시험된 Ox Alpha의 공식 이름이다. 중국 AI 기업 Zhipu AI는 해외 브랜드인 Z.ai를 통해 2026년 8월 26일 Ox Alpha가 자사의 새 모델이었다고 공개했다. 익명 테스트는 8월 20일 OpenRouter와 여러 개발자 도구에서 시작됐다. 3
4
공개된 모델은 총 3,200억 개 파라미터를 가진 혼합 전문가(Mixture of Experts·MoE) 모델이지만, 토큰 하나를 처리할 때는 180억 개 파라미터만 활성화한다. 약 100만 토큰의 컨텍스트와 네이티브 멀티모달 입력을 지원하며, 모델 가중치는 MIT 라이선스로 공개됐다. 3
6
8
Ox Alpha는 제조사나 모델 카드, 상세 사양을 밝히지 않은 무료 엔드포인트로 등장했다. 개발자들은 긴 컨텍스트와 이미지·영상 등 멀티모달 입력을 지원하는 이 모델을 코드 작성과 에이전트 작업에 활용하기 시작했다. 실사용 결과가 예상보다 좋다는 반응이 나오면서 어느 연구소가 개발했는지를 둘러싼 추측도 커졌다. 13
16
Zhipu는 이를 의도적인 ‘블라인드 테스트’라고 설명했다. 모델 이름과 파라미터 규모, 기업 브랜드를 감춘 상태에서 개발자들이 홍보 문구가 아니라 실제 출력과 사용성만으로 평가하도록 하려 했다는 것이다. 실제 소프트웨어 개발과 에이전트 작업에서 발생한 사용 패턴과 피드백은 공식 출시 전 모델을 점검하는 자료가 됐다. 13
15
테스트 기간에는 하루 약 100조 토큰을 처리할 수 있는 무료 용량이 제공됐다는 보도가 나왔다. 스트라이프 공동창업자 패트릭 콜리슨도 모델 품질을 긍정적으로 평가한 개발자 중 한 명으로 언급됐다. 다만 공개적인 호평은 통제된 벤치마크와 같지 않으므로, 이 반응만으로 모델의 우위를 단정할 수는 없다. 13
14
Zhipu는 서비스가 중국산 AI 가속기에서 구동됐다고도 밝혔다. 사우스차이나모닝포스트는 테스트에 중국산 칩 10만 개로 구성된 클러스터가 사용됐으며, 공식 출시 전 모델이 62조 토큰을 처리했다고 보도했다. 무료 처리 용량과 실제 사용량은 매체와 자료에 따라 차이가 있으므로, 이 수치는 독립적으로 감사된 측정값이 아니라 기업 또는 언론이 전한 수치로 보는 편이 안전하다. 7
13
GLM-5.3-Flash의 총 파라미터 수는 3,200억 개지만, 모든 추론 단계에서 전체를 사용하는 것은 아니다. MoE 구조는 입력 토큰마다 필요한 일부 전문가만 선택해 활성화한다. 따라서 전체 모델이 가진 표현력은 크게 유지하면서도 토큰당 연산량을 낮추는 것이 설계 목표다. 3
4
모델은 45개 레이어로 구성됐으며, GLM-5 시리즈에서 처음으로 네이티브 멀티모달 모델로 소개됐다. 텍스트뿐 아니라 이미지, 영상, 시각 문서, 파일과 여러 유형의 입력이 섞인 멀티모달 데이터를 처리한다. 에이전트가 화면을 살펴보거나 스크린샷을 해석하고, 문서를 읽거나 코드 실행 결과를 확인해야 하는 작업에 초점을 맞춘 구성이다. 4
11
Zhipu가 제시한 컨텍스트 윈도는 1,048,576토큰, 흔히 100만 토큰으로 표현된다. 대규모 소프트웨어 저장소, 긴 에이전트 세션, 방대한 문서 묶음, 코드와 이미지·파일을 함께 다루는 작업을 염두에 둔 수치다. 3
4
또한 기존 모델을 단순히 축소한 버전이 아니라 새로운 기반 모델과 학습 레시피로 개발했다고 Zhipu는 설명한다. 학습에는 30조 토큰 규모의 멀티모달 데이터 코퍼스가 사용됐다고 밝혔다. 4
16
GLM-5.3-Flash는 **선형 어텐션(linear attention)**과 **희소 어텐션(sparse attention)**을 결합한다. 선형 어텐션은 긴 시퀀스를 처리할 때 비용을 낮추는 역할을, 희소 어텐션은 중요한 토큰 간 상호작용을 선별해 더 높은 정밀도로 유지하는 역할을 목표로 한다. 두 방식을 조합해 긴 컨텍스트 성능과 추론 비용 사이의 균형을 노린 셈이다. 4
16
Zhipu는 긴 컨텍스트에서 인덱싱에 필요한 메모리와 지연 시간을 줄이기 위한 IndexPool 메커니즘과, 확장 효율을 높이기 위한 매니폴드 제약 하이퍼커넥션도 소개했다. 다만 이런 구현 기술의 실제 효과는 하드웨어, 서버 설정, 입력 길이, 작업 유형에 따라 달라질 수 있다. 4
16
Zhipu의 자체 자료에 따르면 GLM-5.3-Flash는 GLM-5.3과 비교해 어텐션 연산을 3.01배, KV 캐시 사용량을 4.44배 줄였다. 긴 에이전트 세션에서는 어텐션 연산량과 KV 캐시 메모리가 주요 병목이 될 수 있어 개발자에게 중요한 주장이다. 그러나 이 비율은 주로 Zhipu가 발표한 기술 자료에 근거하므로, 모든 환경에서 동일하게 나타나는 독립 검증 속도 향상으로 해석해서는 안 된다. 4
GLM-5.3-Flash는 코딩, 시각적 프로그래밍, 장기 에이전트 작업, 도구 사용을 주요 용도로 내세운다. 에이전트가 코드만 생성하는 것이 아니라 브라우저와 그래픽 사용자 인터페이스를 관찰하고, 렌더링 결과와 상호작용 피드백을 확인하며 작업을 반복하는 흐름을 겨냥한다. 4
Zhipu가 공개한 주요 벤치마크 결과는 다음과 같다.
이 수치는 모델이 소프트웨어 엔지니어링과 에이전트 작업에 강점을 둔다는 포지셔닝과 일치한다. 하지만 에이전트 벤치마크는 프롬프트, 사용 도구, 스캐폴딩, 하드웨어, 시간 제한, 평가 버전에 따라 결과가 크게 달라질 수 있다. 따라서 위 숫자는 우선 Zhipu가 보고한 결과로 이해하고, 모든 경쟁 모델을 확정적으로 줄 세운 순위로 받아들이지는 않는 것이 좋다. 4
15
Zhipu는 GLM-5.3-Flash의 가중치를 Hugging Face에 MIT 라이선스로 공개했다. BF16 버전도 제공되며, 모델 문서는 SGLang과 vLLM 같은 서빙 프레임워크를 통한 배포를 지원한다고 안내한다. 기업이나 연구팀이 Z.ai의 호스팅 API에만 의존하지 않고 자체 인프라에서 모델을 시험하거나 운영할 수 있다는 의미다. 3
6
8
오픈 웨이트 공개는 실용적인 선택지를 넓힌다. 개발자는 자신의 코드 저장소와 문서, 화면 인터페이스, 에이전트 환경에서 모델을 직접 평가할 수 있고, 인프라 팀은 실제 서빙 비용과 하드웨어 요구 사항을 검토할 수 있다.
다만 ‘18B 활성화’가 곧 가벼운 모델이라는 뜻은 아니다. 전체 체크포인트 규모가 3,200억 개 파라미터인 만큼, 자체 배포에는 여전히 상당한 메모리와 시스템 설계가 필요하다. 토큰당 연산량을 줄였더라도 모델 전체를 저장하고 효율적으로 서비스하는 문제는 별도로 남는다.
Ox Alpha 실험의 의미는 단순한 화제몰이에만 있지 않다. 이름과 기업 정보, 파라미터 규모를 숨긴 상태에서도 개발자들이 모델을 계속 사용했는지를 확인했기 때문이다. 실제 작업을 자발적으로 맡긴 사용자들의 반응은 공식 발표 전에 얻은 비교적 현실적인 제품 피드백이 됐다. 13
15
물론 한계도 분명하다. 무료 접속은 평소보다 많은 트래픽을 끌어올 수 있고, 공개적인 호평에는 신제품에 대한 기대감이 섞일 수 있다. 익명 테스트만으로는 프롬프트와 도구 설정을 통제하거나 모든 모델을 동일 조건에서 비교할 수 없다.
가장 신중한 결론은 이렇다. GLM-5.3-Flash는 정체가 알려지기 전부터 개발자들의 상당한 관심과 사용을 끌어냈으며, Zhipu는 그 실사용 데이터를 활용해 공식 출시를 뒷받침했다. 다만 아키텍처의 효율성, 벤치마크 점수, 실제 운영 성능을 확정하려면 독립적이고 재현 가능한 평가가 더 필요하다.
GLM-5.3-Flash는 익명의 Ox Alpha로 먼저 모습을 드러낸 Zhipu의 오픈 웨이트 멀티모달 모델이다. 핵심 사양은 총 3,200억·활성 180억 파라미터의 MoE 구조, 45개 레이어, 100만 토큰 컨텍스트, 선형·희소 어텐션 결합, MIT 라이선스 가중치다. 3
4
11
이 모델의 핵심 경쟁력은 단순한 규모가 아니다. 긴 컨텍스트와 시각 입력, 도구 사용, 에이전트 작업을 한데 묶으면서도 서빙 부담을 낮추겠다는 설계와, 개발자가 직접 내려받아 검증할 수 있는 개방성이 함께 제시됐다는 점이다. Ox Alpha의 블라인드 출시는 이 약속에 대한 초기 실사용 반응을 보여줬지만, 실제 프로덕션 성능에 대한 최종 판단은 아직 독립 평가의 몫이다.
Studio Global AI
이 페이지에는 Studio Global 내에서 계속할 수 있는 소스 기반 답변이 포함되어 있습니다.
2026년 8월 20일 무료 익명 모델로 등장한 Ox Alpha는 8월 26일 Zhipu AI의 GLM 5.3 Flash로 확인됐다.
2026년 8월 20일 무료 익명 모델로 등장한 Ox Alpha는 8월 26일 Zhipu AI의 GLM 5.3 Flash로 확인됐다. GLM 5.3 Flash는 코딩과 시각적 프로그래밍, 장시간 에이전트 작업을 겨냥한 모델로, 총 3,200억 개 파라미터 중 토큰당 180억 개만 활성화하는 MoE 구조를 사용한다.
약 100만 토큰 컨텍스트, 텍스트·이미지·영상·파일 입력, MIT 라이선스 오픈 웨이트를 제공하며, Zhipu는 GLM 5.3 대비 어텐션 연산 3.01배, KV 캐시 사용량 4.44배 감소를 주장한다.