2026년 8월 14일, Z.ai(전 Zhipu AI)가 7400억 개의 매개변수를 가진 오픈 웨이트 모델 GLM 5.3을 출시했습니다. CyberGym에서 84.5%를 기록하며 Anthropic의 Mythos 5(83.8%)와 OpenAI의 GPT 5.6 Sol(83.6%)을 근소한 차이로 앞섰습니다.
연구 답변

Create a landscape editorial hero image for this Studio Global article: What are the key capabilities and benchmark results of Chinese AI firm Zhipu's newly launched GLM-5.3 model, particularly in cybersecurity t. Article summary: On August 14, 2026, Zhipu AI (now branding as **Z.ai**) launched **GLM-5.3**, a 740-billion-parameter open-weight model that delivers roughly 50% better coding performance than GLM-5.2 and unexpectedly strong emergent cy. Topic tags: general, general web, user generated, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
2026년 8월 14일, 중국의 AI 기업 Zhipu AI(현재 해외 브랜드명 Z.ai)가 GLM-5.3을 출시했습니다. 이 모델은 7400억 개의 매개변수를 가진 오픈 웨이트(open-weight) 모델로, 이전 버전인 GLM-5.2보다 코딩 성능이 약 50% 향상되었을 뿐만 아니라, 예상치 못한 강력한 사이버 보안 능력을 갖추고 있는 것으로 나타났습니다 . 이 사이버 보안 능력이 너무 뛰어나 Z.ai는 추가 안전 테스트를 위해 오픈 웨이트 공개를 2주 연기한다고 발표했습니다
.
GLM-5.3의 가장 주목할 만한 성과는 CyberGym 벤치마크에서 나왔습니다. CyberGym은 UC 버클리의 책임 있는 AI 개발 이니셔티브(Responsible AI Development Initiative)에서 개발한 것으로, 모델이 소스 코드에서 실제 취약점을 식별하고 검증할 수 있는지를 테스트합니다 . GLM-5.3은 여기서 **84.5%**를 기록하며, Anthropic의 **Mythos 5(83.8%)**와 OpenAI의 **GPT-5.6 Sol(83.6%)**을 근소한 차이로 앞질렀습니다
.
하지만 더 까다로운 ExploitBench 벤치마크에서는 상황이 달라집니다. ExploitBench는 취약점의 근본 원인을 분석하고 실제로 작동하는 익스플로잇(exploit)을 개발할 수 있는 능력을 평가합니다. GLM-5.3은 전작(24.4%)보다 두 배 이상 향상된 **54.4%**를 기록했지만 , Mythos 5(78%)와 GPT-5.6 Sol(76.5%)에는 크게 뒤쳐지는 것으로 나타났습니다
.
ExploitGym 벤치마크는 정규화된 2시간 예산 내에 모델이 완료하는 익스플로잇 작업 수를 측정합니다. GLM-5.3은 105개의 작업을 완료했으며(GLM-5.2는 29개), 6시간 예산에서는 130개까지 증가했습니다 .
| 벤치마크 | 측정 항목 | GLM-5.3 | Anthropic Mythos 5 | OpenAI GPT-5.6 Sol |
|---|---|---|---|---|
| CyberGym | 소스 코드 기반 화이트박스 취약점 발견 및 검증 | 84.5% | 83.8% | 83.6% |
| ExploitBench | 근본 원인 분석 및 작동하는 익스플로잇 제공 능력 | 54.4% | 78% | 76.5% |
| ExploitGym (2시간 예산) | 정규화된 예산 내 익스플로잇 완료 수 | 105개 작업 | 공개되지 않음 | 공개되지 않음 |
벤치마크를 넘어, GLM-5.3은 실제 보안 테스트에서도 인상적인 결과를 보여주었습니다.
GLM-5.3은 코딩 및 에이전트 벤치마크에서도 강력한 성능을 보이며, 소프트웨어 엔지니어링 분야에서 선도적인 오픈 웨이트 모델로 자리매김했습니다.
Z.ai는 모델의 사이버 보안 능력이 후훈련(post-training) 과정에서 "예상보다 빠르게 성장했다"고 밝혔습니다 . 베이스 모델의 7400억 개 매개변수는 재훈련되지 않았으며, 모든 성능 향상은 후훈련 개선을 통해 이루어졌습니다
. 이 능력이 예상치 못하게 나타났기 때문에, 회사는 안전 및 보안 통제를 강화하기 위해 오픈 웨이트 출시를 2주간 보류하기로 결정했습니다
. 모델은 Z.ai API와 ZCode, Claude Code, OpenCode 통합을 통해 이미 사용할 수 있습니다
.
Studio Global AI
이 페이지에는 Studio Global 내에서 계속할 수 있는 소스 기반 답변이 포함되어 있습니다.
2026년 8월 14일, Z.ai(전 Zhipu AI)가 7400억 개의 매개변수를 가진 오픈 웨이트 모델 GLM 5.3을 출시했습니다. CyberGym에서 84.5%를 기록하며 Anthropic의 Mythos 5(83.8%)와 OpenAI의 GPT 5.6 Sol(83.6%)을 근소한 차이로 앞섰습니다.
2026년 8월 14일, Z.ai(전 Zhipu AI)가 7400억 개의 매개변수를 가진 오픈 웨이트 모델 GLM 5.3을 출시했습니다. CyberGym에서 84.5%를 기록하며 Anthropic의 Mythos 5(83.8%)와 OpenAI의 GPT 5.6 Sol(83.6%)을 근소한 차이로 앞섰습니다. GLM 5.3은 이전 버전보다 코딩 성능이 약 50% 향상되었으며, 269개의 오픈 소스 프로젝트에서 2,436개의 확인된 취약점(이 중 1,097개는 치명적 또는 높은 심각도)을 발견했습니다.
하지만 모든 벤치마크 점수는 회사 자체 보고이며 아직 독립적으로 검증되지 않았습니다. CyberGym에서의 우위는 1% 포인트 미만이며, 실제 익스플로잇 난이도를 측정하는 ExploitBench에서는 Mythos 5(78%)와 GPT 5.6 Sol(76.5%)에 크게 뒤쳐집니다(54.4%).