이름도, 개발사도, 가격도 없던 AI 모델이 불과 며칠 만에 개발자 플랫폼의 사용량 1위에 올랐다. stealth/ox-alpha라는 이름으로 등장한 Ox Alpha는 2026년 8월 20일 OpenRouter와 OpenCode에서 모습을 드러냈고, 약 일주일간 무료 또는 거의 무제한에 가까운 조건으로 제공됐다.
5
18
21
그리고 8월 26일, 수수께끼는 풀렸다. 중국 AI 기업 Z.ai(智谱 AI)는 Ox Alpha가 자사의 GLM 계열 신작 GLM-5.3-Flash라고 확인했다.
3
4
이 사건의 핵심은 단순히 “정체불명의 고성능 모델이 등장했다”는 데 있지 않다. 무료 접근성, 100만 토큰 컨텍스트, 기존 코딩 에이전트와의 결합이 실제 개발 워크플로에 곧바로 연결되면서 사용량을 폭발시켰다는 점이 더 중요하다. 다만 플랫폼 사용량 기록은 모델 성능을 입증하는 벤치마크와는 별개의 지표다.
Ox Alpha는 어떤 모델이었나
Ox Alpha는 Z.ai가 GLM-5.3-Flash를 정식 공개하기 전에 사용한 익명 프리뷰용 코드명이었다. 당시 OpenRouter의 모델 설명에는 개발사 대신 “익명을 유지하기로 한 제3자 제공업체”라고만 적혀 있었다. OpenRouter 역시 모델 요청을 중계할 뿐, 해당 모델의 개발자나 소유자가 아니라고 명시했다.
5
29
OpenRouter에서는 stealth/ox-alpha로 등록됐고, OpenCode 안에도 별도 모델로 통합됐다. 프리뷰 기간 입력·출력 가격은 모두 0달러였으며, OpenCode는 출시 기간 동안 사실상 제한이 거의 없는 수준의 접근성을 내세웠다.
5
18
21
출시일과 주요 사양
Ox Alpha는 2026년 8월 20일 OpenRouter와 OpenCode에 동시에 또는 거의 동시에 등장했다. 당시 공개 목록은 개발사나 상세 모델 카드보다 대규모 컨텍스트와 멀티모달 입력 기능을 앞세웠다.
5
13
29
공개된 주요 사양은 다음과 같다.
- 최대 1,048,576토큰 컨텍스트 윈도우
- 최대 131,072토큰 출력 길이
- 텍스트·이미지·영상 입력
- 텍스트 출력
- 도구 호출(tool calling)
- 코딩, 장시간 에이전트 작업, 복잡한 추론, 프로덕션형 업무 지원
11
13
21
이런 구성은 대규모 코드 저장소를 한 번에 다루거나, 시각적 디버깅을 수행하거나, 긴 작업 흐름의 앞부분을 기억해야 하는 코딩 에이전트에 매력적이다. 다만 이 사양만으로 실제 서비스 환경에서의 일관된 성능까지 보장되는 것은 아니다.
무료 프리뷰가 사용량을 폭발시킨 이유
가장 직접적인 성장 동력은 무료라는 조건이었다. 개발자는 토큰 비용 걱정 없이 긴 코딩 작업을 반복할 수 있었고, OpenCode를 통해 이미 익숙한 터미널 기반 에이전트 워크플로 안에서 모델을 바로 시험할 수 있었다.
OpenCode: DeepSeek의 56일 연속 1위가 끝났다
OpenCode는 Ox Alpha가 6일 동안 약 42조 토큰을 처리했다고 밝혔다. 이는 DeepSeek Flash가 앞서 56일간 플랫폼 최다 사용 모델 자리를 지킨 이후 가장 큰 사용량 기록이었다.
7
16
즉, Ox Alpha는 단순히 새로 순위표에 이름을 올린 것이 아니었다. 거의 두 달 동안 1위를 차지했던 모델을 실제 사용량에서 밀어낸 것이다. 이후 OpenCode는 이 모델을 GLM-5.3-Flash로 표기하며 익명 프리뷰와 Z.ai의 정식 모델이 같은 시스템임을 확인했다.
16
OpenRouter: 주간 순위 1위와 기록적인 유입
OpenRouter의 이동식 사용량 순위에서도 Ox Alpha는 프리뷰 기간 1위에 올랐다. 한 보고서는 관련 7일 집계 구간에서 Ox Alpha가 약 23.2조 토큰을 처리했으며, DeepSeek V4 Flash는 약 11.6조 토큰이었다고 전했다.
11
OpenCode의 42조 토큰과 OpenRouter의 23.2조 토큰은 서로 더하거나, 하나의 전체 시장 사용량으로 해석해서는 안 된다. 서로 다른 플랫폼과 집계 기간을 가리키기 때문이다. 두 수치에서 공통으로 확인되는 결론은 더 좁지만 분명하다. 무료 출시가 두 서비스 모두에서 이례적인 트래픽을 만들었고, OpenRouter에서도 기록적인 상승세를 보였다는 것이다.
11
14
15
코딩 벤치마크가 실제로 보여주는 것
초기 커뮤니티에서 가장 크게 퍼진 주장은 DeepSWE에서 약 80%를 기록했다는 이야기였다. 그러나 이 수치는 소수 과제만을 대상으로 한 결과에서 시작됐고, 전체 독립 평가가 완료되기 전에 확산된 수치였다.
3
31
이후 전체 113개 DeepSWE 과제를 처음부터 끝까지 수행한 테스트에서는 Ox Alpha가 **58.4%**를 기록했다. 같은 자료에서 Claude Opus 4.8의 보고 점수는 **59%**였다.
47
따라서 현재 근거에 기반한 표현은 “해당 테스트에서 Claude Opus 4.8에 가까운 성능을 보였다”에 가깝다. “Claude Fable 5를 확실히 앞섰다”고 말하기는 어렵다.
Fable 5와의 비교가 특히 조심스러운 이유는 벤치마크가 다르기 때문이다. Fable 5에 대해 공개된 수치로는 SWE-bench Pro 80.3%, **SWE-bench Verified 95.0%**가 인용되지만, 이는 DeepSWE와 다른 테스트 세트다. 테스트 하네스, 과제 구성, 에이전트 설정도 다를 수 있어 단순한 점수 대 점수 비교는 적절하지 않다.
36
38
결론적으로 Ox Alpha는 최첨단 모델군에 가까운 신뢰할 만한 코딩 성능을 보여줬고, 장시간 에이전트 작업에 투입할 만큼 개발자의 관심을 끌었다. 그러나 초기 일부 과제 결과나 사용량 순위만으로 Fable 5보다 전반적으로 뛰어나다고 단정할 수는 없다.
개발자들이 주목한 세 가지 조합
Ox Alpha는 보통 따로 제공되는 장점을 한꺼번에 묶었다.
- 프리뷰 기간 토큰 비용 무료: 실험과 반복 작업의 진입 장벽을 낮췄다.
- 100만 토큰 컨텍스트: 대규모 저장소와 장시간 작업을 한 번에 다루기 쉬웠다.
- 멀티모달 입력과 도구 중심 워크플로: 코딩 에이전트가 텍스트, 이미지, 영상과 외부 도구를 함께 활용할 수 있었다.
11
13
21
이 조합은 사용량이 왜 그렇게 빠르게 증가했는지를 설명한다. 순위 변화는 단순한 호기심보다 제품 경험에 대한 수요를 보여줬다. 개발자들은 모델을 즉시 실제 작업에 투입했고, 일반적인 유료 체험판에서는 비용 때문에 하기 어려운 규모의 실험을 진행할 수 있었다.
다만 반응이 모두 긍정적이었던 것은 아니다. 익명 제공 방식은 프롬프트와 결과물이 어디로 전달되고 어떻게 보관되는지에 대한 신뢰 문제를 낳았다. 일부 보도는 모델 목록에 적힌 데이터 보관 관련 문구와 OpenRouter의 광범위한 스텔스 모델 약관 사이에 차이가 있을 수 있다고 지적했다. 또 OpenCode Zen 경로와 OpenRouter 경로 사이의 보존 정책이 다를 수 있다는 보도도 나왔다.
12
17
22
소스 코드가 외부로 유출되면 곤란한 프로젝트라면 익명성과 불명확한 보존 정책은 중요한 위험 요소다. 무료라는 이유만으로 기업 코드에 안전한 모델이라고 볼 수는 없다.
개발사를 둘러싼 추측: 무엇이 맞았나
8월 26일 공식 확인 전까지 개발자와 업계 관측자들은 여러 가능성을 제기했다.
샤오미 MiMo설
샤오미의 MiMo는 유력한 중국 AI 기업이 강력한 코딩 모델을 내놓았을 가능성에 기반한 업계 추측이었다. 그러나 확인된 자료에서는 MiMo와 연결되는 명칭, 호스팅 경로, 소유권 기록 또는 고유한 기술적 지문이 입증되지 않았다. 가능성은 있었지만 증명된 이론은 아니었다.
Google DeepMind설
“Alpha”라는 이름 때문에 Google DeepMind가 아니냐는 추측도 나왔다. 에이전트형 코딩 성능이 이 추측에 힘을 보탰지만, 두 단서 모두 결정적이지 않다. Alpha는 일반적인 브랜딩 표현이고, 공개 목록에는 Google의 attribution, 모델 출처, 인프라 정보, 기술 문서가 없었다.
Z.ai·GLM 계열설
Z.ai는 공식 확인 전부터 가장 강력한 후보로 떠올랐고, 결국 이 추측이 맞았다. 8월 26일 Z.ai는 블룸버그에 Ox Alpha가 GLM 계열의 새 버전이라고 밝혔고, 이후 이를 GLM-5.3-Flash로 명명했다. 회사는 모델 가중치를 공개하겠다는 계획도 밝혔다.
3
4
8
여기서 중요한 것은 기술적 추정과 개발사 attribution을 구분하는 일이다. 모델의 답변 스타일, 토크나이저의 인상, 거부 응답 방식, 컨텍스트 길이, 코드명은 가설을 세우는 데 도움을 줄 수 있다. 하지만 폐쇄형 호스팅 엔드포인트를 누가 운영하는지 확실히 증명하지는 못한다. 결정적 근거는 역공학 추측이 아니라 Z.ai의 공식 확인이었다.
왜 처음에는 개발사가 확인되지 않았나
출시 당시 Ox Alpha에는 회사명, 상세 모델 카드, 기술 논문, 일반적인 상업적 브랜드가 없었다. OpenRouter 목록에는 익명을 선택한 제3자 제공업체라는 설명만 있었다.
5
13
29
이 때문에 사용자는 모델을 평가할 때 보통 참고하는 정보도 얻기 어려웠다. 공식 개인정보 보호정책, 모델의 출처, 지원 창구, 프리뷰 종료 후 가격이 모두 불분명했다. 따라서 8월 20일부터 Z.ai가 공개하기 전까지 “개발사 미확인”이라는 표현은 정확했다. 하지만 8월 26일 이후에는 더 이상 최신 정보가 아니게 됐다.
3
4
GLM-5.3-Flash가 살아남을 조건
무료 일주일은 개발자가 이 모델을 원한다는 사실을 보여줬다. 그러나 무료 기간이 끝난 뒤에도 계속 사용할지는 가격, 한도, 안정성, 신뢰에 달려 있다.
가격과 처리 용량
초기 보도에서는 프리뷰 이후 가격이 공개되지 않았다. 유료 전환 뒤에도 경쟁력 있는 가격을 유지할 수 있는지, 무료 기간에 몰렸던 장시간 작업을 감당할 수 있는지가 장기 사용량을 좌우할 전망이다.
3
5
실제 워크플로의 안정성
바이럴 출시 기간에 좋은 성능을 보인 모델이라도 실제 서비스에서는 예측 가능한 지연시간, 가동률, 도구 사용의 일관성, 오류 복구 능력, 출력 품질이 필요하다. 프로덕션 코드베이스를 수정하는 에이전트에게는 단 한 번의 순위보다 이런 요소가 더 중요하다.
재현 가능한 독립 평가
앞으로 가장 유용한 근거는 전체 코딩 벤치마크와 실제 저장소를 대상으로 한 재현 가능한 테스트다. 테스트 하네스와 에이전트 설정까지 명확히 공개되어야 무료·고사용량 실험이 만든 일시적 이점과 모델 자체의 능력을 구분할 수 있다.
개인정보 보호와 기업 신뢰
익명 프리뷰 과정에서 프롬프트와 결과물의 처리 방식에 대한 불확실성이 있었던 만큼, 명확한 보존 정책, 모델 출처, 보안 관행, 기업용 통제 기능이 중요해진다.
4
12
17
오픈 웨이트와 생태계 확장
Z.ai가 예고한 가중치 공개가 실제로 이뤄지면 단일 API 경로를 넘어 로컬 또는 자체 호스팅 환경에서도 모델을 사용할 가능성이 열린다. OpenCode, OpenRouter, IDE 에이전트, 도구 호출 프레임워크에서의 지속적인 지원도 초기 유행이 장기 개발자 생태계로 이어질지를 결정할 요소다.
3
8
결론
Ox Alpha는 끝까지 정체가 밝혀지지 않은 모델이 아니었다. 2026년 8월 20일 익명 코드명으로 테스트된 뒤, 8월 26일 Z.ai의 GLM-5.3-Flash로 확인된 모델이다. 무료 프리뷰 기간 동안 OpenCode에서 6일간 약 42조 토큰을 처리했고, DeepSeek의 56일 연속 1위 기록을 끝냈으며, OpenRouter 사용량 순위에서도 정상에 올랐다.
7
11
16
기술 사양과 실제 반응은 인상적이었지만, 벤치마크 결과는 과장 없이 읽어야 한다. 전체 DeepSWE 테스트에서 확인된 가장 강한 독립 결과는 Claude Opus 4.8에 가까웠고, Fable 5와의 비교는 서로 다른 테스트를 사용한 만큼 직접적인 우열 판단이 어렵다.
36
38
47
진짜 시험은 무료 기간 이후 시작된다. GLM-5.3-Flash가 바이럴한 수요를 유료 사용, 신뢰할 수 있는 배포, 재현 가능한 코딩 성능, 그리고 지속 가능한 오픈 모델 생태계로 전환할 수 있을지가 관건이다.