Ox Alpha는 정체불명의 새로운 AI 연구소가 만든 모델이 아니었다. 2026년 8월 20일 OpenRouter와 OpenCode에 ‘Stealth’라는 공급자명으로 등장했던 이 모델은, Z.ai가 정식 출시 전에 익명으로 테스트한 GLM-5.3-Flash였다. Z.ai는 8월 26일 Ox Alpha가 바로 이 모델의 사전 공개 버전이었다고 확인했다. 110
이 사건은 AI 모델이 정식 모델 카드나 공식 벤치마크를 공개하기 전에도 어떻게 개발자 커뮤니티의 화제가 될 수 있는지를 보여준다. 100만 토큰에 가까운 컨텍스트, 멀티모달 입력, 에이전트 작업에 맞춘 도구 사용, 그리고 한시적인 무료 접근성이 한꺼번에 결합된 결과였다.
Ox Alpha가 처음 내세운 사양
익명으로 등록된 Ox Alpha는 코딩과 장시간 이어지는 에이전트 작업, 실제 운영 환경의 워크로드를 겨냥한 추론 모델로 소개됐다. 당시 공개된 주요 사양은 다음과 같다.
- 모델 ID:
stealth/ox-alpha
- 컨텍스트 창: 1,048,576토큰
- 최대 출력: 131,072토큰
- 입력 형식: 텍스트·이미지·동영상
- 기능: 추론, 네이티브 도구 호출, 구조화된 출력
- 미리보기 가격: 입력·출력 토큰 모두 무료
무료 제공 기간은 경로에 따라 다르게 안내됐다. OpenRouter는 더 짧은 제공 기간을 알렸고, OpenCode는 8월 20일부터 약 일주일간 무료라고 설명했다. 따라서 무료 접근이 끝나는 시점은 하나의 확정된 날짜라기보다 대략 8월 24~27일 사이로 보는 편이 정확하다. 2412
100만 토큰 컨텍스트가 모델의 품질을 자동으로 보장하는 것은 아니다. 다만 개발자가 시도할 수 있는 작업의 범위를 크게 넓힌다. 코딩 에이전트는 저장소 전체에 가까운 코드와 도구 출력, 로그, 화면 정보를 한 세션에 더 오래 유지할 수 있다. 매번 앞선 내용을 요약하거나 버리지 않아도 되기 때문이다. 동영상 입력까지 더해지면서 브라우저·GUI 테스트처럼 텍스트만으로 처리하기 어려운 작업에도 활용 가능성이 생겼다. 343
왜 이렇게 빠르게 확산됐나
Ox Alpha의 초기 매력은 막연한 ‘미지의 최강 모델’이라는 소문보다 실용성에 있었다. 개발자들은 긴 컨텍스트와 멀티모달 입력, 도구 호출을 지원하는 코딩 모델을 토큰 비용 없이 직접 시험할 수 있었다. 저장소 수정, 브라우저 조작, 장시간 소프트웨어 엔지니어링 같은 에이전트 작업을 실험하려는 사람들에게 진입장벽이 매우 낮았다.
관심은 곧 사용량으로 이어졌다. Ox Alpha는 OpenCode 순위에서 56일 동안 1위를 지키던 DeepSeek를 잠시 밀어냈고, 출시 당일 사용량이 이례적으로 치솟았다는 보도도 나왔다. 다만 당시 유통된 대규모 처리 용량과 토큰 사용량 수치는 모두 독립적으로 검증된 것은 아니다. 따라서 정확한 운영 규모라기보다는 출시 직후 관심이 얼마나 집중됐는지를 보여주는 지표로 해석해야 한다. 114
무료 체험 기간의 인기는 모델의 순수한 성능만 반영하지 않는다. 성능, 신기함, 가격, 접근성, 서비스 안정성이 한데 섞인 결과다. 사용량 순위가 곧 전체적인 모델 우위를 뜻하지 않는 이유다.
DeepSWE 80% 성적은 인상적이지만 결정적이지 않았다
가장 널리 퍼진 초기 주장은 Ox Alpha가 DeepSWE에서 **80%**를 기록했다는 내용이었다. 하지만 이는 113개 과제 중 단 10개를 골라 8개를 해결한 결과였다. 10개 표본은 흥미로운 신호가 될 수는 있어도 안정적인 순위나 모델 간 우열을 입증하기에는 너무 작다.
더 큰 평가에서는 약 **63%**가 보고됐고, Z.ai가 정식 공개한 GLM-5.3-Flash의 공식 수치는 **DeepSWE v1.1 기준 63.4%**였다. 7634 다른 전체 평가에서는 113개 과제 중 58.4%라는 결과도 나왔다. 이 평가에서는 출력 형식과 구현 방식의 문제가 실패 점수에 상당한 영향을 미친 것으로 보고됐다. 4142
따라서 가장 신중한 결론은 다음과 같다. Ox Alpha는 코딩 에이전트 작업에서 강한 능력을 보였고, 일부 평가에서는 선두권 비공개 모델과 비슷한 수준에 도달했다. 그러나 클로드 Fable 5나 다른 모든 프런티어 모델을 일관되게 능가했다고 말할 만한 증거는 부족하다.
클로드 비교가 엇갈린 이유
서로 다른 결과가 나온 데에는 평가 조건의 차이가 컸다. 테스트에 사용한 과제 일부, 에이전트 하네스, 도구 접근 권한, 시간 제한, 성공 판정 기준이 모두 달랐다. 초기 10개 표본에서 80%가 나왔다고 해서 전체 벤치마크에서도 같은 비율이 유지되는 것은 아니다.
전체 과제에 가까운 평가에서 63% 안팎의 결과가 나왔고, 형식 오류에 추가 페널티를 적용한 실행에서는 58.4%가 보고됐다. DeepSWE 팀은 이후 모델의 종합적인 능력이 클로드 Opus 4.8과 대체로 비슷하다고 본 것으로 전해졌다. 이는 Ox Alpha가 클로드 Fable 5를 확실히 앞섰다는 주장과는 다른 결론이다. 35
벤치마크 점수는 숫자만 떼어 비교하기보다 과제 범위와 실행 환경을 함께 제시해야 한다. 서로 다른 설정에서 나온 80%, 63%, 58.4%는 하나의 동일한 순위표에 그대로 놓을 수 있는 수치가 아니다.
주요 개발자들이 높이 평가한 이유
유명 개발자들의 긍정적인 반응은 모델의 실제 작업 흐름과 관련이 있었다. Stripe의 공동 창업자이자 CEO인 패트릭 콜리슨은 에이전트 하네스를 통해 사용한 뒤 Ox Alpha를 “매우 인상적”이라고 평가했다. HermesAgent 창업자도 팀 내부의 여러 평가 기준을 넘어섰다고 말했다. 3335
이런 반응은 코딩과 에이전트 작업에서 직접 사용했을 때의 유용성을 보여주는 사례다. 하지만 통제된 환경의 종합 벤치마크에서 모든 경쟁 모델보다 뛰어났다는 뜻은 아니다.
특정 모델이 실무에서 더 유용하게 느껴지는 이유는 다양하다. 컨텍스트 길이, 도구 호출의 안정성, 응답 속도, 이미지·동영상 처리, 비용 등이 모두 영향을 준다. 전체 평균 성능 순위가 불확실하더라도 특정 개발 워크플로에서는 훨씬 편리할 수 있다.
커뮤니티는 어떻게 정체를 추적했나
정식 공개 전 커뮤니티는 Ox Alpha의 동작을 Xiaomi의 MiMo 팀, Google DeepMind, Zhipu AI의 GLM 계열과 비교했다.
Xiaomi와 MiMo 가설
Xiaomi가 후보로 거론된 이유 중 하나는 MiMo 팀이 과거 ‘Hunter Alpha’라는 익명 테스트를 진행한 전력이었기 때문이다. 하지만 기능 면에서는 차이가 있었다. 당시 공개적으로 알려진 MiMo 모델은 오디오 입력을 지원하는 반면, Ox Alpha는 텍스트·이미지·동영상은 입력받았지만 오디오는 지원하지 않았다. Xiaomi는 흥미로운 후보였지만 강한 귀속 근거는 아니었다. 2229
Google DeepMind 가설
Google과 관련된 암시와 소셜미디어 게시물도 추측을 키웠다. 그러나 공개된 단서만으로는 DeepMind가 해당 엔드포인트를 만들거나 운영했다는 사실을 입증할 수 없었다. 끝까지 정황 증거에 머문 셈이다.
GLM 특유의 기술적 흔적
정식 공개 전 가장 설득력을 얻은 가설은 Zhipu의 GLM 계열이었다. 커뮤니티 테스트에서 Ox Alpha의 토큰 수가 다양한 프롬프트에 대해 GLM-5.3과 일치했으며, 매 요청마다 약 75토큰의 고정된 래퍼 오프셋만 보였다는 보고가 나왔다. 별도의 동영상 테스트에서도 여러 인코딩 특성에 따른 토큰 소비 방식이 Zhipu의 GLM 비전 모델과 맞아떨어졌다. 1821
추가로 다음과 같은 단서도 제시됐다.
- GLM API 응답과 비슷한
reasoning_effort 오류;
- 이미지 분석 실패 과정에서 나타난 중국어 프롬프트;
- Zhipu의 멀티모달 모델과 일치하는 동영상 토큰화 방식;
- Zhipu가 과거 사용한 ‘Pony Alpha’라는 명칭과의 유사성. 212629
각 단서는 라우팅, 래퍼, 공용 인프라 또는 모방으로도 설명할 수 있었다. 하지만 여러 단서가 동시에 쌓이면서 GLM 가설은 점점 힘을 얻었다. 결정적인 증거는 Z.ai가 Ox Alpha를 GLM-5.3-Flash로 직접 확인하고 정식 모델을 출시한 일이었다. 1043
정식 공개로 무엇이 달라졌나
정체가 밝혀지면서 Ox Alpha는 익명의 미스터리 모델에서 제품 미리보기로 성격이 바뀌었다. Z.ai 문서에 따르면 GLM-5.3-Flash는 총 3,200억 개 파라미터 가운데 토큰당 180억 개를 활성화하는 하이브리드 모델이다. 인터페이스를 관찰하고, 렌더링 결과와 상호작용 피드백을 확인하는 네이티브 비주얼 기능도 제공한다. 이를 통해 코드·브라우저·GUI를 연결하는 작업 흐름을 구성할 수 있다. 43
정식 출시가 해결한 가장 큰 문제는 익명 엔드포인트의 불확실성이었다. GLM-5.3-Flash는 MIT 라이선스로 공개됐고, 개발자가 가중치를 내려받아 배포를 직접 통제할 수 있는 형태로 제공됐다. 1950
다만 MIT 라이선스가 모든 배포 비용과 위험을 없애주는 것은 아니다. 실제 도입 전에는 필요한 하드웨어, 추론 성능, API 약관, 개인정보 처리 방식, 호출 제한, 도구 사용 안정성, 응답 일관성을 각자의 환경에서 확인해야 한다.
무료 열풍 이후에도 살아남을 수 있을까
Ox Alpha가 관심을 끈 것은 무료 접근성이었지만, GLM-5.3-Flash의 장기적인 채택 여부는 보다 현실적인 요소에 달려 있다.
- 비용: 유료 API 가격이 다른 고성능 코딩 모델과 비교해 경쟁력 있는가.
- 신뢰성: 가동 시간, 호출 제한, 도구 호출 결과가 안정적인가.
- 개인정보 보호: 코드와 프롬프트, 이미지·동영상 입력이 어떻게 저장되고 사용되는가.
- 재현성: 독립적인 평가가 전체 벤치마크와 실제 애플리케이션에서의 성능을 명확히 보여주는가.
- 배포 선택권: MIT 라이선스 가중치를 활용한 자체 호스팅이 운영 요건을 감당할 만한가.
Ox Alpha의 핵심 교훈은 익명 모델이 잠시 유명 경쟁자를 이겼다는 데 있지 않다. 개발자가 대규모로 시험해볼 수 있고, 실제 작업 흐름에 맞는 기능을 갖춘 모델이라면 정식 브랜드가 없어도 빠르게 확산될 수 있다는 점이다.
벤치마크는 초기 헤드라인보다 훨씬 신중하게 읽어야 했다. 그러나 100만 토큰 컨텍스트, 멀티모달 입력, 도구 사용, 에이전트 코딩, 낮은 비용이라는 조합이 개발자들의 관심을 끌기에 충분했다는 사실은 분명하다. 이제 정체가 GLM-5.3-Flash로 밝혀진 만큼, 다음 관문은 무료 체험과 신비감이 사라진 뒤에도 이 조합이 실제 개발 현장에서 계속 유용한지 여부다.