A Zhipu AI, também conhecida internacionalmente como Z.ai, encerrou em 26 de agosto de 2026 o mistério em torno do modelo anônimo “Ox Alpha”. A empresa confirmou que o sistema — chamado de “Niu Lai” em comunidades chinesas de desenvolvedores — era o GLM-5.3-Flash, um modelo multimodal nativo, de pesos abertos, da família GLM.
1
15
O anúncio veio acompanhado de uma afirmação de escala: segundo a Zhipu, o modelo foi oferecido gratuitamente para testes anônimos no OpenRouter e no OpenCode e processou mais de 50 trilhões de tokens em cinco dias. Todo esse tráfego, afirmou a empresa, foi atendido por um cluster com mais de 100 mil chips chineses.
8
15
Um teste às cegas que virou prova de uso real
O Ox Alpha apareceu sem a identificação da empresa responsável. Isso permitiu que os desenvolvedores avaliassem o modelo pelo uso cotidiano — velocidade, disponibilidade, preço e qualidade das respostas — sem serem influenciados pela marca Zhipu ou pelo hardware usado nos bastidores.
Em pouco tempo, o modelo chegou ao topo dos rankings de uso do OpenRouter e do OpenCode. Relatos posteriores apontaram mais de 60 trilhões de tokens em seis dias, enquanto o volume no OpenRouter teria superado em mais de duas vezes o tráfego de modelos comparáveis da DeepSeek. Os totais variam porque as plataformas usaram períodos e métricas diferentes; a conclusão mais segura é que o teste ultrapassou 50 trilhões de tokens e atraiu uma demanda excepcionalmente alta.
1
3
30
Esse detalhe é importante: antes de saber quem estava por trás do Ox Alpha, os usuários estavam, na prática, “votando com o uso”. A adesão refletia o desempenho percebido e a experiência de operação, não uma campanha de lançamento convencional.
O que a Zhipu disse sobre os chips chineses
A Zhipu afirmou que a carga de trabalho de inferência online foi executada em mais de 100 mil aceleradores fabricados na China. A empresa também declarou que a otimização do software levou a eficiência do hardware e o custo por token a níveis comparáveis aos de GPUs convencionais da NVIDIA.
15
24
Os fornecedores exatos não foram identificados publicamente no material citado. Huawei, Moore Threads e Hygon apareceram em reportagens do setor como possíveis participantes, mas essa atribuição não foi confirmada pela Zhipu e deve ser tratada como informação não verificada.
30
40
A afirmação precisa ser entendida com cuidado. Ela não demonstra que os chips chineses sejam equivalentes aos da NVIDIA em todos os tipos de carga, que tenham substituído a empresa americana no treinamento de modelos ou que os dois ecossistemas ofereçam as mesmas ferramentas para desenvolvedores.
O que o episódio sustenta é uma conclusão mais específica: um serviço de inferência de grande escala pode ser construído sobre uma plataforma doméstica que não usa NVIDIA quando o modelo, o mecanismo de inferência e o hardware são otimizados em conjunto.
Por que o software de inferência foi decisivo
Uma janela de contexto de até 1 milhão de tokens impõe exigências pesadas de memória, largura de banda, comunicação entre chips e gerenciamento de tarefas. Para lidar com essas limitações, a Zhipu teria criado um mecanismo de inferência dedicado baseado no SGLang e usado técnicas como:
- quantização W8A8, para reduzir a pressão sobre memória e computação;
- quantização mista INT8, FP8 e BF16 para o cache;
- paralelismo de tensores dentro dos nós; e
- uma arquitetura Encode–Prefill–Decode (EPD), que separa a codificação multimodal, o processamento inicial do prompt e a geração token a token em grupos de trabalho que podem ser escalados de forma independente.
11
24
Segundo a Zhipu, o sistema aumentou em cerca de três vezes o desempenho ponta a ponta em comparação com sua linha de base inicial no mesmo hardware.
24
26 A documentação posterior do SGLang também registra ganhos adicionais de vazão e de capacidade do cache FP8 em relação a uma configuração de comparação em BF16. Esses dados, porém, não constituem uma auditoria independente da alegação original de triplicação de desempenho.
17
Para a NVIDIA, a implicação mais direta está no papel do CUDA na inferência, e não em um colapso imediato de sua vantagem geral. Kernels especializados, quantização, paralelismo e escalonamento podem reduzir a dependência do CUDA em determinadas cargas de produção. O ecossistema de software da NVIDIA, suas ferramentas, sua base instalada e sua posição no treinamento de modelos são questões mais amplas que o lançamento não resolve.
Especificações do GLM-5.3-Flash
O GLM-5.3-Flash é descrito como um modelo esparso de mistura de especialistas, ou MoE. Ele tem 320 bilhões de parâmetros no total, mas ativa aproximadamente 18 bilhões por token. Também oferece uma janela de contexto de 1.048.576 tokens e entrada multimodal nativa, características voltadas a documentos longos, programação e fluxos de trabalho prolongados com agentes de IA.
2
5
7
O modelo recebeu pontuação 57 no Artificial Analysis Intelligence Index, a mesma pontuação reportada para o Claude Opus 4.8. Isso representa uma equivalência em um índice composto específico — não uma prova de desempenho idêntico em todos os benchmarks, aplicações ou tarefas realizadas por agentes.
9
Preço baixo como parte da estratégia
A Zhipu informou preços de API de US$ 0,15 por milhão de tokens de entrada e US$ 0,50 por milhão de tokens de saída.
4
29
A cobertura contemporânea descreveu o modelo como custando aproximadamente um décimo do GLM-5.3 e cerca de um quadragésimo do Claude Opus 4.8. Essas proporções dependem da direção dos tokens, do plano e da faixa de contexto usados na comparação.
1
4
Na prática, o desafio do GLM-5.3-Flash aos provedores tradicionais combina três elementos: uma arquitetura esparsa relativamente eficiente, otimização agressiva da operação e preços baixos. O teste do Ox Alpha mostrou que essa combinação pode atrair um volume expressivo de usuários antes mesmo de a identidade do modelo ser revelada.
O episódio não prova que a Zhipu tenha eliminado todas as limitações de hardware ou software. Mas oferece uma demonstração em escala de produção de quanto pode ser obtido quando o modelo, o mecanismo de inferência e a infraestrutura são projetados como um único sistema.