Em 26 de agosto de 2026, a Z.ai confirmou que o preview gratuito e anônimo chamado Ox Alpha era o GLM 5.3 Flash, modelo multimodal com 320 bilhões de parâmetros totais e 18 bilhões ativos por token. O modelo aceita texto, imagens e vídeos, oferece contexto de aproximadamente 1 milhão de tokens, tem pesos sob licença...
Resposta de pesquisa

Create a landscape editorial hero image for this Studio Global article: What did Z.ai, the Chinese AI company formerly known as Zhipu AI, reveal about the anonymous “Ox Alpha” model that appeared free and without. Article summary: Z.ai disclosed on August 26 that the previously anonymous, free “Ox Alpha” preview was **GLM-5.3-Flash**—the first natively multimodal GLM-5 model. It is an open-weight, low-cost coding and agent model whose stealth rele. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
A dúvida terminou em 26 de agosto de 2026: a Z.ai confirmou que o Ox Alpha, modelo anônimo oferecido pelo OpenRouter e pelo OpenCode, era o GLM-5.3-Flash. A empresa apresentou o sistema como o primeiro modelo nativamente multimodal da família GLM-5, com pesos abertos, janela de contexto de 1 milhão de tokens e foco em programação e tarefas de agentes de longa duração. 1540
A parte mais importante da história vai além da identidade do modelo. O Ox Alpha combinou um preview gratuito e anônimo com uso intenso por desenvolvedores e, depois, virou um produto com nome próprio e pesos para download. Com isso, a Z.ai conseguiu testar sua infraestrutura sob cargas reais e gerar interesse em torno do lançamento oficial.
O GLM-5.3-Flash é um modelo de mistura de especialistas, ou MoE, com 320 bilhões de parâmetros no total e 18 bilhões de parâmetros ativos por token. Ele aceita nativamente texto, imagens e vídeos, mas produz respostas em texto. A capacidade anunciada de contexto é de aproximadamente 1 milhão de tokens, embora o limite exibido varie conforme a plataforma: a documentação da Z.ai descreve o projeto de 1 milhão de tokens, enquanto o OpenRouter lista uma janela de 1.310.720 tokens. 12340
A Z.ai liberou os pesos sob a Licença MIT, o que torna o modelo muito mais fácil de implantar e adaptar do que um sistema disponível apenas por uma API fechada. Depois do fim do preview anônimo, o modelo também passou a aparecer no OpenRouter com seu nome público. 348
É importante não confundir esse lançamento com o GLM-5.3 maior, anunciado no início de agosto. As informações disponíveis descrevem o GLM-5.3-Flash como um modelo separado, de menor custo e configuração 320B-A18B — não como o mesmo produto da linha GLM-5.3 de maior porte. 10
A Z.ai afirma que o GLM-5.3-Flash supera o GLM-5.2 e reduz os custos de operação. Nos resultados divulgados em torno do lançamento, o modelo marcou 63,4 no DeepSWE v1.1, contra 46,2 do GLM-5.2. A empresa também informou 29,0 pontos em seu benchmark interno de programação, próximo dos 29,5 atribuídos ao Claude Opus 4.8. 316
Esses números ajudam a entender como a Z.ai está posicionando o produto, mas não constituem uma confirmação independente de paridade com o modelo da Anthropic. As definições dos benchmarks, as configurações de avaliação, os prompts e a possibilidade de reprodução dos testes fazem diferença. A conclusão mais segura é que a Z.ai reivindica forte desempenho em programação e tarefas de agentes a um custo muito menor — não que o GLM-5.3-Flash tenha definitivamente superado os modelos de fronteira fechados.
O aspecto mais chamativo do Ox Alpha era a possibilidade de desenvolvedores experimentarem o modelo sem pagar durante o preview anônimo. Essa fase terminou quando o sistema ganhou uma identidade pública. O preço de tabela informado pela Z.ai é de US$ 0,15 por milhão de tokens de entrada e US$ 0,50 por milhão de tokens de saída. 13
Na época do lançamento, o OpenRouter exibia uma tarifa promocional menor, de US$ 0,075 por milhão de tokens de entrada e US$ 0,25 por milhão de tokens de saída. 2 A distinção é importante: o preview gratuito, o preço de tabela da Z.ai e o desconto temporário específico de uma plataforma são condições de acesso diferentes.
Mesmo no preço de tabela, a economia do modelo é parte central de seu apelo. Agentes de programação podem consumir grandes volumes de contexto e gerar muitas respostas. Por isso, o custo por token pode pesar na escolha do modelo tanto quanto uma pequena vantagem em benchmarks.
A Z.ai afirmou que o GLM-5.3-Flash funcionava integralmente em aceleradores de inteligência artificial fabricados na China. 15 Reportagens sobre o sistema de atendimento descrevem uma infraestrutura personalizada baseada no SGLang, com técnicas como quantização, paralelismo de tensores, formatos mistos de cache, divisão de camadas e uma arquitetura separada de codificação, pré-preenchimento e decodificação. O objetivo informado era melhorar o desempenho de ponta a ponta dentro das limitações do hardware doméstico. 25
A afirmação amplia uma narrativa anterior da Z.ai em torno da família GLM. A empresa já havia dito que treinou modelos da série em processadores Huawei Ascend sem usar hardware da Nvidia. Reportagens também observam que a inclusão da Z.ai na Entity List dos Estados Unidos restringe seu acesso aos aceleradores Nvidia H100, H200 e B200. 26
A alegação sobre inferência tem importância estratégica, mas deve ser entendida como uma declaração da empresa apoiada por reportagens do setor, e não como uma comparação de desempenho de hardware completamente auditada. O ponto mais sólido é que a Z.ai está apresentando sua pilha de modelos como capaz de atender a um sistema multimodal de grande porte sem depender das principais GPUs de data center da Nvidia.
O lançamento anônimo parece ter seguido um roteiro deliberado de divulgação discreta: publicar um modelo capaz sem revelar sua origem, oferecê-lo gratuitamente por rotas populares de programação, observar como os desenvolvedores o utilizam e revelar o produto depois que o sistema já acumulou feedback do mundo real. A Z.ai também foi associada a um teste anterior, o “Pony Alpha”, que teria usado uma ideia semelhante. Enquanto isso, investigadores da comunidade tentaram identificar o Ox Alpha por meio do comportamento do tokenizador, de pistas relacionadas ao processamento de vídeo e de padrões de erro da API. 71113
Algumas reportagens publicadas durante o lançamento também mencionaram números muito altos de uso e entusiasmo entre desenvolvedores, mas o material disponível não verifica de forma independente todos os valores ou citações. Essas alegações devem ser tratadas como informações do período de lançamento, não como dados de adoção auditados. 14
O GLM-5.3-Flash não prova que a Z.ai ultrapassou a OpenAI ou a Anthropic em toda a gama de capacidades dos modelos de fronteira. O lançamento, porém, demonstra uma combinação potencialmente disruptiva: entrada multimodal, contexto muito longo, pesos abertos sob a licença MIT, especialização em agentes de programação e preços baixos de API em um único produto. 1540
Para desenvolvedores, essa combinação pode reduzir o custo de mudança de fornecedor e tornar mais viáveis implantações próprias ou com múltiplos provedores. Para empresas que operam modelos fechados, ela aumenta a pressão sobre preços e margens — especialmente em tarefas de programação, nas quais volume de tokens, latência, controle da implantação e disponibilidade de infraestrutura podem importar tanto quanto a posição em um ranking.
Studio Global AI
Esta página inclui uma resposta baseada na fonte que você pode continuar em Studio Global.
Em 26 de agosto de 2026, a Z.ai confirmou que o preview gratuito e anônimo chamado Ox Alpha era o GLM 5.3 Flash, modelo multimodal com 320 bilhões de parâmetros totais e 18 bilhões ativos por token.
Em 26 de agosto de 2026, a Z.ai confirmou que o preview gratuito e anônimo chamado Ox Alpha era o GLM 5.3 Flash, modelo multimodal com 320 bilhões de parâmetros totais e 18 bilhões ativos por token. O modelo aceita texto, imagens e vídeos, oferece contexto de aproximadamente 1 milhão de tokens, tem pesos sob licença MIT e custa US$ 0,15 por milhão de tokens de entrada e US$ 0,50 por milhão de tokens de saída na t...
O lançamento secreto permitiu à Z.ai observar o uso de agentes de programação em escala real antes de revelar a identidade do modelo, combinando teste de infraestrutura, coleta de feedback e estratégia de divulgação.