O Ox Alpha era o GLM 5.3 Flash da Zhipu AI, confirmado em 26 de agosto de 2026 após um teste cego e gratuito iniciado em 20 de agosto. O modelo foi projetado para programação, automação visual, tarefas longas de agentes e uso de ferramentas, com contexto de aproximadamente 1 milhão de tokens e entradas nativas de te...
Resposta de pesquisa

Create a landscape editorial hero image for this Studio Global article: What is Zhipu AI’s GLM-5.3-Flash—the model previously released anonymously on OpenRouter as “Ox Alpha”—and how did its August 20, 2026 blind. Article summary: GLM-5.3-Flash is Zhipu AI’s (Z.ai’s) open-weight, natively multimodal mixture-of-experts model—the system anonymously trialed as “Ox Alpha” before Zhipu identified it on August 26. It is designed chiefly for coding, GUI/. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Durante quase uma semana, o Ox Alpha foi uma espécie de “caixa-preta” para a comunidade de inteligência artificial. O modelo apareceu gratuitamente no OpenRouter e em outras ferramentas para desenvolvedores em 20 de agosto de 2026, sem fabricante identificado, ficha técnica ou marca conhecida. Seis dias depois, a Zhipu AI — empresa que atua internacionalmente como Z.ai — revelou que o sistema era o GLM-5.3-Flash. 3
4
A revelação transformou um mistério viral em um lançamento importante no mercado de modelos abertos: um sistema Mixture-of-Experts (MoE) de 320 bilhões de parâmetros, com apenas 18 bilhões ativados por token, janela de contexto de 1.048.576 tokens, capacidades multimodais nativas e pesos liberados sob a licença MIT. 3
6
8
O endpoint estreou sem informar quem o havia criado. Desenvolvedores encontraram um modelo gratuito, com contexto muito longo e suporte a entradas multimodais, e começaram a usá-lo em tarefas de programação, automação e agentes capazes de operar ferramentas. O desempenho prático alimentou especulações sobre qual laboratório estava por trás da novidade. 13
16
Segundo a Zhipu, o anonimato foi intencional. A empresa queria que os usuários avaliassem as respostas sem influência do nome da marca, do número de parâmetros ou da divulgação tradicional de um lançamento. O tráfego real também permitiu observar como o sistema se comportava em fluxos de desenvolvimento de software e tarefas agentic — isto é, trabalhos em que a IA planeja etapas, usa ferramentas e refina o resultado. 13
15
Relatos apontaram uma capacidade gratuita próxima de 100 trilhões de tokens por dia durante o teste. O cofundador da Stripe, Patrick Collison, esteve entre os desenvolvedores conhecidos associados a avaliações positivas sobre a qualidade do modelo. Essas reações ajudaram a transformar o endpoint anônimo em um dos lançamentos mais acompanhados da semana, embora entusiasmo público não substitua uma avaliação controlada. 13
14
A infraestrutura também virou parte da história. A Zhipu afirmou que o serviço foi executado em aceleradores de inteligência artificial produzidos na China. O South China Morning Post relatou um cluster de 100 mil chips e mencionou 62 trilhões de tokens processados antes do lançamento oficial. Como os números variam entre os relatos, eles devem ser entendidos como cifras divulgadas pela empresa ou pela imprensa, e não como medições auditadas de forma independente. 7
13
O GLM-5.3-Flash é um modelo Mixture-of-Experts. Isso significa que seus 320 bilhões de parâmetros formam um grande conjunto de especialistas, mas somente 18 bilhões são acionados para cada token processado. Na prática, a proposta é combinar a capacidade representacional de um modelo muito grande com um custo computacional menor em cada etapa da inferência. 3
4
A arquitetura tem 45 camadas e é apresentada como a primeira versão nativamente multimodal da série GLM-5. Em vez de tratar imagens ou vídeos como um complemento separado de um modelo essencialmente textual, o sistema foi desenvolvido para lidar com texto, imagens, vídeos, documentos visuais, arquivos e entradas multimodais intercaladas. 4
11
Esse desenho atende a tarefas como analisar uma captura de tela, interpretar um documento, observar o resultado de um código ou acompanhar uma interface gráfica. Para agentes de programação, a ideia é criar um ciclo contínuo entre código, navegador, interface e feedback visual. 4
A Zhipu também anuncia uma janela de contexto de 1.048.576 tokens, normalmente resumida como 1 milhão de tokens. Uma janela desse tamanho pode ser útil para repositórios extensos, sessões prolongadas de agentes, grandes conjuntos de documentos e fluxos que misturam código, arquivos e imagens. 3
4
O modelo foi treinado a partir de uma nova base, com arquitetura e receita de treinamento redesenhadas. A empresa informa ter usado um corpus multimodal de 30 trilhões de tokens, apresentando o Flash como um modelo criado para eficiência e multimodalidade — e não simplesmente como uma versão reduzida do GLM-5.3. 4
16
O GLM-5.3-Flash combina atenção linear e atenção esparsa. A atenção linear busca tornar mais barata a análise de relações em sequências longas, enquanto a atenção esparsa preserva interações mais detalhadas apenas onde elas são consideradas importantes. O objetivo é equilibrar contexto extenso e custos de inferência mais administráveis. 4
16
O modelo também utiliza o mecanismo IndexPool, criado para diminuir o impacto de memória e latência associado à indexação em contextos de até 1 milhão de tokens. Outro componente citado pela Zhipu são as conexões hiperdimensionais restritas a variedades (manifold-constrained hyper-connections), voltadas à eficiência de escalabilidade. O benefício efetivo dessas técnicas depende do hardware, da configuração do serviço, do tamanho da sequência e do tipo de carga de trabalho. 4
16
Em comparação com o GLM-5.3, a Zhipu afirma que o Flash reduz o cálculo de atenção em 3,01 vezes e o uso de KV cache em 4,44 vezes, preservando a qualidade em contextos longos. O KV cache é uma área de memória usada para guardar informações já processadas durante a geração; em agentes de longa duração, ele pode se tornar um dos principais gargalos de custo e memória. 4
Essas proporções, porém, vêm sobretudo dos materiais técnicos da própria empresa. Portanto, não devem ser interpretadas como ganhos universais ou comprovados em qualquer hardware e cenário de produção. 4
O modelo foi direcionado principalmente a programação, programação visual, uso de ferramentas e tarefas agentic de longa duração. A capacidade visual nativa permite que um agente observe interfaces, resultados de renderização e respostas a interações, aproximando o processo de um ciclo de desenvolvimento que conecta código, navegador e interface gráfica. 4
Entre os resultados divulgados pela Zhipu estão:
Os números são compatíveis com o posicionamento do GLM-5.3-Flash como modelo para engenharia de software e agentes. Ainda assim, comparações entre sistemas exigem cautela: esses testes podem variar conforme os prompts, as ferramentas disponíveis, o uso de scaffolding, os limites de tempo, o hardware e a versão da avaliação. Os resultados publicados devem ser tratados como números reportados pela Zhipu, não como um ranking definitivo do mercado. 4
15
A Zhipu publicou os pesos do GLM-5.3-Flash no Hugging Face sob a permissiva licença MIT, incluindo uma versão em BF16. A documentação também aponta suporte a frameworks de inferência como SGLang e vLLM, permitindo que organizações estudem a implantação local ou mantenham sua própria infraestrutura, sem depender exclusivamente da API hospedada pela Z.ai. 3
6
8
Essa abertura muda a forma como o modelo pode ser avaliado. Equipes podem testá-lo com seus próprios repositórios, documentos, interfaces visuais e ambientes de agentes, além de investigar diretamente os custos de hardware e de atendimento.
Isso não significa, contudo, que o modelo seja leve. Os 320 bilhões de parâmetros totais ainda tornam a implantação uma tarefa de engenharia significativa. O fato de apenas 18 bilhões serem ativados por token reduz o trabalho computacional de cada etapa, mas não elimina automaticamente as exigências de memória do checkpoint completo.
O experimento Ox Alpha foi mais do que uma ação de marketing. Ele testou se os desenvolvedores continuariam usando o sistema quando seu nome, seus parâmetros e sua empresa de origem estivessem ocultos. A estratégia gerou padrões de uso e comentários baseados em tarefas reais antes da revelação oficial. 13
15
Mas há limites claros. O acesso gratuito pode provocar um volume de tráfego fora do padrão, elogios públicos podem refletir a novidade do lançamento e um teste anônimo não controla prompts, ferramentas ou condições de comparação. A conclusão mais segura é mais específica: o GLM-5.3-Flash despertou interesse considerável entre desenvolvedores antes que sua identidade fosse conhecida, e a Zhipu usou essa experiência para orientar o lançamento.
O GLM-5.3-Flash é a identidade revelada do Ox Alpha: um modelo aberto, multimodal e voltado à programação e a agentes que usam ferramentas. Seus principais números são 320 bilhões de parâmetros totais, 18 bilhões ativos por token, 45 camadas, contexto de aproximadamente 1 milhão de tokens, atenção linear combinada com atenção esparsa e pesos sob a licença MIT. 3
4
11
A promessa mais relevante não está apenas no tamanho. O modelo combina contexto longo, entrada visual, uso de ferramentas e uma redução de custos de atendimento alegada pela fabricante em um pacote que pode ser baixado e estudado pelos desenvolvedores. O teste cego ofereceu um retrato incomum do interesse real da comunidade, mas avaliações independentes e reproduzíveis ainda são necessárias para medir como essas promessas se traduzem em desempenho de produção.
Studio Global AI
Esta página inclui uma resposta baseada na fonte que você pode continuar em Studio Global.
O Ox Alpha era o GLM 5.3 Flash da Zhipu AI, confirmado em 26 de agosto de 2026 após um teste cego e gratuito iniciado em 20 de agosto.
O Ox Alpha era o GLM 5.3 Flash da Zhipu AI, confirmado em 26 de agosto de 2026 após um teste cego e gratuito iniciado em 20 de agosto. O modelo foi projetado para programação, automação visual, tarefas longas de agentes e uso de ferramentas, com contexto de aproximadamente 1 milhão de tokens e entradas nativas de texto, imagens, vídeos e arquivos.
A arquitetura Mixture of Experts tem 320 bilhões de parâmetros no total, mas ativa 18 bilhões por token; a Zhipu afirma ter reduzido em 3,01 vezes o cálculo de atenção e em 4,44 vezes o uso de KV cache em relação ao G...