O Ox Alpha passou em 8 de 10 tarefas no teste limitado de Ben Davis no DeepSWE, contra 65% do Claude Fable 5 e 52% do GPT 5.6 Sol — mas a amostra é pequena demais para provar uma vitória geral. A janela de contexto de 1.048.576 tokens, o suporte a texto, imagem e vídeo e o acesso gratuito por uma semana tornaram o m...
Resposta de pesquisa

Create a landscape editorial hero image for this Studio Global article: What is known about the anonymous AI model “stealth/ox-alpha,” which appeared on OpenRouter on August 20, 2026 with no disclosed creator, a. Article summary: Ox Alpha is an anonymous, short-preview “stealth” model, not a verified new frontier-model release. The evidence makes a Zhipu AI / Z.ai GLM-family origin plausible, but it was still unconfirmed as of August 21, so it sh. Topic tags: general, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, chart
O Ox Alpha deve ser entendido como uma prévia pública anônima — e não como o lançamento confirmado de um novo modelo de fronteira. O modelo surgiu no OpenRouter em 20 de agosto de 2026, com acesso gratuito por uma semana e especificações voltadas a programação, tarefas longas executadas por agentes e fluxos multimodais. Seus sinais técnicos tornam plausível uma origem na Zhipu AI, também conhecida como Z.ai, e na família GLM, mas isso continua sendo uma inferência, não um fato anunciado.
O OpenRouter listou o modelo stealth/ox-alpha como um sistema de terceiros cujo desenvolvedor e operador decidiram permanecer anônimos durante a prévia. A plataforma afirma apenas encaminhar as solicitações: ela não é a desenvolvedora, proprietária nem provedora do modelo.
As especificações anunciadas eram ambiciosas para um serviço gratuito:
O OpenCode também ofereceu acesso ao modelo em seu plano gratuito. O anúncio falava em limites generosos e uso “quase ilimitado”, além de uma capacidade declarada de 100 trilhões de tokens por dia. Esse número é uma afirmação do operador, não uma medição de throughput auditada de forma independente.
O desenvolvedor Ben Davis testou o Ox Alpha em 10 tarefas extraídas do DeepSWE, um benchmark de engenharia de software que avalia a capacidade de agentes de IA de trabalhar em problemas longos e complexos. Segundo o teste, o modelo passou em oito tarefas, chegando a aproximadamente 80%. Na mesma comparação limitada, o Claude Fable 5 marcou 65% e o GPT-5.6 Sol, 52%.
É um resultado impressionante, mas não deve ser descrito como uma vitória oficial no DeepSWE. A versão 1.1 do benchmark reúne 113 tarefas originais de engenharia de software distribuídas por 91 repositórios. Portanto, o experimento cobriu apenas uma pequena parte da avaliação completa.
Há ainda limitações metodológicas importantes:
O retrato do ranking público disponível naquele momento colocava o Claude Opus 5 em primeiro, com 73,6%, seguido pelo GPT-5.6 Sol, com 72,7%, e pelo Claude Fable 5, com 69,7%. A conclusão mais segura é mais restrita: o Ox Alpha teve desempenho muito forte no experimento de 10 tarefas de Davis, mas o resultado não prova que ele seja o melhor modelo geral para programação.
A principal teoria de atribuição liga o Ox Alpha à Zhipu AI — ou Z.ai — e à sua família de modelos GLM. A hipótese se baseia em uma espécie de análise forense do comportamento do modelo, não em um anúncio da empresa.
Em um teste divulgado, pesquisadores compararam o comportamento de tokenização do Ox Alpha e do GLM-5.3 em 25 prompts. As contagens originais teriam coincidido depois de considerar uma diferença fixa de 75 tokens, atribuída a uma camada de processamento. Testes separados com vídeos também teriam encontrado padrões visuais semelhantes, incluindo o modo de amostragem de quadros, a variação conforme a duração e o tratamento da resolução.
Outras semelhanças relatadas envolvem o estilo das respostas, o comportamento da API e a forma como o modelo lida com entradas de áudio. Isoladamente, cada pista poderia ser explicada por um wrapper compartilhado, infraestrutura comum ou imitação. Juntas, porém, elas formam um conjunto de sinais que analistas consideram compatível com a linha multimodal unificada GLM da Zhipu.
A Zhipu também já teria usado lançamentos anônimos ou em modo stealth, incluindo o codinome Pony Alpha. Esse histórico acrescenta contexto circunstancial à teoria, mas não prova que a empresa tenha criado o Ox Alpha.
Uma hipótese minoritária também relacionou o modelo à equipe MiMo, da Xiaomi. No entanto, os indícios técnicos divulgados publicamente foram interpretados principalmente como compatíveis com a Zhipu e a família GLM. Essa atribuição continua sem confirmação independente ou oficial.
Nenhuma empresa havia reivindicado publicamente a autoria do Ox Alpha no período coberto pelos relatos, e a Zhipu não havia confirmado a atribuição. Especulações chegaram a mencionar variantes específicas da família GLM, mas as evidências disponíveis não determinam se o Ox Alpha é um modelo ainda não lançado, uma variante de produção, um sistema ajustado para tarefas específicas ou um modelo operado de forma independente com infraestrutura relacionada.
A descrição mais defensável, portanto, é: o Ox Alpha provavelmente deriva da família GLM e pode estar ligado à Zhipu, mas seu criador e sua identidade exata permaneciam sem verificação. Percentuais de confiança divulgados por analistas individuais não devem ser tratados como identificação oficial.
A política de dados do Ox Alpha é um dos detalhes mais importantes para desenvolvedores. A página do modelo no OpenRouter informa que os prompts e as respostas são retidos pelo provedor subjacente, mas não são usados para treinamento.
Isso é diferente da política geral de coleta de dados do OpenRouter. A plataforma afirma que não armazena prompts ou respostas, a menos que o usuário ative voluntariamente o registro de entradas e saídas. Ela também documenta separadamente as políticas de cada provedor, o que significa que a camada de roteamento e o fornecedor do modelo podem ter regras diferentes de retenção.
O OpenCode, por sua vez, divulgou o Ox Alpha com a promessa de “zero data retention”, ou retenção zero. Essa declaração pode descrever o tratamento feito pelo próprio OpenCode, mas não elimina automaticamente a informação de retenção associada ao provedor na rota do OpenRouter. Em outras palavras, “o OpenCode não retém os dados” e “o provedor subjacente retém prompts e respostas” podem se referir a etapas diferentes do mesmo caminho de uma solicitação.
Até que os envolvidos publiquem uma política única e contratualmente clara de tratamento de dados, a postura prudente é presumir que o provedor do modelo pode guardar o conteúdo enviado. Desenvolvedores devem evitar inserir código proprietário, credenciais, dados pessoais ou informações reguladas apenas porque o serviço é gratuito ou afirma não treinar com os prompts.
O Ox Alpha se destacou por três motivos: uma prévia gratuita de curta duração, uma janela de contexto e capacidades multimodais incomuns, além de um resultado inicial bastante expressivo em programação. Ainda assim, as evidências recomendam cautela — não a afirmação de que um laboratório desconhecido derrotou definitivamente os modelos de fronteira estabelecidos.
O índice de 80% no DeepSWE veio de oito tarefas concluídas em um conjunto de 10, e não do benchmark completo de 113 tarefas. O ranking público ainda mostrava o Claude Opus 5 à frente, e o Ox Alpha não havia passado pelo processo oficial de avaliação.
As impressões digitais técnicas fazem da ligação entre Zhipu e GLM a explicação mais provável, mas nenhuma confirmação pública estabelecia a autoria. Para experimentos, o Ox Alpha era um modelo interessante de testar. Para sistemas em produção ou código sensível, sua propriedade anônima, a retenção no nível do provedor e a identidade não resolvida eram motivos suficientes para avançar com cuidado.
Studio Global AI
Esta página inclui uma resposta baseada na fonte que você pode continuar em Studio Global.
O Ox Alpha passou em 8 de 10 tarefas no teste limitado de Ben Davis no DeepSWE, contra 65% do Claude Fable 5 e 52% do GPT 5.6 Sol — mas a amostra é pequena demais para provar uma vitória geral.
O Ox Alpha passou em 8 de 10 tarefas no teste limitado de Ben Davis no DeepSWE, contra 65% do Claude Fable 5 e 52% do GPT 5.6 Sol — mas a amostra é pequena demais para provar uma vitória geral. A janela de contexto de 1.048.576 tokens, o suporte a texto, imagem e vídeo e o acesso gratuito por uma semana tornaram o modelo especialmente chamativo; testes de fingerprinting apontam para a família GLM da Zhipu, s...
O OpenRouter informa que o provedor retém prompts e respostas, embora não os use para treinamento; o OpenCode, por outro lado, divulgou uma promessa de retenção zero.