As especificações anunciadas eram ambiciosas para um serviço gratuito:
O OpenCode também ofereceu acesso ao modelo em seu plano gratuito. O anúncio falava em limites generosos e uso “quase ilimitado”, além de uma capacidade declarada de 100 trilhões de tokens por dia. Esse número é uma afirmação do operador, não uma medição de throughput auditada de forma independente.
O desenvolvedor Ben Davis testou o Ox Alpha em 10 tarefas extraídas do DeepSWE, um benchmark de engenharia de software que avalia a capacidade de agentes de IA de trabalhar em problemas longos e complexos. Segundo o teste, o modelo passou em oito tarefas, chegando a aproximadamente 80%. Na mesma comparação limitada, o Claude Fable 5 marcou 65% e o GPT-5.6 Sol, 52%.
É um resultado impressionante, mas não deve ser descrito como uma vitória oficial no DeepSWE. A versão 1.1 do benchmark reúne 113 tarefas originais de engenharia de software distribuídas por 91 repositórios. Portanto, o experimento cobriu apenas uma pequena parte da avaliação completa.
Há ainda limitações metodológicas importantes:
O retrato do ranking público disponível naquele momento colocava o Claude Opus 5 em primeiro, com 73,6%, seguido pelo GPT-5.6 Sol, com 72,7%, e pelo Claude Fable 5, com 69,7%. A conclusão mais segura é mais restrita: o Ox Alpha teve desempenho muito forte no experimento de 10 tarefas de Davis, mas o resultado não prova que ele seja o melhor modelo geral para programação.
A principal teoria de atribuição liga o Ox Alpha à Zhipu AI — ou Z.ai — e à sua família de modelos GLM. A hipótese se baseia em uma espécie de análise forense do comportamento do modelo, não em um anúncio da empresa.
Em um teste divulgado, pesquisadores compararam o comportamento de tokenização do Ox Alpha e do GLM-5.3 em 25 prompts. As contagens originais teriam coincidido depois de considerar uma diferença fixa de 75 tokens, atribuída a uma camada de processamento. Testes separados com vídeos também teriam encontrado padrões visuais semelhantes, incluindo o modo de amostragem de quadros, a variação conforme a duração e o tratamento da resolução.
Outras semelhanças relatadas envolvem o estilo das respostas, o comportamento da API e a forma como o modelo lida com entradas de áudio. Isoladamente, cada pista poderia ser explicada por um wrapper compartilhado, infraestrutura comum ou imitação. Juntas, porém, elas formam um conjunto de sinais que analistas consideram compatível com a linha multimodal unificada GLM da Zhipu.
A Zhipu também já teria usado lançamentos anônimos ou em modo stealth, incluindo o codinome Pony Alpha. Esse histórico acrescenta contexto circunstancial à teoria, mas não prova que a empresa tenha criado o Ox Alpha.
Uma hipótese minoritária também relacionou o modelo à equipe MiMo, da Xiaomi. No entanto, os indícios técnicos divulgados publicamente foram interpretados principalmente como compatíveis com a Zhipu e a família GLM. Essa atribuição continua sem confirmação independente ou oficial.
Nenhuma empresa havia reivindicado publicamente a autoria do Ox Alpha no período coberto pelos relatos, e a Zhipu não havia confirmado a atribuição. Especulações chegaram a mencionar variantes específicas da família GLM, mas as evidências disponíveis não determinam se o Ox Alpha é um modelo ainda não lançado, uma variante de produção, um sistema ajustado para tarefas específicas ou um modelo operado de forma independente com infraestrutura relacionada.
A descrição mais defensável, portanto, é: o Ox Alpha provavelmente deriva da família GLM e pode estar ligado à Zhipu, mas seu criador e sua identidade exata permaneciam sem verificação. Percentuais de confiança divulgados por analistas individuais não devem ser tratados como identificação oficial.
A política de dados do Ox Alpha é um dos detalhes mais importantes para desenvolvedores. A página do modelo no OpenRouter informa que os prompts e as respostas são retidos pelo provedor subjacente, mas não são usados para treinamento.
Isso é diferente da política geral de coleta de dados do OpenRouter. A plataforma afirma que não armazena prompts ou respostas, a menos que o usuário ative voluntariamente o registro de entradas e saídas. Ela também documenta separadamente as políticas de cada provedor, o que significa que a camada de roteamento e o fornecedor do modelo podem ter regras diferentes de retenção.
O OpenCode, por sua vez, divulgou o Ox Alpha com a promessa de “zero data retention”, ou retenção zero. Essa declaração pode descrever o tratamento feito pelo próprio OpenCode, mas não elimina automaticamente a informação de retenção associada ao provedor na rota do OpenRouter. Em outras palavras, “o OpenCode não retém os dados” e “o provedor subjacente retém prompts e respostas” podem se referir a etapas diferentes do mesmo caminho de uma solicitação.
Até que os envolvidos publiquem uma política única e contratualmente clara de tratamento de dados, a postura prudente é presumir que o provedor do modelo pode guardar o conteúdo enviado. Desenvolvedores devem evitar inserir código proprietário, credenciais, dados pessoais ou informações reguladas apenas porque o serviço é gratuito ou afirma não treinar com os prompts.
O Ox Alpha se destacou por três motivos: uma prévia gratuita de curta duração, uma janela de contexto e capacidades multimodais incomuns, além de um resultado inicial bastante expressivo em programação. Ainda assim, as evidências recomendam cautela — não a afirmação de que um laboratório desconhecido derrotou definitivamente os modelos de fronteira estabelecidos.
O índice de 80% no DeepSWE veio de oito tarefas concluídas em um conjunto de 10, e não do benchmark completo de 113 tarefas. O ranking público ainda mostrava o Claude Opus 5 à frente, e o Ox Alpha não havia passado pelo processo oficial de avaliação.
As impressões digitais técnicas fazem da ligação entre Zhipu e GLM a explicação mais provável, mas nenhuma confirmação pública estabelecia a autoria. Para experimentos, o Ox Alpha era um modelo interessante de testar. Para sistemas em produção ou código sensível, sua propriedade anônima, a retenção no nível do provedor e a identidade não resolvida eram motivos suficientes para avançar com cuidado.
As especificações anunciadas eram ambiciosas para um serviço gratuito:
O OpenCode também ofereceu acesso ao modelo em seu plano gratuito. O anúncio falava em limites generosos e uso “quase ilimitado”, além de uma capacidade declarada de 100 trilhões de tokens por dia. Esse número é uma afirmação do operador, não uma medição de throughput auditada de forma independente.
O desenvolvedor Ben Davis testou o Ox Alpha em 10 tarefas extraídas do DeepSWE, um benchmark de engenharia de software que avalia a capacidade de agentes de IA de trabalhar em problemas longos e complexos. Segundo o teste, o modelo passou em oito tarefas, chegando a aproximadamente 80%. Na mesma comparação limitada, o Claude Fable 5 marcou 65% e o GPT-5.6 Sol, 52%.
É um resultado impressionante, mas não deve ser descrito como uma vitória oficial no DeepSWE. A versão 1.1 do benchmark reúne 113 tarefas originais de engenharia de software distribuídas por 91 repositórios. Portanto, o experimento cobriu apenas uma pequena parte da avaliação completa.
Há ainda limitações metodológicas importantes:
O retrato do ranking público disponível naquele momento colocava o Claude Opus 5 em primeiro, com 73,6%, seguido pelo GPT-5.6 Sol, com 72,7%, e pelo Claude Fable 5, com 69,7%. A conclusão mais segura é mais restrita: o Ox Alpha teve desempenho muito forte no experimento de 10 tarefas de Davis, mas o resultado não prova que ele seja o melhor modelo geral para programação.
A principal teoria de atribuição liga o Ox Alpha à Zhipu AI — ou Z.ai — e à sua família de modelos GLM. A hipótese se baseia em uma espécie de análise forense do comportamento do modelo, não em um anúncio da empresa.
Em um teste divulgado, pesquisadores compararam o comportamento de tokenização do Ox Alpha e do GLM-5.3 em 25 prompts. As contagens originais teriam coincidido depois de considerar uma diferença fixa de 75 tokens, atribuída a uma camada de processamento. Testes separados com vídeos também teriam encontrado padrões visuais semelhantes, incluindo o modo de amostragem de quadros, a variação conforme a duração e o tratamento da resolução.
Outras semelhanças relatadas envolvem o estilo das respostas, o comportamento da API e a forma como o modelo lida com entradas de áudio. Isoladamente, cada pista poderia ser explicada por um wrapper compartilhado, infraestrutura comum ou imitação. Juntas, porém, elas formam um conjunto de sinais que analistas consideram compatível com a linha multimodal unificada GLM da Zhipu.
A Zhipu também já teria usado lançamentos anônimos ou em modo stealth, incluindo o codinome Pony Alpha. Esse histórico acrescenta contexto circunstancial à teoria, mas não prova que a empresa tenha criado o Ox Alpha.
Uma hipótese minoritária também relacionou o modelo à equipe MiMo, da Xiaomi. No entanto, os indícios técnicos divulgados publicamente foram interpretados principalmente como compatíveis com a Zhipu e a família GLM. Essa atribuição continua sem confirmação independente ou oficial.
Nenhuma empresa havia reivindicado publicamente a autoria do Ox Alpha no período coberto pelos relatos, e a Zhipu não havia confirmado a atribuição. Especulações chegaram a mencionar variantes específicas da família GLM, mas as evidências disponíveis não determinam se o Ox Alpha é um modelo ainda não lançado, uma variante de produção, um sistema ajustado para tarefas específicas ou um modelo operado de forma independente com infraestrutura relacionada.
A descrição mais defensável, portanto, é: o Ox Alpha provavelmente deriva da família GLM e pode estar ligado à Zhipu, mas seu criador e sua identidade exata permaneciam sem verificação. Percentuais de confiança divulgados por analistas individuais não devem ser tratados como identificação oficial.
A política de dados do Ox Alpha é um dos detalhes mais importantes para desenvolvedores. A página do modelo no OpenRouter informa que os prompts e as respostas são retidos pelo provedor subjacente, mas não são usados para treinamento.
Isso é diferente da política geral de coleta de dados do OpenRouter. A plataforma afirma que não armazena prompts ou respostas, a menos que o usuário ative voluntariamente o registro de entradas e saídas. Ela também documenta separadamente as políticas de cada provedor, o que significa que a camada de roteamento e o fornecedor do modelo podem ter regras diferentes de retenção.
O OpenCode, por sua vez, divulgou o Ox Alpha com a promessa de “zero data retention”, ou retenção zero. Essa declaração pode descrever o tratamento feito pelo próprio OpenCode, mas não elimina automaticamente a informação de retenção associada ao provedor na rota do OpenRouter. Em outras palavras, “o OpenCode não retém os dados” e “o provedor subjacente retém prompts e respostas” podem se referir a etapas diferentes do mesmo caminho de uma solicitação.
Até que os envolvidos publiquem uma política única e contratualmente clara de tratamento de dados, a postura prudente é presumir que o provedor do modelo pode guardar o conteúdo enviado. Desenvolvedores devem evitar inserir código proprietário, credenciais, dados pessoais ou informações reguladas apenas porque o serviço é gratuito ou afirma não treinar com os prompts.
O Ox Alpha se destacou por três motivos: uma prévia gratuita de curta duração, uma janela de contexto e capacidades multimodais incomuns, além de um resultado inicial bastante expressivo em programação. Ainda assim, as evidências recomendam cautela — não a afirmação de que um laboratório desconhecido derrotou definitivamente os modelos de fronteira estabelecidos.
O índice de 80% no DeepSWE veio de oito tarefas concluídas em um conjunto de 10, e não do benchmark completo de 113 tarefas. O ranking público ainda mostrava o Claude Opus 5 à frente, e o Ox Alpha não havia passado pelo processo oficial de avaliação.
As impressões digitais técnicas fazem da ligação entre Zhipu e GLM a explicação mais provável, mas nenhuma confirmação pública estabelecia a autoria. Para experimentos, o Ox Alpha era um modelo interessante de testar. Para sistemas em produção ou código sensível, sua propriedade anônima, a retenção no nível do provedor e a identidade não resolvida eram motivos suficientes para avançar com cuidado.