O preço é de US$ 0,435 por milhão de tokens de entrada e US$ 0,87 por milhão de tokens de saída nas taxas padrão, com descontos de cache de até 97% . No modo de raciocínio de esforço máximo, o preço é de US$ 1,32/US$ 3,96 por milhão de tokens
.
A Moonshot AI lançou o que chama de "primeiro modelo aberto do mundo na classe de 3 trilhões de parâmetros" — um modelo Mixture-of-Experts de 2,8 trilhões de parâmetros que ativa 16 de 896 especialistas por token, com janela de contexto de 1 milhão de tokens e capacidade multimodal nativa (visão + texto) . Os pesos completos foram liberados no Hugging Face em 27 de julho sob uma licença MIT Modificada
. O modelo está disponível no Kimi.com, Kimi Work, Kimi Code e na API Kimi
.
O modelo que deu início à onda. O GLM-5.2 é um MoE de 744 bilhões de parâmetros com cerca de 40 bilhões ativos por token, janela de contexto de 1 milhão de tokens e licença MIT . A avaliação CAISI do NIST (Instituto Nacional de Padrões e Tecnologia dos EUA) classifica suas capacidades gerais como similares às do GPT-5.2 (dezembro de 2025) e suas capacidades cibernéticas como similares às do Claude Opus
. Ele marca 81,0 no Terminal-Bench 2.1 e 62,1 no SWE-bench Pro — a maior pontuação open-weight no Artificial Analysis Intelligence Index
. O preço da API é cerca de 10 vezes mais barato que o do Claude ou GPT-5
.
Um MoE de 1,6 trilhão de parâmetros (48 bilhões ativos por token) com janela de contexto de 1 milhão de tokens, lançado sob licença MIT . Sua distinção crítica: o primeiro modelo com trilhões de parâmetros treinado e executado inteiramente em chips nacionais chineses — um cluster de 50.000 chips Huawei Ascend 910B/C
. Nos testes da Meituan, ele supera o GPT-5.5 em benchmarks de engenharia de software
. O modelo vinha ocupando silenciosamente o topo do ranking OpenLLM sob o codinome "Owl Alpha" antes do lançamento oficial
. O preço da API é de US$ 0,75/US$ 2,95 por milhão de tokens de entrada/saída, com uma promoção de lançamento a US$ 0,30/US$ 1,20
.
Empresas fora da China agora têm alternativas open-weight, de baixo custo e credíveis aos modelos de API americanos. A licença MIT do GLM-5.2, sem restrições regionais, significa que qualquer empresa pode hospedá-lo comercialmente sem restrições . Isso está mudando as decisões de compra no Sudeste Asiático, Oriente Médio, África e partes da Europa.
As evidências apoiam fortemente a tese de que as restrições dos EUA à exportação de chips saíram pela culatra de pelo menos duas maneiras:
Nenhuma fonte corroborante foi encontrada para os preços específicos de US$ 0,06 por tarefa para o DeepSeek V4 Pro ou US$ 2,34 para o Claude Opus 5. Os modelos Tencent Hy3 e Alibaba Qwen3.8-Max também carecem de especificações ou datas de lançamento verificadas nas evidências disponíveis. Alegações sobre um recente manifesto open-source de Mark Zuckerberg não puderam ser confirmadas.
Este artigo é baseado em evidências disponíveis até meados de agosto de 2026. Todas as alegações sobre as capacidades dos modelos vêm de benchmarks relatados pelos desenvolvedores e avaliações de terceiros (incluindo o CAISI do NIST). A verificação independente de todas as pontuações de benchmark está em andamento em toda a indústria. As comparações de custo são baseadas nos preços de token de API publicados; os custos reais por tarefa variam significativamente de acordo com a complexidade da tarefa, comprimento do contexto e taxas de acerto de cache.