Treinado do zero, o ZGCM 1 7B combina raciocínio matemático e busca com auxílio de ferramentas em um modelo com contexto anunciado de 256 mil tokens. Seu valor como referência de pesquisa está nos dois modos de resposta, na documentação do treinamento e na publicação de dados e checkpoints intermediários.
Publicado porEditado com GPT-6 SolImagens geradas com GPT Image 2
Resposta de pesquisa

Create a landscape editorial hero image for this Studio Global article: What is ZGCM-1-7B, who released it and under what license, and what makes it a useful open baseline for mathematical reasoning and tool-assi. Article summary: ZGCM-1-7B is a 7.39-billion-parameter dense language model trained from scratch for mathematical reasoning and tool-assisted search. It was released by researchers at Zhongguancun Academy and the Zhongguancun Institute o. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
O ZGCM-1-7B é um modelo de linguagem denso, com 7,39 bilhões de parâmetros, treinado do zero para combinar raciocínio matemático com busca de informações apoiada por ferramentas. Pesquisadores da Zhongguancun Academy e do Zhongguancun Institute of Artificial Intelligence o apresentaram como uma referência que pode ser examinada, e não apenas comparada por notas em testes. 2
4
A página do modelo indica licença MIT. Já a indicação CC BY 4.0 na página do artigo científico se refere ao artigo e não deve ser tomada como a licença do modelo. Quem pretende usar os recursos publicados deve conferir os termos de cada um. 2
7
1
O ZGCM-1-7B é um Transformer denso do tipo decoder-only, com janela de contexto anunciada de 256 mil tokens. O mesmo modelo oferece um modo de raciocínio deliberado, chamado thinking, e outro de resposta direta. Isso permite estudar os dois estilos sem trocar de modelo. 2
4
Na arquitetura de atenção, camadas com janela deslizante e mecanismo de controle são intercaladas com camadas de atenção completa. Uma descrição do modelo especifica 27 camadas do primeiro tipo e cinco do segundo. Em comparação com a configuração de atenção completa usada pelos autores, o desenho híbrido teria reduzido em 6,4 vezes o uso do cache KV — memória usada durante a geração — e elevado em 3,94 vezes a vazão com contexto de 256 mil tokens. São resultados daquela comparação, não uma previsão de desempenho para qualquer infraestrutura. 4
10
A receita divulgada percorre o pré-treinamento, uma etapa intermediária que amplia progressivamente o contexto e o ajuste supervisionado com exemplos gerais e de uso de agentes. Ela reúne atenção híbrida e o otimizador Muon em FP8; passa por estágios de 16 mil, 64 mil e 256 mil tokens; e reformula registros de interação como transições de um processo de decisão de Markov, ou MDP. Segundo o projeto, o currículo da etapa intermediária abrange 600 bilhões de tokens. 1
2
10
Além do modelo final, o projeto publicou um conjunto de dados e checkpoints intermediários. A cobertura do lançamento também descreve código, receitas e registros de treinamento. Assim, pesquisadores podem examinar mais etapas do processo do que seria possível com a publicação apenas dos pesos finais. Um checkpoint identificado como parte do estágio de dados de 16 mil tokens, por exemplo, documenta o contexto usado no treinamento e o total acumulado de tokens dessa etapa intermediária. 2
3
6
9
A equipe afirma ter usado agentes de IA sob orientação dos pesquisadores em tarefas de desenvolvimento, como curadoria de dados e operações do cluster de computação. Isso descreve o fluxo de trabalho, mas não demonstra que os agentes tenham concebido ou validado o modelo de forma independente, nem mede sua contribuição para as notas obtidas. 2
8
Nas avaliações reportadas, o ZGCM-1-7B alcançou 97,13% no MATH-500, 75,00% no AIME 2026, 63,09% no WebWalkerQA e 19,43% no BrowseComp. Ele não supera todos os modelos de comparação: as tabelas publicadas também mostram resultados inferiores no AIME 2024 e no AIME 2025. Os autores relatam ainda que o pré-treinamento atingiu a mesma perda em cerca de 4,2 vezes menos tempo do que sua configuração de referência com AdamW/BF16. Tanto as notas quanto os ganhos de eficiência dependem dos testes e das configurações escolhidas; não comprovam desempenho equivalente em todo tipo de busca. 7
10
A página de zgcagi/ZGCM-1-7B traz um exemplo de geração de texto com Transformers que usa trust_remote_code=True. Antes de ativar essa opção, é prudente revisar o código personalizado do repositório. O material fornecido não estabelece GPU mínima, quantidade de memória nem versão obrigatória de pacote para executar o modelo final; esses requisitos não devem ser deduzidos dos testes ou das páginas de checkpoints. 2
19
Studio Global AI
Esta página inclui uma resposta baseada na fonte que você pode continuar em Studio Global.
Treinado do zero, o ZGCM 1 7B combina raciocínio matemático e busca com auxílio de ferramentas em um modelo com contexto anunciado de 256 mil tokens.
Treinado do zero, o ZGCM 1 7B combina raciocínio matemático e busca com auxílio de ferramentas em um modelo com contexto anunciado de 256 mil tokens. Seu valor como referência de pesquisa está nos dois modos de resposta, na documentação do treinamento e na publicação de dados e checkpoints intermediários.
Os ganhos de velocidade e as notas em testes foram reportados em condições específicas; não garantem o mesmo desempenho em qualquer uso.