ZGCM 1 7B è un modello da 7,39 miliardi di parametri con un contesto dichiarato di 256K token, pensato per il ragionamento matematico e la ricerca assistita da strumenti. La pubblicazione di dati, checkpoint intermedi e dettagli sull’addestramento lo rende una base di confronto più esaminabile dei soli pesi finali.
Pubblicato daModificato con GPT-6 SolImmagini generate con GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is ZGCM-1-7B, who released it and under what license, and what makes it a useful open baseline for mathematical reasoning and tool-assi. Article summary: ZGCM-1-7B is a 7.39-billion-parameter dense language model trained from scratch for mathematical reasoning and tool-assisted search. It was released by researchers at Zhongguancun Academy and the Zhongguancun Institute o. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
ZGCM-1-7B è un modello linguistico denso, addestrato da zero per combinare ragionamento matematico e ricerca attiva di informazioni con l’aiuto di strumenti. È stato pubblicato da ricercatori della Zhongguancun Academy e dello Zhongguancun Institute of Artificial Intelligence. Per chi studia questi sistemi, l’interesse non è soltanto nei punteggi: il progetto mette a disposizione anche materiali con cui esaminare il percorso di addestramento. 2
4
3
6
Il modello ha 7,39 miliardi di parametri ed è un Transformer denso di tipo decoder-only. La finestra di contesto dichiarata è di 256K token. Nello stesso modello sono disponibili sia una modalità thinking, orientata al ragionamento deliberato, sia una modalità di risposta diretta: una distinzione utile per confrontare i due comportamenti senza cambiare modello. 2
4
L’architettura alterna livelli di attenzione a finestra scorrevole con meccanismo di gating e livelli di attenzione completa. Una descrizione indica rispettivamente 27 e 5 livelli. Nel confronto di sistema presentato dagli autori, questa soluzione riduce di 6,4 volte l’uso della cache KV — la memoria usata per conservare informazioni durante la generazione — e aumenta di 3,94 volte il throughput con un contesto da 256K token rispetto alla configurazione di confronto con sola attenzione completa. Non significa che ogni installazione otterrà gli stessi guadagni. 4
10
La scheda del modello indica la licenza MIT. La dicitura CC BY 4.0 associata all’articolo scientifico riguarda invece l’articolo: non va confusa con la licenza del modello. Chi riutilizza materiali del progetto dovrebbe verificare le condizioni della singola risorsa. 2
7
1
La ricetta descritta va dal preaddestramento all’addestramento intermedio progressivo su contesti lunghi, fino al fine-tuning supervisionato per compiti generali e agentici. Include l’ottimizzatore Muon in FP8, fasi da 16K, 64K e 256K token e la riformulazione delle tracce di interazione come transizioni di un processo decisionale di Markov. Per l’addestramento intermedio sono riportati 600 miliardi di token. 1
2
10
Oltre al modello finale sono stati pubblicati un dataset e checkpoint intermedi; le informazioni sulla pubblicazione descrivono anche codice, ricette e log di addestramento. Un checkpoint relativo alla fase dati da 16K, per esempio, documenta il contesto effettivamente usato nell’addestramento e il numero cumulativo di token di quella fase. Sono elementi che permettono di studiare più del solo risultato finale. 2
3
6
9
Il gruppo riferisce inoltre di aver impiegato agenti AI guidati dai ricercatori in attività come la selezione dei dati e la gestione del cluster di calcolo. È una descrizione del metodo di lavoro, non la prova che gli agenti abbiano progettato o convalidato autonomamente il modello, né una misura del loro contributo ai punteggi. 2
8
Nelle valutazioni riportate, ZGCM-1-7B ottiene 97,13% su MATH-500, 75,00% su AIME 2026, 63,09% su WebWalkerQA e 19,43% su BrowseComp. Non prevale però in tutti i confronti pubblicati: su AIME 2024 e AIME 2025 risulta dietro un modello di confronto. Gli autori riferiscono anche di aver raggiunto la stessa perdita di preaddestramento in un tempo circa 4,2 volte inferiore rispetto alla loro configurazione di riferimento AdamW/BF16. Sono risultati legati a benchmark, procedure di valutazione e configurazioni specifiche, non una promessa di prestazioni equivalenti in ogni attività di ricerca. 7
10
La scheda su Hugging Face include un esempio di generazione testuale con Transformers per zgcagi/ZGCM-1-7B che usa trust_remote_code=True: prima di abilitare questa opzione è opportuno esaminare il codice personalizzato del repository. Il materiale disponibile non stabilisce requisiti minimi di GPU, memoria o versioni dei pacchetti per il modello finale; non vanno dedotti dalle descrizioni dei benchmark o dei checkpoint. 2
19
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
ZGCM 1 7B è un modello da 7,39 miliardi di parametri con un contesto dichiarato di 256K token, pensato per il ragionamento matematico e la ricerca assistita da strumenti.
ZGCM 1 7B è un modello da 7,39 miliardi di parametri con un contesto dichiarato di 256K token, pensato per il ragionamento matematico e la ricerca assistita da strumenti. La pubblicazione di dati, checkpoint intermedi e dettagli sull’addestramento lo rende una base di confronto più esaminabile dei soli pesi finali.
I guadagni di velocità e i punteggi nei benchmark sono risultati riferiti dagli autori nelle condizioni delle rispettive prove, non garanzie per ogni utilizzo.