ZGCM 1 7B is een vanaf nul getraind model met 7,39 miljard parameters en een opgegeven contextvenster van 256.000 tokens. Het is vooral interessant als onderzoeksbasis doordat zowel de trainingsaanpak als data en tussenliggende checkpoints zijn gepubliceerd.
Gepubliceerd doorBewerkt met GPT-6 SolAfbeeldingen gegenereerd met GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is ZGCM-1-7B, who released it and under what license, and what makes it a useful open baseline for mathematical reasoning and tool-assi. Article summary: ZGCM-1-7B is a 7.39-billion-parameter dense language model trained from scratch for mathematical reasoning and tool-assisted search. It was released by researchers at Zhongguancun Academy and the Zhongguancun Institute o. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
ZGCM-1-7B is een AI-taalmodel voor wiskundig redeneren en zoeken met behulp van externe tools. Onderzoekers van Zhongguancun Academy en het Zhongguancun Institute of Artificial Intelligence trainden het vanaf nul. Doordat zij niet alleen het eindmodel, maar ook onderdelen van het trainingstraject beschikbaar stelden, kunnen anderen meer onderzoeken dan de benchmarkscores alleen. 2
4
Het model heeft 7,39 miljard parameters en is een dense, decoder-only Transformer: bij het verwerken van tekst wordt het volledige model gebruikt. De modelvermelding noemt MIT als licentie. Het label CC BY 4.0 bij het onderzoeksartikel geldt voor dat artikel en moet niet worden aangezien voor de licentie van het model. Controleer daarom de voorwaarden van de afzonderlijke materialen die je wilt gebruiken. 2
4
7
1
ZGCM-1-7B heeft volgens de makers een contextvenster van 256.000 tokens. Het ondersteunt in hetzelfde model zowel een thinking-modus, gericht op stapsgewijs redeneren, als een modus voor directe antwoorden. Dat maakt het mogelijk die antwoordstijlen te vergelijken zonder van model te wisselen. 2
4
De architectuur wisselt lagen met gated sliding-window attention af met lagen die de volledige context kunnen overzien. Een modelbeschrijving noemt 27 lagen van het eerste type en vijf van het tweede. Volgens de gerapporteerde systeemvergelijking gebruikt dit ontwerp 6,4 keer minder KV-cache — werkgeheugen voor eerder verwerkte tokens — en levert het bij een context van 256.000 tokens 3,94 keer zoveel verwerkingscapaciteit als de gebruikte variant met uitsluitend volledige attention. Dat zijn resultaten voor die specifieke vergelijking, geen belofte voor iedere installatie. 4
10
De gepubliceerde aanpak loopt van voortraining via training met steeds langere contexten tot begeleide fijnafstemming voor algemene en agentachtige taken. Daarbij combineert het team de hybride architectuur met een stabiele FP8 Muon-optimizer. De training met langere context doorloopt fasen van 16.000, 64.000 en 256.000 tokens en beslaat volgens de publicatie 600 miljard tokens. Interacties worden daarbij geformuleerd als overgangen in een Markov decision process, een manier om opeenvolgende acties en uitkomsten te beschrijven. 1
2
10
Naast het eindmodel zijn een dataset en tussenliggende checkpoints gepubliceerd. Berichtgeving over de release noemt ook trainingscode, recepten en logs. Zo kunnen onderzoekers delen van het ontwikkeltraject bekijken die bij een publicatie van alleen modelgewichten buiten beeld blijven. Een checkpoint voor de 16K-datafase vermeldt bijvoorbeeld de gebruikte trainingscontext en het cumulatieve aantal tokens in die trainingsfase. 2
3
6
9
Het team zegt ook door onderzoekers aangestuurde AI-agents te hebben ingezet, onder meer bij dataselectie en het beheer van rekenclusters. Dat beschrijft een werkwijze: het bewijst niet dat de agents het model zelfstandig ontwierpen of valideerden, en evenmin welk deel van de prestaties aan hun inzet is toe te schrijven. 2
8
De gerapporteerde scores zijn 97,13% op MATH-500, 75,00% op AIME 2026, 63,09% op WebWalkerQA en 19,43% op BrowseComp. ZGCM-1-7B wint niet iedere vergelijking: in de gepubliceerde tabellen scoort een vergelijkingsmodel beter op AIME 2024 en AIME 2025. De auteurs melden daarnaast dat hun aanpak ongeveer 4,2 keer minder tijd nodig had om dezelfde voortrainingsfout te bereiken als hun AdamW/BF16-basislijn. Scores en snelheidswinst hangen af van de gekozen testopzet en vergelijkingsbasis; ze voorspellen niet automatisch hoe het model in iedere zoektaak zal presteren. 7
10
De modelpagina geeft een voorbeeld voor tekstgeneratie met Transformers en zgcagi/ZGCM-1-7B. Dat voorbeeld gebruikt trust_remote_code=True: bekijk de aangepaste code in de repository voordat je die optie inschakelt. Het beschikbare materiaal legt geen minimale GPU, geheugencapaciteit of vereiste pakketversies voor het eindmodel vast. Leid zulke eisen dus niet af uit benchmarkcijfers of de beschrijvingen van tussenliggende checkpoints. 2
19
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
ZGCM 1 7B is een vanaf nul getraind model met 7,39 miljard parameters en een opgegeven contextvenster van 256.000 tokens.
ZGCM 1 7B is een vanaf nul getraind model met 7,39 miljard parameters en een opgegeven contextvenster van 256.000 tokens. Het is vooral interessant als onderzoeksbasis doordat zowel de trainingsaanpak als data en tussenliggende checkpoints zijn gepubliceerd.
De gemelde snelheidswinst en benchmarkscores gelden voor specifieke vergelijkingen; ze zijn geen garantie voor prestaties in elke toepassing.