ZGCM 1 7B har 7,39 milliarder parametre, en oplyst kontekstlængde på 256K tokens og kan både ræsonnere trinvis og svare direkte. Projektet har offentliggjort data og mellemcheckpoints, så forskere kan undersøge mere end blot den færdige model.
Udgivet afRedigeret med GPT-6 SolBilleder genereret med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is ZGCM-1-7B, who released it and under what license, and what makes it a useful open baseline for mathematical reasoning and tool-assi. Article summary: ZGCM-1-7B is a 7.39-billion-parameter dense language model trained from scratch for mathematical reasoning and tool-assisted search. It was released by researchers at Zhongguancun Academy and the Zhongguancun Institute o. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
ZGCM-1-7B er en sprogmodel, som forskere ved Zhongguancun Academy og Zhongguancun Institute of Artificial Intelligence har trænet fra bunden til matematisk ræsonnement og søgning ved hjælp af eksterne værktøjer. Den har 7,39 milliarder parametre. Det særligt interessante ved udgivelsen er, at andre forskere ikke kun får en færdig model at teste: Projektet giver også indblik i dele af vejen dertil. 2
3
4
9
ZGCM-1-7B er en tæt Transformer-model af decoder-only-typen med en oplyst kontekstlængde på 256K tokens. Den understøtter både en »thinking«-tilstand, hvor den arbejder mere trinvis, og en tilstand med direkte svar. Dermed kan man undersøge de to svarmåder i samme model frem for at skifte model undervejs. 2
4
Arkitekturen veksler mellem lag, der retter opmærksomheden mod et begrænset, glidende udsnit af konteksten, og lag med fuld opmærksomhed. En modelbeskrivelse angiver 27 lag af den første type og fem af den anden. Ifølge forfatterne bruger dette design 6,4 gange mindre KV-cache og giver 3,94 gange højere gennemløb ved 256K-kontekst end deres sammenligning med fuld opmærksomhed. KV-cachen er den hukommelse, modellen bruger til at genbruge tidligere beregninger under tekstgenerering. Tallene gælder den konkrete systemsammenligning – ikke nødvendigvis enhver installation. 4
10
Det offentliggjorte træningsforløb spænder fra grundtræning til gradvis træning med længere kontekst og efterfølgende superviseret finjustering på generelle opgaver og agentopgaver. Det omfatter en FP8 Muon-optimizer, trin med 16K, 64K og 256K kontekst samt en metode, hvor forløb med værktøjsinteraktion omformes til overgange i en markovsk beslutningsproces. Forskerne oplyser, at mellemtræningen omfatter 600 milliarder tokens. 1
2
10
Ud over den endelige model er der offentliggjort et datasæt og mellemcheckpoints. Omtale af udgivelsen beskriver også træningskode, opskrifter og logfiler. Et checkpoint fra det såkaldte 16K-datatrin oplyser eksempelvis både den anvendte træningskontekst og det samlede antal tokens i mellemtræningen frem til det punkt. Det gør det lettere at undersøge træningsforløbet end med modelvægte alene. 2
3
6
9
Holdet beskriver desuden, at AI-agenter under forskernes ledelse hjalp med udviklingsopgaver som datakuratering og drift af computerklyngen. Det fortæller noget om arbejdsgangen, men dokumenterer hverken, at agenterne selvstændigt designede eller validerede modellen, eller hvor meget de bidrog til testresultaterne. 2
8
De rapporterede evalueringer giver ZGCM-1-7B 97,13 % på MATH-500, 75,00 % på AIME 2026, 63,09 % på WebWalkerQA og 19,43 % på BrowseComp. På AIME 2024 og AIME 2025 ligger modellen dog efter en sammenligningsmodel i de offentliggjorte opgørelser. Forskerne oplyser også, at deres grundtræning nåede samme træningstab på cirka 4,2 gange kortere tid end deres sammenligning med AdamW/BF16. Resultaterne afhænger af testene, evalueringsopsætningen og de valgte systemer til sammenligning; de siger ikke i sig selv, hvordan modellen vil klare enhver konkret søgeopgave. 7
10
Modelopslaget angiver MIT som licens for modellen. Forskningsartiklen er mærket CC BY 4.0, men den mærkning gælder artiklen og må ikke forveksles med modellens licens. Tjek vilkårene for hver enkelt ressource, du vil bruge. 2
7
1
Modelopslaget viser et eksempel på tekstgenerering med Transformers og model-id’et zgcagi/ZGCM-1-7B. Eksemplet bruger trust_remote_code=True, så gennemgå repositoryets tilpassede kode, før du aktiverer indstillingen. Det tilgængelige materiale fastslår ikke et minimumskrav til GPU, hukommelse eller pakkeversioner for den færdige model; sådanne krav kan ikke udledes af testresultaterne eller beskrivelserne af mellemcheckpoints. 2
19
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
ZGCM 1 7B har 7,39 milliarder parametre, en oplyst kontekstlængde på 256K tokens og kan både ræsonnere trinvis og svare direkte.
ZGCM 1 7B har 7,39 milliarder parametre, en oplyst kontekstlængde på 256K tokens og kan både ræsonnere trinvis og svare direkte. Projektet har offentliggjort data og mellemcheckpoints, så forskere kan undersøge mere end blot den færdige model.
De rapporterede resultater er stærke på udvalgte matematik og søgetests, men er ikke en garanti for samme ydelse i andre arbejdsgange.