ZGCM 1 7B har 7,39 milliarder parametere og er laget for matematisk resonnering og søk med verktøy. Datasett, mellomliggende kontrollpunkter og en beskrevet treningsoppskrift gjør det mulig å undersøke mer enn bare sluttmodellen.
Publisert avRedigert med GPT-6 SolBilder generert med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is ZGCM-1-7B, who released it and under what license, and what makes it a useful open baseline for mathematical reasoning and tool-assi. Article summary: ZGCM-1-7B is a 7.39-billion-parameter dense language model trained from scratch for mathematical reasoning and tool-assisted search. It was released by researchers at Zhongguancun Academy and the Zhongguancun Institute o. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
ZGCM-1-7B er en språkmodell trent fra bunnen av for to krevende oppgaver: matematisk resonnering og aktiv informasjonsinnhenting ved hjelp av verktøy. Bak utgivelsen står forskere ved Zhongguancun Academy og Zhongguancun Institute of Artificial Intelligence. For dem som vil undersøke hvordan en slik modell blir til, er poenget ikke bare resultatene den oppnår, men også innsynet i treningsløpet. 2
4
Modellen har 7,39 milliarder parametere. Modelloppføringen angir MIT-lisens for modellen. Forskningsartikkelen er merket CC BY 4.0, men den merkingen gjelder artikkelen og må ikke forveksles med modellens lisens. Sjekk vilkårene for hver ressurs du tar i bruk. 2
7
1
ZGCM-1-7B er en tett Transformer-modell som bare bruker dekoder, med en oppgitt kontekstgrense på 256 000 tokens. Den har både en modus for mer trinnvis resonnering og en modus for direkte svar. Dermed kan forskere studere de to svarmåtene uten å bytte modell. 2
4
Arkitekturen veksler mellom lag med gated sliding-window attention, som behandler et begrenset utsnitt, og lag med full oppmerksomhet. En modellbeskrivelse oppgir 27 lag av den første typen og fem av den andre. I utviklernes sammenligning brukte denne løsningen 6,4 ganger mindre KV-cache og ga 3,94 ganger høyere gjennomstrømning ved 256 000 tokens enn oppsettet med bare full oppmerksomhet. Tallene gjelder den konkrete sammenligningen, ikke nødvendigvis enhver installasjon. 4
10
Den publiserte oppskriften beskriver forhåndstrening, gradvis utvidelse av konteksten under videre trening og veiledet finjustering for generelle oppgaver og oppgaver med agentbruk. Den omfatter blant annet FP8 Muon-optimalisering og trinn på 16 000, 64 000 og 256 000 tokens. Spor av interaksjoner omformes til overganger i en Markov-beslutningsprosess; den rapporterte videre treningen omfatter 600 milliarder tokens. 1
2
10
Prosjektet har publisert et datasett og mellomliggende kontrollpunkter i tillegg til sluttmodellen. Omtale av utgivelsen beskriver også treningskode, oppskrifter og logger. Et kontrollpunkt fra 16K-datatrinnet dokumenterer for eksempel både treningskonteksten og hvor mange tokens som var brukt i den videre treningen fram til da. Slik kan forskere undersøke mer av veien fram til sluttmodellen enn de kunne gjort med bare modellvektene. 2
3
6
9
Teamet oppgir at KI-agenter styrt av forskerne bidro i utviklingsarbeidet, blant annet med datakuratering og drift av dataklynger. Det sier noe om arbeidsmåten, men viser ikke at agentene utformet eller validerte modellen på egen hånd. Kildene tallfester heller ikke hvor mye de bidro til resultatene. 2
8
De rapporterte resultatene er 97,13 % på MATH-500, 75,00 % på AIME 2026, 63,09 % på WebWalkerQA og 19,43 % på BrowseComp. Modellen ligger ikke foran sammenligningsmodellene i alle tester: de publiserte sammenligningene viser også svakere resultater på AIME 2024 og AIME 2025. Utviklerne rapporterer dessuten at forhåndstreningen nådde samme tapsnivå på omtrent 4,2 ganger kortere tid enn deres sammenligningsoppsett med AdamW og BF16. Alle tallene må leses i lys av testene og oppsettene de bygger på; de fastslår ikke ytelsen i enhver praktisk søkeoppgave. 7
10
Modelloppføringen har et eksempel på tekstgenerering med Transformers for zgcagi/ZGCM-1-7B. Eksemplet bruker trust_remote_code=True, så gjennomgå den egendefinerte koden i modellarkivet før du aktiverer dette. Det tilgjengelige materialet fastslår ingen minste GPU-kapasitet, minnekrav eller påkrevd pakkeversjon for å kjøre sluttmodellen. Slike krav bør derfor ikke utledes fra testresultater eller beskrivelser av kontrollpunkter. 2
19
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
ZGCM 1 7B har 7,39 milliarder parametere og er laget for matematisk resonnering og søk med verktøy.
ZGCM 1 7B har 7,39 milliarder parametere og er laget for matematisk resonnering og søk med verktøy. Datasett, mellomliggende kontrollpunkter og en beskrevet treningsoppskrift gjør det mulig å undersøke mer enn bare sluttmodellen.
Resultatene på tester og målingene av ytelse er rapportert for bestemte oppsett – de er ingen garanti for tilsvarende resultater i annen bruk.