ZGCM 1 7B har 7,39 miljarder parametrar och en angiven kontextlängd på 256K token. Som forskningsmodell är den intressant inte bara för sina testresultat, utan också för sina två svarslägen, sin dokumenterade träningsmetod och publicerade data och mellanliggande modellversioner.
Publicerad avRedigerad med GPT-6 SolBilder genererade med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is ZGCM-1-7B, who released it and under what license, and what makes it a useful open baseline for mathematical reasoning and tool-assi. Article summary: ZGCM-1-7B is a 7.39-billion-parameter dense language model trained from scratch for mathematical reasoning and tool-assisted search. It was released by researchers at Zhongguancun Academy and the Zhongguancun Institute o. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
ZGCM-1-7B är en tät språkmodell som tränats från grunden för två uppgifter: matematisk problemlösning och informationssökning med hjälp av verktyg. Bakom modellen står forskare vid Zhongguancun Academy och Zhongguancun Institute of Artificial Intelligence. Den har 7,39 miljarder parametrar och är tänkt att kunna granskas som en forskningsmodell, inte bara jämföras genom resultat på standardiserade tester. 2
4
ZGCM-1-7B är en tät Transformer-modell som genererar text steg för steg. Den angivna kontextlängden är 256K token, och samma modell kan användas både i ett mer resonerande thinking-läge och i ett läge för direkta svar. Det gör det möjligt att undersöka de båda svarssätten utan att byta modell. 2
4
Arkitekturen varvar lager med styrd uppmärksamhet inom ett glidande fönster med lager som kan använda hela kontexten. En modellbeskrivning anger 27 fönsterbaserade lager och fem lager med full uppmärksamhet. Enligt de rapporterade systemjämförelserna använder lösningen 6,4 gånger mindre KV-cache och ger 3,94 gånger högre genomströmning vid 256K kontext än jämförelsevarianten med enbart full uppmärksamhet. Det är resultat för den angivna jämförelsen, inte en hastighetsgaranti för varje installation. 4
10
Den publicerade träningsmetoden omfattar förträning, successiv träning med längre kontext och övervakad finjustering för allmänna uppgifter och agentbaserad användning. Den kombinerar hybridarkitekturen med en stabil FP8-version av optimeraren Muon. Under den mellanliggande träningen utökas kontexten stegvis via 16K, 64K och 256K, medan sekvenser av interaktioner omformas till övergångar i en Markovbeslutsprocess – ett sätt att beskriva tillstånd, handlingar och deras följder. Den rapporterade delen av denna träning omfattar 600 miljarder token. 1
2
10
Projektet har publicerat en datauppsättning och mellanliggande modellversioner vid sidan av slutmodellen. Rapportering om lanseringen beskriver även träningskod, träningsanvisningar och loggar. Ett mellanliggande tillstånd märkt för 16K-datafasen redovisar exempelvis både använd träningskontext och den sammanlagda mängden token fram till den punkten. För forskare ger sådant material mer att granska än enbart den färdiga modellens vikter. 2
3
6
9
Teamet uppger också att AI-agenter under forskarnas ledning hjälpte till med utvecklingsarbete, bland annat datakurering och drift av beräkningskluster. Det beskriver ett arbetssätt; det visar inte att agenterna självständigt konstruerade eller validerade modellen, och säger inte hur stor del av resultaten som kan tillskrivas dem. 2
8
I de rapporterade utvärderingarna får ZGCM-1-7B 97,13 procent på MATH-500 och 75,00 procent på AIME 2026, två tester av matematisk problemlösning. I söktesterna är resultaten 63,09 procent på WebWalkerQA och 19,43 procent på BrowseComp. Modellen ligger inte före jämförelsemodellerna överallt: de publicerade jämförelserna visar även svagare resultat på AIME 2024 och AIME 2025. 7
10
Forskarna rapporterar dessutom att deras förträning nådde samma träningsförlust på ungefär 4,2 gånger kortare tid än deras jämförelse med AdamW/BF16. Både den siffran och testresultaten beror på vilka system, testuppgifter och utvärderingsinställningar som jämförs. De visar inte att modellen fungerar lika bra i varje verkligt sökflöde. 7
10
Modellens publicerade sida anger MIT-licens. Forskningsartikeln är märkt CC BY 4.0, men den märkningen gäller artikeln och ska inte tas som licensbesked för modellvikterna. Kontrollera villkoren för varje resurs du använder. 2
7
1
På modellsidan finns ett exempel på textgenerering med Transformers och modellnamnet zgcagi/ZGCM-1-7B. Exemplet använder trust_remote_code=True, vilket gör det klokt att granska projektets egen kod innan inställningen aktiveras. Det tillgängliga underlaget fastställer däremot inget minsta krav på grafikprocessor, minne eller paketversion för att köra slutmodellen; sådana krav bör inte härledas från beskrivningarna av tester eller mellanliggande modellversioner. 2
19
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
ZGCM 1 7B har 7,39 miljarder parametrar och en angiven kontextlängd på 256K token.
ZGCM 1 7B har 7,39 miljarder parametrar och en angiven kontextlängd på 256K token. Som forskningsmodell är den intressant inte bara för sina testresultat, utan också för sina två svarslägen, sin dokumenterade träningsmetod och publicerade data och mellanliggande modellversioner.
Modellen anges ha MIT licens. Forskningsartikelns CC BY 4.0 märkning gäller artikeln och ska inte förväxlas med modellens licens.