ZGCM 1 7B on 7,39 miljardin parametrin malli, jonka ilmoitettu konteksti ikkuna on 256K tokenia. Tutkimuskäyttöä tukevat kaksi vastaustapaa, kuvattu koulutusprosessi sekä julkaistut aineisto ja koulutuksen välitallenteet.
JulkaisijaMuokattu mallilla GPT-6 SolKuvat luotu mallilla GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is ZGCM-1-7B, who released it and under what license, and what makes it a useful open baseline for mathematical reasoning and tool-assi. Article summary: ZGCM-1-7B is a 7.39-billion-parameter dense language model trained from scratch for mathematical reasoning and tool-assisted search. It was released by researchers at Zhongguancun Academy and the Zhongguancun Institute o. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
ZGCM-1-7B:n kiinnostavin puoli ei ole yksittäinen vertailutestin pistemäärä, vaan mahdollisuus tutkia mallin kehityspolkua. Zhongguancun Academyn ja Zhongguancun Institute of Artificial Intelligencen tutkijoiden julkaisema malli on koulutettu alusta asti matemaattista päättelyä ja työkalujen avulla tehtävää tiedonhakua varten. Siinä on 7,39 miljardia parametria. 2
4
Mallin julkaisusivun mukaan malli on MIT-lisensoitu. Tutkimusartikkelissa näkyvä CC BY 4.0 koskee artikkelia, eikä sitä pidä tulkita mallin lisenssiksi. Käyttäjän kannattaa tarkistaa erikseen kunkin hyödyntämänsä resurssin ehdot. 2
7
1
ZGCM-1-7B on tiheä, vain dekooderista koostuva Transformer-kielimalli. Sen ilmoitettu konteksti-ikkuna on 256K tokenia. Malli tukee sekä harkitsevaa thinking-tilaa että suoraa vastaustapaa. Näin tutkija voi tarkastella erilaisia vastaustapoja vaihtamatta mallia. 2
4
Arkkitehtuurissa vuorottelevat portitetun liukuvan huomiointi-ikkunan kerrokset ja koko kontekstin kattavat huomiokerrokset. Yhden mallikuvauksen mukaan kerroksia on vastaavasti 27 ja viisi. Tekijöiden vertailussa rakenne vähensi KV-välimuistin käyttöä 6,4-kertaisesti ja kasvatti läpimenoa 3,94-kertaiseksi 256K-tokenin kontekstilla verrattuna heidän koko kontekstin huomiointia käyttävään vertailuunsa. Nämä eivät ole yleispäteviä lupauksia nopeudesta eri laitteistoilla. 4
10
Kuvattu koulutusprosessi ulottuu esikoulutuksesta pitkän kontekstin vaiheittaiseen jatkokoulutukseen ja yleisiä sekä agenttipohjaisia tehtäviä sisältävään ohjattuun hienosäätöön. Siinä yhdistyvät huomiointirakenne, vakautettu FP8 Muon -optimointi sekä 16K:n, 64K:n ja 256K:n vaiheisiin etenevä kontekstin laajentaminen. Vuorovaikutustapahtumat on lisäksi muotoiltu Markovin päätösprosessin tilasiirtymiksi. Raportoitu jatkokoulutuksen kokonaismäärä on 600 miljardia tokenia. 1
2
10
Lopullisen mallin lisäksi projektista on julkaistu koulutusaineistoa ja välitallenteita. Julkaisua käsittelevä raportointi mainitsee myös koulutuskoodin, koulutusohjeistuksen ja lokit. Ne antavat tutkijoille enemmän tarkasteltavaa kuin pelkät lopulliset mallipainot: esimerkiksi 16K-aineistovaiheen välitallenne kertoo käytetyn koulutuskontekstin ja siihen mennessä kertyneiden jatkokoulutustokenien määrän. 2
3
6
9
Tiimi kertoo myös tutkijoiden ohjaamien tekoälyagenttien avustaneen kehitystyössä muun muassa aineiston kuratoinnissa ja laskentaklusterin käytössä. Kuvaus kertoo työnkulusta. Se ei osoita, että agentit olisivat suunnitelleet tai validoineet mallin itsenäisesti, eikä mittaa niiden osuutta tuloksiin. 2
8
Raportoiduissa arvioinneissa ZGCM-1-7B sai 97,13 % MATH-500:ssa, 75,00 % AIME 2026:ssa, 63,09 % WebWalkerQA:ssa ja 19,43 % BrowseCompissa. Malli ei kuitenkaan voittanut kaikkia verrokkeja: julkaistussa vertailussa se jäi jälkeen AIME 2024- ja AIME 2025 -testeissä. Tekijät raportoivat lisäksi saavuttaneensa saman esikoulutuksen häviöarvon noin 4,2 kertaa lyhyemmässä ajassa kuin käyttämällään AdamW/BF16-vertailutoteutuksella. Luvut kuvaavat näitä testejä ja järjestelmävertailuja, eivät suorituskykyä kaikissa tiedonhakutehtävissä. 7
10
Mallin julkaisusivulla on Transformers-kirjaston tekstintuoton esimerkki tunnukselle zgcagi/ZGCM-1-7B. Siinä käytetään asetusta trust_remote_code=True, joten mallivaraston oma koodi on syytä tarkistaa ennen asetuksen käyttöönottoa. Saatavilla oleva aineisto ei määritä lopulliselle mallille vähimmäisnäytönohjainta, muistimäärää tai pakollista ohjelmistoversiota; niitä ei pidä päätellä vertailutuloksista tai välitallenteiden tiedoista. 2
19
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
ZGCM 1 7B on 7,39 miljardin parametrin malli, jonka ilmoitettu konteksti ikkuna on 256K tokenia.
ZGCM 1 7B on 7,39 miljardin parametrin malli, jonka ilmoitettu konteksti ikkuna on 256K tokenia. Tutkimuskäyttöä tukevat kaksi vastaustapaa, kuvattu koulutusprosessi sekä julkaistut aineisto ja koulutuksen välitallenteet.
Ilmoitetut nopeus ja vertailutulokset koskevat tiettyjä testejä ja vertailuasetelmia, eivät kaikkia käyttötilanteita.