ZGCM 1 7B to wytrenowany od podstaw model o 7,39 mld parametrów, przeznaczony do zadań matematycznych i wyszukiwania z użyciem narzędzi. Jako punkt odniesienia dla badaczy wyróżnia się dwoma trybami odpowiedzi oraz udostępnionymi danymi, opisem treningu i pośrednimi checkpointami.
Opublikowane przezEdytowane za pomocą GPT-6 SolObrazy wygenerowane za pomocą GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is ZGCM-1-7B, who released it and under what license, and what makes it a useful open baseline for mathematical reasoning and tool-assi. Article summary: ZGCM-1-7B is a 7.39-billion-parameter dense language model trained from scratch for mathematical reasoning and tool-assisted search. It was released by researchers at Zhongguancun Academy and the Zhongguancun Institute o. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
ZGCM-1-7B powstał z myślą o połączeniu dwóch umiejętności: rozwiązywania zadań matematycznych oraz aktywnego zbierania informacji za pomocą narzędzi. To gęsty model językowy o 7,39 mld parametrów, wytrenowany od podstaw przez badaczy z Zhongguancun Academy i Zhongguancun Institute of Artificial Intelligence. Dla osób badających modele AI istotne jest nie tylko to, jak wypada w testach, lecz także możliwość prześledzenia części drogi, którą powstał. 2
4
Karta modelu wskazuje licencję MIT. Oznaczenie CC BY 4.0 przy artykule naukowym dotyczy publikacji i nie należy go automatycznie przypisywać modelowi. Przed wykorzystaniem wag, danych lub kodu warto sprawdzić warunki właściwe dla każdego z tych zasobów. 2
7
1
To gęsty Transformer typu decoder-only z deklarowanym oknem kontekstowym 256 tys. tokenów. W tym samym modelu dostępne są tryb bardziej rozbudowanego rozumowania (thinking) i tryb odpowiedzi bezpośredniej. Pozwala to porównywać style pracy bez zmiany modelu. 2
4
W architekturze przeplatają się warstwy mechanizmu uwagi o bramkowanym, przesuwającym się oknie oraz warstwy pełnej uwagi. Jeden z opisów podaje odpowiednio 27 i 5 warstw. Według autorów, w ich porównaniu z architekturą opartą na pełnej uwadze takie rozwiązanie zmniejszyło zapotrzebowanie na pamięć podręczną KV 6,4 raza i zwiększyło przepustowość przy kontekście 256 tys. tokenów 3,94 raza. Nie oznacza to, że każde wdrożenie uzyska taki sam wzrost szybkości. 4
10
Opisana ścieżka obejmuje trening wstępny, etap pośredni ze stopniowym wydłużaniem kontekstu oraz nadzorowane dostrajanie do zadań ogólnych i związanych z działaniem agentów. Wykorzystano hybrydowy mechanizm uwagi i optymalizator Muon w FP8. Program treningu pośredniego przechodzi przez etapy 16K, 64K i 256K oraz przedstawia przebiegi interakcji jako przejścia w markowowskim procesie decyzyjnym (MDP). Według autorów ten etap objął 600 mld tokenów. 1
2
10
Oprócz modelu opublikowano zbiór danych i pośrednie checkpointy; materiały opisujące projekt wymieniają również kod treningowy, procedury i dzienniki. Dzięki temu można analizować więcej niż same końcowe wagi. Przykładowo checkpoint oznaczony etapem danych 16K podaje rzeczywisty kontekst użyty podczas treningu — 32 768 tokenów — oraz skumulowaną liczbę tokenów z etapu pośredniego. 2
3
6
9
Zespół informuje też, że w pracach pomagały agenty AI kierowane przez badaczy, m.in. przy przygotowaniu danych i obsłudze infrastruktury obliczeniowej. Jest to opis organizacji pracy, a nie dowód, że agenty samodzielnie zaprojektowały lub zweryfikowały model. Dostępne informacje nie pozwalają również przypisać im konkretnej części uzyskanych wyników. 2
8
W opublikowanych ocenach ZGCM-1-7B uzyskał 97,13% w MATH-500, 75,00% w AIME 2026, 63,09% w WebWalkerQA oraz 19,43% w BrowseComp. Nie wygrywa jednak każdego zestawienia: w przedstawionych porównaniach ustępuje innemu modelowi w AIME 2024 i AIME 2025. Autorzy podają też, że osiągnięcie tego samego poziomu błędu podczas treningu wstępnego zajęło około 4,2 razy mniej czasu niż przy ich konfiguracji odniesienia AdamW/BF16. Są to wyniki określonych testów i porównań systemowych, a nie gwarancja podobnej skuteczności w każdym zadaniu wyszukiwania. 7
10
Karta zgcagi/ZGCM-1-7B zawiera przykład generowania tekstu z użyciem biblioteki Transformers i ustawienia trust_remote_code=True. Przed włączeniem tej opcji należy sprawdzić niestandardowy kod repozytorium. Udostępnione materiały nie potwierdzają minimalnych wymagań dotyczących GPU, pamięci ani wersji pakietów dla końcowego modelu — nie należy ich wywodzić z wyników testów lub opisów pośrednich checkpointów. 2
19
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
ZGCM 1 7B to wytrenowany od podstaw model o 7,39 mld parametrów, przeznaczony do zadań matematycznych i wyszukiwania z użyciem narzędzi.
ZGCM 1 7B to wytrenowany od podstaw model o 7,39 mld parametrów, przeznaczony do zadań matematycznych i wyszukiwania z użyciem narzędzi. Jako punkt odniesienia dla badaczy wyróżnia się dwoma trybami odpowiedzi oraz udostępnionymi danymi, opisem treningu i pośrednimi checkpointami.
Autorzy podają mocne wyniki w wybranych testach, lecz nie we wszystkich porównaniach model wygrywa, a deklarowane przyspieszenia zależą od przyjętego punktu odniesienia.