ZGCM 1 7B je od základu trénovaný model se 7,39 miliardy parametrů, určený pro matematické uvažování a vyhledávání s pomocí nástrojů. Vedle modelu jsou dostupná data a průběžné kontrolní body trénování, takže lze zkoumat více než samotné výsledné váhy.
PublikovalUpraveno pomocí GPT-6 SolObrázky vytvořeny pomocí GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is ZGCM-1-7B, who released it and under what license, and what makes it a useful open baseline for mathematical reasoning and tool-assi. Article summary: ZGCM-1-7B is a 7.39-billion-parameter dense language model trained from scratch for mathematical reasoning and tool-assisted search. It was released by researchers at Zhongguancun Academy and the Zhongguancun Institute o. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
ZGCM-1-7B spojuje dvě schopnosti: promýšlet matematické úlohy a podle potřeby získávat informace pomocí nástrojů. Výzkumníci ze Zhongguancun Academy a Zhongguancun Institute of Artificial Intelligence jej představili jako otevřený model, u něhož lze zkoumat také postup trénování, nikoli pouze porovnávat konečná skóre. 2
4
Jde o hustý jazykový model se 7,39 miliardy parametrů, trénovaný od základu. Karta modelu uvádí licenci MIT. Označení CC BY 4.0 u výzkumného článku se vztahuje na článek, a nemělo by se proto zaměňovat za licenci modelu. Při použití jednotlivých zveřejněných zdrojů je namístě ověřit jejich vlastní podmínky. 2
7
1
ZGCM-1-7B je hustý Transformer typu decoder-only s deklarovaným kontextovým oknem 256 tisíc tokenů. V jednom modelu nabízí režim postupného uvažování (thinking) i režim přímé odpovědi. Výzkumníci tak mohou porovnávat oba způsoby odpovídání bez výměny modelu. 2
4
Architektura střídá vrstvy pozornosti s řízeným posuvným oknem a vrstvy plné pozornosti; jeden z popisů uvádí 27 vrstev prvního typu a pět druhého. Podle autorů toto uspořádání v jejich srovnání snížilo využití mezipaměti KV 6,4krát a při kontextu 256 tisíc tokenů zvýšilo propustnost 3,94krát oproti variantě s plnou pozorností. Nejde o příslib stejného zrychlení při každém nasazení. 4
10
Zveřejněný postup zahrnuje předtrénování, postupné rozšiřování kontextu v navazující fázi trénování a doškolení na příkladech obecných i agentních úloh. Využívá optimalizátor Muon při trénování v přesnosti FP8; fáze dlouhého kontextu postupují přes 16K, 64K a 256K a záznamy interakcí převádějí na přechody markovského rozhodovacího procesu. Autoři pro tuto navazující fázi uvádějí 600 miliard tokenů. 1
2
10
Projekt zveřejnil také datovou sadu a průběžné kontrolní body; zprávy o vydání zmiňují rovněž trénovací kód, postupy a záznamy. Lze tak zkoumat větší část cesty k výslednému modelu. Například kontrolní bod označený jako fáze dat 16K dokumentuje použitý trénovací kontext i průběžný počet tokenů. 2
3
6
9
Tým uvádí, že mu při vývoji pomáhali AI agenti řízení výzkumníky, mimo jiné při přípravě dat a provozu výpočetního clusteru. To popisuje pracovní postup; samo o sobě to nedokládá, že agenti model nezávisle navrhli či ověřili, ani nevyčísluje jejich podíl na výsledcích. 2
8
V uváděných hodnoceních dosáhl ZGCM-1-7B 97,13 % v MATH-500, 75,00 % v AIME 2026, 63,09 % ve WebWalkerQA a 19,43 % v BrowseComp. Ve všech srovnáních však nevede: zveřejněné tabulky ukazují také horší výsledky v AIME 2024 a AIME 2025. Autoři navíc uvádějí, že stejné hodnoty ztrátové funkce při předtrénování dosáhli přibližně za 4,2krát kratší dobu než se svou výchozí konfigurací AdamW/BF16. Jde o výsledky konkrétních testů a systémových srovnání, nikoli o záruku výkonu při každém vyhledávacím úkolu. 7
10
Karta modelu obsahuje příklad generování textu v knihovně Transformers pro zgcagi/ZGCM-1-7B. Používá volbu trust_remote_code=True, proto je vhodné před jejím zapnutím zkontrolovat vlastní kód v repozitáři. Dostupné podklady nestanovují minimální požadavky finálního modelu na GPU či paměť ani povinné verze balíčků; údaje z popisů průběžných kontrolních bodů za takové požadavky nelze vydávat. 2
19
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
ZGCM 1 7B je od základu trénovaný model se 7,39 miliardy parametrů, určený pro matematické uvažování a vyhledávání s pomocí nástrojů.
ZGCM 1 7B je od základu trénovaný model se 7,39 miliardy parametrů, určený pro matematické uvažování a vyhledávání s pomocí nástrojů. Vedle modelu jsou dostupná data a průběžné kontrolní body trénování, takže lze zkoumat více než samotné výsledné váhy.