ZGCM 1 7B — навчена з нуля модель на 7,39 млрд параметрів для математичних задач і пошуку з використанням інструментів; заявлена довжина контексту — 256K токенів. Опубліковані дані, проміжні контрольні точки й опис навчання дають змогу досліджувати не лише кінцеву модель, а й шлях до неї.
ОпублікувавВідредаговано за допомогою GPT-6 SolЗображення створено за допомогою GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is ZGCM-1-7B, who released it and under what license, and what makes it a useful open baseline for mathematical reasoning and tool-assi. Article summary: ZGCM-1-7B is a 7.39-billion-parameter dense language model trained from scratch for mathematical reasoning and tool-assisted search. It was released by researchers at Zhongguancun Academy and the Zhongguancun Institute o. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
ZGCM-1-7B — щільна мовна модель, яку дослідники Zhongguancun Academy та Zhongguancun Institute of Artificial Intelligence навчили з нуля для математичних міркувань і пошуку інформації за допомогою інструментів. Вона має 7,39 млрд параметрів. На відміну від релізу, де доступні лише підсумкові ваги й таблиця тестів, цей проєкт дає дослідникам матеріали для вивчення процесу навчання. 2
4
У картці моделі зазначено ліцензію MIT. Позначка CC BY 4.0 на дослідницькій статті стосується статті — її не слід автоматично переносити на модель. Перед використанням варто перевірити умови саме того ресурсу, який ви завантажуєте. 2
7
1
ZGCM-1-7B — щільний Transformer типу decoder-only із заявленим контекстним вікном 256K токенів. Одна й та сама модель підтримує режим розгорнутого міркування (thinking) і режим прямої відповіді. Це дає змогу порівнювати їхню поведінку, не змінюючи саму модель. 2
4
В архітектурі чергуються шари уваги з керованим ковзним вікном і шари повної уваги; в одному з описів наведено відповідно 27 і 5 шарів. За вимірами авторів, така схема зменшує використання KV-кешу — пам’яті для проміжних даних під час генерації — у 6,4 раза і підвищує пропускну здатність за контексту 256K у 3,94 раза порівняно з їхнім варіантом на повній увазі. Це результат конкретного системного порівняння, а не гарантія такого самого прискорення на іншому обладнанні. 4
10
Опублікований опис охоплює попереднє навчання, поетапне навчання на довших контекстах і контрольоване донавчання на загальних та агентних завданнях. Він поєднує гібридну увагу з оптимізатором FP8 Muon; етапи роботи з контекстом охоплюють 16K, 64K і 256K, а послідовності взаємодій подано як переходи марковського процесу ухвалення рішень. За повідомленням авторів, цей проміжний етап охопив 600 млрд токенів. 1
2
10
Окрім фінальної моделі, опубліковано набір даних і проміжні контрольні точки. У повідомленнях про реліз також ідеться про код, навчальні рецепти та журнали. Наприклад, картка контрольної точки для етапу 16K документує контекст навчання й накопичений обсяг токенів проміжного навчання. Ці матеріали роблять шлях до результату доступнішим для перевірки, ніж самі фінальні ваги. 2
3
6
9
Команда також описує участь ШІ-агентів під керівництвом дослідників — зокрема у підготовці даних і роботі з обчислювальним кластером. Це опис робочого процесу, а не доказ того, що агенти самостійно спроєктували чи перевірили модель. Їхній окремий внесок у результати тестів не виміряно. 2
8
У наведених оцінюваннях ZGCM-1-7B набрала 97,13% на MATH-500, 75,00% на AIME 2026, 63,09% на WebWalkerQA і 19,43% на BrowseComp. Водночас у порівняльних таблицях вона поступається іншій моделі на AIME 2024 та AIME 2025. Окремо автори повідомляють, що досягли такого самого значення функції втрат під час попереднього навчання приблизно у 4,2 раза швидше, ніж із базовим підходом AdamW/BF16. Усі ці цифри залежать від методики тестування та обраних системних баз порівняння; вони не описують автоматично якість у кожному реальному пошуковому сценарії. 7
10
У картці zgcagi/ZGCM-1-7B є приклад генерації тексту через Transformers із параметром trust_remote_code=True. Перш ніж вмикати його, перегляньте власний код репозиторію, який він дозволяє виконувати. Надані матеріали не встановлюють мінімальних вимог до GPU, пам’яті чи версій пакетів для запуску фінальної моделі; їх не варто виводити з описів тестів або проміжних контрольних точок. 2
19
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
ZGCM 1 7B — навчена з нуля модель на 7,39 млрд параметрів для математичних задач і пошуку з використанням інструментів; заявлена довжина контексту — 256K токенів.
ZGCM 1 7B — навчена з нуля модель на 7,39 млрд параметрів для математичних задач і пошуку з використанням інструментів; заявлена довжина контексту — 256K токенів. Опубліковані дані, проміжні контрольні точки й опис навчання дають змогу досліджувати не лише кінцеву модель, а й шлях до неї.
Високі результати окремих тестів і заявлений приріст швидкості стосуються конкретних умов порівняння, а не будь якого практичного застосування.