ZGCM 1 7B — обученная с нуля модель на 7,39 млрд параметров для математических рассуждений и поиска с помощью инструментов; заявленная длина контекста — 256 тысяч токенов. Ценность проекта для исследователей — в сочетании двух режимов ответа, опубликованной схемы обучения, набора данных и промежуточных версий модели.
ОпубликовалОтредактировано с помощью GPT-6 SolИзображения созданы с помощью GPT Image 2
Ответ на исследование

Create a landscape editorial hero image for this Studio Global article: What is ZGCM-1-7B, who released it and under what license, and what makes it a useful open baseline for mathematical reasoning and tool-assi. Article summary: ZGCM-1-7B is a 7.39-billion-parameter dense language model trained from scratch for mathematical reasoning and tool-assisted search. It was released by researchers at Zhongguancun Academy and the Zhongguancun Institute o. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
ZGCM-1-7B разработана исследователями Zhongguancun Academy и Zhongguancun Institute of Artificial Intelligence для решения математических задач и поиска информации с использованием инструментов. Это плотная языковая модель, обученная с нуля. Её можно оценивать не только по итоговым баллам: проект публикует материалы, по которым исследователи могут изучать отдельные этапы обучения. 2
4
9
У ZGCM-1-7B 7,39 млрд параметров. В описании модели указана лицензия MIT. Пометка CC BY 4.0 относится к научной статье и не должна автоматически переноситься на модель. Перед использованием стоит проверять условия именно того ресурса, который вы скачиваете. 2
7
1
ZGCM-1-7B — плотный Transformer, который генерирует текст последовательно (decoder-only). Заявленное контекстное окно составляет 256 тысяч токенов. Одна и та же модель поддерживает режим развёрнутого рассуждения (thinking) и режим прямого ответа. Это позволяет сопоставлять их поведение, не переключаясь между разными моделями. 2
4
В архитектуре чередуются слои внимания с ограниченным скользящим окном и слои полного внимания. В одном из описаний указаны 27 слоёв первого типа и пять второго. По данным авторов, такая схема уменьшила объём KV-кеша — памяти для промежуточных данных при генерации — в 6,4 раза и повысила пропускную способность при контексте в 256 тысяч токенов в 3,94 раза по сравнению с их конфигурацией только с полным вниманием. Это результат конкретного сравнения, а не обещание такого же ускорения при любом запуске. 4
10
Описанный процесс охватывает предварительное обучение, промежуточное обучение с постепенным увеличением контекста и дообучение с учителем на общих и агентных задачах. В нём используются оптимизатор Muon с вычислениями в формате FP8, этапы на 16, 64 и 256 тысяч токенов, а также представление последовательностей взаимодействия как переходов марковского процесса принятия решений. Заявленный объём данных на этапе промежуточного обучения — 600 млрд токенов. 1
2
10
Помимо итоговой модели, опубликованы набор данных и промежуточные версии модели; сообщения о выпуске также упоминают код обучения, инструкции и журналы. Например, для версии после этапа с данными 16K указаны контекст, использованный при обучении, и накопленное число токенов промежуточного обучения. Это даёт возможность изучать путь к итоговой модели, а не только её финальные веса. 2
3
6
9
Команда также сообщает, что в работе участвовали ИИ-агенты под руководством исследователей: они помогали, в частности, с подготовкой данных и операциями в вычислительном кластере. Это описание рабочего процесса; оно не доказывает, что агенты самостоятельно спроектировали или проверили модель, и не показывает, какую долю результатов можно приписать их участию. 2
8
В опубликованных оценках ZGCM-1-7B набрала 97,13% на MATH-500, 75,00% на AIME 2026, 63,09% на WebWalkerQA и 19,43% на BrowseComp. Преимущество не распространяется на все сравнения: в опубликованных таблицах модель уступает конкуренту на AIME 2024 и AIME 2025. Авторы также сообщают, что при предварительном обучении достигли того же значения функции потерь примерно в 4,2 раза быстрее, чем в выбранной ими базовой конфигурации AdamW/BF16. Все эти цифры зависят от методики тестирования и условий сравнения; они не гарантируют аналогичного результата в каждом реальном сценарии поиска. 7
10
На странице модели приведён пример генерации текста через Transformers для zgcagi/ZGCM-1-7B с параметром trust_remote_code=True. Перед его включением стоит изучить пользовательский код репозитория. Представленные материалы не позволяют назвать минимальные требования к видеокарте, памяти или версиям библиотек для запуска итоговой модели: параметры отдельных промежуточных версий и условий тестирования нельзя считать такими требованиями. 2
19
Studio Global AI
На этой странице есть ответ, подтвержденный источником, который вы можете продолжить внутри Studio Global.
ZGCM 1 7B — обученная с нуля модель на 7,39 млрд параметров для математических рассуждений и поиска с помощью инструментов; заявленная длина контекста — 256 тысяч токенов.
ZGCM 1 7B — обученная с нуля модель на 7,39 млрд параметров для математических рассуждений и поиска с помощью инструментов; заявленная длина контекста — 256 тысяч токенов. Ценность проекта для исследователей — в сочетании двух режимов ответа, опубликованной схемы обучения, набора данных и промежуточных версий модели.