Moonshot AI связывает прогресс ИИ с двумя видами масштабирования: большей ёмкостью модели до развёртывания и большим объёмом вычислений на этапе выполнения задач. Kimi K3 заявлена как мультимодальная MoE модель с 2,8 трлн параметров, но для каждого токена активирует около 104 млрд параметров — это снижает стоимость...
Ответ на исследование

Create a landscape editorial hero image for this Studio Global article: How does Moonshot AI’s 47-page Kimi K3 technical report argue that AI progress depends on scaling both pre-deployment model size and post-de. Article summary: K3’s core argument is that frontier progress requires scaling two complementary resources: model capacity before deployment, and the compute spent after deployment on long reasoning, tool use, and agentic rollouts. Its a. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Moonshot AI представляет Kimi K3 как аргумент в пользу масштабирования по двум осям. Первая — наращивать возможности модели ещё до развёртывания. Вторая — после развёртывания давать ей достаточно вычислений для рассуждений, работы с инструментами, браузером, кодом и исправления собственных ошибок.
Главный вопрос здесь экономический. Недостаточно сделать сеть просто глубже и больше: если обслуживание длинного контекста оказывается чрезмерно дорогим, заявленные возможности остаются непрактичными. Архитектура K3 задумана так, чтобы резко увеличить общую ёмкость модели, не оплачивая на каждом генерируемом токене вычисления и память плотной сети на 2,8 трлн параметров. 1
Kimi K3 описывается как нативно мультимодальная модель типа Mixture-of-Experts (MoE, «смесь экспертов») с 2,8 трлн параметров всего, примерно 104 млрд активируемых параметров на токен и окном контекста до 1 млн токенов. 1
17
Эти две цифры отвечают на разные вопросы:
В этом и состоит практический смысл MoE. K3 может быть значительно крупнее плотной модели при близком объёме вычислений на токен. Инференс от этого не становится дешёвым — 104 млрд активных параметров всё ещё очень много, — но системе не приходится на каждом токене прогонять через вычисления плотную сеть на 2,8 трлн параметров. 1
Поэтому тезис Moonshot AI не сводится к формуле «больше параметров — лучше». Компания утверждает, что условные вычисления позволяют сделать новую ступень ёмкости модели пригодной для длинных, многошаговых задач.
Контекст в миллион токенов — сложная задача не только для обучения. В традиционных механизмах внимания потребление памяти и вычислений обычно заметно растёт по мере увеличения последовательности. В K3 используется гибридная схема: Kimi Delta Attention (KDA) сочетается с Gated Multi-head Latent Attention (Gated MLA). В описанной конфигурации — 69 слоёв KDA и 24 слоя Gated MLA, преимущественно по схеме «три KDA на один MLA». 1
12
KDA — линейная компонента внимания в модели. Вместо обычного key-value-кэша, который накапливается по всей истории в каждом таком слое, она использует рекуррентное состояние фиксированного размера. Идея в том, что память и вычисления при генерации не растут с уже обработанной длиной контекста так же, как при полном внимании. 1
В отчёте также описано нижнее ограничение для скорости затухания в KDA. Это не только выбор в пользу определённого поведения модели: ограничение не допускает чрезвычайно малых значений, неудобных для эффективных численных вычислений, и делает возможной блочную реализацию, рассчитанную на тензорные ядра GPU. 1
Одна лишь линейная рекуррентность может уступать полному вниманию в избирательном поиске нужного фрагмента по всему контексту. Поэтому слои Gated MLA сохраняются по всей сети. В этой гибридной схеме KDA обеспечивает относительно экономичную обработку последовательности с постоянным состоянием, а MLA периодически возвращает глобальное извлечение информации. 1
Это важно именно как системный подход. Большое заявленное окно контекста имеет ценность, только если модель может находить в нём нужные данные и при этом отвечать с приемлемой стоимостью.
Второй архитектурный элемент K3 — Attention Residuals (AttnRes). У модели 93 слоя; AttnRes позволяет более поздним слоям извлекать сжатые представления из ранних блоков глубины, а не заставляет всю информацию проходить исключительно шаг за шагом через каждый следующий слой. 1
Упрощённо: KDA решает вопрос движения информации по длине последовательности, а AttnRes — её движения по глубине сети. Это особенно существенно для глубокой модели, в которой значительная часть стека использует линейное внимание. Замена дорогого глобального внимания принесёт пользу лишь в том случае, если полезная информация не теряется и не изолируется при прохождении активаций через сеть. 1
В MoE-слоях K3, согласно отчёту, используются 896 маршрутизируемых экспертов, из которых для каждого токена выбираются 16. 1
6 Именно этот механизм создаёт разрыв между общим числом параметров и числом параметров, реально активных на токен.
Подход Stable LatentMoE сосредоточен на устойчивости и балансе маршрутизации. Распределение токенов между экспертами рассматривается как задача оптимизации на уровне батча; для балансировки применяется подход на основе квантилей. При этом отчёт выводит точный оптимум при заданных допущениях, но на этапе развёртывания не решает задачу заново для каждого батча: используются фиксированные смещения экспертов и обычный выбор top-k. 1
Это важная оговорка. «Идеальное равновесие» — результат для конкретной математической постановки маршрутизации, а не гарантия, что в любой реальной рабочей нагрузке токены распределятся между экспертами совершенно равномерно.
У крупных MoE-моделей возникает и сетевая проблема: токены часто нужно пересылать между устройствами к назначенным экспертам. Если часть экспертов получает непропорционально большой спрос, задержку может определять самый медленный коммуникационный путь.
Moonshot AI позиционирует MoonEP как системный слой для экспертно-параллельных коммуникаций. Его задача — снижать дисбаланс в обменах all-to-all, возникающих из-за разреженной маршрутизации, чтобы большой пул экспертов можно было и обучать, и обслуживать на практике. 1
В этом заключается один из главных тезисов K3: архитектуру, маршрутизацию и межустройственную связь нельзя считать независимыми объяснениями производительности. Все три компонента нужны, чтобы превратить теоретическую разреженную ёмкость в реальную пропускную способность.
Другая половина стратегии K3 относится к тому, что происходит после предобучения. Moonshot AI описывает инфраструктуру для траекторий обучения с подкреплением: длинных задач с инструментами, программированием, браузером и итеративным поиском решения. Также в отчёте говорится о дистилляции нескольких специализированных учителей по доменам и рассуждениям в одну систему. 1
Поддерживающая среда — это система «песочниц» на базе лёгких виртуальных машин, рассчитанная на массовое создание, сохранение снимков и возобновление сред выполнения. Заявленные показатели: 51,2 млн экземпляров песочниц, 133 мс на снимок и 49 мс на восстановление. 1
Практический смысл прост: если модель должна тратить больше вычислений во время ответа на планирование, вызовы инструментов, проверку результата или продолжение длинной задачи, то обучение должно включать подобные траектории. Возможность недорого ставить среду на паузу, ветвить и восстанавливать её позволяет создавать больше таких обучающих развёртываний.
Это не означает, что любой ответ K3 автоматически получает неограниченный вычислительный бюджет. Речь о системе, которая должна превращать дополнительные шаги и дополнительный контекст в более высокий результат, а не полагаться исключительно на ещё более крупную предобученную модель.
Для Kimi K3 заявлен результат 91,2% на BrowseComp — бенчмарке, ориентированном на долгосрочный поиск информации. Сторонняя таблица результатов также указывает для K3 91,2%, хотя позиции в рейтинге и конфигурации измерений могут меняться. 18
Такой результат согласуется с целью продукта: систему, рассчитанную на длинный контекст, агентное дообучение и рассуждения во время инференса, логично проверять на сложных задачах поиска и синтеза информации. Но это не чистый эксперимент, изолирующий отдельные компоненты.
Одна оценка бенчмарка не позволяет установить, какая доля результата обеспечена KDA, AttnRes, маршрутизацией экспертов, коммуникационной инфраструктурой, RL-средами, дистилляцией, промптингом или настройками инференса. Наиболее осторожная интерпретация такова: заявленная система хорошо работает как интегрированный стек, но это не доказывает решающий вклад какой-то одной архитектурной новации. 1
18
K3 нередко подают как вызов другим большим открытым моделям, включая системы DeepSeek. Однако из самого отчёта следует более аккуратный вывод: Moonshot AI предлагает иной акцент в дизайне — сочетание очень большой разреженной ёмкости, экономичной работы с длинным контекстом и инфраструктуры дообучения для агентов. 1
17
Технический отчёт подтверждает спецификации и архитектурные решения K3. Но сам по себе он не доказывает, что другие открытые модели «застряли», и не изолирует निर्णающее преимущество K3 над конкретным конкурентом. Для таких рыночных выводов нужны последовательные независимые сравнения в воспроизводимых условиях.
Сравнения цены за токен или за выполненную задачу особенно легко истолковать слишком широко. На них влияют промпт, интенсивность рассуждений, длина контекста, кэширование, использование инструментов, предположения о пропускной способности, дата прайсинга и сам тестовый контур.
В одной опубликованной оценке стоимость завершённой задачи составила примерно $0,94 для K3 и $1,04 для GPT-5.6 Sol. Это может указывать на небольшое преимущество K3 в конкретной конфигурации, но не подтверждает универсальное утверждение, что K3 стоит вдвое дешевле Sol. 20
Более устойчивый вывод менее громкий: K3 — попытка сделать длинный контекст и агентные возможности экономически убедительными на существенно большем общем масштабе модели. Насколько это удаётся в реальности, зависит от воспроизводимых тестов и расчёта стоимости для конкретного развёртывания.
Технический отчёт Kimi K3 строит аргумент не вокруг одного рекордного числа, а вокруг целого стека. Масштабирование до развёртывания обеспечивают MoE-модель на 2,8 трлн параметров и около 104 млрд активных параметров на токен. Масштабирование после развёртывания — обучение и обслуживание системы, способной использовать длинный контекст, инструменты, дополнительные шаги рассуждения и агентные траектории. 1
17
KDA, Gated MLA, AttnRes, Stable LatentMoE, MoonEP и инфраструктура RL-песочниц — части одного замысла: для агентного поведения фронтирного уровня нужна не просто более крупная модель, а дизайн, который делает практически доступными и больший контекст, и больше работы во время инференса. Бенчмарки дают обнадёживающие свидетельства в пользу этого системного подхода, но их корректнее читать как заявленные результаты всей системы, а не как окончательное доказательство вклада каждого отдельного компонента. 1
18
Studio Global AI
На этой странице есть ответ, подтвержденный источником, который вы можете продолжить внутри Studio Global.
Moonshot AI связывает прогресс ИИ с двумя видами масштабирования: большей ёмкостью модели до развёртывания и большим объёмом вычислений на этапе выполнения задач.
Moonshot AI связывает прогресс ИИ с двумя видами масштабирования: большей ёмкостью модели до развёртывания и большим объёмом вычислений на этапе выполнения задач. Kimi K3 заявлена как мультимодальная MoE модель с 2,8 трлн параметров, но для каждого токена активирует около 104 млрд параметров — это снижает стоимость относительно плотной модели такого же общего размера.
Архитектура объединяет KDA, Gated MLA, AttnRes, маршрутизацию Stable LatentMoE и коммуникационный слой MoonEP, чтобы длинный контекст и разреженная сеть экспертов были практически применимы.