Moonshot AI утверждает, что передовые ИИ системы должны одновременно наращивать ёмкость модели до развёртывания и вычисления, затрачиваемые на рассуждение после него. Kimi K3 заявлена как MoE модель с 2,78 трлн общих параметров, но с активацией 104,2 млрд параметров на токен — это снижает цену инференса по сравнению...
Ответ на исследование

Create a landscape editorial hero image for this Studio Global article: How does Moonshot AI’s 47 page Kimi K3 technical report argue that AI progress depends on scaling both pre deployment model size and post de. Article summary: K3’s core argument is that frontier progress requires scaling two complementary resources: model capacity before deployment, and the compute spent after deployment on long reasoning, tool use, and agentic rollouts.. Topic tags: general web, llm, agents, ai, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Главный тезис Kimi K3 состоит в том, что прогресс на переднем крае ИИ требует масштабирования двух дополняющих ресурсов: ёмкости модели до развёртывания и вычислений после развёртывания — на длительное рассуждение, использование инструментов и агентные последовательности действий. Архитектура K3 задумана так, чтобы оба вида масштабирования были экономически приемлемы: MoE-модель почти на 2,8 трлн параметров может хранить значительно больше знаний и навыков, активируя около 104 млрд параметров на токен, а механизмы внимания, маршрутизации, коммуникаций и обучения с подкреплением должны удешевлять использование этой ёмкости. 1
K3 описывается как нативно мультимодальная MoE-модель с 2,78 трлн параметров всего, 104,2 млрд активных параметров на токен и контекстным окном до 1 млн токенов. 1 В этом и заключается ставка на условные вычисления: модель имеет очень большой общий объём параметров, но при генерации каждого токена не выполняет вычисления, эквивалентные работе плотной модели на 2,78 трлн параметров.
Важно уточнить контекстное окно: отчёт заявляет нативную экстраполяцию до 1 млн токенов, а не до 100 тыс. Модель сначала обучали на длине 8 тыс. токенов, затем — 64 тыс. Она не использует явные позиционные эмбеддинги; авторы считают, что рекуррентные затворы и затухание в KDA достаточно кодируют позицию для такой экстраполяции без модификации RoPE. 1
KDA (Kimi Delta Attention) заменяет большую часть квадратичного внимания рекуррентным состоянием фиксированного размера. Поэтому состояние на токен и цена декодирования не растут с длиной предыдущего контекста так, как при полном KV-кеше. Moonshot чередует три слоя KDA с одним слоем Gated MLA: KDA обеспечивает недорогую обработку длинной последовательности, а MLA возвращает возможность выборочно извлекать информацию из глобального контекста. 1
Указанная в отчёте нижняя граница скорости затухания KDA — не просто изменение модели. Это технический приём, предотвращающий численно проблемные слишком малые значения затухания и позволяющий использовать блочные вычисления, удобные для тензорных ядер. 1
Attention Residuals (AttnRes) должны не дать очень глубокой сети с преимущественно линейным вниманием потерять связь с ранними представлениями. Поздние слои могут извлекать сжатую информацию из предыдущих блоков по глубине, а не получать всё полезное только через строго последовательную передачу слой за слоем. По замыслу авторов, это помогает сохранять качество, заменяя значительную часть дорогого глобального внимания KDA-слоями. 1
Схема Stable LatentMoE использует 896 экспертов и маршрутизацию top-16, увеличивая условную ёмкость модели. Метод квантильной балансировки формулирует маршрутизацию как задачу сбалансированного назначения и выводит точный оптимум в рамках своих пакетных допущений. При развёртывании же маршрутизатор применяет фиксированные смещения экспертов и обычный выбор top-k, а не запускает балансирующий решатель при каждом инференсе. 1
Это сильнее обычной балансировки через вспомогательную функцию потерь, но вывод о «совершенном равновесии» следует понимать узко: он относится к заявленной оптимизационной постановке, а не гарантирует идеальную балансировку в каждом реальном пакете запросов.
Практическая сторона этой идеи — MoonEP. Крупная MoE-модель имеет смысл лишь тогда, когда токены можно быстро передать выбранным экспертам: неравномерный спрос на экспертов иначе создаёт сетевые задержки. MoonEP предназначен для балансировки обмена all-to-all, возникающего при такой маршрутизации, чтобы модель с 896 экспертами можно было обучать и обслуживать в масштабе. Архитектурные и системные решения здесь дополняют друг друга, а не являются независимыми объяснениями результатов на бенчмарках. 1
Тезис Moonshot AI не сводится к увеличению чекпойнта. Инфраструктура «лёгких» виртуальных машин и снимков состояния, согласно отчёту, делает возможным создание большого числа проверяемых длинных RL-траекторий, а также дешёвое ветвление и возобновление их выполнения. Это создаёт основу для моделей, которые во время ответа могут делать больше шагов: планировать, искать информацию, писать и запускать код, вызывать инструменты и исправлять собственные ошибки. 1
Отчёт также описывает дистилляцию нескольких специализированных моделей для разных областей и типов рассуждений в одну систему. Смысл в переносе специализированного поведения без необходимости обслуживать девять отдельных моделей. 1
Иными словами, масштабирование до запуска даёт модели запас способностей, а масштабирование на этапе инференса позволяет потратить больше вычислений на сложный конкретный запрос. Именно эту связку Moonshot AI представляет как путь к практичным длинноконтекстным и агентным системам.
Показатель 91,2% в BrowseComp был бы аргументом в пользу высокой эффективности K3 в долгих задачах поиска и обработки информации: по состоянию на 2 сентября 2026 года сторонняя таблица BenchLM.ai указывала Kimi K3 на втором месте, после GPT-5.6 Sol с 92,2%. 4 Однако один бенчмарк не позволяет выделить вклад KDA, AttnRes, маршрутизации MoE, RL-сред, дистилляции или дополнительных вычислений при инференсе по отдельности. Это итоговый, сквозной результат всей системы.
С осторожностью стоит относиться и к ценовым сопоставлениям. В доступном техническом отчёте и в независимом высокоавторитетном источнике не удалось подтвердить утверждения, что K3 стоит «вдвое дешевле GPT-5.6 Sol» или что её результат в Kimi Code Bench ровно на четыре пункта ниже «Claude Fable 5» при 38% цены. Один из приведённых источников оценивает стоимость завершённой задачи примерно в $0,94 для K3 и $1,04 для GPT-5.6 Sol — это совсем не разрыв в 50%. 8 Такие цифры зависят от конфигурации, запросов, даты тарифов и методики полного учёта затрат.
Вывод отчёта скорее архитектурный, чем исключительно ценовой: Moonshot AI утверждает, что для преодоления триллионного масштаба и превращения длинного контекста с агентным инференсом в полезную способность открытым моделям нужен новый совместный стек — дизайн модели, обучение и распределённые системы. Но тезис о том, что открытые модели якобы «застряли» около 1 трлн параметров, а также конкретные сравнения с «DeepSeek V4 Pro», из приведённых данных самой статьи K3 напрямую не следуют.
Studio Global AI
На этой странице есть ответ, подтвержденный источником, который вы можете продолжить внутри Studio Global.
Moonshot AI утверждает, что передовые ИИ системы должны одновременно наращивать ёмкость модели до развёртывания и вычисления, затрачиваемые на рассуждение после него.
Moonshot AI утверждает, что передовые ИИ системы должны одновременно наращивать ёмкость модели до развёртывания и вычисления, затрачиваемые на рассуждение после него. Kimi K3 заявлена как MoE модель с 2,78 трлн общих параметров, но с активацией 104,2 млрд параметров на токен — это снижает цену инференса по сравнению с плотной моделью такого же размера.
Архитектура KDA, Gated MLA, Attention Residuals, маршрутизация экспертов и инфраструктура RL должны сделать длинный контекст и агентные траектории практически применимыми.