Kimi K3 认为,前沿 AI 的进步依赖两种互补资源:部署前扩展模型容量,以及部署后为长链推理、工具调用和智能体任务投入更多算力。 K3 是原生多模态 MoE 模型,总参数量为 2.78 万亿,但每个 token 仅激活约 1042 亿参数,并支持最高 100 万 token 上下文。[1] KDA、Gated MLA、Attention Residuals、Stable LatentMoE 与 MoonEP 的共同目标,是在保留大模型容量的同时,降低长上下文和专家路由带来的计算与通信成本。[1]
研究答案

Create a landscape editorial hero image for this Studio Global article: How does Moonshot AI’s 47 page Kimi K3 technical report argue that AI progress depends on scaling both pre deployment model size and post de. Article summary: K3’s core argument is that frontier progress requires scaling two complementary resources: model capacity before deployment, and the compute spent after deployment on long reasoning, tool use, and agentic rollouts.. Topic tags: general web, llm, agents, ai, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Kimi K3 技术报告的核心并不是简单宣称“参数越多越好”。Moonshot AI 的论点是:前沿 AI 能力需要同时扩展两类互补资源——部署前的模型容量,以及部署后、实际推理阶段可投入的计算量。后者包括更长的推理过程、规划、浏览、编程、工具调用和自我修正等智能体式执行。
K3 的设计意图,是让这两种扩展都更可负担:模型通过超大规模混合专家(MoE)架构储存更多能力,同时避免在每个 token 上支付一个 2.78 万亿参数稠密模型的完整推理成本;而注意力、路由、通信和强化学习基础设施,则服务于更长、更复杂的部署后推理。1
报告称,Kimi K3 是一款原生多模态 MoE 模型,拥有 2.78 万亿总参数,每个 token 激活 1042 亿参数,上下文窗口最高可达 100 万 token。1
这一区别是其“容量扩展”主张的关键:
换言之,K3 希望获得超大模型的条件容量,却不必为每一步推理承担稠密 2.78 万亿参数模型的全部计算代价。1
报告提出的上下文能力是 100 万 token,并非 10 万 token。训练初期使用 8K 上下文,随后扩展到 64K;论文认为,模型不依赖显式位置嵌入,而是通过 KDA 的循环门控与衰减机制编码位置信息,因此可在无需修改 RoPE 的条件下外推至更长序列。1
这项设计的目标,不只是容纳更长的输入,更是让模型能够处理需要持续读取、检索和整合大量信息的任务,例如长文档研究、代码库分析或多步骤网页检索。
Kimi Delta Attention(KDA)将大部分传统二次复杂度注意力替换为固定大小的循环状态。与完整 KV Cache 会随历史上下文增长不同,KDA 的每 token 状态与解码成本不会以相同方式随既有上下文线性膨胀。1
但完全依赖线性或循环式注意力也可能削弱对全局信息的精确提取。因此,K3 采用混合结构:每 3 层 KDA 后接 1 层 Gated MLA。KDA 提供低成本、可持续的序列处理,Gated MLA 则补回选择性全局检索能力。1
报告还提到,KDA 衰减率的下限不仅是建模选择,也是一项工程约束:它用于避免数值上过小的衰减值,并支持更适合 Tensor Core 的分块计算。1
K3 共有 93 层。报告中的 Attention Residuals(AttnRes)旨在解决一个问题:当深层网络大部分使用线性注意力时,有价值的信息若只能逐层向后传递,可能会逐渐被压缩、稀释或隔离。
AttnRes 允许后续层从较早的深度块中检索压缩表示,也就是为信息提供一条跨深度的访问路径,而非强迫所有内容严格按层级逐级传输。1
Moonshot 的主张是,这有助于在用 KDA 替换大量高成本全局注意力的同时,尽量维持模型质量。它与 KDA、Gated MLA 共同构成一套取舍:降低长序列成本,但不完全放弃全局信息访问。
K3 的 Stable LatentMoE 使用 896 个专家与 top-16 路由,即每个 token 选择其中 16 个专家参与计算。1
报告将其分位数均衡方法描述为一个批次层面的平衡分配问题,并在相应假设下推导出精确最优解。实际部署时,路由器并不会执行这一均衡求解器,而是采用固定专家偏置和常规 top-k 选择。1
因此,所谓“完美均衡”应理解为:它是针对论文所设定路由优化问题的结果,而不是承诺现实部署中的每一个请求批次都能绝对均衡。
此外,超大 MoE 是否真正经济,还取决于 token 能否高效地被送往所选专家。MoonEP 的作用在于处理专家需求不均衡所触发的 all-to-all 通信,减少网络尾延迟主导整体时延的风险,使 896 专家的训练与服务更具可操作性。1
这也是报告的重要信息:模型架构与系统工程并非彼此独立的“加分项”。如果专家通信成为瓶颈,再大的条件容量也难以转化为可用能力。
K3 对推理算力扩展的论述还延伸至后训练。报告描述了一套轻量虚拟机沙盒集群,可生成大量可验证、长时程的强化学习轨迹,并通过快照以较低成本分支或恢复任务状态。1
这类基础设施提供的是训练素材:让模型学会在测试时使用更多步骤完成任务,而不是只依赖一个预训练完成后便固定不变的大模型。可增加的步骤包括规划、浏览、写代码、调用工具,以及发现错误后的修正。
报告还提到,将多个领域和推理教师模型蒸馏到统一系统中。其意义是把专门行为迁移给一个模型,而无需在线上同时部署九个不同模型。1
截至 2026 年 9 月 2 日的第三方榜单显示,Kimi K3 在 BrowseComp 获得 91.2%,位列第二,仅次于 92.2% 的 GPT-5.6 Sol。4
BrowseComp 着重考察真实网页研究行为,而不只是模型已有的静态知识。因此,91.2% 的结果可支持这样一种判断:K3 对长时程、信息检索型智能体任务具备很强竞争力。4
但这不能自动证明 KDA、AttnRes、MoE 路由、强化学习环境、蒸馏或测试时计算中的任何一项单独造成了该成绩。它首先是一个端到端系统结果。
对于“K3 成本仅为 GPT-5.6 Sol 一半”,或“在 Kimi Code Bench 上仅落后 Claude Fable 5 四个百分点、但成本仅为其 38%”等精确说法,现有技术报告和高权威独立来源不足以核实。
一项被引用的比较给出的每项完成任务估算成本约为:K3 0.94 美元,GPT-5.6 Sol 1.04 美元。这与“相差 50%”并不一致。8
成本高度依赖模型配置、提示词长度、推理预算、定价日期以及评测任务设计。若没有公开统一评测框架和完整成本核算,这类数字都应被视为条件性的比较,而非固定结论。
Kimi K3 的战略含义或许不在于单纯的价格竞争,而在于它提出了一种架构与系统路线:开放模型若要跨越万亿参数级别,并把长上下文、工具使用和智能体式推理转化为实际能力,就需要同时重做模型结构、专家路由、分布式通信、后训练环境和测试时推理机制。1
至于“开源模型整体停滞在约 1 万亿参数”,或 K3 相对于“DeepSeek V4 Pro”的具体定位,现有 K3 论文所提供的证据本身并不足以确立。这些仍是需要独立数据与可复现实验检验的行业判断。
Studio Global AI
此页面包含一个有来源支持的答案,您可以在 Studio Global 内继续。
Kimi K3 认为,前沿 AI 的进步依赖两种互补资源:部署前扩展模型容量,以及部署后为长链推理、工具调用和智能体任务投入更多算力。
Kimi K3 认为,前沿 AI 的进步依赖两种互补资源:部署前扩展模型容量,以及部署后为长链推理、工具调用和智能体任务投入更多算力。 K3 是原生多模态 MoE 模型,总参数量为 2.78 万亿,但每个 token 仅激活约 1042 亿参数,并支持最高 100 万 token 上下文。[1]
KDA、Gated MLA、Attention Residuals、Stable LatentMoE 与 MoonEP 的共同目标,是在保留大模型容量的同时,降低长上下文和专家路由带来的计算与通信成本。[1]