Ling 3.0 flash 拥有 124B 总参数,但每个 token 只激活约 5.1B 参数;这体现了稀疏 MoE 在容量与单次推理计算量之间的取舍。 该模型原生支持 256K token 上下文,并可扩展至 1M,定位于编程、工具调用和高频智能体执行,而非取代所有通用大模型。
研究答案

Create a landscape editorial hero image for this Studio Global article: How did Ant Group Bailing’s July 30, 2026 release of the open-source Ling-3.0-flash execution model—coinciding with Jensen Huang’s first X p. Article summary: The release is evidence for a “sparse execution-model” strategy, not proof that parameter count has ceased to matter. Ling-3.0-flash concentrates computation on roughly 5.1B parameters per token while retaining 124B para. Topic tags: general, general web, user generated, documentation, education. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text,
对需要反复读文件、调用工具、修改代码并重试的 AI 智能体而言,最关键的问题往往不再是“谁的参数最多”,而是:谁能以可接受的质量、延迟和成本,把任务稳定完成。
蚂蚁集团旗下百灵推出的 Ling-3.0-flash,正是这一思路的代表。它共有 124B(1240 亿)参数,但在生成每个 token 时只激活约 5.1B(51 亿)参数。官方将其定位为适合高频任务的高性价比混合推理模型,原生上下文窗口为 256K token,可扩展至 1M token。
Ling-3.0-flash 使用的是专家混合模型(Mixture of Experts,MoE)架构。简单说,模型并不会让全部参数参与每一个 token 的计算,而是根据输入把任务路由给少量“专家”参数组。
这意味着,模型可以保有较大的总体知识与能力容量,同时把单次生成所需的活跃计算压低。蚂蚁的发布材料称,Ling-3.0-flash 的总参数量约为其 1T 级 Ring-2.6-1T 模型的 12.4%,活跃参数量约为后者的 8.1%。其架构还结合了 KDA 与 MLA 层交替的混合线性注意力设计,以及稀疏 MoE 路由。
这并不代表总参数量从此失去意义。模型的总容量仍会影响其可表达的能力边界,而专家路由是否准确,也决定了 MoE 能否真正发挥效果。但对实际部署来说,响应速度和边际推理成本更直接取决于每个 token 实际动用了多少参数,以及注意力计算本身有多重,而不是模型仓库里一共存了多少参数。
蚂蚁称,Ling-3.0-flash 在其公布的大多数基准对比中,能够追平或超过 Ring-2.6-1T。百灵官方账号也称,它以约八分之一的总参数、约十二分之一的活跃参数,在多数展示的基准中达到或超过自家 1T 旗舰。
这对一款明确面向生产级智能体工作负载的模型而言,是值得关注的内部对比结果;但它不等于 Ling-3.0-flash 在所有任务上都优于所有更大的通用模型。
判断时至少要注意三点:
对企业团队来说,更有价值的测试应当来自真实任务:接入实际工具 Schema、代码仓上下文、延迟目标、失败重试机制,以及错误所带来的业务代价。
Ling-3.0-flash 的模型页面列举了 SWE-Bench Pro、SWE-Bench Multilingual、Tau3-banking-AA、MCP-Atlas 和 SkillsBench 等评测,并提到可在 Claude Code、Kilo Code、Qwen Code、Hermes Agent、OpenClaw 等智能体相关环境中使用。1
这些方向之所以重要,是因为智能体系统会迅速放大 token 消耗。一项工作流若要读取大量文件、调用多个工具、接收执行结果、修订计划并进行重试,所用 token 往往远高于一次普通对话回复。
因此,许多团队更适合采用分层策略:
官方资料显示,Ling-3.0-flash 原生支持 256K token 上下文,最高可扩展到 1M token。这对于较长的代码库、冗长的工具调用轨迹或持续保存的工作状态很有帮助。
OpenRouter 为该模型列出的服务端上下文窗口为 262,144 token。6
不过,长上下文本身不能证明它在多智能体系统中一定更强。它确实可以帮助工作流保留更多共享信息,但可靠的多智能体部署还取决于编排机制、记忆设计、工具权限、任务交接和评测体系。现有资料支持其长上下文规格与智能体定位,但并未量化证明它在多智能体部署中胜过竞争对手。
蚂蚁在 2026 年 7 月 24 日 发布 Ling-3.0-flash,并宣布在 OpenRouter 和百灵官方平台提供限时免费 API 调用,免费期至 8 月 3 日。 模型也已在 Hugging Face 上提供,项目介绍强调了其基准评测与智能体框架应用方向。1
OpenRouter 列出的价格为:每百万输入 token 0.021 美元,每百万输出 token 0.063 美元,上下文窗口为 262,144 token。6 对 token 消耗很高的工作流来说,这种定价让大规模试用更具可行性;但实际成本、时延、可用性与输出质量仍会随服务商和部署条件变化。
OpenRouter 的模型发现页还将其智能、编程和智能体百分位分别列为 49、56 和 54。这也说明,对于一款重执行、重成本效率的模型,用一个总排名来下结论并不充分。12
Ling-3.0-flash 的发布恰逢英伟达 CEO 黄仁勋发表首条 X 帖子。他转发了一封支持开放权重模型的公开信,认为开放模型有助于提升安全与网络安全、加速创新和扩散,并支持技术主权;他同时强调,世界既需要前沿闭源模型,也需要前沿开放模型。
这一时间点使 Ling-3.0-flash 成为开放权重 AI 讨论中的一个贴切案例:当模型权重可获得时,开发者能更直接地检查、私有化部署、微调并集成模型。但两件事发生在同一天,并不能说明英伟达与蚂蚁集团之间存在合作关系或技术关联。
Ling-3.0-flash 最值得关注的地方,不是它宣告了大模型竞赛结束,而是它强化了一种按成本调整后的执行模型策略:稀疏 MoE 可以在保留较大总容量的同时,将每个 token 的活跃计算压到更低水平,从而有机会让高频智能体循环更快、更便宜。
它的性能主张仍值得独立复现,也不应被视为最大通用模型的全面替代品。但从 124B 总参数、5.1B 活跃参数、面向智能体的评测目标、长上下文能力以及低价 API 来看,凡是推理成本和延迟成为核心约束的团队,都值得把这类稀疏模型纳入实测清单。1
6
Studio Global AI
此页面包含一个有来源支持的答案,您可以在 Studio Global 内继续。
Ling 3.0 flash 拥有 124B 总参数,但每个 token 只激活约 5.1B 参数;这体现了稀疏 MoE 在容量与单次推理计算量之间的取舍。
Ling 3.0 flash 拥有 124B 总参数,但每个 token 只激活约 5.1B 参数;这体现了稀疏 MoE 在容量与单次推理计算量之间的取舍。 该模型原生支持 256K token 上下文,并可扩展至 1M,定位于编程、工具调用和高频智能体执行,而非取代所有通用大模型。
官方称其在多数已公布对比中可追平或超过自家 1T 级 Ring 2.6 1T;不过,这仍需结合真实业务工作流和独立评测验证。