Ling 3.0 flash 有 1,240 億總參數,但每個 token 約只啟用 51 億參數,展示稀疏 MoE 點樣將大型容量同較低每 token 運算量結合。 佢原生支援 256K token 上下文、可擴展至 100 萬 token,定位係高頻編程、工具調用及 agent 執行工作,而唔係宣稱全面取代最大型通用模型。
研究答案

Create a landscape editorial hero image for this Studio Global article: How did Ant Group Bailing’s July 30, 2026 release of the open-source Ling-3.0-flash execution model—coinciding with Jensen Huang’s first X p. Article summary: The release is evidence for a “sparse execution-model” strategy, not proof that parameter count has ceased to matter. Ling-3.0-flash concentrates computation on roughly 5.1B parameters per token while retaining 124B para. Topic tags: general, general web, user generated, documentation, education. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text,
對要長時間跑 AI agent 嘅開發團隊嚟講,最重要嘅問題未必係「邊個模型參數最多」,而係:喺可接受嘅任務質素下,邊個模型可以用最低延遲同推理成本完成最多工作?
螞蟻集團嘅 Ling-3.0-flash,正好係一個值得留意嘅例子。佢有 1,240 億(124B)總參數,但每生成一個 token,約只會啟用 51 億(5.1B)參數。官方將佢定位為適合高頻工作嘅成本效益型混合推理模型,原生上下文窗口為 256K token,並可延伸至 100 萬 token。
Ling-3.0-flash 用嘅係 **Mixture-of-Experts(MoE,專家混合)**架構。簡單講,模型唔會每次都動員全部參數;佢會為每個 token 路由到少量較相關嘅「專家」部分處理。
結果係,模型保留咗龐大嘅已學習容量,但每次生成所需嘅活躍運算量細得多。螞蟻集團表示,Ling-3.0-flash 嘅總參數約為其 Ring-2.6-1T 模型嘅 12.4%,活躍參數則約為 8.1%。官方亦提到,模型採用交替配置 KDA 與 MLA 層嘅混合線性注意力架構,再配合稀疏 MoE 路由。
呢個唔代表總參數量從此冇意義。模型總容量仍然影響佢可以表達同記住幾多知識,而路由做得好唔好,亦直接影響 MoE 能否發揮潛力。不過,對部署成本同輸出速度而言,更直接嘅因素通常係每個 token 實際啟用幾多參數,以及注意力計算有幾重。
螞蟻集團稱,Ling-3.0-flash 喺其公開嘅大部分 benchmark 比較中,能夠追平或超過 Ring-2.6-1T。其 Ling 帳戶亦形容,模型以約八分之一總參數、十二分之一活躍參數,喺大部分展示嘅測試中打平或勝過 1T 級旗艦。
呢個對內部世代比較係一項有意思嘅成績,尤其模型明確瞄準量產級 agent 工作負載。但要留意:佢唔等於 Ling-3.0-flash 喺所有任務上都勝過每一款更大型通用模型。
原因好直接:
所以,真正要評估時,應該拎真實工作負載去測:包括工具 schema、程式庫上下文、重試行為、延遲 SLA,以及一旦出錯所付出嘅代價。
Ling-3.0-flash 模型卡列出嘅評測包括 SWE-Bench Pro、SWE-Bench Multilingual、Tau3-banking-AA、MCP-Atlas 同 SkillsBench;亦列出 Claude Code、Kilo Code、Qwen Code、Hermes Agent 同 OpenClaw 等 agent 導向環境。1
呢類工作最容易出現「token 用量爆炸」:agent 要讀檔、調工具、接收輸出、改計劃,再重試幾輪;總 token 數可以遠高過一次普通對話。在呢種情況下,若一個較平、較快嘅模型能夠穩定處理大部分例行執行步驟,實際價值未必輸畀每一步都用最昂貴通用推理模型。
一個較實際嘅部署方法可以係分層:
官方文件列明 Ling-3.0-flash 原生支援 256K token 上下文,最高可擴展至 100 萬 token。 OpenRouter 所列嘅服務上下文窗口則為 262,144 token。6
對長 codebase、大量工具執行紀錄,或者要保留較長工作狀態嘅流程而言,呢個規格有實際吸引力。不過,長上下文本身唔應被當成已驗證嘅多 agent 能力:可靠嘅多 agent 系統,仲要睇編排方式、記憶設計、工具權限、交接機制同評估方法。現有資料支持佢嘅長上下文規格同 agent 定位,但未足以證明佢喺多 agent 部署上定量優勝其他對手。
Ling-3.0-flash 於 2026 年 7 月 24 日發布;螞蟻集團當時表示,OpenRouter 同官方平台提供限時免費 API,至 8 月 3 日結束。 模型亦已在 Hugging Face 提供,項目頁面重點提及 benchmark 及 agent framework 應用。1
OpenRouter 列出嘅價格為:每 100 萬 input token 0.021 美元、每 100 萬 output token 0.063 美元,上下文窗口為 262,144 token。6 呢個定價令團隊較容易用高 token 量工作流做實測;但實際成本、延遲、供應穩定性同輸出質素,仍會因供應商與部署環境而有差異。
OpenRouter 嘅模型探索頁面亦把 Ling-3.0-flash 分成不同維度:intelligence、coding、agentic 百分位分別為 49、56、54。12 呢個正好說明,對一款執行導向模型而言,用單一「總排名」判斷價值往往過於粗疏。
發布同日,Nvidia 行政總裁黃仁勳首次喺 X 發文,分享一封支持開放模型嘅信,認為開放模型可加強安全同網絡安全、加快創新與普及,並支援技術自主;他同時指出,世界需要前沿閉源模型與前沿開放模型。
時間上兩件事碰巧呼應,令 Ling-3.0-flash 成為開放權重 AI 討論嘅一個例子:權重可用,開發者就更容易自行檢視、部署、微調同整合模型。不過,兩件事同日發生,唔表示 Nvidia 同螞蟻集團之間存在合作或技術關係。
Ling-3.0-flash 最值得留意嘅地方,係佢為一種按成本調整嘅執行模型策略提供咗實例。稀疏 MoE 可以保留較廣嘅參數容量,同時令每個 token 只啟用細得多嘅部分;對頻繁運轉嘅 agent loop,這有機會同時降低成本與延遲。
佢嘅效能說法仍然需要更多獨立重現,亦唔應被視為取代最大型通用系統嘅萬用答案。不過,結合 agent 導向評測、長上下文規格同低 API 定價,Ling-3.0-flash 提醒團隊:只要推理成本同速度係硬約束,就值得測試專門處理高頻執行工作嘅稀疏模型。1
6
Studio Global AI
此頁麵包含一個有來源支援的答案,您可以在 Studio Global 內繼續。
Ling 3.0 flash 有 1,240 億總參數,但每個 token 約只啟用 51 億參數,展示稀疏 MoE 點樣將大型容量同較低每 token 運算量結合。
Ling 3.0 flash 有 1,240 億總參數,但每個 token 約只啟用 51 億參數,展示稀疏 MoE 點樣將大型容量同較低每 token 運算量結合。 佢原生支援 256K token 上下文、可擴展至 100 萬 token,定位係高頻編程、工具調用及 agent 執行工作,而唔係宣稱全面取代最大型通用模型。
螞蟻集團公布嘅旗艦對比值得留意,但仍屬開發商評測;團隊應用真實 repository、工具 schema、延遲要求同出錯成本親自驗證。