Ling 3.0 flash 擁有 124B 總參數,但每個 token 約只啟用 5.1B;這種稀疏 MoE 設計,讓大型容量不必等同於大型單次推論成本。 它原生支援 256K token 上下文、可擴展至 1M,並鎖定編程、工具呼叫與 Agent 工作流等高 token 用量情境。
研究答案

Create a landscape editorial hero image for this Studio Global article: How did Ant Group Bailing’s July 30, 2026 release of the open-source Ling-3.0-flash execution model—coinciding with Jensen Huang’s first X p. Article summary: The release is evidence for a “sparse execution-model” strategy, not proof that parameter count has ceased to matter. Ling-3.0-flash concentrates computation on roughly 5.1B parameters per token while retaining 124B para. Topic tags: general, general web, user generated, documentation, education. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text,
對需要反覆讀取檔案、呼叫工具、修正計畫與重試的 AI Agent 而言,真正的問題往往不是「哪個模型參數最多」,而是「哪個模型能在可接受的品質下,把延遲與每次推論成本壓低」。
螞蟻集團的 Ling-3.0-flash 正是這種思路的案例。它有 1,240 億(124B)總參數,但每生成一個 token,約只啟用 51 億(5.1B)參數。官方將其定位為適合高頻任務、兼顧成本的混合推理模型;原生上下文長度為 256K token,可延伸至 1M token。
Ling-3.0-flash 採用 專家混合模型(Mixture of Experts,MoE)。簡單說,模型不會讓所有參數參與每一個 token 的運算,而是將工作路由給少量較適合的「專家」子網路。
這帶來的意義是:模型仍能保有龐大的已學習能力池,但單次生成所需的活躍計算量較小。相對於其 1T 級 Ring-2.6-1T 模型,螞蟻集團表示 Ling-3.0-flash 的總參數約為前者 12.4%,啟用參數約為 8.1%。官方資料亦提到,它結合稀疏 MoE 路由與交替使用 KDA、MLA 層的混合線性注意力架構。
這不代表總參數量從此無關緊要。總容量依然影響模型可表徵的知識與能力,而 MoE 的實際表現也高度依賴路由品質。但稀疏啟用改變了經濟帳:服務成本與速度,更直接取決於每個 token 真正用到多少參數,以及注意力運算有多重,而不是單看模型儲存了多少全部權重。
螞蟻集團表示,Ling-3.0-flash 在其公布的多數基準比較中,能追平或超越 Ring-2.6-1T。Ling 的官方 X 帳號也形容,該模型以約八分之一總參數、十二分之一活躍參數,在所展示的大多數基準上追平或擊敗 1T 旗艦模型。
這是具意義的內部比較,特別是因為它明確鎖定生產級 Agent 工作負載;但它不是「Ling-3.0-flash 在所有任務都勝過所有更大通用模型」的證據。
評估時至少要留意三點:
因此,對團隊而言,最有價值的測試不是只看排行榜,而是拿真實工作負載來跑:包括實際工具 schema、程式庫上下文、延遲門檻、重試行為,以及出錯後的補救成本。
模型頁面列出的評測包括 SWE-Bench Pro、SWE-Bench Multilingual、Tau3-banking-AA、MCP-Atlas 與 SkillsBench;並提到可搭配 Claude Code、Kilo Code、Qwen Code、Hermes Agent、OpenClaw 等 Agent 導向環境使用。1
這類任務特別適合用成本來衡量。Agent 不只是回覆一次文字:它可能讀取多個檔案、呼叫 API 或終端工具、取得結果、修訂計畫,必要時還要重試。整個流程的 token 消耗,往往遠高於一般聊天問答。
較務實的部署方式,是建立分層模型策略:
官方文件指出,Ling-3.0-flash 原生支援 256K token 上下文,並可擴展至 1M token。 OpenRouter 所列的實際服務上下文視窗則是 262,144 token。6
長上下文可用於處理較長的程式碼庫、龐大的工具呼叫紀錄,或保留較持久的工作狀態。不過,不能把「上下文長」直接等同於「已驗證的多 Agent 能力更強」。可靠的多 Agent 系統還牽涉編排方式、記憶設計、工具權限、任務交接與評估機制。
目前來源足以支持它的長上下文規格與 Agent 定位,但不足以證明它在多 Agent 正式部署中量化勝過競品。
Ling-3.0-flash 於 2026 年 7 月 24 日推出。螞蟻集團當時表示,OpenRouter 與其官方平台提供限時免費 API,期限至 8 月 3 日;模型也可在 Hugging Face 取得,專案頁面著重其基準與 Agent 框架應用。1
在 OpenRouter 上,列出的價格為每百萬 token:
這樣的價格使高 token 用量工作流更容易進行測試,但實際費用、延遲、可用性與輸出品質,仍會隨供應商及部署條件而變動。
OpenRouter 的模型探索頁面也將它的 intelligence、coding 與 agentic 百分位分別列為 49、56、54;這正說明,對以執行效率為主的模型而言,單一總排名不足以完整判斷價值。12
Ling-3.0-flash 發布當天,NVIDIA 執行長黃仁勳也首次在 X 發文,分享一封支持開放模型的聯名信。他主張開放模型有助於強化安全與資安、加速創新和擴散,並支持技術自主;同時他也認為,產業需要前沿閉源模型與前沿開放模型並存。
這個時間點讓 Ling-3.0-flash 成為開放權重 AI 討論中的合適例子:權重可取得時,開發者能更直接地檢視、託管、微調與整合模型。但兩件事只是同期發生,不代表 NVIDIA 與螞蟻集團之間存在合作或技術連結。
Ling-3.0-flash 最值得關注之處,在於它展示了一種成本調整後的執行模型策略:稀疏 MoE 可以兼有較大的儲存容量與較小的每 token 啟用量,讓頻繁運行的 Agent 迴圈有機會更快、更便宜,而不必退回能力明顯受限的小模型。
它的效能宣稱仍需要更多獨立重現,也不應被視為大型通用模型的萬用替代品。不過,124B/5.1B 的規格、面向 Agent 的評測目標、長上下文與低 API 定價,都足以讓重視推論成本與延遲的團隊,將這類專用稀疏模型列入實測清單。1
6
Studio Global AI
這個頁面包含附來源佐證的答案,你可以在 Studio Global 內繼續追問。
Ling 3.0 flash 擁有 124B 總參數,但每個 token 約只啟用 5.1B;這種稀疏 MoE 設計,讓大型容量不必等同於大型單次推論成本。
Ling 3.0 flash 擁有 124B 總參數,但每個 token 約只啟用 5.1B;這種稀疏 MoE 設計,讓大型容量不必等同於大型單次推論成本。 它原生支援 256K token 上下文、可擴展至 1M,並鎖定編程、工具呼叫與 Agent 工作流等高 token 用量情境。
螞蟻集團宣稱它在多數內部比較中可追平或超越 1T 級 Ring 2.6 1T;但實際導入仍須以自家工具、程式庫、錯誤代價與延遲要求驗證。