雲知聲於 2026 年 9 月 15 日發布 U2 Flash;模型採稀疏 MoE 架構,總參數約 2,660 億,單次推理約啟用 100 億參數。 雲知聲公布其 DeepSWE v1.1 為 64.6、TerminalBench 3.0 為 24.3、SWE Bench Pro 為 61.6,並稱相較 U2,Agent 任務週期縮短 35%。
發布者使用 GPT-5.6 Terra 編輯圖片由 GPT Image 2 生成
研究答案

Create a landscape editorial hero image for this Studio Global article: What is Unisound’s U2-Flash, launched on September 15, 2026, and how does its roughly 266-billion-parameter sparse MoE architecture with abo. Article summary: Unisound’s U2-Flash is a September 15, 2026 release positioned as a “high-density” production model: a sparse Mixture-of-Experts successor to U2 intended to combine coding, agent execution, mathematical reasoning, and in. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
雲知聲在 2026 年 9 月 15 日發布的 U2-Flash,是一款以程式開發、可使用工具的 AI Agent、數學推理與指令遵循為目標的「高密度」模型。它建基於 U2 通用基座模型,核心訴求是:在不必每次推理都動用全部參數的前提下,同時處理多步驟、偏生產環境的任務。 5
U2-Flash 使用稀疏混合專家模型(Mixture of Experts,MoE)架構,總參數約 2,660 億,但每次推理約啟用 100 億參數,不到總量的 4%。MoE 的做法,是由路由機制依輸入內容選擇部分專門模組運算,而非讓所有參數處理每一個 token。 5
雲知聲藉此主張,U2-Flash 能以相對小的實際啟用運算規模,提供接近大型稠密模型的任務完成能力。不過,現有資料沒有提供在相同工作負載下的獨立成本、耗電或品質對照,因此這項定位目前仍應視為廠商主張。 5
依雲知聲說法,U2-Flash 將程式設計、Agent、數學推理與指令遵循整合在同一套權重中,目標情境包括工程程式碼、終端機任務、辦公工作、知識推理及其他生產流程。 5
模型也具備雲知聲所稱的「隱式思考」與「連續狀態推理」,並提供四個推理強度等級。該公司表示,在最高強度下可輸出可讀的推理軌跡,方便檢視與追溯。這可提升流程可觀察性,但可讀的推理內容本身,不能直接證明答案正確、安全,或適合高風險的自主運作。 5
雲知聲表示,U2-Flash 是在 U2 基座模型上進行強化後訓練的成果。其中的遞迴自我改進(RSI)流程,會協助產生任務、分析執行軌跡、找出錯誤,並在人工設定的沙箱與驗證限制內重新抽樣、修正訓練資料。 5
針對軟體工程與 Agent 任務,該公司稱其系統結合:
雲知聲宣稱,此方法可帶來約 60% 更多有效訓練軌跡,並以約少 55% 的訓練步數達到可比較的能力水準。不過,現有材料未公開實驗設計、對照基線、原始執行結果或可重現訓練產物,外界無法獨立判斷這些數字。 5
從實務角度看,這套方法意在訓練模型完成多步驟工作:嘗試任務、檢查工具調用或執行路徑、找出失誤,再以修正後的範例改善後續行為。但這是對訓練流程的合理理解,並不等於已證實每一項機制各自造成了所公布的效能提升。 5
雲知聲表示,U2-Flash 相較上一代 U2,在數個軟體工程及終端機導向評測上有明顯提升:
| 基準測試 | 雲知聲公布的 U2-Flash 分數 | 雲知聲的比較說法 |
|---|---|---|
| DeepSWE v1.1 | 64.6 | 約為前代 U2 的兩倍;雲知聲稱其在比較中高於 GLM5.3-Flash 與 DeepSeek-V4-Pro-0813。 |
| TerminalBench 3.0 | 24.3 | 雲知聲稱高於 K3 等兆參數級模型。 |
| SWE-Bench Pro | 61.6 | 比前代高 10.5 分。 |
此外,雲知聲稱,相比 U2,U2-Flash 的 Agent 任務迭代次數減少 20% 至 30%、任務執行週期縮短 35%,token 消耗減少 20% 至 30%。 5
這些結果可作為開發者理解其產品目標的參考,但不應直接視作獨立排名。提供的材料未交代模型端點、提示詞、採樣設定、Agent 框架、工具、執行環境、測試 harness 設定或原始測試紀錄;因此,目前無法進行嚴謹的橫向比較。 5
雲知聲稱,U2-Flash 的平均首 token 回應時間低於 3 秒,峰值輸出吞吐量最高可達每秒 300 tokens。公告未交代所用硬體、併發量、上下文長度、精度設定或延遲分位數,因此不足以直接與其他模型的服務效能作等值比較。 5
在部署方面,雲知聲表示已就模型架構、核心算子、推理框架與叢集調度,適配主流中國國產算力平台。宣傳報導則稱,部分情境下可接近 NVIDIA GPU 方案的效能;但未提供對照晶片、軟體版本、工作負載、批次處理、功耗、成本或延遲量測,不能據此認定已實現硬體效能對等。 17
其定位的應用場景包括大規模推理、高併發與長上下文負載,以及政府與企業、金融、製造、能源等領域。 17
U2-Flash 據報已透過雲知聲的 MaaS(Model as a Service,模型即服務)平台提供服務。宣傳內容指出,2026 年 9 月 15 日至 9 月 30 日期間推出六折優惠:每百萬輸入 tokens 為人民幣 0.6 元、每百萬輸出 tokens 為人民幣 1.2 元、每百萬快取命中輸入 tokens 為人民幣 0.12 元;新舊用戶均可在活動期間領取 1 億 tokens 額度。 17
這些屬於限時條款,有意採用者仍應直接向雲知聲確認目前的供應情況、價格、額度與使用條件。 17
U2-Flash 是一款明確瞄準生產級程式開發與 Agent 工作流的 MoE 模型:總參數約 2,660 億、單次啟用約 100 億參數,搭配任務生成與執行回饋導向的後訓練流程,以及可控推理模式。雲知聲公布的資料顯示,它在所選工程基準上較前代 U2 有顯著進步。 5
但重點在於證據品質。基準成績、訓練效率、延遲與吞吐量、token 節省,以及國產加速器比較,大多來自公司公告或宣傳報導。在有獨立評測者以相同模型版本、工具、硬體與測試條件公布可重現結果前,較合適的判斷是:U2-Flash 是一項值得關注的廠商發布,而非已被獨立驗證的市場領先者。 5
17
Studio Global AI
這個頁面包含附來源佐證的答案,你可以在 Studio Global 內繼續追問。
雲知聲於 2026 年 9 月 15 日發布 U2 Flash;模型採稀疏 MoE 架構,總參數約 2,660 億,單次推理約啟用 100 億參數。
雲知聲於 2026 年 9 月 15 日發布 U2 Flash;模型採稀疏 MoE 架構,總參數約 2,660 億,單次推理約啟用 100 億參數。 雲知聲公布其 DeepSWE v1.1 為 64.6、TerminalBench 3.0 為 24.3、SWE Bench Pro 為 61.6,並稱相較 U2,Agent 任務週期縮短 35%。
所有基準、訓練效率、延遲、吞吐量及國產算力平台效能比較,現階段主要來自雲知聲或宣傳報導,缺少可重現的獨立測試細節。