華為公開 openPangu-2.0-Pro,唔只係放出一個模型 checkpoint 咁簡單;不過,「開源」同「可以完整重現訓練」係兩回事。
目前公開嘅內容,令開發者可以檢視、評測同部署一個以昇騰(Ascend)平台為主要目標嘅超大模型;但就未代表外界已經有齊材料,可以由零開始、原樣重做一次前沿規模嘅訓練。
先講清楚最常被寫錯嘅規格:Pro 係一個混合專家模型(MoE),總參數約 5,050 億(505B),但每個 token 實際啟動嘅參數約為 180 億(18B)。模型支援 512K token 上下文,預訓練資料量約 34 萬億 token(34T)。
21
華為今次實際公開咗乜?
華為喺 2026 年 7 月 31 日宣布,公開 openPangu-2.0-Pro 嘅模型權重、基礎推理代碼同技術報告,其他 openPangu 2.0 相關組件亦會經其開源渠道逐步上線。
12
三樣嘢各有用途:
- 模型權重:可用嚟測試同提供已訓練模型嘅推理服務。
- 基礎推理代碼:提供一條針對昇騰環境嘅實作及部署路徑。
- 技術報告及模型文件:讓人理解模型架構同華為披露嘅設計取捨。
12
21
華為喺 HDC 2026 提過,會分階段開放七個組件,包括預訓練代碼、後訓練代碼同訓練算子。
2
10 如果呢啲層面最終以可用形式齊備,項目就會比「淨係放權重」嘅模型,更接近由訓練到推理嘅完整技術棧。
點解現階段仲唔可以話「完全可重現」?
有公開權重,代表外界可以下載 checkpoint 去測試;但呢個唔等於已知點樣重新訓練出同一個 checkpoint。
要重做一個 34T token 級別嘅預訓練,至少要有原始資料,或者可重現嘅資料生成規格;完整訓練及後訓練實作;超參數;叢集拓撲;軟件、編譯器版本;分散式訓練配置;自訂算子;評測設定,以及足夠嘅兼容硬件。現有資料確認咗權重、基礎推理碼同報告已經公開;而華為對其他組件嘅說法,係會逐步推出。
12
21
所以,較準確嘅講法應該係:呢個係一個以昇騰為先嘅開放模型發布,並且列出咗走向更全面技術棧透明度嘅路線。 但暫時未足以證明第三方今日已能獨立重現原本嘅訓練流程。
512K 上下文背後嘅設計取捨
openPangu-2.0-Pro 一方面有好大嘅總參數量,另一方面亦透過幾種設計,嘗試控制生成同處理超長上下文嘅成本。
MoE:容量大,但唔使每次全開
MoE 會將每個 token 分派畀一部分「專家」參數處理。Pro 雖然總參數約 505B,但每個 token 約啟動 18B 參數。
21
呢個唔表示模型好輕量:儲存、服務同通訊一個 505B 模型,依然需要相當可觀嘅基建。不過,相比起總規模相同嘅稠密模型,每個 token 所需參與運算嘅參數會較少。
DSA 加 SWA:兼顧近處細節與遠距資料
模型保留 MLA,並以 1:2 層數比例結合 DSA 同滑動視窗注意力(SWA)。華為指,SWA 層處理局部視窗資訊,DSA 層則捕捉稀疏嘅全局上下文;目標係降低長上下文推理嘅運算、記憶體及記憶體存取成本,同時維持準確度。
21
原因好直接:對 512K 上下文做全量注意力,成本會急升。局部注意力可以較平咁處理附近內容;稀疏全局機制就嘗試保留模型讀取遙遠但相關資訊嘅能力。
四支流殘差、MTP 同 Muon
華為又提到,四支流 mHC 殘差拓撲旨在提升表徵多樣性同泛化能力;三頭多 token 預測(MTP)模組會額外預測未來 token,以加快推理;Muon 則係訓練時使用嘅優化器,目標係加快收斂。
21
要留意,以上係華為喺公開材料中提出嘅架構與優化主張,唔等於任何部署環境都必然有同一幅度嘅加速。吞吐量同延遲會受加速器配置、精度、批次大小、上下文長度、流量模式同 serving 軟件影響。
長上下文 Agent 有咩實際價值?
512K 視窗可以令 Agent 喺同一個工作階段讀到更多材料,例如操作手冊、政策文件、系統日誌、之前嘅工具輸出同規格書,減少過度切碎文件嘅需要。但佢唔會取代檢索、權限控制、來源核實同人手審批。
較值得考慮嘅應用包括:
- 政府及公共行政:協助整理法規、個案材料、公眾意見及跨部門文件,但決策必須可審計,並保留嚴格存取控制。
- 金融:查閱研究報告、申報文件、合約同合規材料;未經驗證嘅模型輸出唔應直接用於交易、信貸或監管決定。
- 製造及能源:綜合設備手冊、告警紀錄、保養紀錄、流程文件及更次報告,支援調查同規劃。
- 醫療:在臨床管治下協助文獻或長期病歷摘要,而唔係自主作診斷或治療決定。
- 自動駕駛工程:離線分析測試日誌、場景描述、安全論證及技術文件;唔應視為可取代已驗證嘅即時自動駕駛系統。
對好多中小型機構嚟講,即使採用稀疏啟動,Pro 仍然未必易於自行託管。華為亦推出較細嘅 openPangu-2.0-Flash:總參數 92B、每 token 啟動 6B,可能係較易入手嘅評估同部署選項。
15
20
寫程式可以幫手,但唔係「自動維護員」
華為報告顯示,openPangu-2.0-Pro Thinking 版本喺 SWE-bench Verified 得分為 68.5。
24 呢個基準成績值得留意,但唔應解讀成模型可以可靠地接管複雜嘅生產系統開發。
真實軟件專案牽涉環境建置、相依套件、測試執行、安全審查、架構判斷、不斷轉變嘅產品要求,以及跨多步驟除錯。較穩陣嘅模式,係用受監督嘅編程 Agent:只畀指定 repository 權限、喺沙盒執行、配合自動測試與靜態分析、經 code review,再有回滾程序;而唔係讓佢自動合併程式碼。
分階段開源,其實係生態策略
呢件事嘅戰略價值,唔止係模型權重本身。一個昇騰原生嘅參考模型,可以鼓勵開發者喺昇騰上建立、測試同優化工作負載;更多工作負載又會推動 runtime、算子、工具同託管服務改善。華為亦明確引導開發者、企業夥伴同研究人員,到 Ascend Tribe 社群及華為雲 MaaS 平台下載、使用同提供意見。
12
Flash 同 Pro 兩種規模,擴大咗潛在使用者基礎;而規劃中嘅訓練、後訓練及算子組件,則針對真正影響模型開發者能否採用某個硬件平台嘅軟件層。
10
15
因此,openPangu 2.0 較適合理解為加強 「昇騰 + 盤古」開發生態嘅計劃。佢對部署、檢視同實驗嘅開放性,已經有實質意義;至於能否叫做完全可重現,仍要視乎餘下代碼、配置同資料相關細節幾時公開,以及獨立團隊實測後,到底可以重建到幾多。