openPangu 2.0 Pro 已公開模型權重、基礎推理代碼同技術報告;佢係 505B 參數 MoE 模型,每個 token 約啟動 18B 參數,並非 180B。[12][21] DSA+SWA 混合注意力、四支流 mHC 殘差架構、三頭 MTP 同 Muon 優化器,均係為咗改善長上下文推理或訓練效率而設;實際效能仍取決於硬件及部署配置。[21] 對企業而言,眼前價值係可控評測、昇騰原生部署同實驗;要聲稱能重現原始 34T token 訓練,仍要等更多訓練碼、設定及資料流程細節公開。
研究答案

Create a landscape editorial hero image for this Studio Global article: How does Huawei’s open-sourcing of openPangu-2.0-Pro—a 505B-parameter MoE model with roughly 180B active parameters, 512K context, 34T-token. Article summary: One correction: openPangu-2.0-Pro has about 505B total parameters but roughly 18B—not 180B—activated per token. The release is significant because it makes an Ascend-native, non-NVIDIA path inspectable from model design . Topic tags: general, general web, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
華為公開 openPangu-2.0-Pro,唔只係放出一個模型 checkpoint 咁簡單;不過,「開源」同「可以完整重現訓練」係兩回事。
目前公開嘅內容,令開發者可以檢視、評測同部署一個以昇騰(Ascend)平台為主要目標嘅超大模型;但就未代表外界已經有齊材料,可以由零開始、原樣重做一次前沿規模嘅訓練。
先講清楚最常被寫錯嘅規格:Pro 係一個混合專家模型(MoE),總參數約 5,050 億(505B),但每個 token 實際啟動嘅參數約為 180 億(18B)。模型支援 512K token 上下文,預訓練資料量約 34 萬億 token(34T)。21
華為喺 2026 年 7 月 31 日宣布,公開 openPangu-2.0-Pro 嘅模型權重、基礎推理代碼同技術報告,其他 openPangu 2.0 相關組件亦會經其開源渠道逐步上線。12
三樣嘢各有用途:
華為喺 HDC 2026 提過,會分階段開放七個組件,包括預訓練代碼、後訓練代碼同訓練算子。2
10 如果呢啲層面最終以可用形式齊備,項目就會比「淨係放權重」嘅模型,更接近由訓練到推理嘅完整技術棧。
有公開權重,代表外界可以下載 checkpoint 去測試;但呢個唔等於已知點樣重新訓練出同一個 checkpoint。
要重做一個 34T token 級別嘅預訓練,至少要有原始資料,或者可重現嘅資料生成規格;完整訓練及後訓練實作;超參數;叢集拓撲;軟件、編譯器版本;分散式訓練配置;自訂算子;評測設定,以及足夠嘅兼容硬件。現有資料確認咗權重、基礎推理碼同報告已經公開;而華為對其他組件嘅說法,係會逐步推出。12
21
所以,較準確嘅講法應該係:呢個係一個以昇騰為先嘅開放模型發布,並且列出咗走向更全面技術棧透明度嘅路線。 但暫時未足以證明第三方今日已能獨立重現原本嘅訓練流程。
openPangu-2.0-Pro 一方面有好大嘅總參數量,另一方面亦透過幾種設計,嘗試控制生成同處理超長上下文嘅成本。
MoE 會將每個 token 分派畀一部分「專家」參數處理。Pro 雖然總參數約 505B,但每個 token 約啟動 18B 參數。21
呢個唔表示模型好輕量:儲存、服務同通訊一個 505B 模型,依然需要相當可觀嘅基建。不過,相比起總規模相同嘅稠密模型,每個 token 所需參與運算嘅參數會較少。
模型保留 MLA,並以 1:2 層數比例結合 DSA 同滑動視窗注意力(SWA)。華為指,SWA 層處理局部視窗資訊,DSA 層則捕捉稀疏嘅全局上下文;目標係降低長上下文推理嘅運算、記憶體及記憶體存取成本,同時維持準確度。21
原因好直接:對 512K 上下文做全量注意力,成本會急升。局部注意力可以較平咁處理附近內容;稀疏全局機制就嘗試保留模型讀取遙遠但相關資訊嘅能力。
華為又提到,四支流 mHC 殘差拓撲旨在提升表徵多樣性同泛化能力;三頭多 token 預測(MTP)模組會額外預測未來 token,以加快推理;Muon 則係訓練時使用嘅優化器,目標係加快收斂。21
要留意,以上係華為喺公開材料中提出嘅架構與優化主張,唔等於任何部署環境都必然有同一幅度嘅加速。吞吐量同延遲會受加速器配置、精度、批次大小、上下文長度、流量模式同 serving 軟件影響。
512K 視窗可以令 Agent 喺同一個工作階段讀到更多材料,例如操作手冊、政策文件、系統日誌、之前嘅工具輸出同規格書,減少過度切碎文件嘅需要。但佢唔會取代檢索、權限控制、來源核實同人手審批。
較值得考慮嘅應用包括:
對好多中小型機構嚟講,即使採用稀疏啟動,Pro 仍然未必易於自行託管。華為亦推出較細嘅 openPangu-2.0-Flash:總參數 92B、每 token 啟動 6B,可能係較易入手嘅評估同部署選項。15
20
華為報告顯示,openPangu-2.0-Pro Thinking 版本喺 SWE-bench Verified 得分為 68.5。24 呢個基準成績值得留意,但唔應解讀成模型可以可靠地接管複雜嘅生產系統開發。
真實軟件專案牽涉環境建置、相依套件、測試執行、安全審查、架構判斷、不斷轉變嘅產品要求,以及跨多步驟除錯。較穩陣嘅模式,係用受監督嘅編程 Agent:只畀指定 repository 權限、喺沙盒執行、配合自動測試與靜態分析、經 code review,再有回滾程序;而唔係讓佢自動合併程式碼。
呢件事嘅戰略價值,唔止係模型權重本身。一個昇騰原生嘅參考模型,可以鼓勵開發者喺昇騰上建立、測試同優化工作負載;更多工作負載又會推動 runtime、算子、工具同託管服務改善。華為亦明確引導開發者、企業夥伴同研究人員,到 Ascend Tribe 社群及華為雲 MaaS 平台下載、使用同提供意見。12
Flash 同 Pro 兩種規模,擴大咗潛在使用者基礎;而規劃中嘅訓練、後訓練及算子組件,則針對真正影響模型開發者能否採用某個硬件平台嘅軟件層。10
15
因此,openPangu 2.0 較適合理解為加強 「昇騰 + 盤古」開發生態嘅計劃。佢對部署、檢視同實驗嘅開放性,已經有實質意義;至於能否叫做完全可重現,仍要視乎餘下代碼、配置同資料相關細節幾時公開,以及獨立團隊實測後,到底可以重建到幾多。
Studio Global AI
此頁麵包含一個有來源支援的答案,您可以在 Studio Global 內繼續。
openPangu 2.0 Pro 已公開模型權重、基礎推理代碼同技術報告;佢係 505B 參數 MoE 模型,每個 token 約啟動 18B 參數,並非 180B。[12][21]
openPangu 2.0 Pro 已公開模型權重、基礎推理代碼同技術報告;佢係 505B 參數 MoE 模型,每個 token 約啟動 18B 參數,並非 180B。[12][21] DSA+SWA 混合注意力、四支流 mHC 殘差架構、三頭 MTP 同 Muon 優化器,均係為咗改善長上下文推理或訓練效率而設;實際效能仍取決於硬件及部署配置。[21]
對企業而言,眼前價值係可控評測、昇騰原生部署同實驗;要聲稱能重現原始 34T token 訓練,仍要等更多訓練碼、設定及資料流程細節公開。