華為釋出 openPangu-2.0-Pro,其意義不只是把一個大型模型檢查點放上網路;但也不能因此直接稱為「完整可重現」的訓練配方。
較精確的說法是:它讓開發者能更實際地檢視、評估並在華為昇騰(Ascend)平台上部署一個大型模型,同時揭示朝更完整訓練到推論堆疊開放的路徑;不過,外部團隊目前仍無法據此獨立重做原始的前沿規模訓練。
先釐清一項常見數字誤讀:Pro 是混合專家模型(MoE),總參數約 5,050 億(505B),但每個 token 約啟用 180 億(18B) 參數。模型支援 512K token 上下文,訓練資料總量約 34T token。
21
已公開的內容,實際能做什麼?
華為於 2026 年 7 月 31 日宣布,openPangu-2.0-Pro 的模型權重、基礎推論程式碼與技術報告正式開源,其他 openPangu 2.0 相關元件則會陸續上線。
12
這三項內容各有不同價值:
- 模型權重:可用來測試模型能力與提供推論服務。
- 基礎推論程式碼:提供面向昇騰環境的實作起點。
- 技術報告與模型文件:讓使用者理解架構及官方揭露的設計取捨。
12
21
華為在 HDC 2026 所提出的規畫,則包括分階段開放 7 項元件,當中涵蓋預訓練程式碼、後訓練程式碼與訓練算子。
2
10 若這些元件都以可用形式完整釋出,openPangu 2.0 將比僅釋出權重的模型,更接近從訓練到推論的全流程工具鏈。
為什麼現在還不能說「完整可重現」?
開放權重不等於可在原始規模上重現訓練。下載權重可以證明外界能測試已釋出的檢查點,卻不代表外部組織已擁有重新產生相同模型的一切條件。
若要再現一次 34T token 的預訓練,至少還需要:精確的資料集,或可重現的資料生成規格;完整的訓練與後訓練實作;超參數;叢集拓撲;軟體、編譯器版本;分散式訓練配置;自訂算子;評測設定,以及足夠的相容硬體。現有公開資訊確認了權重、基礎推論程式碼和報告;其餘元件則仍由華為描述為逐步釋出。
12
21
因此,目前最公允的定位是:一個以昇騰為優先目標的開放模型釋出,並宣示將朝更透明的完整堆疊推進。 這不等於外部團隊今天已能獨立複製原始訓練工作。
512K 長上下文背後的效率設計
openPangu-2.0-Pro 嘗試在極大的總參數規模下,控制生成與長上下文處理的成本。
MoE:不是所有參數都要參與每次運算
MoE 會把每個 token 路由到部分專家參數。Pro 約有 505B 總參數,但單一 token 約啟用 18B 參數。
21
這不表示模型變得容易部署:儲存、服務與跨裝置通訊 505B 規模模型,仍需要可觀的基礎設施。但相較於同等總規模的稠密模型,單一 token 所需的參數計算量可望降低。
DSA+SWA:兼顧近處細節與遠距資訊
模型保留 MLA,並以 1:2 的層比例結合 DSA 與滑動視窗注意力(SWA)。依華為說明,SWA 層用於局部視窗建模,DSA 層則負責稀疏的全域上下文聚合,目標是在維持準確度的前提下,降低長序列推論的計算量、記憶體占用與記憶體存取成本。
21
這是針對 512K 上下文的一項務實設計:若每個 token 都與所有 token 做完整注意力計算,成本會快速攀升;局部注意力可較經濟地處理鄰近內容,稀疏全域機制則力求保留存取遠距關鍵資訊的能力。
四支流 mHC、三頭 MTP 與 Muon
華為也提到,Pro 採用四支流 mHC 殘差拓撲,以提升表徵多樣性與泛化能力;三頭多 token 預測(MTP)模組會額外預測後續 token,設計目標是提升推論速度;訓練則使用 Muon 最佳化器,以加速收斂。
21
這些都是華為在公開文件中提出的架構與最佳化主張,不能直接視為所有部署情境都必然取得特定加速幅度的獨立證明。實際吞吐量與延遲,仍會受到加速器配置、精度、批次大小、上下文長度、流量型態及服務軟體影響。
長上下文代理可用在哪裡?
512K 上下文可讓代理系統在單一工作階段中納入更多材料,例如操作手冊、政策文件、紀錄檔、既有工具輸出及規格文件。這能減少過度切分文件的需求,但無法取代檢索、權限管理、來源查核與人工核准。
較有價值的應用方向包括:
- 政府與公共行政:輔助整理法規、案件資料、公共意見與跨機關文件,但必須有嚴格存取控制與可稽核的人工決策。
- 金融業:協助檢視研究報告、申報資料、合約與法遵文件;未經驗證的模型輸出不應直接用於交易、授信或監理判定。
- 製造與能源:彙整設備手冊、警報紀錄、維護歷史、製程文件與交班報告,協助調查與規畫。
- 醫療:在臨床治理下進行文獻或長期病歷摘要,而非自主做出診斷或治療決策。
- 自動駕駛工程:用於離線分析測試紀錄、場景描述、安全論證與技術文件,而不是取代經驗證的即時駕駛系統。
不過,即使採用稀疏啟用,Pro 對多數中小型組織而言仍可能難以自行託管。華為也推出 openPangu-2.0-Flash:總參數 92B、每個 token 啟用 6B 參數,可能是評估與部署時更容易切入的選項。
15
20
軟體工程能力:適合作為助手,不是自主維護者
華為公布的評測結果顯示,openPangu-2.0-Pro Thinking 版本在 SWE-bench Verified 的分數為 68.5。
24 這是值得注意的基準成績,但不能據此推論模型能可靠地獨力承擔複雜的正式環境軟體工作。
真實程式庫涉及環境設定、相依性、測試執行、安全檢視、架構判斷、持續變動的產品需求,以及跨多步驟的除錯。較合理的部署方式,是讓受監督的程式代理只取得儲存庫範圍內的權限,並搭配沙箱執行、自動化測試、靜態分析、程式碼審查與回滾機制,而非允許模型自行合併程式碼。
分階段開源,為何是生態策略?
這次釋出的戰略價值不只在模型權重。一個昇騰原生的參考模型,可促使開發者在昇騰上建置、測試與最佳化工作負載;這些工作負載再帶動執行環境、算子、工具鏈與託管服務的改善。華為也明確引導開發者、企業夥伴與研究人員,透過 Ascend Tribe 社群及華為雲 MaaS(Model as a Service,模型即服務)取得、使用並回饋模型。
12
Flash 與 Pro 同時覆蓋不同規模的使用者,而預訓練、後訓練及算子等後續元件,則瞄準決定硬體平台是否真正適合模型開發者的軟體層。
10
15
因此,openPangu 2.0 更適合被理解為強化 「昇騰+盤古」開發生態 的計畫。它目前的開放程度,已對部署、檢視與實驗有實質意義;至於能否稱為完整可重現,仍應等待其餘程式碼、設定與資料相關細節公開,並由獨立團隊實測哪些部分確實能被重建。