華為瞄準的並非單純推出兩款更快的 AI 晶片,而是建立從處理器、互連、超節點、集群到軟體的整合式 AI 算力堆疊。其目標是在美國先進晶片出口限制持續影響供應的背景下,為中國市場提供可大規模部署的本土替代方案,並逐步挑戰輝達(Nvidia)的主導地位。
1
2027 年產品時程:960DT 先行,960PR 隨後
華為表示,960DT將於 2027 年第一季推出,Ascend 960PR則規劃在 2027 年第三季亮相。這兩款產品屬於 Ascend 960 世代,是華為後續 AI 運算產品路線的一環。
1
這個安排的重要性不只在晶片更新週期。華為的競爭方向,是把 Ascend 處理器作為完整系統中的一個環節,而不是以單一加速器的規格直接決勝負:客戶購買的應是能夠擴充、互連、管理並部署模型的整套基礎設施。
UnifiedBus 的角色:讓許多晶片像一套系統般協作
大規模 AI 訓練與推論的瓶頸,往往不僅是單顆晶片的算力,而是晶片彼此交換資料的速度與延遲。華為的 UnifiedBus 是一種高速互連架構,旨在讓大量 Ascend 處理器以高頻寬、低延遲交換資料,使軟體可以將它們視為協同工作的 AI 運算系統,而非彼此獨立的加速器。
據報導,升級後的實作可連接多達 4,000 顆處理器,並讓高速光學連結深入系統內部。
2 對需要把模型切分到許多處理器上執行的工作而言,互連能力會直接影響擴充後能否維持有效效率;如果通訊成為瓶頸,新增晶片未必能帶來相應的實際效能。
從超節點到百萬處理器超集群
華為的架構分為多個層次:先將大量處理器組成 SuperPoD/超節點,再由多個 SuperPoD 組成 SuperCluster/超集群。華為已公布 Atlas 960 SuperCluster,宣稱可容納超過 100 萬顆 Ascend NPU(神經網路處理器)。
3
這項數字應理解為橫向擴充的系統規模主張:它不代表 100 萬顆處理器處於單一、平坦且直接相連的網路中,而是由多個超節點與集群層級共同構成的大型運算基礎設施。
華為也表示,已向超過 370 家客戶出貨逾 1,000 套 Ascend 超節點。
4 這顯示其產品已跨出實驗室驗證、進入商業部署階段;不過,這些由公司公布的出貨與客戶數據,並不能獨立證明其相較競爭對手的效能、系統使用率或獲利能力。
美國出口限制為何成為華為的機會
美國針對先進 AI 晶片及半導體製造設備的出口管制,限制了中國取得部分領先輝達加速器的能力。這既是中國 AI 業者面對的供應限制,也為華為創造了策略空間:
1
- 中國雲端業者、公共部門採購者與模型開發商,更有誘因驗證和導入本土硬體。
- 本土供應鏈可降低對可能受進一步管制影響的外部供應來源之依賴。
- 華為可將「可取得性」與「供應韌性」作為賣點,而不只訴諸單晶片跑分。
因此,華為的訴求可說是兼具技術與供應策略:提供在地支援的端到端平台,讓大型企業或國家級專案能在中國本土環境中部署。
真正的門檻仍是輝達的 CUDA 生態系
即使硬體與集群規模持續擴大,輝達的優勢並不只來自 GPU 本身。CUDA 長年累積的開發工具、函式庫、框架相容性、應用支援與開發者技能,形成很高的轉換成本。
對華為而言,關鍵不只是宣稱系統層級算力更高,而是要讓客戶能實際完成以下工作:
- 將既有模型與工作負載移植到 Ascend;
- 完成模型調校、訓練、推論與日常維運;
- 在大規模擴充時保持可靠性與成本效益;
- 建立可重複部署、可被企業採用的軟體與工具鏈。
華為表示,其 CANN 社群的月活躍開發者達 5,270 人,藉此展現軟體生態的成長動能。
5 這批開發者有助於改善框架支援、運算子、模型移植與工具,但與輝達全球 CUDA 生態相比,規模與成熟度仍有距離。最終考驗不在活躍人數本身,而在於能否產生可在生產環境穩定運作的軟體,以及持續出現的實際部署案例。
結論:以系統規模彌補生態差距
華為正嘗試用系統級策略縮小與輝達的差距:以 UnifiedBus 將大量處理器整合、以超節點和超集群放大算力、以本土供應對應出口限制,並透過 Ascend 與 CANN 擴大軟體生態。
短期內,華為最有利的戰場仍是受供應限制影響較深的中國市場。至於能否在更廣泛市場真正撼動輝達,將取決於軟體相容性、大規模部署的可靠度,以及真實工作負載下的價格效能表現。