中國頂尖AI開發者——包括DeepSeek、Kimi K3和阿里巴巴——仍依賴輝達晶片訓練最先進模型,核心障礙是CUDA軟體生態系統的鎖定效應[3][5]。 輝達CUDA擁有15年以上的成熟函式庫、除錯工具和全球開發者社群,而華為CANN工具鏈相對不成熟,開發者需大幅重寫程式碼[1][2][6]。
研究答案

Create a landscape editorial hero image for this Studio Global article: Why do China's leading AI developers still rely on Nvidia chips to train their most advanced models, and what specific barriers — including. Article summary: China's leading AI developers — including those behind DeepSeek, Kimi K3, and Alibaba's models — remain heavily reliant on Nvidia chips for training their most advanced models, despite government pressure and export rest. Topic tags: general, education, news, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
儘管面臨政府壓力和美國出口限制,中國頂尖的人工智慧開發者——包括DeepSeek、Kimi K3和阿里巴巴Qwen模型的團隊——在訓練最先進的大型語言模型時,仍然高度依賴輝達(Nvidia)晶片。核心障礙並非硬體性能,而是軟體生態系統的鎖定效應:輝達的CUDA平台已成為AI開發的事實標準,要轉移到華為的昇騰(Ascend)晶片與CANN工具鏈,所需付出的工程成本高得令人卻步
。
輝達的CUDA(統一計算設備架構)擁有超過15年的先發優勢,其成熟的函式庫(如cuDNN、TensorRT)、除錯工具以及全球開發者社群,讓它立於不敗之地。幾乎所有主流AI框架——PyTorch、TensorFlow、JAX——都是原生為CUDA最佳化
。
相比之下,華為的CANN(神經網絡計算架構)工具鏈,即使在2025年8月開源後,在運算元覆蓋率、最佳化程度和社群工具成熟度方面仍遠遠不及。開發者反映,許多為CUDA最佳化的核心(kernel)程式在CANN中找不到直接對應的版本,需要手動重寫
。
這是一個難以打破的自我強化循環:輝達的開發者社群越大、預先最佳化的程式碼庫越豐富,替代方案就越難獲得市場動能。
一位來自上海附屬研究機構的AI研究人員估計,將訓練任務從輝達CUDA轉移到華為昇騰,時間與成本都會增加至少50%。業界消息人士也證實,這個數字是相當務實的下限
。
這包含了以下開銷:
軟體差距最具說服力的案例莫過於DeepSeek。這家中國最受矚目的AI實驗室之一,據報導已放棄在華為昇騰NPU上訓練其R2模型的計畫,理由是性能與工具鏈問題遲遲未能解決。這是一個頂尖實驗室在處理最嚴苛的工作負載時,認為國產替代方案尚未成熟的具體實例。
儘管華為的昇騰910C NPU已有長足進步,但開發者指出,在大型分散式訓練任務上,它的表現仍不如輝達Hopper世代的GPU。基於中芯國際(SMIC)增強型7奈米製程打造的昇騰910C,其BF16吞吐量大約只有輝達B200的三分之一。華為即將推出的昇騰950可望進一步縮小這個差距,摩根士丹利的數據也顯示,中國晶片與輝達符合出口規範的硬體之間,性能差距已顯著縮小
。
矛盾的是,美國的出口限制並未完全切斷對中國的輝達晶片供應。美國批准了H200對中國的銷售,而北京當局隨後又阻止其進口——但中國的AI實驗室早已囤積了大量輝達晶片。字節跳動、阿里巴巴和騰訊為了因應預期的禁令,總計花費約160億美元,囤積了大約130萬至160萬顆H20晶片
。
這個龐大的既有安裝基礎產生了強大的慣性:只要現有的輝達硬體還能運作,高昂的轉換成本就會延緩轉向國產替代方案的腳步。
中國當然不會坐以待斃。面對這些障礙,中國採取了一系列行動:
進步是確實的:根據報導,國產晶片的訓練占比已從2025年初的8%,成長到2026年4月的42%。然而,這些採用似乎主要集中於較不關鍵的工作負載和推論任務,而非前沿模型訓練
。
華為開源CANN是建立如CUDA般強大的開發者生態系統的重要一步。但大多數分析師認為,軟體生態系統的差距——而非純粹的硬體規格——將需要數年時間才能趕上
。短期內,中國頂尖的AI實驗室將繼續使用輝達晶片訓練模型,同時在較不關鍵的工作負載上嘗試混合部署國產方案,而北京當局的2,950億美元網路計畫,則旨在加速這個轉型過程
。
Studio Global AI
這個頁面包含附來源佐證的答案,你可以在 Studio Global 內繼續追問。
中國頂尖AI開發者——包括DeepSeek、Kimi K3和阿里巴巴——仍依賴輝達晶片訓練最先進模型,核心障礙是CUDA軟體生態系統的鎖定效應[3][5]。
中國頂尖AI開發者——包括DeepSeek、Kimi K3和阿里巴巴——仍依賴輝達晶片訓練最先進模型,核心障礙是CUDA軟體生態系統的鎖定效應[3][5]。 輝達CUDA擁有15年以上的成熟函式庫、除錯工具和全球開發者社群,而華為CANN工具鏈相對不成熟,開發者需大幅重寫程式碼[1][2][6]。
中國晶片製造商力拚2026年將國產AI晶片產量提高三倍,北京當局也正草擬2,950億美元計畫,目標在2028年前將各數據中心串聯成單一AI運算網路[2][8]。