相比之下,華為嘅CANN(Compute Architecture for Neural Networks)工具套件,即使喺2025年8月開源咗之後,喺算子覆蓋率、最佳化同社群工具方面仍然遠遠未夠成熟 。開發者話,好多CUDA最佳化嘅核心程式喺CANN入面冇直接對應嘅版本,要人手重寫
。
呢個係一個自我強化嘅循環:Nvidia嘅開發者社群越大、預先最佳化嘅程式碼庫越豐富,替代方案就越難突圍 。
具體包括:
最能夠說明軟件差距嘅例子係DeepSeek。據報DeepSeek放棄咗喺華為昇騰NPU上訓練R2模型嘅計劃,話係因為效能同工具鏈嘅問題解決唔到 。呢個係一個頂級實驗室親身判斷國產替代方案仲未準備好應付最 demanding 嘅工作負載。
雖然華為昇騰910C NPU已經有好大進步,但開發者話喺大規模分佈式訓練任務上,仍然比唔上Nvidia Hopper世代嘅GPU 。昇騰910C用中芯國際改良版7nm製程,BF16吞吐量大約只有Nvidia B200嘅三分之一 。華為即將推出嘅昇騰950有望進一步收窄差距,摩根士丹利嘅數據顯示,中國晶片同Nvidia出口合規硬件之間嘅效能差距已經明顯縮細
。
矛盾嘅係,美國出口限制並冇完全切斷中國嘅Nvidia供應。美國批准咗H200賣畀中國,北京之後拒絕接受——但中國嘅實驗室手上已經有大量Nvidia晶片存貨 。字節跳動、阿里巴巴同騰訊總共用咗大約160億美元,囤積咗大約130萬到160萬塊H20,預估禁令會嚟
。
中國當然冇坐以待斃: