中国顶尖AI开发者——包括DeepSeek、Kimi K3和阿里巴巴——仍在使用英伟达芯片训练其最先进模型,根源在于CUDA软件生态的锁定效应 [3][5] 核心障碍是英伟达CUDA生态已发展超15年,拥有成熟库、调试工具和全球开发者社区;而华为CANN工具包尚不成熟,需大量代码重写 [1][2][6] 中国芯片厂商计划在2026年将国产AI芯片产量提升两倍,北京正起草一项约2950亿美元的计划,到2028年将全国数据中心连成统一AI算力网络 [2][8]
研究答案

Create a landscape editorial hero image for this Studio Global article: Why do China's leading AI developers still rely on Nvidia chips to train their most advanced models, and what specific barriers — including. Article summary: China's leading AI developers — including those behind DeepSeek, Kimi K3, and Alibaba's models — remain heavily reliant on Nvidia chips for training their most advanced models, despite government pressure and export rest. Topic tags: general, education, news, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
中国领先的人工智能开发者——包括DeepSeek、Kimi K3和阿里巴巴Qwen模型背后的团队——尽管面临巨大的政府压力和美国的出口限制,却依然严重依赖英伟达芯片来训练其最先进的大型语言模型 。核心障碍并非硬件性能,而是软件生态锁定:英伟达的CUDA平台已成为AI开发的事实标准,迁移到华为昇腾芯片及CANN工具包将带来高得令人望而却步的工程成本
。
英伟达的CUDA(统一计算设备架构)拥有超过15年的先发优势,具备成熟的库(cuDNN、TensorRT)、调试工具和全球开发者社区 。几乎所有主流AI框架——PyTorch、TensorFlow、JAX——都默认针对CUDA进行了优化
。
相比之下,华为的CANN(神经网络计算架构)工具包即使在2025年8月开源后,在算子覆盖范围、优化程度和社区工具方面仍远不成熟 。开发者报告称,许多针对CUDA优化的核心代码没有直接对应的CANN版本,需要手动重写
。
这种自我强化的循环难以打破:英伟达的开发者社区越大,其预优化代码库越丰富,替代方案就越难获得发展动力 。
一家上海附属研究所的AI研究员估计,将训练从英伟达CUDA迁移到华为昇腾,时间和成本至少增加50% 。行业消息人士确认这一数字是现实底线
。
这包括:
软件鸿沟最有力的例证来自中国最著名的AI实验室之一DeepSeek。据报道,DeepSeek放弃了在华为昇腾NPU上训练其R2模型的计划,原因是存在未解决的性能和工具链问题 。这是一个顶级实验室认定国产替代品尚不能胜任其最苛刻工作负载的具体案例。
尽管华为昇腾910C NPU已有显著改进,但开发者报告称,在大型分布式训练任务中,其性能仍不及英伟达的Hopper代GPU 。基于中芯国际增强型7nm工艺制造的昇腾910C,其BF16吞吐量约为英伟达B200的三分之一 。华为即将推出的昇腾950预计将进一步缩小这一差距,摩根士丹利的数据显示,中国芯片与英伟达合规出口硬件之间的性能差距已大幅缩小
。
矛盾的是,美国的出口限制并未完全切断对中国的英伟达供应。美国批准了H200对华销售,但北京随后阻止了其接受——不过中国实验室已经囤积了大量英伟达芯片 。字节跳动、阿里巴巴和腾讯预计共花费约160亿美元,抢购了约130万至160万颗H20芯片,以应对可能的禁令
。
这一已安装基础造成了强大的惯性:只要现有的英伟达硬件继续运行,高昂的转换成本就会延迟向国产替代方案的迁移 。
中国并非停滞不前。针对这些障碍:
进展是真实的:据报道,国产芯片在训练中的使用占比从2025年初的8%增长到2026年4月的42% 。但这种采用似乎主要集中在不太关键的工作负载和推理任务上,而非前沿模型训练
。
华为开源CANN是朝着构建CUDA所享有的开发者生态迈出的有意义一步 。但大多数分析人士认为,软件生态差距——而非原始硬件规格——需要数年时间才能弥合
。短期内,中国顶尖AI实验室将继续在英伟达芯片上训练模型,同时尝试在不太关键的工作负载中混合部署国产方案,而北京2950亿美元的算力网络计划旨在加速这一转型
。
Studio Global AI
此页面包含一个有来源支持的答案,您可以在 Studio Global 内继续。
中国顶尖AI开发者——包括DeepSeek、Kimi K3和阿里巴巴——仍在使用英伟达芯片训练其最先进模型,根源在于CUDA软件生态的锁定效应 [3][5]
中国顶尖AI开发者——包括DeepSeek、Kimi K3和阿里巴巴——仍在使用英伟达芯片训练其最先进模型,根源在于CUDA软件生态的锁定效应 [3][5] 核心障碍是英伟达CUDA生态已发展超15年,拥有成熟库、调试工具和全球开发者社区;而华为CANN工具包尚不成熟,需大量代码重写 [1][2][6]
中国芯片厂商计划在2026年将国产AI芯片产量提升两倍,北京正起草一项约2950亿美元的计划,到2028年将全国数据中心连成统一AI算力网络 [2][8]