DeepSeek把华为国产芯片训练视为重点,核心考量并不是眼下能否以最低成本替代英伟达,而是供应安全和长期技术韧性。在美国持续限制中国获得高性能英伟达AI加速器的背景下,拥有一套能承担大规模训练的国产软硬件体系,正从“产业升级选项”变成实际运营风险管理。
短期代价并不小。此前,DeepSeek尝试使用Ascend 910C训练R2,据报道因软硬件能力限制而未能成功完成;另有报道称,约需4颗华为处理器才能达到1颗英伟达GB300的算力水平。这反映出国产方案在前沿训练的性能和能效上仍有差距。但真实、大规模的部署也会带来反馈:编译器、框架、算子、互联网络以及模型架构,只有在高强度工作负载中才能持续优化。
训练芯片何时到位?
据报道,DeepSeek预期华为最早在2026年第四季度开始供应专门面向训练的芯片,并在2027年初实现更广泛的可用性。华为则表示,Ascend 960DT计划于2027年第一季度推出;同时预计Ascend 950DT系统将在明年广泛用于模型训练。
1
这并不意味着DeepSeek已立即将最重的前沿预训练任务全面迁至华为平台。更准确地说,它正在为这一转移预先建设软硬件兼容性、工程经验和供应链能力,让国产训练成为可执行的备选方案,而非停留在纸面上的目标。
16万颗Ascend 950DT:规模很大,但当前主要用于推理
DeepSeek计划在内蒙古乌兰察布建设的约1吉瓦数据中心中,部署至少160,000颗Ascend 950DT加速器。若计划落地,这将成为已知规模最大的国产AI芯片集群之一。
但报道显示,该集群的当前用途是推理——即运行已训练好的模型、响应用户请求——而不是立即承担模型预训练。部署进度还取决于华为的产能。
2
这个区别很关键:推理与训练对芯片、内存、网络和软件稳定性的要求并不完全相同。DeepSeek先把大规模推理负载迁向国产芯片,既可扩大国产平台的实际使用,也能在相对可控的场景中验证系统可靠性;至于最复杂、最耗算力的前沿训练,英伟达硬件目前仍占据重要位置。
从“能跑”到“能训”:V4适配是关键一步
DeepSeek推出了适配华为芯片的V4版本。这并非简单把模型“移植”到另一种硬件上,而是模型与硬件软件栈协同设计的一部分。
3
对训练而言,真正决定可用性的往往不只是单颗芯片峰值算力,还包括:
- 编译器和开发工具链是否成熟;
- 深度学习框架、算子与内核是否高效;
- 大规模集群的通信和网络能力是否稳定;
- 模型结构能否适配硬件特性;
- 长时间训练任务的调试、容错与运维是否可靠。
V4的华为适配,意味着DeepSeek正在帮助搭建这套生态基础。它先证明国产平台可以有效运行模型,继而积累让大规模训练更可行的工程条件。
华为不是唯一选项:DeepSeek也在开发自研芯片
DeepSeek并未把未来完全押在华为一家身上。路透社报道称,该公司也在开发自己的AI芯片,这可能降低其对英伟达和华为芯片的依赖。
4
因此,与华为的合作更像是一项兼具现实性与战略性的布局:一方面,华为提供当前最具规模潜力的国产替代平台;另一方面,DeepSeek通过自研芯片保留更大的长期自主空间。两条路线并行,目标是避免关键算力被单一供应商或外部政策所牵制。
出口管制如何改变中国AI芯片市场?
美国对高端AI加速器出口的限制,改变了中国市场的激励逻辑。过去,采用国产芯片更多是成本、性能与产业政策之间的权衡;如今,获得稳定可持续的高端算力供应本身已成为企业必须解决的问题。
华为表示,其AI计算产品需求超过供给,并称Ascend在中国市场的份额已超过英伟达。需要注意的是,这一市场份额判断来自华为自身,并非独立机构发布的统一统计。
1
短期内,英伟达在最前沿训练能力上仍可能保持优势;但限制措施也在推动中国客户更快投资国产芯片、软件工具链和数据中心基础设施。DeepSeek的V4华为适配、16万颗950DT的推理部署计划、后续训练芯片供应预期,以及自研芯片项目,共同指向同一件事:建立更自主、更可持续的中国AI计算体系。
3
4
结论:这是一场以效率换确定性的长期投入
DeepSeek明知华为方案在训练效率上可能暂时落后,仍把国产训练能力列为优先事项,原因在于它追求的不是一次性替代,而是确保在外部供应进一步收紧时,仍拥有可持续演进的算力选择。
16万颗Ascend 950DT项目目前主要服务推理,并不等同于DeepSeek已经完成从英伟达到华为的训练迁移。但V4的协同适配、训练芯片的后续交付和自研芯片布局,显示其正在从“国产芯片能否运行模型”,走向“国产生态能否支撑训练”的下一阶段。