深圳这套系统到底实现了什么?
深圳近日启用一套拥有1万张AI加速卡的智能计算集群,采用华为昇腾910C芯片。这被报道为中国首个完全采用国产先进芯片、覆盖芯片、服务器、网络与软件的全栈自主可控万卡级AI集群。711
新启用部分的算力为1.1万P(petaflops,千万亿次浮点运算级别)。如果算上此前已经投入运行的3000P部分,深圳这一算力设施的总规模达到1.4万P。711
这并不意味着单张芯片的性能已经超过英伟达产品,而是说明中国正在把国产AI芯片组织成可用于大模型工作的超大规模计算基础设施。
华为提供了哪些关键技术?
集群的核心是华为昇腾910CAI加速器,以及围绕昇腾构建的“昇腾 + CANN”软硬件生态。CANN是华为面向昇腾平台的异构计算架构,为模型编译、算子运行和加速卡调度提供软件支持。
昇腾910C还被描述为采用双芯片单元封装的加速卡,目标是通过集成更多计算资源,满足训练和推理等AI任务的需求。华为也在继续扩展从芯片、服务器到数据中心系统的产品线,使其不只是提供一张替代GPU的芯片,而是提供一套完整的算力平台。610
昇腾910C与英伟达H100相比如何?
据DeepSeek相关测试报道,昇腾910C在推理任务中的性能约为英伟达H100的60%。1114
但这个数字需要谨慎解读:
- 它针对的是特定模型和推理工作负载,不是覆盖所有场景的统一行业基准;
- 推理是模型训练完成后生成结果的环节,不能直接代表大规模训练性能;
- 这一比较也没有单独证明两者在软件成熟度、功耗效率、内存带宽或系统稳定性方面完全相当。
因此,更准确的说法是:昇腾910C在部分推理任务中已经具备较强的实用价值,能够帮助中国企业减少对英伟达高端加速卡的依赖,但它还不能被简单描述为全面追平H100。
为什么把上万张卡连接成集群?
AI集群的价值不只是“把很多芯片放在同一个机房”,而是让这些加速卡能够像一个协同工作的计算系统。
在训练大模型时,系统可以把数据、模型层或参数计算拆分到不同加速卡上并行处理;在推理场景中,也可以把大量用户请求分配给不同卡组同时执行。这样,整体吞吐量和可处理的模型规模都会显著提升。
不过,并行计算也会带来通信开销。不同加速卡需要频繁交换中间结果,如果网络速度不够快,等待通信的时间就可能抵消并行计算带来的收益。因此,AI集群还需要高速互联网络、内存系统、任务调度和编译软件共同配合。CANN等软件栈的作用,正是帮助硬件更高效地运行AI模型,减少“卡很多、效率却不高”的问题。
系统已经被广泛采用了吗?
现有信息显示,深圳此前启用的3000P算力部分在新一阶段上线前已经被全部预订,说明本地对国产AI算力存在较强需求。11
另有报道提到,近50家机构已签署使用该集群算力的框架协议,整体预约率达到92%。1这些机构的具体构成和长期实际使用量仍需更多公开数据确认,因此,预约情况可以证明市场需求正在形成,但还不能据此断言华为平台已经在中国全面取代英伟达。
此外,有报道称,华为主导的团队曾使用至少1000张昇腾910C,对超大规模模型开展全参数后训练。这表明国产加速器正在尝试承担更接近训练级别的任务,但单个项目的成功并不等于所有大模型训练都已完成平台迁移。3
中国还公布了哪些AI芯片进展?
华为曾提出一种芯片设计路线,目标是在不依赖最先进光刻工具的情况下,到2031年实现相当于1.4纳米制程的晶体管密度。不过,这属于公司提出的技术规划,目前并没有独立数据证明已经形成可量产、可商用的对应芯片。23
另据路透社报道,华为昇腾950PR在客户测试中的表现获得积极反馈,字节跳动和阿里巴巴正在考虑下单。该消息显示,国产AI芯片能否真正扩大市场,除了峰值算力,还取决于软件兼容性、供应能力和大型互联网企业的实际部署。23
这与美国出口限制有什么关系?
美国自2022年起限制英伟达A100、H100等先进AI加速器向中国出口,并在2023年进一步扩大对先进计算芯片及相关芯片制造设备的限制范围。23
在这一背景下,深圳万卡集群具有明显的产业链回应意味:当海外高端加速器获取受到限制时,中国需要同时补齐国产芯片、服务器、网络互联和软件生态,而不是只寻找一款单独的替代产品。
华为的关键作用在于,昇腾既提供AI加速器,也延伸到数据中心级系统和软件平台,为中国企业提供从芯片到集群的国内方案。712但昇腾910C与H100的性能差距、生态迁移成本,以及部分中国企业仍通过海外数据中心获取英伟达算力的报道,都说明中国AI算力自主化仍在推进中,尚未完全实现替代。712
换句话说,深圳这套集群的意义不在于证明国产芯片已经全面领先,而在于证明中国正把国产AI硬件和软件推向万卡规模,并试图将这种能力转化为可持续使用的产业基础设施。