杭州这套国产TPU千卡集群的看点,并不只是“1024片芯片”这个数字,而是它试图把芯片、服务器、网络、调度和算力运营串成一套可交付的服务。
中国电信杭州分公司、中兴通讯和中昊芯英联合建设的项目一期,采用1024片第一代“刹那”TPU,并基于“泰则”智算平台搭建,算力规模达400PFLOPS,服务于大模型训练、AI推理和科学计算。相关报道将其称为中国电信体系内首个大规模国产TPU集群部署项目,也是华东地区首个国产TPU千卡级集群。
17
18
关键不在“有多少卡”,而在“每张卡能产出多少Token”
对于大语言模型推理,用户输入和模型生成回答并不是同一种计算任务:
- Prefill(预填充):处理用户的提示词,建立上下文;
- Decode(解码):逐个生成输出Token(词元)。
两者对计算、显存、批处理和时延的要求并不相同。所谓Prefill-Decode分离调度,就是把这两类工作拆开配置和调度,避免同一批设备在统一调度下同时承担两种负载,从而提升集群利用率。实际落地还依赖集群编排与网络配置等系统能力。
2
杭州电信表示,经过数月围绕模型版本、算子实现、服务器配置、网络带宽和调度方式的软硬件协同调优,集群的Token输出效率较年初提升超过10倍;每百万Token的成本则从约100元降至10元以下。
9
11
不过,这组数据应理解为运营方披露的特定部署结果,而非可直接套用到所有TPU或推理平台的通用基准。目前公开报道未说明所测模型、计算精度、批处理规模、流量结构、资源利用率及成本核算口径,因此外部无法据此复现,也难以与其他平台作严格横向比较。
三方合作,补齐从芯片到服务的链条
一套大规模AI集群能否真正投入生产,往往不取决于单颗芯片的峰值算力,而取决于硬件和软件能否协同工作。
- 中昊芯英提供“刹那”TPU及“泰则”平台。报道显示,“刹那”拥有自研IP核、指令集与计算平台。
18
19
- 中兴通讯参与通信网络、服务器集成和集群基础设施建设。
18
- 杭州电信则提供规模化算力运营场景,使集群能够面向客户交付和管理计算资源。
项目覆盖AI算力、服务器硬件、集群组网与算力调度,并提出计算资源、资源调度、模型适配、运营管理和行业应用五层能力架构。
17
18
对国产AI芯片而言,这种运营商环境尤其重要:验证不再停留在单芯片跑分,而是转向真实服务能力——调度是否有效、模型是否容易适配、网络是否稳定、容量是否可预测、后续运维是否可持续。
TPU的优势,也意味着软件适配门槛更高
TPU是面向张量计算的AI加速器,适合大模型训练和推理中大量出现的矩阵计算。但在千卡甚至更大规模下,实际性能并不由FLOPS单独决定。
互联带宽、内存访问、集合通信、调度策略、故障恢复,以及模型框架和推理引擎的兼容性,都会决定最终能交付多少有效Token。
因此,国产替代要证明的不只是“芯片能运行”,还包括模型、算子、推理引擎、量化方案和客户工作流能否稳定迁移与长期运行。现有报道能够支持杭州项目的落地与扩容规划,但尚不足以证明其在各类主流模型、框架及软件生态中已实现全面对等。
二期瞄准万P规模,“须臾”将接棒
项目二期计划采用中昊芯英第二代“须臾”TPU,整体规划算力超过10000PFLOPS。
17
19
按企业公开信息,“须臾”混合精度浮点算力为896TFLOPS,8-bit推理算力为1792TOPS,单芯片额定功耗600W;企业称其性能约为“刹那”的3倍,并称在相近算力性能下,功耗较传统芯片低50%。这些均为企业披露的规格和对比口径。
19
20
在集群侧,中昊芯英称,“须臾”可在单个超节点内实现最多2048片芯片全光互联,面向超大规模分布式训练和高并发推理负载。
20
真正的检验:稳定、兼容与可验证的经济性
杭州集群已经展示了一种从加速器、指令集、服务器和网络,到调度平台与运营服务的国产AI算力整合路径。
18
19
400PFLOPS的一期落地及万P级二期规划已有多方报道;更受关注的“Token效率提升超10倍”和“每百万Token不足10元”则仍是运营方和项目参与方的披露。要判断这套体系能否形成可复制的商业能力,后续仍需看到更透明的基准方法、负载细节,以及在多模型、多框架和长期生产环境中的稳定表现。
9
11