杭州電信、中興通訊與中昊芯英完成一期 1,024 顆「剎那」TPU 集群,算力規模為 400 PFLOPS。[17][18] 專案被稱為中國電信體系首個大規模國產 TPU 集群部署,也是華東首個國產 TPU 千卡級集群。[17][20] 杭州電信表示,經數月軟硬體調校與 Prefill–Decode 分離調度後,Token 輸出效率較年初提升逾 10 倍,百萬 Token 成本由約人民幣 100 元降至 10 元以下;這些均為營運方揭露的成果。[9][11]
研究答案

Create a landscape editorial hero image for this Studio Global article: How did China Telecom’s Hangzhou branch, ZTE, and Zhonghao Xinying deploy China’s first domestic 1,024-chip Chana TPU cluster delivering 400. Article summary: China Telecom’s Hangzhou branch, ZTE, and Zhonghao Xinying built the first phase as a production-oriented, fully domestic TPU stack rather than merely installing accelerators: 1,024 first-generation Chana TPUs were integ. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
杭州這座集群的看點,不只是「1,024 顆晶片」或 400 PFLOPS 的數字,而是三方把晶片、伺服器、網路與調度軟體整合為可實際交付的 AI 算力服務。
中國電信杭州分公司、中興通訊與中昊芯英,以第一代「剎那」TPU 和「泰則」智算平台建成一期系統,面向大型模型訓練、AI 推理與科學運算。報導稱,這是中國電信體系內首個大規模國產 TPU 集群部署,也是華東地區首個國產 TPU 千卡級集群。17
20
一期採用 1,024 顆「剎那」TPU,建置於中昊芯英的「泰則」平台上,整體算力規模為 400 PFLOPS。合作方稱,系統涵蓋 AI 加速器、伺服器硬體、集群網路與算力調度平台,形成全鏈路國產化架構。17
18
這個差異很關鍵。大型 AI 集群不是把大量加速器裝進機櫃就能發揮效能;伺服器配置、網路互連、模型軟體與排程器能否協同,直接影響使用者實際拿到的吞吐量與延遲表現。此案的重點,正是讓 TPU 不只是展示用晶片,而能成為可營運、可管理的算力服務。18
大型語言模型的推理通常可拆成兩個性質不同的階段:
兩者所需的算力、記憶體與批次處理方式並不相同。將它們分離後,平台能分別配置與調度提示詞處理、逐 Token 生成的資源,而不必讓同一批裝置以單一排程同時承擔兩種工作。實際部署還需要集群編排和網路設定配合;SGLang 的 Prefill–Decode 分離服務部署文件也反映了這類系統對基礎設施整合的需求。2
杭州電信表示,經過數月軟硬體調校,包括模型版本、算子實作、伺服器配置、網路頻寬及調度方式,集群的 Token 輸出效率較年初提升超過 10 倍;百萬 Token 成本則從約人民幣 100 元降至 10 元以下。9
11
不過,這些數字應視為營運方公布的部署成果,而非可直接套用到所有 TPU 或推理平台的通用基準。現有報導未披露使用的模型組合、精度、批次大小、流量型態、設備使用率或成本計算方式,因此外界尚無法獨立重現,也無法與其他推理平台做嚴格的同條件比較。
此案把通常各自評估的三種能力放到同一套系統中:
對國產 AI 晶片來說,電信營運商環境的價值在於:測試標準不再只是晶片峰值規格,而是能否持續交付服務。資源調度、模型適配、網路行為與日常維運,都會影響客戶是否能獲得穩定、可預期的推理能力。該專案明確納入算力資源、調度、模型適配、營運管理與產業應用等層面。18
TPU 是針對張量運算設計的 AI 加速器,理論優勢不只在峰值 FLOPS,也在於能否高效率執行大型模型訓練與推理中常見的大量矩陣運算。
但在集群規模下,加速器表現離不開互連、記憶體行為、集體通訊、調度、可靠性與模型軟體相容性。換句話說,國產替代不能只證明矽晶片能運作;模型、推理引擎、算子、量化方案與客戶既有工作流程,都必須能可靠地遷移與運行。
目前資料足以支持杭州集群已部署、並規劃擴建,但尚不足以證明其在各種模型和框架下,已全面追平主流 GPU 軟體生態系。相容性、穩定性與可重複驗證的成本效益,仍是下一階段最重要的觀察重點。
合作方規劃第二期改採中昊芯英第二代「須臾」TPU,總算力目標突破 10,000 PFLOPS。17
19
依公司公開資訊,「須臾」的混合精度浮點效能為 896 TFLOPS,8-bit 推理效能為 1,792 TOPS,額定功耗為 600 W。公司並稱,其效能約為「剎那」的 3 倍,且在同等效能下,相較傳統晶片可降低 50% 功耗;上述均屬公司公布規格與主張。19
20
在系統部署層面,中昊芯英表示,「須臾」可透過全光互連,在單一超節點中連接最多 2,048 顆晶片,以支援超大模型分散式訓練、多智能體協作與高併發 Token 推理等工作負載。20
它證明的是一種從晶片延伸到平台的整合嘗試:加速器、指令集、伺服器、網路、調度和服務營運被放入同一個可落地的算力架構中。18
19
400 PFLOPS 一期部署與後續「須臾」擴建計畫已有多方報導;至於 Token 輸出效率提升逾 10 倍、百萬 Token 成本低於人民幣 10 元等更吸睛的指標,雖可能反映分離調度與提升利用率帶來的效益,但在基準方法與工作負載細節公開前,仍應視為營運方與專案參與者的說法,而非獨立驗證結論。9
11
Studio Global AI
這個頁面包含附來源佐證的答案,你可以在 Studio Global 內繼續追問。
杭州電信、中興通訊與中昊芯英完成一期 1,024 顆「剎那」TPU 集群,算力規模為 400 PFLOPS。[17][18]
杭州電信、中興通訊與中昊芯英完成一期 1,024 顆「剎那」TPU 集群,算力規模為 400 PFLOPS。[17][18] 專案被稱為中國電信體系首個大規模國產 TPU 集群部署,也是華東首個國產 TPU 千卡級集群。[17][20]
杭州電信表示,經數月軟硬體調校與 Prefill–Decode 分離調度後,Token 輸出效率較年初提升逾 10 倍,百萬 Token 成本由約人民幣 100 元降至 10 元以下;這些均為營運方揭露的成果。[9][11]