杭州電信、中興通訊及中昊芯英一期部署1,024枚「剎那」TPU,集群算力為400 PFLOPS,服務大模型訓練、AI推理及科學計算。[17][18] 營運方稱經過數月軟硬件調優,加上Prefill–Decode分離調度後,Token輸出效率較年初升逾10倍,每百萬Token成本由約100元人民幣降至10元以下;不過未公開完整測試方法及工作負載細節。[9][11] 二期計劃改用第二代「須臾」TPU,整體規劃算力超過10,000 PFLOPS;其公開規格包括896 TFLOPS混合精度算力、1,792 TOPS 8 bit推理算力及600W額定功耗。[17][19][20]
研究答案

Create a landscape editorial hero image for this Studio Global article: How did China Telecom’s Hangzhou branch, ZTE, and Zhonghao Xinying deploy China’s first domestic 1,024-chip Chana TPU cluster delivering 400. Article summary: China Telecom’s Hangzhou branch, ZTE, and Zhonghao Xinying built the first phase as a production-oriented, fully domestic TPU stack rather than merely installing accelerators: 1,024 first-generation Chana TPUs were integ. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
杭州呢個部署最值得留意嘅,未必單純係「1,024枚晶片」呢個數字,而係三方將晶片、伺服器、集群網絡、調度系統同實際營運整合埋一齊。杭州電信、中興通訊同中昊芯英以第一代「剎那」TPU及「泰則」智算平台,建成一個400 PFLOPS系統,面向大模型訓練、AI推理同科學計算。報道形容,呢個係中國電信體系內首個大規模國產TPU集群部署,亦係華東首個國產TPU千卡級集群。17
20
一期採用1,024枚「剎那」TPU,建基於中昊芯英嘅「泰則」智算平台。項目方稱,從AI加速器、伺服器硬件、集群組網到算力調度平台,都採用國產方案。17
18
呢個分別好關鍵:大型AI集群唔係將大量加速器塞入機櫃就完成。真正可交付嘅效能,取決於伺服器、網絡、模型軟件同調度器能否協同運作。呢個項目嘅目標,正正係將TPU由單一晶片展示,變成可以對外提供、日常營運嘅算力服務。18
大型語言模型推理通常可分成兩段:
兩段工作對運算、記憶體、批次處理同延遲嘅要求並唔相同。將佢哋分開後,平台可以獨立分配及調度處理輸入同生成Token嘅資源,而唔使由同一組裝置以同一套排程兼顧兩種工作。實際落地亦牽涉集群協調同網絡配置;例如SGLang嘅Prefill–Decode分離服務部署指引,就列明相關集群及網絡元件要求。2
杭州電信表示,團隊經過數月軟硬件調優,包括模型版本、算子實作、伺服器配置、網絡頻寬同調度方式,令集群Token輸出效率較年初提高逾10倍;每百萬Token成本則由約100元人民幣降至10元以下。9
11
不過,呢啲數字應理解為營運方公布嘅部署成效,而唔係適用於所有TPU或所有模型嘅通用基準測試。現有報道未披露模型組合、數值精度、batch size、流量型態、使用率,以至成本計算方法,因此外界未能獨立重現結果,亦難以直接同其他推理平台作公平比較。
呢個集群將通常分開評估嘅三種能力接埋:
對國產AI晶片嚟講,電訊營運商嘅環境特別有價值,因為測試焦點會由晶片峰值規格,轉向服務係咪真係交付到:調度穩唔穩、模型適配得好唔好、網絡表現如何,以及長期運維能否維持可預期嘅推理能力。項目架構亦明確包括算力資源、資源調度、模型適配、營運管理同產業應用五個層面。18
TPU,即張量處理器,係針對AI運算設計嘅加速器。佢嘅價值唔只係峰值FLOPS,亦在於可否高效處理大模型訓練及推理中常見、以矩陣運算為主嘅工作。
但去到集群規模,效能從來唔只睇加速器本身;互連、記憶體行為、集體通訊、調度、可靠性,以及模型與軟件兼容性,全都會影響最終可用算力。
所以,國產替代要證明嘅唔止係晶片「跑得郁」。模型、推理引擎、算子、量化方法同客戶既有工作流程,都要可靠噉喺新平台運行。現有資料支持杭州集群已落地及將會擴容,但未足以證明其在各種主流模型、框架及軟件生態上,已與主流GPU平台全面看齊。
三方計劃喺二期採用中昊芯英第二代「須臾」TPU,整體規劃算力超過10,000 PFLOPS。17
19
中昊芯英公布,「須臾」具896 TFLOPS混合精度浮點算力、1,792 TOPS 8-bit推理算力,額定功耗為600W。公司又稱,其效能約為「剎那」嘅3倍,並指在相若效能下,功耗較傳統算力晶片低50%。以上均屬公司公布嘅規格及比較說法。19
20
按公司公開介紹,「須臾」可透過全光互連組成最多2,048枚晶片嘅超節點,目標承載大規模分散式訓練、多智能體協同運算及高並發Token推理等重負載工作。20
杭州項目展示嘅,係由晶片一路延伸到平台嘅國產AI算力堆疊:加速器、指令集、伺服器、網絡、調度同服務營運都涵蓋在內。18
19
下一步真正嘅考驗,係呢套系統能否持續承受多元化嘅生產工作負載,同時做到軟件兼容、效能穩定,同埋經濟效益清晰透明。
400 PFLOPS一期集群同「須臾」擴容計劃已有多方報道;至於「Token效率升逾10倍」及「每百萬Token低於10元人民幣」等較吸睛嘅數字,雖然可以視為提高推理資源使用率後可能達成嘅目標,但在測試方法與工作負載詳情公開前,仍應視為營運方及項目參與者嘅說法。9
11
Studio Global AI
此頁麵包含一個有來源支援的答案,您可以在 Studio Global 內繼續。
杭州電信、中興通訊及中昊芯英一期部署1,024枚「剎那」TPU,集群算力為400 PFLOPS,服務大模型訓練、AI推理及科學計算。[17][18]
杭州電信、中興通訊及中昊芯英一期部署1,024枚「剎那」TPU,集群算力為400 PFLOPS,服務大模型訓練、AI推理及科學計算。[17][18] 營運方稱經過數月軟硬件調優,加上Prefill–Decode分離調度後,Token輸出效率較年初升逾10倍,每百萬Token成本由約100元人民幣降至10元以下;不過未公開完整測試方法及工作負載細節。[9][11]
二期計劃改用第二代「須臾」TPU,整體規劃算力超過10,000 PFLOPS;其公開規格包括896 TFLOPS混合精度算力、1,792 TOPS 8 bit推理算力及600W額定功耗。[17][19][20]