中国電信杭州分公司、中興通訊、中昊芯英は、「泰則」プラットフォーム上で第1世代「刹那」TPU 1,024基を導入し、400PFLOPSのクラスタを構築した。[17][20] 杭州電信は、Prefill・Decode分離を含む数か月のソフト・ハード最適化により、トークン出力効率が年初比で10倍超に向上し、100万トークン当たりのコストが約100元から10元未満になったと報告している。[9][11] 第2期では第2世代「須臾」TPUを採用し、総演算能力を1万PFLOPS超へ拡張する計画。公表値では混合精度896TFLOPS、8ビット推論1,792TOPS、定格消費電力600Wとされる。[17][19]
研究の答え

Create a landscape editorial hero image for this Studio Global article: How did China Telecom’s Hangzhou branch, ZTE, and Zhonghao Xinying deploy China’s first domestic 1,024-chip Chana TPU cluster delivering 400. Article summary: China Telecom’s Hangzhou branch, ZTE, and Zhonghao Xinying built the first phase as a production-oriented, fully domestic TPU stack rather than merely installing accelerators: 1,024 first-generation Chana TPUs were integ. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
中国・杭州で稼働した国産TPUクラスタの注目点は、1,024基というチップ数そのものより、それらをどう一つの推論サービスとして使える形にまとめたかにある。
中国電信杭州分公司、中興通訊(ZTE)、中昊芯英は、第1世代「刹那(Chana)」TPUと「泰則(Taize)」智算プラットフォーム、サーバー、クラスタネットワーク、スケジューリングを統合し、400PFLOPSのシステムを構築した。大規模言語モデルの学習・AI推論・科学計算向けで、中国電信グループとして初の大規模な国産TPUクラスタ導入、かつ華東地域初の国産TPUによる千カード級クラスタと位置付けられている。17
20
第1期は、中昊芯英の「泰則」プラットフォームを基盤に「刹那」TPU 1,024基を配備し、400PFLOPSの演算能力を掲げる。報道によれば、AIアクセラレータ、サーバーハードウェア、クラスタネットワーク、演算リソースのスケジューリングまで、全レイヤーを国産技術で構成したという。17
18
AIクラスタでは、アクセラレータを大量に並べるだけでは実効性能につながらない。サーバー構成、ネットワーク、モデル実行ソフト、ジョブの割り当てを担うスケジューラが連動して初めて、利用者に安定した計算資源を提供できる。杭州のプロジェクトは、TPUを単体チップの実証で終わらせず、運用可能な計算サービスにすることを狙った構成といえる。18
大規模言語モデルの推論は、大きく二段階に分かれる。
両者では求められる計算・メモリ・遅延の特性が異なる。そこで処理を分離すれば、入力処理とトークン生成に対し、それぞれに適した規模のリソースを個別に割り当て、スケジューリングできる。1つのアクセラレータ群に両方の仕事を同じ方式で詰め込む場合と比べ、設備の稼働効率を上げられる可能性がある。実運用ではクラスタのオーケストレーションやネットワーク設定も必要となる。2
杭州電信は、モデルのバージョン、演算子実装、サーバー構成、ネットワーク帯域、スケジューリング方式を数か月にわたりソフト・ハード両面で調整した結果、トークン出力効率が年初比で10倍超に改善したと説明する。100万トークン当たりのコストも、およそ100元から10元未満へ下がったとしている。9
11
ただし、これは運営側が公表した導入結果であり、あらゆるTPUや推論基盤に当てはまるベンチマークではない。対象モデル、演算精度、バッチサイズ、利用トラフィック、稼働率、コスト算定方法は開示されていないため、第三者が再現したり、他の推論基盤と厳密比較したりすることは現時点ではできない。
このプロジェクトは、通常は別々に評価されがちなチップ、通信・ネットワーク、運用基盤を結び付けた。
国産AIチップにとって、通信事業者の環境で動かす意義は大きい。問われるのはチップ単体のピーク性能ではなく、モデル適合、リソース配分、ネットワーク挙動、継続的な運用を含め、利用者が予測可能な推論能力を得られるかどうかだからだ。プロジェクトは、計算資源、スケジューリング、モデル適応、運用管理、業界向けアプリケーションという5層の能力構成を掲げている。18
TPUは、テンソル演算に特化したAIアクセラレータである。大規模モデルの学習や推論で中心となる行列演算を効率よく処理することが期待される。
一方、クラスタ規模では、性能はピークFLOPSだけで決まらない。相互接続、メモリの使い方、集団通信、スケジューリング、信頼性、モデルや推論エンジンとの互換性が実用性を左右する。
国産代替基盤が証明すべきことは、シリコンが動作することだけではない。モデル、推論エンジン、演算子、量子化手法、顧客側のワークフローが新しいスタックで安定して動く必要がある。今回の報道は杭州での導入と拡張計画を裏付ける一方、主流GPUのソフトウェアエコシステムと、幅広いモデル・フレームワークで同等の互換性があることまでは示していない。
3社は第2期として、中昊芯英の第2世代TPU「須臾(Xuyu)」を導入し、総演算能力を1万PFLOPS超へ拡張する計画だ。17
19
同社の公表値では、須臾は混合精度浮動小数点性能が896TFLOPS、8ビット推論性能が1,792TOPS、定格消費電力は600W。刹那の約3倍の性能で、同等性能の従来型チップに比べ消費電力を50%下げられるとしている。これらは企業側が示した仕様・主張である。19
20
また同社の説明では、須臾は最大2,048基を全光接続するスーパーノードを想定している。20
このプロジェクトが示したのは、アクセラレータ、命令セット、サーバー、ネットワーク、スケジューリング、サービス運用までを、チップからプラットフォームへと一体で組み上げようとする試みだ。18
19
本当の評価は、多様な実運用ワークロードを、互換性のあるソフトウェア、安定した性能、説明可能な経済性とともに継続して処理できるかにかかっている。400PFLOPSの導入と須臾への拡張計画は広く報じられている。一方で、トークン出力効率10倍超、100万トークン当たり10元未満という目を引く数字は、ベンチマーク手法や負荷条件が開示されるまでは、事業者・参加企業による報告値として受け止めるのが適切だ。9
11
Studio Global AI
このページにはソースに裏付けされた回答が含まれており、Studio Global 内で続行できます。
中国電信杭州分公司、中興通訊、中昊芯英は、「泰則」プラットフォーム上で第1世代「刹那」TPU 1,024基を導入し、400PFLOPSのクラスタを構築した。[17][20]
中国電信杭州分公司、中興通訊、中昊芯英は、「泰則」プラットフォーム上で第1世代「刹那」TPU 1,024基を導入し、400PFLOPSのクラスタを構築した。[17][20] 杭州電信は、Prefill・Decode分離を含む数か月のソフト・ハード最適化により、トークン出力効率が年初比で10倍超に向上し、100万トークン当たりのコストが約100元から10元未満になったと報告している。[9][11]
第2期では第2世代「須臾」TPUを採用し、総演算能力を1万PFLOPS超へ拡張する計画。公表値では混合精度896TFLOPS、8ビット推論1,792TOPS、定格消費電力600Wとされる。[17][19]