China Telecom’un Hangzhou birimi, ZTE ve Zhonghao Xinying; Taize platformu üzerinde 1.024 Chana TPU’dan oluşan, 400 PFLOPS kapasiteli bir küme kurdu. Şirketler, Prefill–Decode ayrımı ve aylar süren donanım yazılım optimizasyonuyla token üretim veriminin 10 kattan fazla arttığını; milyon token maliyetinin yaklaşık 10...
Research answer

Create a landscape editorial hero image for this Studio Global article: How did China Telecom’s Hangzhou branch, ZTE, and Zhonghao Xinying deploy China’s first domestic 1,024-chip Chana TPU cluster delivering 400. Article summary: China Telecom’s Hangzhou branch, ZTE, and Zhonghao Xinying built the first phase as a production-oriented, fully domestic TPU stack rather than merely installing accelerators: 1,024 first-generation Chana TPUs were integ. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Hangzhou’daki kurulumun önemini yalnızca 1.024 çip sayısı açıklamıyor. Asıl mesele, bu çiplerin çevresine inşa edilen bütünleşik sistem: China Telecom’un Hangzhou birimi, ZTE ve Zhonghao Xinying; ilk nesil Chana TPU’ları Taize hesaplama platformu, sunucular, küme ağı ve kaynak zamanlama yazılımıyla birleştirerek 400 PFLOPS’luk bir sistem kurdu. Sistem; büyük model eğitimi, yapay zekâ çıkarımı ve bilimsel hesaplama için tasarlandı. Haberlerde bu proje, China Telecom bünyesindeki ilk büyük ölçekli yerli TPU kümesi ve Doğu Çin’deki ilk yerli bin-kart TPU kümesi olarak tanımlanıyor. 17
20
İlk faz, Zhonghao Xinying’in Taize platformu üzerinde çalışan 1.024 Chana TPU’dan oluşuyor. Ortaklar; hızlandırıcı çipten sunucu donanımına, küme ağından hesaplama zamanlamasına uzanan katmanlarda yerli bileşenler kullandıklarını belirtiyor. 17
18
Bu ayrım önemli: Büyük bir yapay zekâ kümesi, aynı rafa çok sayıda hızlandırıcı yerleştirmekten ibaret değil. Gerçek kullanımda alınan performansı; sunucular, ağ dokusu, model yazılımı ve zamanlayıcının birlikte ne kadar verimli çalıştığı belirliyor. Projenin hedefi de TPU’yu tek başına bir çip gösteriminden çıkarıp işletilebilir bir hesaplama hizmetine dönüştürmek. 18
Büyük dil modeli çıkarımı iki farklı aşamadan oluşur:
Bu iki aşamanın kaynak tüketim profili aynı değildir. Ayrıştırılmış bir mimari, istem işleme ile çıktı üretimi için kapasiteyi ayrı ayrı tahsis edip zamanlayabilir; böylece tüm iş yükünü tek bir cihaz havuzuna ve tek bir zamanlama düzenine sıkıştırmak zorunda kalmaz. Bu yaklaşımın üretim ortamında çalışması ise küme orkestrasyonu ve ağ yapılandırması gerektirir; Prefill–Decode ayrımlı SGLang servislerine ilişkin kurulum yönergeleri de buna işaret ediyor. 2
Hangzhou Telecom, model sürümleri, operatörler, sunucu yapılandırmaları, ağ bant genişliği ve zamanlama yöntemlerini kapsayan aylarca süren donanım-yazılım ayarı sonucunda token çıktı veriminin yıl başına göre 10 kattan fazla yükseldiğini açıkladı. Kurum ayrıca milyon token başına maliyetin yaklaşık 100 yuandan 10 yuanın altına düştüğünü bildirdi. 9
11
Ancak bu rakamları evrensel TPU kıyaslamaları olarak değil, işletmecinin bildirdiği saha sonuçları olarak okumak gerekiyor. Açık raporlarda kullanılan model karması, hassasiyet düzeyi, paket boyutu, trafik yapısı, kullanım oranı ya da maliyet hesaplama yöntemi paylaşılmıyor. Bu nedenle tasarruf oranını bağımsız biçimde yeniden üretmek veya başka bir çıkarım platformuyla doğrudan karşılaştırmak mümkün değil.
Küme, çoğu zaman ayrı ayrı değerlendirilen üç yetkinliği bir araya getiriyor:
Yerli bir yapay zekâ çipi açısından böyle bir telekom işletmecisi ortamı değerli; çünkü test odağını çipin tepe teknik özelliklerinden hizmet sunumuna kaydırıyor. Zamanlama, model uyarlama, ağ davranışı ve sürekli işletim; müşterilerin istikrarlı çıkarım kapasitesi alıp almayacağını doğrudan etkiliyor. Projenin mimarisinde hesaplama kaynakları, zamanlama, model uyarlama, operasyon yönetimi ve sektörel uygulamalar açıkça yer alıyor. 18
TPU, tensör işlemleri için tasarlanmış bir yapay zekâ hızlandırıcısıdır. Değeri yalnızca en yüksek FLOPS rakamında değil; büyük model eğitimi ve çıkarımında yaygın olan yoğun matris işlemlerini verimli çalıştırma potansiyelinde yatıyor.
Ne var ki küme ölçeğinde hızlandırıcı performansı; bağlantı altyapısından bellek davranışına, toplu iletişimden zamanlamaya, güvenilirlikten model yazılımı uyumluluğuna kadar birçok unsurdan ayrı düşünülemez.
Dolayısıyla yerli bir alternatifin yalnızca silikonunun çalıştığını kanıtlaması yetmez. Modellerin, çıkarım motorlarının, operatörlerin, kuantizasyon yöntemlerinin ve müşteri iş akışlarının yeni yığında güvenilir biçimde çalışması gerekir. Mevcut haberler Hangzhou kurulumunu ve planlanan genişlemeyi destekliyor; ancak ana akım GPU yazılım ekosistemleriyle farklı model ve çerçeveler genelinde tam eşdeğerlik gösterildiğine dair yeterli kanıt sunmuyor.
Ortaklar, ikinci fazda Zhonghao Xinying’in ikinci nesil Xuyu TPU’sunu kullanmayı ve toplam planlı hesaplama kapasitesini 10.000 PFLOPS’un üzerine çıkarmayı hedefliyor. 17
19
Şirketin bildirdiğine göre Xuyu, karma hassasiyetli kayan nokta işlemlerinde 896 TFLOPS, 8 bit çıkarımda ise 1.792 TOPS performans sunuyor; çipin nominal güç tüketimi 600 W. Şirket ayrıca Xuyu’nun Chana’ya göre yaklaşık üç kat performans sağladığını ve benzer performanstaki geleneksel çiplere kıyasla yüzde 50 daha düşük enerji tükettiğini öne sürüyor. Bunlar şirket tarafından açıklanan teknik değerlerdir. 19
20
Şirketin kamuya açık sunumuna göre Xuyu, tamamen optik bağlantıyla birbirine bağlanmış en fazla 2.048 çiplik süper düğümleri destekleyecek şekilde tasarlandı. 20
Bu proje, çipten platforma uzanan yerli bir yapay zekâ hesaplama yığını kurma çabasını ortaya koyuyor: hızlandırıcı, komut seti, sunucular, ağ, zamanlama ve hizmet operasyonları. 18
19 Asıl sınav ise bu yapının farklı üretim iş yüklerinde yazılım uyumluluğunu, öngörülebilir performansı ve şeffaf maliyet yapısını sürdürülebilir biçimde sunup sunamayacağı olacak.
400 PFLOPS’luk kurulum ve Xuyu tabanlı genişleme planı birçok haberde yer alıyor. Buna karşılık, token çıktı veriminde 10 katı aşan artış ve milyon token başına 10 yuan altı maliyet gibi daha çarpıcı rakamlar; daha yüksek kullanım oranına sahip bir çıkarım sisteminin ulaşmak isteyeceği makul hedefler olsa da, kıyaslama yöntemi ve iş yükü ayrıntıları açıklanana kadar işletmeci ile proje ortaklarının iddiası olarak kalıyor. 9
11
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
China Telecom’un Hangzhou birimi, ZTE ve Zhonghao Xinying; Taize platformu üzerinde 1.024 Chana TPU’dan oluşan, 400 PFLOPS kapasiteli bir küme kurdu.
China Telecom’un Hangzhou birimi, ZTE ve Zhonghao Xinying; Taize platformu üzerinde 1.024 Chana TPU’dan oluşan, 400 PFLOPS kapasiteli bir küme kurdu. Şirketler, Prefill–Decode ayrımı ve aylar süren donanım yazılım optimizasyonuyla token üretim veriminin 10 kattan fazla arttığını; milyon token maliyetinin yaklaşık 100 yuandan 10 yuanın altına indiğini bildiriyor.
İkinci fazda, 896 TFLOPS karma hassasiyet performansı sunduğu belirtilen Xuyu TPU ile toplam kapasitenin 10.000 PFLOPS’u aşması planlanıyor.