China Telecom בהאנגג'ואו, ZTE ו Zhonghao Xinying פרסו 1,024 שבבי Chana TPU על פלטפורמת Taize, בהיקף מוצהר של 400 PFLOPS. השותפים מדווחים על שיפור של יותר מפי 10 בתפוקת טוקנים ועל ירידה מעל כ 100 יואן לפחות מ 10 יואן למיליון טוקנים, לאחר אופטימיזציית חומרה ותוכנה והפרדת Prefill–Decode.
Research answer

Create a landscape editorial hero image for this Studio Global article: How did China Telecom’s Hangzhou branch, ZTE, and Zhonghao Xinying deploy China’s first domestic 1,024-chip Chana TPU cluster delivering 400. Article summary: China Telecom’s Hangzhou branch, ZTE, and Zhonghao Xinying built the first phase as a production-oriented, fully domestic TPU stack rather than merely installing accelerators: 1,024 first-generation Chana TPUs were integ. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
הנתון הבולט בפרויקט בהאנגג'ואו הוא אמנם 1,024 שבבים, אך המשמעות המעשית שלו נמצאת במה שנבנה סביבם. סניף China Telecom בהאנגג'ואו, ZTE ו-Zhonghao Xinying שילבו שבבי Chana TPU מהדור הראשון עם פלטפורמת המחשוב Taize, שרתים, רשת אשכולות ותוכנת תזמון, למערכת בהיקף מוצהר של 400 PFLOPS. היא מיועדת לאימון מודלים גדולים, להסקת AI ולמחשוב מדעי. בדיווחים היא מתוארת כפריסת אשכול ה-TPU המקומי רחבת-ההיקף הראשונה במערך China Telecom, וכאשכול ה-TPU המקומי הראשון במזרח סין בהיקף של אלף כרטיסים. 17
20
השלב הראשון מבוסס על 1,024 שבבי Chana TPU ועל פלטפורמת Taize של Zhonghao Xinying. לפי השותפים, כל שכבות המערכת — המאיץ, חומרת השרתים, רשת האשכולות ותזמון משאבי המחשוב — נבנו מקומית. 17
18
ההבחנה הזו חשובה: אשכול AI גדול אינו רק אוסף של מאיצים. הביצועים שניתן לקבל בפועל תלויים בהתאמה בין השרתים, מארג הרשת, תוכנת המודל ומנגנון התזמון. המטרה המוצהרת כאן היא להפוך את ה-TPU משבב הדגמה לשירות מחשוב שאפשר להפעיל ולנהל. 18
בהסקה של מודלי שפה גדולים יש שני שלבים שונים:
לשני השלבים דרישות משאבים שונות. הפרדה ביניהם מאפשרת להקצות ולתזמן בנפרד את הקיבולת לעיבוד הקלט ואת הקיבולת ליצירת הפלט, במקום לגרום לאותו מאגר מאיצים לשרת את שתי המשימות תחת אותו תזמון. בפריסות ייצור, גישה כזו דורשת גם תזמור אשכולות והגדרות רשת מתאימות. 2
Hangzhou Telecom מסרה כי לאחר חודשים של כוונון חומרה ותוכנה — כולל גרסאות מודל, אופרטורים, תצורות שרתים, רוחב פס רשת ושיטות תזמון — יעילות הפקת הטוקנים עלתה ביותר מפי 10 לעומת תחילת השנה. עוד נמסר כי העלות למיליון טוקנים ירדה מכ-100 יואן לפחות מ-10 יואן. 9
11
חשוב לקרוא את המספרים האלה כתוצאות שדווחו בידי המפעיל, ולא כמדדי TPU אוניברסליים. הדיווחים הזמינים אינם מפרטים את תמהיל המודלים, הדיוק החישובי, גודל האצוות, דפוסי התעבורה, שיעור ניצול החומרה או שיטת חישוב העלות. לכן אי אפשר לשחזר באופן עצמאי את החיסכון הנטען או להשוותו ישירות לפלטפורמת הסקה אחרת.
האשכול מחבר שלוש יכולות שבדרך כלל נבחנות בנפרד:
עבור שבב AI מקומי, סביבת מפעיל כזו מעבירה את המבחן ממפרטי שיא של שבב בודד לאספקת שירות: תזמון, התאמת מודלים, התנהגות הרשת ותפעול שוטף משפיעים כולם על יכולת הלקוחות לקבל קיבולת הסקה יציבה וצפויה. ארכיטקטורת הפרויקט כוללת במפורש משאבי מחשוב, תזמון, התאמת מודלים, ניהול תפעולי ויישומים ענפיים. 18
TPU הוא מאיץ AI המותאם לחישובי טנזורים. הערך שלו אינו נמדד רק בשיא ה-FLOPS, אלא גם ביכולתו להריץ ביעילות עומסים עתירי פעולות מטריצה, הנפוצים באימון ובהסקה של מודלים גדולים. אולם בקנה מידה של אשכול, ביצועי המאיץ תלויים גם בקישוריות, בהתנהגות הזיכרון, בתקשורת הקולקטיבית, בתזמון, באמינות ובתאימות לתוכנת המודלים.
לכן חלופה מקומית צריכה להוכיח יותר מכך שהסיליקון עובד. מודלים, מנועי הסקה, אופרטורים, שיטות קוונטיזציה ותהליכי עבודה של לקוחות צריכים לפעול באופן אמין על המחסנית החדשה. הדיווחים תומכים בקיום הפריסה בהאנגג'ואו ובהרחבה המתוכננת, אך אינם מבססים תאימות רחבה למערכות התוכנה המקובלות סביב GPU, על פני מודלים ומסגרות עבודה שונות.
השותפים מתכננים שלב שני המבוסס על Xuyu, ה-TPU מהדור השני של Zhonghao Xinying, עם היקף מחשוב כולל מתוכנן של יותר מ-10,000 PFLOPS. 17
19
לפי נתוני החברה, Xuyu מספק 896 TFLOPS בחישוב נקודה צפה בדיוק מעורב ו-1,792 TOPS להסקה ב-8 ביט, עם הספק נומינלי של 600 ואט. החברה גם טוענת לביצועים גבוהים בערך פי שלושה מ-Chana ולצריכת חשמל נמוכה ב-50% לעומת שבבים קונבנציונליים בעלי ביצועים דומים. אלה מפרטים שדווחו על ידי החברה. 19
20
ברמת המערכת, Xuyu מתוכנן לסופר-צמתים שבהם עד 2,048 שבבים מחוברים בקישור אופטי מלא, לפי המצגת הציבורית של החברה. 20
הפרויקט מדגים ניסיון להרכיב מחסנית מחשוב AI מקומית, מהשבב ועד הפלטפורמה: מאיץ, מערך הוראות, שרתים, רשת, תזמון ותפעול שירות. 18
19 המבחן המשמעותי יהיה יכולתה של מחסנית זו להחזיק עומסי ייצור מגוונים, עם תוכנה תואמת, ביצועים צפויים וכלכלה שקופה.
פריסת ה-400 PFLOPS וההרחבה המתוכננת עם Xuyu דווחו במספר מקורות. לעומת זאת, הטענות הבולטות יותר — שיפור של יותר מפי 10 ביעילות הפקת הטוקנים ועלות של פחות מ-10 יואן למיליון טוקנים — הן בשלב זה טענות של המפעיל ומשתתפי הפרויקט. הן עשויות לשקף יעד אפשרי במערכת הסקה שמנוצלת טוב יותר, אך ללא מתודולוגיית מדידה ופרטי עומס עבודה, אין להן אימות עצמאי. 9
11
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
China Telecom בהאנגג'ואו, ZTE ו Zhonghao Xinying פרסו 1,024 שבבי Chana TPU על פלטפורמת Taize, בהיקף מוצהר של 400 PFLOPS.
China Telecom בהאנגג'ואו, ZTE ו Zhonghao Xinying פרסו 1,024 שבבי Chana TPU על פלטפורמת Taize, בהיקף מוצהר של 400 PFLOPS. השותפים מדווחים על שיפור של יותר מפי 10 בתפוקת טוקנים ועל ירידה מעל כ 100 יואן לפחות מ 10 יואן למיליון טוקנים, לאחר אופטימיזציית חומרה ותוכנה והפרדת Prefill–Decode.
בשלב השני מתוכנן שימוש ב TPU מדור שני, Xuyu, עם יעד כולל של יותר מ 10,000 PFLOPS.