AMD הציגה את תוצאת תפוקת הטוקנים המצטברת הגדולה ביותר עם מערך של 512 מאיצי MI355X, בעוד NVIDIA פרסמה תוצאות תצוגה מקדימה ל Vera Rubin — עד פי 3.7 מהתפוקה של GB300 NVL72 בעומס Qwen3 VL. הסבב כלל שיא של 30 ארגונים מגישים ו 486 תוצאות למרכזי נתונים ולמחשוב קצה, והוסיף מבחני RAG מקצה לקצה והסקת מסקנות סוכנית בקצה.
פורסם על ידינערך באמצעות GPT-5.6 Terraהתמונות נוצרו באמצעות GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What were the key results and broader implications of MLCommons’ MLPerf Inference v6.1 benchmarks, including AMD’s record-setting MI355X per. Article summary: MLPerf Inference v6.1 showed a more competitive and more deployment-oriented inference market: AMD set aggregate-scale records, NVIDIA demonstrated its next platform while retaining strong Blackwell results, Intel broade. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
MLPerf Inference v6.1 אינו עוד טבלת דירוג של שבב יחיד, אלא תמונת מצב של שינוי באופן שבו מגישים מודלי AI למשתמשים. האותות הבולטים בסבב היו ההגשה רחבת-ההיקף של AMD עם MI355X, נתוני התצוגה המקדימה הראשונים של NVIDIA ל-Vera Rubin, הרחבת הכיסוי של אינטל להסקה נגישה יותר, ומבחנים חדשים ליצירה מועצמת-אחזור (RAG) ולסוכני AI בקצה.
המסקנה פשוטה: יחידת ההשוואה השימושית כבר אינה רק GPU, אלא מערכת הגשה שלמה, זמינה ורלוונטית לעומס העבודה — תוך עמידה בדרישות השהיה.
הכותרת של AMD הגיעה מתצורת Crusoe הכוללת 512 מאיצי Instinct MI355X, שהציגה את נתוני תפוקת הטוקנים המצטברים הגבוהים ביותר שדווחו בסבב v6.1. 5 זו הדגמה משמעותית של קנה מידה: היא בוחנת לא רק את ביצועי המאיץ, אלא גם הסקה מבוזרת, רשת ואינטגרציית מערכת בפריסה עצומה.
ועדיין, אין זו הכרזה גורפת על עליונות פלטפורמה. אין להשוות ישירות תוצאה מצטברת של 512 GPUs למתלה יחיד או לאשכול קטן יותר בלי לנרמל לפי מספר המאיצים, המודל, תרחיש הבנצ'מרק ודרישות רמת השירות. תפוקה מצטברת היא מדד נכון לצי הסקה גדול; בפריסה מסוימת עשויים להיות חשובים יותר התפוקה לכל מאיץ, צפיפות המתלה, צריכת החשמל, זמינות המערכת ומורכבות התפעול.
הטענה של AMD היא גם סיפור תוכנה. החברה הדגישה שיפור ביצועים של אותו חומרת MI355X לעומת סבב MLPerf הקודם, וייחסה אותו לאופטימיזציות ב-ROCm. המשמעות הרחבה ברורה: מהדרים, קרנלים, זמני ריצה למודלים ותוכנות להגשה מבוזרת יכולים להגדיל את הקיבולת השימושית של צי קיים, בלי להחליף חומרה.
AMD התחייבה גם לקצב שחרורים של ROCm אחת לשישה שבועות. אם קצב זה יניב שיפורים עקביים שאפשר לפרוס בפועל, מהירות התקדמות התוכנה עשויה להפוך לרכיב מהותי בחישוב עלות לטוקן אצל רוכשים. עם זאת, יש לאמת תוצאות MLPerf מול תמהיל המודלים, שיטות הקוונטיזציה, המסגרת, דפוסי התעבורה ויעדי ההשהיה של כל ארגון; שיפור בבנצ'מרק אחד אינו עובר בהכרח אחד לאחד לסביבת ייצור.
Vera Rubin NVL72 של NVIDIA הופיעה לראשונה ב-MLPerf Inference כהגשת תצוגה מקדימה. NVIDIA דיווחה על תפוקה גבוהה עד פי 3.7 מ-GB300 NVL72 ב-Qwen3-VL, ותיארה הגשת GB300 NVL72 בת 288 GPUs שהשיגה יעילות סקיילינג של 99% בארבעה מתלים. 2
ההסתייגות החשובה היא זמינות. תוצאות תצוגה מקדימה הן עדות שימושית לכיוון הארכיטקטוני ולבשלות התוכנה, אך אינן השוואת רכש ישירה למערכות הזמינות באופן כללי. גם גדלי האשכולות בהגשות התצוגה המקדימה היו שונים, ולכן השוואה לכל GPU — או השוואה מנורמלת אחרת — מלמדת יותר מתפוקת המערכת הכוללת בלבד. 8
Blackwell ו-Blackwell Ultra נותרות מרכזיות בפריסות הקרובות. לדוגמה, CoreWeave דיווחה על תוצאות מובילות בקרב ספקיות ענן בכמה תצורות Blackwell ו-Blackwell Ultra, בעומסי Qwen3-VL, DeepSeek-R1 ו-GPT-OSS-120B. 4 המסקנה המעשית היא פילוח, ולא מנצחת יחידה: קיבולת מצטברת באשכול גדול, הגשה בקנה מידה של מתלה, הסקה מולטימודלית והשהיה אינטראקטיבית עשויות להעדיף תצורות שונות.
ההגשות של אינטל הרחיבו את הנראות של הסקה על CPUs ועל GPUs בתחנות עבודה. צומת Arc Pro B70 עם ארבעה GPUs כלל 128GB של זיכרון וידאו והגיש תוצאות עבור Llama, GPT-OSS-120B, Whisper ועומס ה-RAG החדש מקצה לקצה. אינטל דיווחה גם על שיפורים שמקורם בתוכנה באותה תצורת Arc Pro B70 לעומת הסבב הקודם. 3
אין פירוש הדבר ש-Arc Pro הוא תחליף ישיר לאשכולות מאיצים בהיקף היפרסקייל. אך הבנצ'מרק נעשה מייצג יותר עבור ארגונים הבוחנים פריסות קטנות, זולות או גמישות יותר — במיוחד כשקיבולת זיכרון, הסקה מקומית או תשתית שרתים קיימת משפיעות על ההחלטה.
MLCommons דיווחה על שיא של 30 ארגונים מגישים ו-486 תוצאות למרכזי נתונים ולמחשוב קצה ב-v6.1. החבילה הוסיפה בנצ'מרק RAG מקצה לקצה למרכזי נתונים ובנצ'מרק Edge Agentic Inference, המשקפים את המעבר מאינטראקציות חד-פעמיות עם מודל ליישומי AI מרובי שלבים. 9
ההרחבה הזו חשובה מפני שעומסים סוכניים חושפים צווארי בקבוק שמבחן תפוקת טוקנים לא מקוון רגיל עלול להחמיץ: אינטראקציות מרובות פניות, שימוש בכלים, עלויות תקורה של תזמור ותגובתיות בין שלבים. MLCommons מתארת את מבחן הקצה ככזה שמשקף משימות מורכבות ורב-שלביות, כגון תכנות סוכני. 9
אלו עדיין בנצ'מרקים מבוקרים, ולא ייצוג מלא של שירותי ייצור חיים. ובכל זאת, הם מקרבים את ההערכה לסוגי עומסי העבודה שצוותים רבים מנסים כעת לפרוס.
MLCommons הציגה גם תצוגה מקדימה של MLPerf Endpoints ככיוון אפשרי להמשך. ההבחנה המרכזית היא בין הגשות בנצ'מרק תקופתיות לבין ביצועים נצפים של נקודות קצה פעילות להגשת מודלים. תוכנית בשלה הממוקדת בנקודות קצה עשויה להדגיש יותר התנהגות תחת עומס, עקביות השהיה, זמינות והדירות תפעולית — ולא רק תוצאת שיא בריצה קבועה של בנצ'מרק.
בשלב זה, רוכשים צריכים לראות בכך כיוון מדידה מתהווה, ולא תחליף סופי לתהליך ההגשה הקיים. תוצאות v6.1 עצמן מבהירות מדוע מהלך כזה עשוי להיות בעל ערך: איכות הפריסה תלויה בהרבה יותר ממספר הטוקנים המרבי לשנייה.
MLPerf v6.1 מספק ראיות חזקות לכך שהתחרות בתחום ההסקה מעוצבת בידי שלושה גורמים מחוברים: יכולת המאיץ, שיפור תוכנה ואינטגרציית מערכות. ההגשה הגדולה של AMD עם MI355X מדגימה את חשיבות קנה המידה; תצוגת Vera Rubin של NVIDIA מסמנת את הצעד הבא בביצועים, בזמן ש-Blackwell משרתת פריסות עכשוויות; תוצאות Arc Pro B70 של אינטל מרחיבות את מגוון החומרה המיוצגת; והמבחנים החדשים של MLCommons מכירים בכך ש-RAG וסוכנים מציבים דרישות ביצועים אחרות.
בהערכת פלטפורמה, כדאי להתחיל בעומס העבודה וביעד התפעולי: המודל, אורך ההקשר, מקביליות, יעד השהיה, מעטפת החשמל, גודל הפריסה והעלות לכל פלט שימושי. רק לאחר מכן יש להשוות מערכות בקנה מידה ובדרגת זמינות מקבילים. זו גישה מועילה יותר מלהתייחס לכל כותרת MLPerf יחידה כאל תשובה אוניברסלית.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
AMD הציגה את תוצאת תפוקת הטוקנים המצטברת הגדולה ביותר עם מערך של 512 מאיצי MI355X, בעוד NVIDIA פרסמה תוצאות תצוגה מקדימה ל Vera Rubin — עד פי 3.7 מהתפוקה של GB300 NVL72 בעומס Qwen3 VL.
AMD הציגה את תוצאת תפוקת הטוקנים המצטברת הגדולה ביותר עם מערך של 512 מאיצי MI355X, בעוד NVIDIA פרסמה תוצאות תצוגה מקדימה ל Vera Rubin — עד פי 3.7 מהתפוקה של GB300 NVL72 בעומס Qwen3 VL. הסבב כלל שיא של 30 ארגונים מגישים ו 486 תוצאות למרכזי נתונים ולמחשוב קצה, והוסיף מבחני RAG מקצה לקצה והסקת מסקנות סוכנית בקצה.
עבור רוכשי תשתיות, שיפורי תוכנה על חומרה קיימת, זמינות מערכת ויכולת פריסה עקבית חשובים לא פחות ממפרט המאיץ עצמו.