במבחני AgentX, Nvidia הייתה יעילה עד פי 5 בעלות מ AMD ב GLM 5.3 בקצב של 150 טוקני פלט לשנייה למשתמש, והציגה יותר מפי 20 ביצועים ב Qwen 3.5 בקצב של 90 טוקנים לשנייה למשתמש. היתרון נבע מהשילוב בין חומרה, קיבולת זיכרון, שימוש חוזר נרחב במטמון, ניהול העברה לזיכרון מארח ותוכנות הגשה כמו TensorRT LLM — ולא ממפרט חומרה יחיד.
Research answer

Create a landscape editorial hero image for this Studio Global article: What did SemiAnalysis’s open-source AgentX 1.0 benchmark, released on August 24 as part of InferenceX v3 and based on 393 anonymized Claude. Article summary: AgentX’s main finding was not that Nvidia always wins, but that on the tested, realistic long-context coding-agent traces, Nvidia’s hardware-plus-serving stack held a large advantage in the broadly deployable SGLang conf. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
מבחן AgentX 1.0 של חברת המחקר SemiAnalysis מצביע על כך של-Nvidia עדיין יש יתרון משמעותי בתשתית החומרה והתוכנה שלה להרצת סוכני קוד עם הקשרים ארוכים במיוחד. בתצורות SGLang שנבדקו, היתרון הגיע לעד פי 5 ביעילות העלות של Nvidia מול AMD ב-GLM 5.3, וליותר מ-פי 20 בביצועים ב-Qwen 3.5 ביעד של 90 טוקני פלט לשנייה למשתמש. 26
עם זאת, אין מדובר בדירוג אוניברסלי שבו Nvidia מנצחת את AMD בכל תרחיש. AgentX מודד שילוב מסוים של מודל, מאיץ, מנוע הרצה, עומס עבודה, רמת מקביליות ויעד תגובתיות. בתצורות מסוימות ה-MI355X של AMD, יחד עם מנוע ההגשה ATOM, הציג תוצאות תחרותיות ואף עדיפות; בנוסף, עדכוני תוכנה שינו את הדירוג בין מערכות שונות. 14
AgentX 1.0 הוא חלק מחבילת InferenceX v3 של SemiAnalysis. בניגוד למבחני הסקה קונבנציונליים, שמסתמכים על אורך קבוע של קלט ופלט — למשל 8,000 טוקנים של קלט ו-1,000 טוקני פלט — AgentX משחזר תעבורת עבודה של סוכני קוד רב־תוריים, עם הקשרים שעשויים להתקרב למיליון טוקנים. 13
מערך הנתונים כולל 393 סשנים אנונימיים של Claude Code, שנאספו בהסכמה. הסשנים שנכללו הכילו לפחות 20 בקשות, ועברו עיבוד להסרת בקשות כפולות, קריאות מסוימות הספציפיות ללקוח וקלטים משוחזרים שאורכם עולה על 990,000 טוקנים. הבקשה החציונית כללה 142,000 טוקני קלט ו-444 טוקני פלט, וב-44% מהסשנים הופעלו תתי־סוכנים. 8
הדפוס הזה חשוב משום שסוכן קוד שולח שוב ושוב גרסאות מתעדכנות של אותה שיחה או של אותו בסיס קוד. לכן המבחן בוחן בעיקר שירות אינטראקטיבי רציף — לא בקשה יחידה עם פרומפט ארוך ותשובה ארוכה.
הפער הברור ביותר הופיע בהשוואות שהתבססו על תצורות SGLang זמינות יחסית:
חשוב לקרוא את המספרים האלה כהשוואות בנקודת הפעלה מוגדרת — לא כציון יחיד לכל קו המוצרים של Nvidia או AMD. InferenceX משווה בין פלטפורמות ברמות מוגדרות של אינטראקטיביות, ומחשב את העלות לפי מעטפת ההגשה שנצפתה בפועל בכל פלטפורמה. 79
המשמעות המעשית היא שמבחן קבוע של 8,000 טוקני קלט ו-1,000 טוקני פלט עלול לפספס צווארי בקבוק מכריעים בעומסי עבודה של סוכנים. מאיץ יכול להיראות תחרותי בתפוקה מבודדת, אך להישאר מאחור כאשר הוא נדרש לשמור על תגובתיות עבור משתמשים רבים עם הקשרים גדולים וחלקית־חוזרים.
בעומסי AgentX חלק גדול מההקשר חוזר מבקשה לבקשה. SemiAnalysis מתארת שיעורי פגיעה במטמון הקידומת, או KV-cache, שלרוב עולים על 95% במסלולי העבודה הסוכניים. 1
במצב כזה המערכת אינה מעבדת בכל פעם פרומפט חדש לחלוטין. היא שומרת ומרחיבה מצבים גדולים שכבר חושבו, ובמקביל מייצרת תשובות קצרות יחסית. לכן היכולת לאחסן, לאתר, להעביר ולמחזר את המצבים האלה הופכת לגורם מרכזי בתפוקה ובעלות.
קיבולת זיכרון ה-DRAM המהיר והשמיש קובעת כמה ממידע ה-KV-cache יכול להישאר על המאיץ. כאשר סביבת העבודה חורגת מזיכרון ההתקן, מערכות ההגשה עשויות להעביר נתונים לזיכרון המארח או לנהל את המטמון דרך נתיב איטי יותר. 1
העברה לזיכרון מארח מאפשרת לתמוך במספר גדול יותר של סשנים, אך היא מוסיפה עלויות של רוחב פס והשהיה. פלטפורמה שמחזיקה יותר מהמטמון הפעיל בזיכרון המקומי — או מנהלת את תנועת הנתונים ביעילות רבה יותר — יכולה לשמור על רמת אינטראקטיביות גבוהה יותר באותה עלות.
SemiAnalysis הדגישה גם את מנגנון הטוקניזציה האינקרמנטלית ומודעות הגבולות של TensorRT-LLM. במקום לבצע טוקניזציה מחדש לכל הפרומפט המתפתח, המערכת מזהה גבולות יציבים ומעבדת רק את החומר שנוסף. 1
האופטימיזציה הזו רלוונטית במיוחד לסוכני קוד: הבקשות עשויות להכיל הקשרים עצומים, אך לייצר רק כמה מאות טוקנים. לכן עיבוד מקדים בצד המעבד והטוקניזציה החוזרת עלולים להפוך לחלק משמעותי מעלות ההגשה.
המסקנה הרחבה היא שביצועי הסקה ביחס למחיר הם תוצאה של חומרה × מנוע הרצה × מודל × עומס עבודה × יעד השהיה. מספר יחיד של FLOPS, רוחב פס זיכרון או טוקנים לשנייה אינו מתאר את התמונה כולה.
AgentX לא הראה ניצחון גורף של Nvidia. SemiAnalysis דיווחה על ניצחונות משמעותיים של AMD או על כמעט־שוויון בשילובים מסוימים של מודל, תפוקה ומנוע — בעיקר כאשר ה-MI355X שולב עם מנוע ההגשה ATOM של AMD. 1
הטלמטריה מפרידה בין תוצאות MI355X ב-ATOM, ב-SGLang, ב-vLLM ובתצורות אחרות. ההפרדה הזו קריטית: “התוצאה של AMD” תלויה במידה רבה במנוע ההגשה, במימוש המודל ובכיוונון שנבחרו במבחן. 4
התזמון הייעודי, ניהול המטמון והקרנלים המותאמים ל-AMD של ATOM יכולים להציג ביצועים חזקים כאשר המודל ועומס העבודה מתאימים לתצורת הזיכרון של MI355X. כלומר, AMD יכולה להיות תחרותית מאוד כאשר המפעיל מוכן להשתמש במנוע הרצה שמותאם במיוחד לפלטפורמה.
מנוע ייעודי יכול להדגים מה החומרה מסוגלת לעשות בתנאים מיטביים. אך רוכשי תשתיות זקוקים בדרך כלל ליותר מתוצאת שיא של קרנל יחיד: הם צריכים גם תמיכה במודלים, קצב שחרור גרסאות, כלי פיתוח, מומחיות בהטמעה ודרך תפעול שאפשר לתחזק לאורך זמן.
SemiAnalysis מסרה שהמתכונים שלה מתבססים בעיקר על ההנחיות של גרסאות ה-upstream של vLLM ו-SGLang, כדי למדוד תצורות שלקוחות יכולים לפרוס באופן מציאותי — ולא להסתמך רק על מחסנית שנבנתה במיוחד עבור המבחן. 1
לכן עבור רוב הרוכשים ששוקלים AMD, ההשוואה הרלוונטית יותר היא ביצועים ב-vLLM וב-SGLang upstream, עם גרסאות רגילות, כיסוי מודלים וכלי תפעול מקובלים. ATOM הוא עדות חשובה לכך שחומרת AMD יכולה לספק ביצועים חזקים בסביבת תוכנה מתאימה, אך אין להשוות את תוצאתו אוטומטית לזו שניתן להשיג במנוע upstream נפוץ.
זו הבחנה הנוגעת לאימוץ ולזמינות תוכנה — לא טענה ש-ATOM אינו תקף או שמנועים ייעודיים חסרי ערך.
המבחן ממחיש גם מדוע השוואות הסקה מתיישנות במהירות. בטלמטריה מופיעה תצורת MI355X MoRI/SGLang מ-21 באוגוסט, לצד תצורות AMD אחרות שנמדדו בתאריכים שונים. 4
עדכון תוכנה מ-21 באוגוסט שינה את סדר התוצאות בהשוואה אחת לפחות. הדבר מדגים כיצד שיפורים בתזמון, בקרנלים, בתנועת מטמון ובתמיכה במודלים יכולים לשנות את היררכיית החומרה בתוך ימים. 14
עבודה קודמת של SemiAnalysis על MI355X ו-Qwen 3.5 מספקת אזהרה דומה: גרסאות SGLang עוקבות הובילו לשיפורי ביצועים משמעותיים לאורך תקופה של 13 שבועות. 12
עבור רוכשים, המסקנה המעשית היא לתעד את גרסת מנוע ההרצה, התצורה, קוונטיזציית המודל, טווח המקביליות ויעד האינטראקטיביות המדויק בעת השוואת מאיצים. פסק דין על חומרה ללא ההקשר הזה עלול להפוך במהירות למטעה.
AgentX הוא מדד שימושי לעומסי עבודה של סוכני קוד ארוכי־הקשר, אך אינו מפקד מייצג של כל עומס עבודה ייצור. מערך הנתונים מבוסס על מאגר פנימי של מסלולים שנאספו בהסכמה, וכולל 393 סשנים נבחרים — לא את כלל התעבורה של סוכנים בארגונים. 8
התוצאות עשויות להיות שונות ב:
גם Google TPU לא נכלל במערך ההשוואה הראשוני, ולכן AgentX 1.0 אינו יכול לקבוע מסקנה משולשת בין Nvidia, AMD ו-Google. 1
ההשוואה גם מתפתחת כל הזמן. SemiAnalysis ציינה את Rubin של Nvidia, את MI455X UALoE72 של AMD ואת מערכות ה-TPU החדשות כתוספות עתידיות או קרובות. הכללתן עשויה לשנות את התמונה התחרותית. 111
SemiAnalysis שחררה את מערך הנתונים, את כלי ההרצה, את התצורות, את הטלמטריה וחומרים נלווים תחת רישיון Apache 2.0. 1
ייתכן שהחשיבות ארוכת הטווח של AgentX תהיה פחות בכותרת אחת של “Nvidia מול AMD”, ויותר בעבודה ההנדסית שהוא מעודד. לפי SemiAnalysis, AgentX כבר הפך לעומס יעד עבור יותר מ-70 בקשות מיזוג upstream בפרויקטים ובהם vLLM, SGLang, TensorRT-LLM, ATOM, AITER, Dynamo, LMCache ו-Mooncake. 1
כך מקבלים מפתחי מנועי ההגשה דרך ניתנת לשחזור לשפר את המערכות עבור התנהגות אמיתית של סוכנים: שימוש חוזר נרחב בקידומות, מטמוני KV גדולים, תורות קצרות רבות, תתי־סוכנים, העברת מטמון, עומס תזמון ועלויות טוקניזציה.
AgentX מחזק את הטענה שמחסנית התוכנה ומערך ההגשה של Nvidia הם עדיין יתרון מרכזי בהרצת סוכני קוד עם הקשרים ארוכים. בהשוואות SGLang שנבדקו, הדיווח הצביע על יתרון של עד פי 5 ביעילות העלות ב-GLM 5.3 ויותר מ-פי 20 בביצועים ב-Qwen 3.5 ביעד אינטראקטיביות מוגדר. 26
אך המבחן אינו מוכיח ש-Nvidia תמיד מנצחת. ה-MI355X של AMD ו-ATOM הראו שביצועי מחיר תחרותיים — ולעיתים טובים יותר — אפשריים בתצורות ייעודיות, בעוד ששיפורים מהירים בתוכנת ההגשה יכולים להפוך את הדירוגים.
לכן המסקנה השימושית ביותר עבור צוותי תשתית אינה לבחור מנצחת על סמך מספר כותרת יחיד, אלא לשחזר את ההשוואה באמצעות המודל, מנוע ההרצה, התפלגות ההקשרים ויעד ההשהיה שמאפיינים את סביבת העבודה שלהם.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
במבחני AgentX, Nvidia הייתה יעילה עד פי 5 בעלות מ AMD ב GLM 5.3 בקצב של 150 טוקני פלט לשנייה למשתמש, והציגה יותר מפי 20 ביצועים ב Qwen 3.5 בקצב של 90 טוקנים לשנייה למשתמש.
במבחני AgentX, Nvidia הייתה יעילה עד פי 5 בעלות מ AMD ב GLM 5.3 בקצב של 150 טוקני פלט לשנייה למשתמש, והציגה יותר מפי 20 ביצועים ב Qwen 3.5 בקצב של 90 טוקנים לשנייה למשתמש. היתרון נבע מהשילוב בין חומרה, קיבולת זיכרון, שימוש חוזר נרחב במטמון, ניהול העברה לזיכרון מארח ותוכנות הגשה כמו TensorRT LLM — ולא ממפרט חומרה יחיד.
ה MI355X של AMD ומנוע ATOM הציגו ניצחונות או כמעט־שוויון בתצורות מסוימות, אך עבור רוב הרוכשים ההשוואה הרלוונטית יותר היא מול vLLM ו SGLang upstream, ולא מול סביבת הרצה ייעודית ומותאמת במיוחד.