ב 12 ביוני 2026, פורסמו התוצאות הראשונות של AA AgentPerf, בנצ'מרק החומרה הפתוח והרב ספקי הראשון בעולם שתוכנן במיוחד לעומסי AI סוכני – לא להשלמת טקסט פשוטה [4]. המדד בוחן כמה סוכני תכנות AI יכולים לרוץ במקביל על מערכת הסקה, תוך עמידה ביעדי שירות מוגדרים מראש (SLO) למהירות הפקת טקסט וזמן תגובה ראשוני [4].

Create a landscape editorial hero image for this Studio Global article: What did Nvidia achieve in the first published results of Artificial Analysis's AgentPerf benchmark, what does this new benchmark measure, a. Article summary: Here are the key findings from the first published results of Artificial Analysis's **AA-AgentPerf** benchmark, announced on June 12, 2026.. Topic tags: general, documentation, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject "We measure real-world performance of AI accelerator systems during language model inference. ## AA-AgentPerf: The Hardware Benchmark for the Agent Era. AA-AgentPerf has been shaped" source context "AI Hardware Benchmarking & Performance Analysis" Reference image 2: visual subject "For years, co-founder and chief executive officer Jensen Huang and other higher-ups at Nvidia have
AA-AgentPerf, פרי פיתוח של חברת המחקר Artificial Analysis, הוא לא סתם עוד בנצ'מרק ביצועים. מדובר במדד החומרה הפתוח והרב-ספקי הראשון בעולם שתוכנן מהיסוד למדידת עומסי עבודה של בינה מלאכותית סוכנית (Agentic AI). בניגוד למדדים מסורתיים שמודדים כמה מהר מודל שפה יכול להשלים טקסט (Single-turn chat), AgentPerf בוחן תרחישים מורכבים מהעולם האמיתי .
מהות המדד היא השאלה: כמה סוכני AI עצמאיים יכולים לרוץ במקביל על מערכת הסקה (Inference) נתונה, תוך שהם עדיין מספקים ביצועים סבירים למשתמש הקצה? המדד מגדיר "ביצועים סבירים" באמצעות יעדי רמת שירות (Service Level Objectives, SLO) הכוללים שני פרמטרים מרכזיים:
הבנצ'מרק אינו מבוסס על שאילתות סינתטיות. צוות Artificial Analysis לקח מסלולי עבודה (Trajectories) אמיתיים של סוכני תכנות AI, שמקורם במאגרים ציבוריים, הכתובים ביותר מ-12 שפות תכנות שונות. כל מסלול עבודה כולל שרשרת ארוכה של קריאות למודל השפה (LLM), קריאות לכלים חיצוניים (Tool Calls) שדורשות השהיות מעבד (CPU) מדומות, וחלונות קונטקסט (Context Windows) שהולכים וגדלים ככל שהסוכן עובד . כדי לאפשר השוואה הוגנת בין טכנולוגיות שונות, התוצאות הסופיות מנורמלות ליחידת מאיץ (לכל GPU) וליחידת צריכת חשמל (לכל מגה-ואט - MW).
בסבב התוצאות הראשון, שפורסם ב-12 ביוני 2026, פלטפורמת Nvidia GB300 NVL72, המבוססת על ארכיטקטורת Blackwell Ultra, הציגה דומיננטיות ברורה. עיקר הממצאים:
התוצאות הללו אינן אירוע בודד, אלא חלק ממהלך אסטרטגי רחב ומתואם היטב של אנבידיה, שמטרתו למצב את Blackwell Ultra כפלטפורמה ההכרחית לעידן ה-AI הסוכני בקנה מידה גדול.
אנבידיה מייחסת את השיפור הדרמטי של פי 20 ליכולתה לבצע תכנון-משותף (Co-design) קיצוני בין חומרה ותוכנה. החברה מדגישה שילוב של מספר טכנולוגיות מפתח :
AgentPerf הוא נדבך נוסף בשליטה של אנבידיה על עולם מדדי הביצועים. לפניו, ארכיטקטורת Blackwell Ultra כבר קבעה שיאים במקצי הסקה (Inference) ואימון (Training) המסורתיים של MLPerf. במדד MLPerf Inference v5.1, הפלטפורמה הציגה שיפור של 40% בתפוקת DeepSeek-R1 לעומת דגם Blackwell הקודם . במדד MLPerf Training v5.1, היא לא רק ניצחה, אלא טאטאה את כל שבעת הבנצ'מרקים, כולל אימון מודל Llama 3.1 405B תוך 10 דקות בלבד
. הישגי AgentPerf מוסיפים כעת מימד קריטי של ביצועי AI סוכני, ומשלימים תמונה של עליונות טכנולוגית כמעט בכל זירה.
אנבידיה אינה מסתפקת בניצחונות מעבדתיים. החברה מצביעה על שותפויות קונקרטיות בהן חומרת Blackwell כבר משרתת עומסי עבודה סוכניים. לדוגמה, חברת Together AI משתמשת ב-Blackwell כדי להניע את היכולות הסוכניות של כלי הפיתוח Cursor, ו-DeepInfra משתמשת בפלטפורמה כדי להפעיל את "כוח העבודה" הוירטואלי של Pam.ai . הציטוטים האלה מחזקים את הטענה שהפלטפורמה מוכנה לעולם הייצור (Production-Ready), ולא רק חזקה על הנייר.
הפוסט בבלוג של אנבידיה לא מסתיר את העובדה שהמירוץ רק החל. הוא מרמז במפורש על הארכיטקטורה הבאה בתור, Vera Rubin, שכבר נמצאת בשלבי ייצור וצפויה לקחת את יכולות ה-AI הסוכני צעד נוסף קדימה . המסמך הטכני המעמיק של AgentPerf גם הוא מספק הצצה לעתיד, עם תחזיות לשיפורים נוספים שיגיעו מכוח מחשוב של 50 PFLOPs בחישובי NVFP4 ומהאצה משופרת של קריאות כלים (Tool Calls)
.
סיבוב התוצאות הראשון של AgentPerf הוא הרבה יותר מסתם ניצחון בנצ'מרק עבור אנבידיה. הוא מספק מדד אובייקטיבי ראשון מסוגו, שמראה עד כמה ארכיטקטורת Blackwell Ultra מתאימה לעומס העבודה שנחשב לעתיד התחום: AI סוכני. תוצאת הפי 20 במספר הסוכנים למגה-ואט, בשילוב עם אופטימיזציות ייעודיות לאורך כל מחסנית המחשוב, ממחישה את ההובלה הטכנולוגית של אנבידיה במעבר מעוזרים חכמים, לסוכנים אוטונומיים בעולם התוכנה הארגונית.
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
ב 12 ביוני 2026, פורסמו התוצאות הראשונות של AA AgentPerf, בנצ'מרק החומרה הפתוח והרב ספקי הראשון בעולם שתוכנן במיוחד לעומסי AI סוכני – לא להשלמת טקסט פשוטה [4].
ב 12 ביוני 2026, פורסמו התוצאות הראשונות של AA AgentPerf, בנצ'מרק החומרה הפתוח והרב ספקי הראשון בעולם שתוכנן במיוחד לעומסי AI סוכני – לא להשלמת טקסט פשוטה [4]. המדד בוחן כמה סוכני תכנות AI יכולים לרוץ במקביל על מערכת הסקה, תוך עמידה ביעדי שירות מוגדרים מראש (SLO) למהירות הפקת טקסט וזמן תגובה ראשוני [4].
בנצ'מרק מבוסס על מסלולי עבודה אמיתיים של סוכני תכנות משפות תכנות שונות, ומשלב קריאות LLM מרובות, קריאות כלים (עם השהיות CPU מדומות) וחלונות קונטקסט הולכים וגדלים [4].