في اختبارات AgentX، كانت إنفيديا أكثر كفاءة من AMD بنحو 5 مرات على GLM 5.3 عند هدف 150 رمز إخراج في الثانية لكل مستخدم، وتفوقت بأكثر من 20 مرة في الأداء على Qwen 3.5 عند هدف 90 رمزاً في الثانية لكل مستخدم. جاء التفوق من تفاعل سعة الذاكرة، وإعادة استخدام بادئات السياق، وسلوك نقل ذاكرة KV إلى ذاكرة المضيف، وبرمجيات ال...
إجابة البحث

Create a landscape editorial hero image for this Studio Global article: What did SemiAnalysis’s open-source AgentX 1.0 benchmark, released on August 24 as part of InferenceX v3 and based on 393 anonymized Claude. Article summary: AgentX’s main finding was not that Nvidia always wins, but that on the tested, realistic long-context coding-agent traces, Nvidia’s hardware-plus-serving stack held a large advantage in the broadly deployable SGLang conf. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
يقترح اختبار AgentX 1.0 من شركة SemiAnalysis أن منظومة إنفيديا المتمحورة حول CUDA—بما في ذلك العتاد وبرمجيات خدمة النماذج—لا تزال تتمتع بأفضلية كبيرة عند تشغيل وكلاء البرمجة في ظروف واقعية ذات سياق طويل. وفي إعدادات SGLang التي شملتها المقارنة، وصل الفارق إلى نحو 5 أضعاف في كفاءة التكلفة لصالح إنفيديا على GLM 5.3، وإلى أكثر من 20 ضعفاً في الأداء على Qwen 3.5 عند هدف معلن يبلغ 90 رمز إخراج في الثانية لكل مستخدم. 26
لكن هذه النتيجة ليست ترتيباً شاملاً يثبت تفوق إنفيديا على AMD في كل الأحوال. فـAgentX يقيس تركيبة محددة من النموذج، والمسرّع، ومحرك التشغيل، ونمط الحمل، ومستوى التزامن، وهدف الاستجابة. وقدمت معالجات AMD MI355X مع محرك ATOM نتائج تنافسية في إعدادات بعينها، كما أدت تحديثات البرمجيات إلى تغيير ترتيب بعض الأنظمة. 14
يأتي AgentX 1.0 ضمن حزمة اختبارات InferenceX v3 من SemiAnalysis. وعلى عكس اختبارات الاستدلال التقليدية التي تعتمد على أطوال ثابتة للمدخلات والمخرجات، يعيد AgentX تشغيل حركة مرور حقيقية لوكلاء البرمجة متعددة الجولات، مع سياقات طويلة جداً قد تقترب من مليون رمز. 13
تضم مجموعة بيانات الإصدار الأول 393 جلسة مجهّلة المصدر من Claude Code، وجميعها مقدمة بموافقة اختيارية. اشترطت العينة المؤهلة أن تحتوي الجلسة على 20 طلباً على الأقل، ثم عولجت البيانات لإزالة الطلبات المكررة وبعض الاستدعاءات الخاصة بالعميل والمدخلات المعاد بناؤها التي تتجاوز 990 ألف رمز. واحتوى الطلب الوسيط على 142 ألف رمز إدخال و444 رمز إخراج، فيما تضمنت 44% من الجلسات وكلاء فرعيين. 8
وتكتسب هذه الصيغة أهمية خاصة لأن وكيل البرمجة يعيد إرسال نسخ متطورة من محادثة أو قاعدة شيفرة كبيرة من طلب إلى آخر. لذلك يقيس الاختبار قدرة النظام على تقديم خدمة تفاعلية مستمرة، لا مجرد معالجة مطالبة طويلة مرة واحدة ثم توليد إجابة مطولة.
ظهر أوضح تفوق لإنفيديا في المقارنات التي استخدمت إعدادات SGLang المتاحة على نطاق واسع:
وينبغي قراءة هذه الأرقام باعتبارها مقارنات عند نقطة تشغيل محددة، لا نتيجة واحدة تمثل خط منتجات كاملاً. إذ تقارن InferenceX المنصات عند مستويات معلنة من التفاعلية، وتحسب التكلفة استناداً إلى نطاق الخدمة الذي أمكن رصده لكل منصة. 79
والخلاصة العملية هنا أن اختباراً ثابتاً مثل 8 آلاف رمز إدخال و1,000 رمز إخراج قد لا يكشف الاختناقات التي تصبح حاسمة في حركة مرور الوكلاء متعددة الجولات. فقد يبدو مسرّع ما منافساً في معدل إنتاج منفصل، لكنه يتراجع عندما يُطلب منه إبقاء عدد كبير من السياقات الضخمة، والمتكررة جزئياً، سريع الاستجابة في الوقت نفسه.
تعيد أحمال AgentX استخدام جزء كبير من السياق من طلب إلى آخر. وتصف SemiAnalysis معدلات إصابة لذاكرة بادئة السياق، أو ذاكرة KV، تتجاوز 95% في كثير من آثار الاستخدام الوكيلي. 1
ويغيّر ذلك التوازن بين مرحلتي تهيئة السياق والتوليد. فالنظام لا يعالج مطالبة جديدة بالكامل في كل مرة، بل يحافظ على حالات مخزنة كبيرة ويمدّدها، مع إنتاج ردود قصيرة نسبياً. ومن ثم تصبح القدرة على تخزين هذه الحالات والوصول إليها ونقلها وإعادة استخدامها عاملاً مركزياً في الأداء والتكلفة.
تحدد سعة الذاكرة عالية النطاق القابلة للاستخدام مقدار حالة ذاكرة KV التي يمكن إبقاؤها على المسرّع. وعندما يتجاوز حجم العمل سعة ذاكرة الجهاز، قد تضطر أنظمة الخدمة إلى نقل البيانات إلى ذاكرة المضيف أو إدارة حالة التخزين المؤقت عبر مسار أبطأ. 1
ويمكن لنقل البيانات إلى ذاكرة المضيف أن يزيد عدد الجلسات التي تدعمها المنصة، لكنه يضيف كلفة من حيث عرض النطاق والزمن الكامن. لذلك تستطيع المنصة التي تُبقي قدراً أكبر من الذاكرة المؤقتة النشطة داخل المسرّع، أو تدير نقلها بكفاءة أعلى، الحفاظ على مستوى تفاعلية أفضل عند التكلفة نفسها.
سلطت SemiAnalysis الضوء أيضاً على ميزة التقسيم التدريجي للرموز مع مراعاة حدود السياق في TensorRT-LLM. فبدلاً من تقسيم المطالبة المتطورة بالكامل إلى رموز في كل مرة، يحدد الأسلوب الحدود المستقرة ويعالج المادة المضافة حديثاً فقط. 1
وتفيد هذه العملية خصوصاً وكلاء البرمجة، إذ يمكن أن تتضمن الطلبات سياقات ضخمة لكنها لا تنتج سوى بضع مئات من الرموز. وفي مثل هذا الحمل، قد تصبح المعالجة المسبقة على المعالج المركزي وإعادة تقسيم النص بالكامل جزءاً مؤثراً من كلفة الخدمة.
والدرس الأوسع هو أن نسبة السعر إلى الأداء في الاستدلال ناتجة عن حاصل تفاعل العتاد × محرك التشغيل × النموذج × الحمل × هدف الاستجابة. فلا تكفي وحدها أرقام العمليات الحسابية، أو عرض نطاق الذاكرة، أو معدل إنتاج واحد لوصف النتيجة كاملة.
لم يُظهر AgentX انتصاراً شاملاً لإنفيديا. فقد سجلت SemiAnalysis انتصارات واضحة أو تقارباً ملحوظاً لصالح AMD في تركيبات محددة من النماذج ومعدلات الإنتاج ومحركات التشغيل، ولا سيما عند الجمع بين MI355X ومحرك ATOM من AMD. 1
وتفصل بيانات القياس نتائج MI355X الخاصة بـATOM وSGLang وvLLM وغيرها من الإعدادات. وهذا التفصيل أساسي، لأن «نتيجة AMD» تعتمد بدرجة كبيرة على محرك الخدمة، وتنفيذ النموذج، والضبط المستخدم في الاختبار. 4
وتستطيع جدولة ATOM المتخصصة، وإدارته لذاكرة التخزين المؤقت، ونواته البرمجية المحسنة لمنصة AMD، تقديم أداء قوي عندما يتوافق النموذج والحمل مع ترتيب ذاكرة MI355X. وبعبارة أخرى، يمكن لـAMD أن تكون منافساً قوياً عندما يكون المشغّل مستعداً لاستخدام محرك تشغيل مُحسّن خصيصاً للمنصة.
قد يبرهن محرك متخصص على ما يستطيع العتاد تحقيقه في ظروف مواتية. لكن مشتري البنية التحتية يحتاجون عادةً إلى أكثر من نتيجة مثالية لنواة برمجية واحدة؛ فهم يحتاجون أيضاً إلى دعم واسع للنماذج، ودورية تحديث مناسبة، وأدوات تشغيل، وخبرة نشر، ومسار صيانة يمكن الاعتماد عليه بمرور الوقت.
تقول SemiAnalysis إن وصفات الاختبار اتبعت أساساً إرشادات الإصدارات المفتوحة من vLLM وSGLang لقياس إعدادات يمكن للعملاء نشرها واقعياً، بدلاً من الاعتماد حصراً على حزمة مخصصة للاختبار. 1
ولهذا فإن نتائج vLLM وSGLang upstream—أي الإصدارات الأساسية المتاحة للمجتمع—تمثل بالنسبة إلى كثير من المشترين المحتملين معيار المقارنة الأكثر صلة. ويظل ATOM دليلاً مهماً على قدرة عتاد AMD على تقديم أداء قوي في بيئة برمجية مناسبة، لكن لا ينبغي التعامل مع نتيجته على أنها قابلة للمقارنة مباشرة مع الأداء المتاح عبر طبقة خدمة مفتوحة شائعة.
هذا تمييز يتعلق بالتبني وتوافر البرمجيات، وليس حكماً بأن ATOM غير صالح أو بأن محركات التشغيل المتخصصة بلا قيمة.
يوضح الاختبار أيضاً لماذا تتقادم مقارنات الاستدلال بسرعة. إذ تتضمن بيانات القياس إعداداً لـAMD MI355X مع MoRI/SGLang مؤرخاً في 21 أغسطس، إلى جانب إعدادات أخرى لـAMD قيس أداؤها في تواريخ مختلفة. 4
وغيّر تحديث برمجي صدر في 21 أغسطس ترتيب إحدى المقارنات على الأقل، ما يوضح أن تحسينات الجدولة، والنوى البرمجية، ونقل الذاكرة المؤقتة، ودعم النماذج يمكن أن تغير التسلسل الظاهري للعتاد خلال أيام. 14
وتقدم أعمال SemiAnalysis السابقة على MI355X مع Qwen 3.5 تحذيراً مشابهاً؛ فقد حققت إصدارات SGLang المتعاقبة مكاسب أداء كبيرة خلال فترة 13 أسبوعاً. 12
أما الدرس العملي للمشترين فهو ضرورة تسجيل إصدار محرك التشغيل بدقة، وإعداداته، وكمّ النموذج، ونطاق التزامن، وهدف التفاعلية عند مقارنة المسرّعات. فالحكم على العتاد من دون هذا السياق قد يصبح مضللاً سريعاً مع تحسن برمجيات الخدمة.
يُعد AgentX مؤشراً مفيداً على أداء وكلاء البرمجة ذوي السياق الطويل، لكنه ليس مسحاً شاملاً لكل أحمال الإنتاج. فمجموعة البيانات مبنية على corpus داخلي من آثار الاستخدام المقدمة اختيارياً، وتضم 393 جلسة مختارة، لا جميع حركة مرور الوكلاء في المؤسسات. 8
وقد تختلف النتائج في حالات مثل:
كما لم تشمل مجموعة المقارنة الأولية وحدات معالجة Google TPU، ولذلك لا يستطيع AgentX 1.0 إثبات نتيجة ثلاثية بين إنفيديا وAMD وGoogle. 1
وتظل المقارنة متحركة أيضاً. فقد أشارت SemiAnalysis إلى أن أنظمة Nvidia Rubin وAMD MI455X UALoE72 وأجيالاً أحدث من TPU ستُضاف لاحقاً أو تمثل نقاط مقارنة مستقبلية، وقد يؤدي إدراجها إلى تغيير المشهد التنافسي. 111
أطلقت SemiAnalysis مجموعة بيانات AgentX، وأداة الاختبار، والإعدادات، وبيانات القياس، والمواد ذات الصلة بموجب رخصة Apache 2.0. 1
وقد لا تكمن أهمية الاختبار على المدى الطويل في عنوان واحد عن إنفيديا مقابل AMD، بل في العمل الهندسي الذي يشجعه. فقد أفادت SemiAnalysis بأن AgentX أصبح بالفعل حملاً مستهدفاً لأكثر من 70 طلب سحب في مشاريع مفتوحة المصدر، من بينها vLLM وSGLang وTensorRT-LLM وATOM وAITER وDynamo وLMCache وMooncake. 1
ويمنح ذلك مطوري أطر الخدمة طريقة قابلة لإعادة الإنتاج لتحسين الأداء وفق سلوك الوكلاء الفعلي: إعادة استخدام البادئات بنسبة مرتفعة، وذاكرات KV الكبيرة، والجولات القصيرة المتعددة، والوكلاء الفرعيين، ونقل الذاكرة المؤقتة، وضغط الجدولة، وكلفة تقسيم الرموز.
يعزز AgentX الاعتقاد بأن برمجيات إنفيديا ومنظومة خدمتها لا تزالان تمنحانها أفضلية كبيرة في استدلال وكلاء البرمجة ذوي السياق الطويل. ففي مقارنات SGLang المختبرة، أُبلغ عن تفوق يصل إلى 5 أضعاف في كفاءة التكلفة على GLM 5.3، وأكثر من 20 ضعفاً في الأداء على Qwen 3.5 عند أهداف تفاعلية محددة. 26
لكن الاختبار لا يثبت أن إنفيديا تفوز دائماً. فقد أظهرت MI355X مع ATOM إمكانية تحقيق سعر مقابل أداء تنافسي أو أفضل في إعدادات متخصصة، كما يمكن للتحسينات السريعة في برمجيات الخدمة أن تقلب الترتيب. لذلك فإن القرار الأهم لفرق البنية التحتية ليس اختيار فائز استناداً إلى رقم واحد، بل إعادة الاختبار باستخدام النموذج، ومحرك التشغيل، وتوزيع السياق، وهدف الاستجابة الخاص بها.
Studio Global AI
تتضمن هذه الصفحة إجابة مدعومة بالمصدر يمكنك المتابعة داخل Studio Global.
في اختبارات AgentX، كانت إنفيديا أكثر كفاءة من AMD بنحو 5 مرات على GLM 5.3 عند هدف 150 رمز إخراج في الثانية لكل مستخدم، وتفوقت بأكثر من 20 مرة في الأداء على Qwen 3.5 عند هدف 90 رمزاً في الثانية لكل مستخدم.
في اختبارات AgentX، كانت إنفيديا أكثر كفاءة من AMD بنحو 5 مرات على GLM 5.3 عند هدف 150 رمز إخراج في الثانية لكل مستخدم، وتفوقت بأكثر من 20 مرة في الأداء على Qwen 3.5 عند هدف 90 رمزاً في الثانية لكل مستخدم. جاء التفوق من تفاعل سعة الذاكرة، وإعادة استخدام بادئات السياق، وسلوك نقل ذاكرة KV إلى ذاكرة المضيف، وبرمجيات التشغيل مثل TensorRT LLM، وليس من مواصفات العتاد الخام وحدها.
حققت منصة AMD MI355X مع محرك ATOM انتصارات أو نتائج قريبة من التعادل في حالات محددة، لكن نتائج vLLM وSGLang مفتوحة المصدر تظل أكثر صلة بمعظم المشترين من نتائج محرك متخصص شديد التحسين.