تقول NVIDIA إن نظام AVO، المدمج مع Claude Opus 5، حقق 100.00 RHAE في المجموعة العامة من ARC AGI 3، وأنهى المستويات الـ183 في 25 بيئة باستخدام 6,624 إجراءً. الرسالة الأهم تتعلق بالبنية المحيطة بالنموذج لا بالنموذج وحده: إذ جمعت AVO بين الذاكرة المستمرة، واستخدام الأدوات، والمراجعة المستندة إلى التغذية الراجعة، والتحك...
إجابة البحث

Create a landscape editorial hero image for this Studio Global article: How did Nvidia’s Agentic Variation Operators (AVO) agent achieve a perfect 100% score on the ARC-AGI-3 interactive reasoning benchmark, and. Article summary: NVIDIA reports that AVO achieved 100.00 RHAE on ARC-AGI-3’s public set by pairing Claude Opus 5 with a long-horizon agent harness—not by relying on a stronger base model alone. It completed all 183 levels in 25 environme. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
تقول NVIDIA إن نظامها Agentic Variation Operators (AVO) حقق نتيجة كاملة بلغت 100.00 RHAE في المجموعة العامة من اختبار ARC-AGI-3 التفاعلي. وبالاعتماد على Claude Opus 5، أنهى النظام جميع المستويات الـ183 في 25 بيئة، مستخدمًا 6,624 إجراءً.
لكن اللافت هنا ليس أن نموذجًا أساسيًا جديدًا حلّ الاختبار فجأة. الأهم أن بنية وكيل طُوّرت أصلًا للبرمجة وتحسين نوى وحدات معالجة الرسوميات انتقلت إلى مهمة مختلفة تمامًا في الاستدلال التفاعلي.
كان Claude Opus 5 مسجلًا عند 30.2% في لقطة منشورة من جدول ARC-AGI-3، بينما حقق GPT-5.6 Sol نسبة 7.8% ضمن بيئة الاختبار القياسية.
أما نتيجة NVIDIA، فاستندت إلى النموذج نفسه تقريبًا داخل نظام مصمم لمواصلة العمل عبر خطوات كثيرة. يستطيع هذا النظام فحص الملفات وتعديلها، وتشغيل الأدوات والأوامر، والرجوع إلى الوثائق، وتقييم النتائج، ثم تغيير نهجه بناءً على التغذية الراجعة الخارجية.
عمليًا، تستبدل AVO نمط السؤال والجواب ذي المحاولة الواحدة بحلقة متكررة:
وتكتسب هذه الحلقة أهمية خاصة في ARC-AGI-3، إذ يتعين على الوكيل استكشاف بيئات تفاعلية غير مألوفة واستنتاج القواعد والأهداف من خلال التفاعل، بدل الاكتفاء بالرد على تعليمات مكتملة وواضحة.
تجمع البنية المعلنة عدة قدرات تبدو عادية كل واحدة منها على حدة، لكنها تصبح مؤثرة عندما تعمل معًا على مدى زمني طويل.
تسمح الذاكرة المستمرة للوكيل بالاحتفاظ بالاكتشافات والمحاولات الفاشلة والحالة المفيدة، بدل التعامل مع كل خطوة كأنها محادثة منفصلة. وفي اختبار يقوم على الاستكشاف، يمكن لذلك أن يقلل تكرار الأخطاء ويساعد النظام على بناء تصور عملي عن البيئة المجهولة.
طُوّرت AVO كنظام لوكيل برمجي يستطيع فحص العمل وإجراء التعديلات وتشغيل الأوامر والتحقق من النتائج. لذلك لا يبقى التفكير منفصلًا عن الواقع؛ إذ يمكن اختبار الاقتراح وقياسه وتعديله، بدل قبوله لمجرد أنه يبدو منطقيًا.
تساعد طبقة إشرافية في تنسيق العملية الطويلة. فبدل ترك استدعاء واحد للنموذج يتحكم في كل القرارات إلى ما لا نهاية، يستطيع النظام مراقبة التقدم، ورصد المسارات غير المثمرة، ودعم التعافي عندما تفشل إحدى الفرضيات. وتصف NVIDIA ومصادر مرتبطة بها AVO بأنها تجمع الذاكرة وأدوات التنفيذ والتغذية الراجعة والإشراف للعمل الذاتي المستمر.
معًا، تمنح هذه العناصر النموذج طريقة منظمة للاستكشاف والتنفيذ والملاحظة والتصحيح. يظل النموذج مسؤولًا عن جانب كبير من الاستدلال، لكن بيئة التشغيل أو الـharness تحدد كيف يتحول ذلك الاستدلال إلى أفعال متتابعة داخل البيئة.
المقارنة مفيدة، لكن ينبغي قراءة الأرقام إلى جانب طريقة التقييم المستخدمة:
| النظام أو الإعداد | النتيجة المعلنة في ARC-AGI-3 | سياق التقييم |
|---|---|---|
| AVO مع Claude Opus 5 | 100.00 RHAE | المجموعة العامة؛ إكمال 183 من أصل 183 مستوى |
| Claude Opus 5 وحده | 30.2% | لقطة منشورة من جدول النتائج وإعداد المقارنة القياسي |
| GPT-5.6 Sol | 7.8% | مقارنة قياسية أو شبه خاصة موثقة |
| GPT-5.6 Sol مع الاحتفاظ بالتفكير وضغطه | 38.3% | تشغيل مخصص أبلغت عنه OpenAI على المهام العامة |
ولا تمثل نتيجتا AVO وClaude Opus 5 وحده القياس نفسه تمامًا: الأولى نتيجة لنظام وكيل متكامل على المجموعة العامة، والثانية نتيجة نموذج ضمن بيئة معيارية. وهذه النقطة هي جوهر القصة.
ويؤكد GPT-5.6 Sol الفكرة من زاوية أخرى. فنتائج ARC Prize المنشورة تضعه عند 7.78% مع أقصى جهد استدلال، بينما أبلغت OpenAI عن 38.3% في تشغيل منفصل على المهام العامة بعد الاحتفاظ بحالة التفكير واستخدام الضغط. ولا تحل هذه النتيجة المخصصة محل نتيجة جدول الترتيب الرسمي، لكنها توضح أن الذاكرة وإدارة الحالة قد تؤثران بوضوح في أداء الوكيل.
لذلك، لا يصح استنتاج أن نموذجًا واحدًا أفضل في كل الظروف. الاستنتاج الأكثر أمانًا هو أن أداء الأنظمة الذاتية يعتمد بدرجة كبيرة على تفاعل النموذج مع سياسة الذاكرة، وواجهة الأدوات، وإدارة الحالة، وآلية التقييم.
كانت بيئة AVO الأصلية هي هندسة البرمجيات الصعبة وتحسين نوى وحدات معالجة الرسوميات. في هذا النوع من العمل، يفحص الوكيل تنفيذًا قائمًا، ويقترح تعديلًا، ويشغّل اختبارات مرتبطة بالأداء الفعلي للعتاد، ويفسر النتائج، ثم يقرر ما الذي سيجربه بعد ذلك. ويتطلب النجاح تجارب متكررة، لا توليدًا صحيحًا من المحاولة الأولى.
وتقول NVIDIA إن AVO استكشفت أكثر من 500 اتجاه، واعتمدت 40 إصدارًا من النوى، وحققت تحسنًا وصل إلى 10.5% مقارنةً بـFlashAttention-4 على أنظمة DGX B200.
والقدرة القابلة للنقل هنا ليست بالضرورة معرفة خاصة بنوى GPU، بل العملية التجريبية نفسها: توليد حل مرشح، وتنفيذه، وقياس النتيجة، وحفظ ما تم تعلمه، ثم تغيير المسار عندما لا تؤيد الأدلة الفرضية. وتقدم ARC-AGI-3 واجهة مختلفة، لكنها تكافئ أيضًا الوكلاء القادرين على اكتشاف البنية من خلال التفاعل المتكرر.
بحسب التقرير، حلّت AVO المجموعة العامة كاملة باستخدام 6,624 إجراءً بيئيًا، مقارنةً بـ7,542 إجراءً لنظام VISTA؛ أي انخفاض يقارب 12% مع إكمال المستويات الـ183 نفسها.
وهذا مهم لأن مقياس RHAE في ARC-AGI-3 لا ينظر إلى الوصول إلى الحل فقط، بل يدمج كفاءة الأفعال مقارنةً بالأداء البشري. فالوكيل طويل الأمد يجب أن يدير استكشافه بعناية؛ إذ قد تجعل المحاولات العشوائية المتكررة نظامًا قادرًا لكنه بطيئًا ومكلفًا وغير عملي.
بالنسبة إلى تطبيقات المؤسسات، تكمن الفائدة الأوضح في الدرس المعماري. فمن غير المرجح أن يكون النظام الذاتي الموثوق مجرد نموذج لغوي كبير موصول بعدد قليل من الأدوات؛ بل يحتاج إلى طبقة تنفيذ محكومة تحيط بالنموذج.
وقد تشمل هذه الطبقة:
كما تعزز AVO فكرة حزم الوكلاء المعيارية. فإذا كان جزء كبير من التحسن يأتي من بيئة التشغيل، فقد تستفيد المؤسسات من فصل الذاكرة، وموائمات الأدوات، ومجموعات التقييم، وضوابط السياسات، وقابلية المراقبة عن النموذج الأساسي. ويجعل ذلك مقارنة النماذج أو تغيير مزود الخدمة أو ضبط النظام لسير عمل محدد أسهل، من دون إعادة بناء الحزمة بأكملها.
لكن لا ينبغي التعامل مع نتيجة 100% باعتبارها دليلًا على موثوقية مؤسسية عامة. فالرقم الذي أعلنته NVIDIA يتعلق بالمجموعة العامة من ARC-AGI-3، ولا يثبت أداءً مماثلًا على مهام خاصة أو بيانات إنتاجية أو عمليات أعمال عالية المخاطر. ولا تزال هناك حاجة إلى تكرار مستقل للتجربة، واختبارات على مجموعات مخفية، وتحليل للتكلفة والسرعة، ومراجعات أمنية وتقييمات للسلامة.
تنقل نتيجة AVO النقاش من سؤال: «أي نموذج هو الأذكى؟» إلى سؤال تشغيلي أكثر أهمية: أي نظام يستطيع الحفاظ على السياق، واستخدام الأدوات، والتعلم من التغذية الراجعة، والتعافي من الأخطاء خلال سير عمل طويل؟
يظل النموذج عنصرًا أساسيًا، لكن ARC-AGI-3 يقدم مثالًا واضحًا على أن البيئة المحيطة قد تحدد ما إذا كانت قدراته ستصمد أمام بيئة مجهولة. وبالنسبة إلى المؤسسات التي تبني أنظمة ذكاء اصطناعي ذاتية، قد تكمن الأفضلية التنافسية المتزايدة في جودة نظام التنفيذ، لا في استدعاء النموذج وحده.
Studio Global AI
تتضمن هذه الصفحة إجابة مدعومة بالمصدر يمكنك المتابعة داخل Studio Global.
تقول NVIDIA إن نظام AVO، المدمج مع Claude Opus 5، حقق 100.00 RHAE في المجموعة العامة من ARC AGI 3، وأنهى المستويات الـ183 في 25 بيئة باستخدام 6,624 إجراءً.
تقول NVIDIA إن نظام AVO، المدمج مع Claude Opus 5، حقق 100.00 RHAE في المجموعة العامة من ARC AGI 3، وأنهى المستويات الـ183 في 25 بيئة باستخدام 6,624 إجراءً. الرسالة الأهم تتعلق بالبنية المحيطة بالنموذج لا بالنموذج وحده: إذ جمعت AVO بين الذاكرة المستمرة، واستخدام الأدوات، والمراجعة المستندة إلى التغذية الراجعة، والتحكم الإشرافي.