وتقول الشركة إن تشغيل Opus 5 عبر Prime Agent حقق 95.5% في Best@1 على معيار ARC-AGI-3 التفاعلي، متجاوزاً خط أساس الخبراء البشريين البالغ 95.4%. لكن هذه النتيجة ما تزال معلنة من الجهة المطوّرة وغير متحقق منها بصورة مستقلة من مجتمع ARC، فيما يرى منتقدون أن جزءاً كبيراً من التحسن قد يكون ناتجاً عن استغلال الإطار لآلية المعيار، لا عن تطور حقيقي في الاستدلال .
معظم أطر الوكلاء الحديثة تعرّف مجموعة من الأدوات مسبقاً: أداة للبحث، وأخرى لقراءة الملفات، وثالثة لتشغيل الأوامر أو استدعاء نموذج فرعي. أما Prime Agent فيراهن على منح النموذج بيئة برمجة عامة يستطيع أن يكتب فيها التعليمات البرمجية ليفحص البيانات، ويحوّل السياق، ويشغّل المهام الفرعية، ويحافظ على المتغيرات بين خطوات العمل .
وتلخّص Prime Intellect فلسفة التصميم بعبارة: «كل شيء Python». فالنموذج لا يتعامل مع مخطط محدود لاستدعاء الأدوات، بل مع واجهة REPL — أي مفسّر أوامر تفاعلي — يمكنه البرمجة فوقها مباشرة . وتقول الشركة إن تنفيذ الدوال على البيانات قد يكون أكثر كفاءة من تمرير البيانات إلى أدوات منفصلة ثم إعادة قراءتها، ما قد يخفض استهلاك الرموز في بعض السيناريوهات .
ومن المهم توضيح معنى «التطوير الذاتي» هنا: Prime Agent لا يعيد تدريب النموذج ولا يغيّر أوزانه. المقصود أن الإطار يستطيع تعديل أجزاء من حالته التشغيلية الإضافية أثناء المهمة، مثل الذاكرة والمهارات وبعض التعليمات .
يتعامل Recursive Language Model (RLM) مع سجل المحادثة بوصفه متغيراً يمكن للنموذج فحصه وتحويله داخل نواة IPython الدائمة . وهذا يغيّر طبيعة السياق: فبدلاً من أن يكون نصاً يُمرَّر إلى النموذج ثم يُختصر أو يُستبدل، يصبح مادة يمكن للبرنامج التعامل معها.
كما تُعرَض الاستعانة بالوكلاء الفرعيين على هيئة استدعاءات Python عادية. فعند تنفيذ:
rlm("مهمة فرعية")
يمكن إطلاق جلسة فرعية كاملة لها نموذجها ونواتها وسجلها الخاص . وتبقى الجلسات حية للمهام الطويلة بفضل عملية خلفية تدير استمراريتها .
عملياً، يسمح ذلك للنموذج بتقسيم المهمة، وتفويض أجزاء منها إلى وكلاء فرعيين، ثم جمع النتائج داخل بيئة برمجية واحدة، بدلاً من الاعتماد على سلسلة ثابتة من الأدوات المصممة مسبقاً.
يصف Prime Agent حالة الإطار بالصيغة:
[
H = (ρ, G, K, M)
]
حيث تمثل العناصر — وفق تعريف المشروع — التعليمات أو الموجّه، والوكلاء الفرعيين، والمهارات، والذاكرة. ويمكن إنشاء هذه العناصر وقراءتها وتحديثها وحذفها من داخل Python، وهي عمليات تعرف عادةً باسم CRUD .
/refineيحلل الأمر /refine مسار التنفيذ السابق: ما الذي جُرّب، وأين حدث الفشل، وما الأساليب التي أدت إلى نتيجة أفضل. ثم يطبّق تعديلات صغيرة مدعومة بما ظهر في المسار على الحالة الإضافية للإطار، مثل الذاكرة أو المهارات أو التعليمات المساندة .
لكن هناك حد مهم: لا يستطيع /refine إعادة كتابة موجّه النظام الأساسي. فالتعديلات تقتصر على الطبقة الإضافية المحيطة به، وتُسجّل برقم تعريف يتيح مراجعتها أو التراجع عنها .
/compactيوفر /compact طريقة يدوية لضغط السياق عندما تصبح المحادثة طويلة أو تحتاج إلى إعادة تنظيم المعلومات . ومع ذلك، تبقى حالة Python — مثل المتغيرات والاستيرادات وبعض مقابض الملفات — مستمرة داخل النواة حتى مع عمليات ضغط السياق، بحسب مراجعات للشفرة والوثائق .
جميع الأرقام التالية معلنة من Prime Intellect ولم تتحقق منها جهة مستقلة حتى الآن . لذلك ينبغي قراءتها بوصفها نتائج أولية، لا سجلاً نهائياً على لوائح المقارنة الرسمية.
| المقياس | النتيجة | الملاحظات |
|---|---|---|
| Best@1 مع Opus 5 | 95.5% | أعلى من خط أساس الخبراء البشريين المعلن، البالغ 95.4% |
| الاتساق بين التشغيلات | 95.0% و95.2% و95.5% | إكمال المستويات الـ183 جميعها في التشغيلات الثلاثة |
| Best@3 | 99.97% | أفضل نتيجة من أصل ثلاث محاولات |
| المقارنة | 30.2% مقابل 95.5% | النموذج نفسه لم يتغير؛ الذي تغير هو إطار التشغيل |
الفرق بين النتيجة الرسمية الأعلى التي تبلغ نحو 30.2% والنتيجة المعلنة لـPrime Agent يعود، بحسب الشركة، إلى طبقة الإطار لا إلى تبديل النموذج . ولهذا لا تضع منظمة ARC Prize نتائج تعتمد على تغييرات في الـharness وحدها ضمن لوحتها الرسمية . كما يسجل أحد تقارير النتائج تشغيلًا وسيطاً مختلفاً عند 95.24%، وهو تفصيل يمنع اختزال الصورة في الرقم الأعلى وحده .
تقول Prime Intellect إن Prime Agent مع Opus 5 تفوق على Claude Code وCodex في معظم اختبارات السياق الطويل والمهام الممتدة، بما في ذلك OOLONG وLongBenchPro وLongBenchv2 وOBLIQ-Bench .
مع GLM-5.2 بإعداد high، تقول الشركة إن Prime Agent تفوق على Pi-mono في ثمانية من أصل تسعة تقييمات للسياق الطويل .
| النموذج | النتيجة أو الملاحظة |
|---|---|
| Opus 5 | نحو ثلاثة أضعاف في ARC-AGI-3، من 30.2% إلى 95.5% |
| DeepSeek V4 Flash | إكمال التحديات البرمجية الثمانية من أصل ثمانية باستخدام 4.17 مليون رمز في اختبار واحد |
| GLM-5.2 | التفوق على إطار مملوك في معظم تقييمات السياق الطويل تقريباً |
وعبر GLM-5.2 وOpus 5 وGPT-5.6 Sol، تشير النتائج المعلنة إلى أن Prime Agent يحقق عموماً قيماً قصوى أعلى من أطر التشغيل الأصلية لهذه النماذج، مع استهلاك إجمالي أقل للرموز في بعض المقارنات .
العنوان الأبرز — 95.5% في ARC-AGI-3 — ليس نتيجة مراجعة مستقلة من مجتمع ARC. كما أن المقارنة تضع إطاراً جديداً في مواجهة نتائج تشغيل مختلفة، ولذلك لا تعني بالضرورة أن Opus 5 أصبح نموذجاً أفضل في كل أنواع الاستدلال. وتبقى النتيجة الرسمية الأعلى على لوحة ARC-AGI-3 عند نحو 30.2% وفق المصادر التي تناولت الإطلاق .
بما أن /refine يستطيع تعديل الذاكرة والمهارات والتعليمات المساندة أثناء المهمة، فهناك احتمال لدخول الوكيل في حلقة تغذي نفسها: يغيّر الإطار، ثم يفسر النتيجة الجديدة على أنها دليل نجاح، ثم يكرر التعديل. ولا يقدّم التصميم، وفق المعلومات المتاحة، آلية آلية مكتملة لاكتشاف كل التعديلات الضارة .
هذا النظام ليس آمناً تلقائياً. فعمليات العامل والنواة تعمل بصلاحيات المستخدم المحلية بدلاً من بيئة معزولة افتراضياً، ما يعني أن تشغيله على مستودعات أو ملفات غير موثوقة قد يعرّض البيئة لمخاطر حقيقية . ويحتاج المستخدمون إلى العزل، وتقييد الصلاحيات، وتحديد ميزانيات للوقت والدورات والرموز.
صحيح أن موجّه النظام الأساسي غير قابل لإعادة الكتابة، لكن الحالة الإضافية — بما فيها الذاكرة والمهارات وتعريفات الوكلاء الفرعيين والتعليمات المساندة — قابلة للتعديل. وقد يؤدي تحديث سيئ إلى إفساد سلوك الإطار حتى لو بقيت التعليمات الأساسية سليمة . وجود إمكان التراجع عن التعديلات مفيد، لكنه لا يغني عن المراجعة والاختبار قبل اعتمادها.
استهلك DeepSeek V4 Flash 4.17 مليون رمز لإكمال ثماني مهام برمجية في اختبار واحد . كما أن النواة الدائمة والوكلاء الفرعيين التكراريين قد يفتحان الباب أمام استهلاك غير محدود تقريباً إذا لم تُفرض حدود صارمة على عدد الأدوار والوقت والرموز .
بالنسبة إلى فرق التطوير، هذه ليست ملاحظة محاسبية ثانوية: فالإطار الذي يبدو أكثر كفاءة في بعض الاختبارات قد يصبح مكلفاً جداً عند السماح له بالتجربة والتفويض وإعادة المحاولة بلا سقف.
لا يلغي Prime Agent مشكلات النموذج الأساسي. فالهلوسة وضعف التخطيط وسوء الاستدلال تنتقل إلى الحلقة التكرارية، وقد تتضخم عندما يستطيع الوكيل إنشاء محاولات فرعية وتخزين استنتاجاته واستخدامها لاحقاً . وتبدو المكاسب الأكبر مع النماذج المتقدمة أصلاً، لا مع النماذج الضعيفة.
أصدر المشروع أربعة تحديثات فرعية خلال أسبوعه الأول في أغسطس/آب 2026، ما يعكس سرعة التطوير، لكنه قد يعني أيضاً أن الواجهات البرمجية لم تستقر بعد . ولا تزال تفاصيل معمارية، مثل صيغة تسلسل الذاكرة الدقيقة وضمانات عزل الوكلاء الفرعيين، غير موثقة بالكامل في المصادر المتاحة .
تذهب قراءة نقدية إلى أن القفزة في ARC-AGI-3 قد تكون نتيجة استغلال قدرة الإطار على إعادة كتابة تعليماته أثناء المهمة، لا تحسناً أصيلاً في قدرة النموذج على التفكير . ووفق هذا التفسير، يتعامل الوكيل مع المعيار بوصفه مسألة فوقية في هندسة التعليمات: يجرّب أساليب مختلفة، يلاحظ ما ينجح، ثم يثبت النهج الفائز في حالته التشغيلية.
إذا صح هذا التفسير، فقد يكون Prime Agent ممتازاً في اكتشاف أنماط فعالة لكل مهمة، من دون أن يعني ذلك امتلاكه قدرة عامة جديدة على الاستدلال. الفصل بين الأمرين يتطلب اختبارات مستقلة، وبروتوكولات معلنة، ومقارنات تمنع الإطار من تعديل قواعد عمله أثناء التقييم.
رغم التحسن المعلن، لم تُحل أصعب المهام الوكيلة طويلة الأفق. ففي اختبارات سطر الأوامر الطويلة مثل LongCLI-Bench، تحقق جميع أنظمة الوكلاء — بما فيها الأنظمة المتقدمة — معدلات نجاح تقل عن 20% في أصعب الحالات . وهذا يضع Prime Agent في سياق أكثر واقعية: إطار واعد، لكنه ليس حلاً عاماً للعمل المستقل الموثوق.
يقدم Prime Agent فكرة مختلفة فعلاً لبناء وكلاء الذكاء الاصطناعي: بدلاً من واجهة أدوات ثابتة، يمنح النموذج بيئة Python دائمة يستطيع فيها التعامل مع السياق، واستدعاء الوكلاء الفرعيين، وإعادة تنظيم أجزاء من الإطار أثناء العمل.
لكن النتيجة الأكثر إثارة — 95.5% مع Opus 5 في ARC-AGI-3 — ما تزال ذاتية الإبلاغ وغير متحققة مستقلاً. كما أن القفزة تبدو مرتبطة بدرجة كبيرة بقدرة الـharness على تعديل تعليماته وحالته أثناء المهمة، لا بتغيير النموذج نفسه .
بالنسبة إلى الباحثين والمطورين، يمثل المشروع نمطاً تجريبياً مثيراً في هندسة الوكلاء، وقد يكون مفيداً للبرمجة والبحث والمهام الطويلة. أما استخدامه في بيئة إنتاجية فيتطلب عزلاً أمنياً قوياً، وصلاحيات محدودة، وميزانيات واضحة للرموز والوقت، وسجلاً قابلاً للمراجعة والتراجع — فضلاً عن قدر كبير من الحذر تجاه أي نتيجة معيارية لم تُكررها جهة مستقلة.