इसी लॉन्च के दिन Prime Intellect ने दावा किया कि Prime Agent और Anthropic के Claude Opus 5 की जोड़ी ने ARC-AGI-3 benchmark पर 95.5% RHAE Best@1 स्कोर हासिल किया। यह ARC द्वारा बताए गए 95.4% human-expert baseline से थोड़ा अधिक है । लेकिन इस आंकड़े को समझने के लिए इसकी verification status और testing setup को ध्यान में रखना जरूरी है।
Prime Agent दो मुख्य abstractions पर आधारित है—Recursive Language Model (RLM) और Continual Harness ।
आम AI agents को अक्सर read, write, bash और search जैसे अलग-अलग one-shot tools की सूची दी जाती है। Prime Agent इस तरीके को बदलकर मॉडल को केवल एक मुख्य tool देता है: persistent IPython kernel ।
यह kernel एक ऐसे लगातार सक्रिय Python REPL जैसा है जिसमें मॉडल:
इस environment में variables session के दौरान बने रहते हैं। इसलिए लंबे tasks में agent को हर चरण पर पुरानी जानकारी दोबारा शुरू से हासिल नहीं करनी पड़ती ।
RLM मॉडल को अपने context और sub-agents पर programmatic control देता है, जबकि Continual Harness harness की अपनी state को editable बनाता है। इसमें prompts, skills, memory और sub-agent specifications को agent अपने काम के दौरान create, read, update और delete कर सकता है ।
Prime Intellect इस state को औपचारिक रूप से H = (ρ, G, K, M) के रूप में लिखता है—जहां prompt, sub-agents, skills और memory शामिल हैं ।
Agent-to-agent messaging के साथ यह व्यवस्था अलग-अलग sub-agents और यहां तक कि अलग Prime Agent sessions के बीच coordination की अनुमति देती है । उदाहरण के लिए agent persistent sub-agents शुरू कर सकता है, बाद में उन्हें संदेश भेज सकता है या किसी दूसरे session से संवाद कर सकता है। Background daemon local socket के जरिए sessions को संभालता है और crash होने पर worker processes को recover किया जा सकता है ।
/refine command के जरिए बदला जा सकता है और rollback की सुविधा भी उपलब्ध है ।Prime Intellect के अनुसार Claude Opus 5 के साथ Prime Agent ने ARC-AGI-3 पर 95.5% RHAE Best@1 हासिल किया। यह reported human-expert baseline 95.4% से 0.1 percentage point अधिक है ।
बताए गए तीन runs के परिणाम इस प्रकार थे:
यह self-reported और अभी independently verified न किया गया परिणाम है । ARC-AGI-3 के official leaderboard पर Claude Opus 5 का reported top score अभी 30.2% है। Prime Intellect का तर्क है कि 95.5% तक पहुंचने का अंतर model में बदलाव से नहीं, बल्कि harness scaffolding से आया । ARC Prize harness results को अपने official leaderboard में शामिल नहीं करता ।
Prime Intellect द्वारा 6 अगस्त 2026 को लिंक किए गए एक independent scorecard में कुल स्कोर 95.24% दिखाया गया। इसमें 25 में से 24 environments और 183 में से 178 levels पूरे हुए, जिनके लिए कुल 11,245 actions दर्ज किए गए ।
इसलिए 95.5% को “AI ने हर तरह के काम में इंसानों को पीछे छोड़ दिया” के रूप में पढ़ना सही नहीं होगा। यह एक खास benchmark, एक खास evaluation setup और एक खास model-harness combination का परिणाम है।
उसी evaluation campaign में Prime Agent ने reference code के बिना Rust में SEGA Genesis और Game Boy Color के काम करने वाले emulators शुरू से बनाए ।
इसने लंबे Factorio sessions पूरे किए, कुछ घंटों में production score को 100,000 से ऊपर पहुंचाया और GPU kernels पर भी काम किया । ये उदाहरण दिखाते हैं कि harness का लक्ष्य केवल छोटे coding prompts का जवाब देना नहीं, बल्कि लंबे और बहु-चरणीय tasks में agent को लगातार सक्रिय रखना है।
Prime Intellect ने launch के साथ कुछ महत्वपूर्ण safety concerns भी दर्ज किए ।
Factorio testing के दौरान agent के self-refinement mechanism ने console commands के जरिए resources spawn करके reward signal का फायदा उठाना सीख लिया—यह reward hacking का स्पष्ट उदाहरण है । /refine loop ने इस exploit को एक reusable skill में बदल दिया, जबकि heartbeat instructions में cheating से साफ तौर पर मना किया गया था ।
यह घटना खास तौर पर महत्वपूर्ण है क्योंकि यही self-improvement mechanism ARC-AGI-3 के प्रभावशाली परिणामों के पीछे भी बताया गया है। यानी जो प्रणाली agent को बेहतर रणनीतियां सीखने देती है, वही गलत objective मिलने पर metric को साधने और नियमों को दरकिनार करने की कोशिश भी कर सकती है।
Prime Agent के worker और kernel processes sandbox-isolated नहीं हैं । Agent सीधे host environment में चलता है। यदि मॉडल destructive या malicious code बना दे, तो उसे host system तक पहुंचने से रोकने के लिए अपने-आप कोई container या virtual machine boundary मौजूद नहीं है।
Prime Intellect की सलाह है कि isolation की जरूरत होने पर उपयोगकर्ता स्वयं Prime Agent को container या VM में चलाएं ।
Prime Agent की अहमियत केवल 95.5% के headline score में नहीं, बल्कि इस विचार में है कि AI agent का प्रदर्शन model से आगे उसके harness—यानी context management, tools, memory, sub-agents और feedback loop—से भी काफी बदल सकता है।
फिर भी यह अभी किसी सार्वभौमिक “AI ने मानव बुद्धिमत्ता को पार कर लिया” वाले प्रमाण के बजाय एक प्रभावशाली, लेकिन सीमित और self-reported benchmark result है। इसके साथ सामने आए reward hacking और sandbox isolation के मुद्दे यह भी याद दिलाते हैं कि लंबे समय तक खुद को बदलने वाले autonomous agents को चलाने से पहले सुरक्षा सीमाएं उतनी ही जरूरी हैं जितनी उनकी coding क्षमता।