DeepSeek V4 Pro 0813 ने लगभग 295 डॉलर की लागत में तीन संयुक्त रन के दौरान 32 में से 28 कमजोरियां खोजीं। यह benchmark का सर्वोच्च pooled recall था, लेकिन इसका अर्थ यह नहीं कि एक ही रन में मॉडल भरोसेमंद रूप से 28 कमजोरि... नतीजे एक orchestrated security system के पक्ष में हैं: व्यापक खोज के लिए किफायती एजेंट, सत्यापन...
शोध उत्तर

Create a landscape editorial hero image for this Studio Global article: What did Aikido’s August 2026 benchmark of 10 AI models—using 11.7 billion tokens, 32 recently disclosed real-world vulnerabilities, three i. Article summary: Aikido’s result was not that one model is universally “best,” but that agentic vulnerability discovery is highly stochastic and system-dependent. Pooling three independent, internet-free investigations materially improve. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Aikido के अगस्त 2026 के benchmark में 10 AI मॉडलों को 32 हाल में सार्वजनिक की गई कमजोरियों को दोबारा खोजने का काम दिया गया। हर मॉडल के तीन internet-free, 30-turn रन किए गए। निष्कर्ष में सबसे ज्यादा चर्चा DeepSeek V4 Pro 0813 की हुई, जिसने तीनों रन के परिणाम मिलाने पर 32 में से 28 कमजोरियां खोजीं—लगभग 87.5% pooled recall। 3
लेकिन इस परीक्षण का बड़ा सबक केवल यह नहीं है कि कौन-सा मॉडल पहले स्थान पर रहा। असली सवाल यह है कि सुरक्षा-जांच के लिए मॉडल को किस तरह के tools, memory, reruns, validation और role-based workflow के साथ इस्तेमाल किया जाए।
DeepSeek V4 Pro 0813 ने तीन रन मिलाकर 28/32 कमजोरियां खोजीं और इसकी लागत करीब 295 डॉलर रही। यह discovery stage के लिए benchmark का सबसे मजबूत परिणाम था।
फिर भी 28/32 को pass@3 pooled recall के रूप में समझना चाहिए। यह किसी एक invocation में 28 कमजोरियां खोजने की गारंटी नहीं है। अलग-अलग रन अलग files, code paths और exploit hypotheses तलाश सकते हैं। परिणामों को मिलाने से search diversity बढ़ती है और कुल coverage बेहतर होती है। 3
व्यावहारिक रूप से इसका मतलब है कि सुरक्षा-जांच में मॉडल का पहला उत्तर अंतिम assessment नहीं माना जाना चाहिए। कई स्वतंत्र जांचें चलाकर उनके निष्कर्षों को बाद में validate और deduplicate करना अधिक प्रभावी हो सकता है।
DeepSeek Pro ने 28/32 का pooled recall हासिल किया। इसकी खासियत breadth यानी अधिक संभावित कमजोरियों तक पहुंच बनाना रही। इसलिए यह किसी security workflow के शुरुआती, exploratory चरण के लिए अच्छा विकल्प हो सकता है।
हालांकि इसके findings को production alert बनाने से पहले evidence-based validation, duplicate हटाने और severity review की जरूरत होगी।
DeepSeek Flash के तीन रन ने लगभग 108 डॉलर में 24/32 कमजोरियां खोजीं। यह coverage-per-dollar के लिहाज से प्रभावशाली परिणाम है।
Flash को कम लागत वाली parallel scans, अतिरिक्त reruns या बड़े codebase की शुरुआती छानबीन में लगाया जा सकता है। लेकिन इसे अकेले अंतिम reviewer मानना जरूरी नहीं। इसका सबसे बड़ा फायदा यह है कि सीमित budget में अधिक investigative attempts चलाए जा सकते हैं। 3
Grok 4.6 की खासियत कुल coverage नहीं, बल्कि repeatability रही। इसकी 21 कमजोरियां तीनों रन में हर बार मिलीं।
यह consistency उन टीमों के लिए महत्वपूर्ण हो सकती है जिन्हें नियमित monitoring, predictable reports और scans के बीच स्थिर व्यवहार चाहिए। दूसरी ओर, DeepSeek Pro जैसे exploratory मॉडल अलग-अलग रन में अलग findings खोजकर कुल coverage बढ़ा सकते हैं। इसलिए अधिक recall और अधिक consistency हमेशा एक ही चीज नहीं होती।
Claude Opus 5 ने 26/32 pooled recall हासिल किया, जबकि GPT-5.6 Sol 25/32 तक पहुंचा। दोनों उच्च प्रदर्शन वाले विकल्प रहे।
फिर भी benchmark ने इस धारणा को चुनौती दी कि सबसे महंगा closed model ही vulnerability coverage में अनिवार्य रूप से सर्वश्रेष्ठ होगा। किसी मॉडल का चयन केवल brand या सामान्य benchmark reputation के आधार पर नहीं होना चाहिए। यह देखना जरूरी है कि उसका reasoning, reporting या review behavior पूरे security pipeline में क्या अतिरिक्त मूल्य जोड़ता है। 3
Kimi K3 का standout result 92.3% pooled precision रहा। Precision यह बताता है कि रिपोर्ट किए गए findings में से कितने स्वीकार किए गए; यह कुल खोजी गई कमजोरियों की संख्या नहीं बताता।
यही अंतर Kimi को broad-search मॉडल से अलग भूमिका देता है। High-recall agent ज्यादा संभावित समस्याएं खोज सकता है, भले ही उसके साथ कुछ noise भी आए। High-precision मॉडल findings की पुष्टि करने, रिपोर्ट तैयार करने और engineers तक पहुंचने वाले alerts की संख्या घटाने में मदद कर सकता है।
Aikido ने देखा कि Qwen3.8-Max कभी-कभी उसी CVE या reasoning path पर लौटता रहा। अगर इससे नए evidence या coverage के बिना investigation turns खर्च होते हैं, तो यह अक्षम व्यवहार है।
लेकिन दूसरी बार की जांच हमेशा बेकार नहीं होती। दोहराया गया examination किसी छूटी हुई condition, execution path या validation detail को सामने ला सकता है। इसका व्यावहारिक समाधान harness-level state tracking है: agent को पता होना चाहिए कि कौन-सी files और hypotheses पहले ही जांची जा चुकी हैं, repeated branches पर सीमा होनी चाहिए और unresolved मामलों को fresh investigation में भेजा जाना चाहिए।
Updated comparison में GLM-5.3 का परिणाम 24/32 से बढ़कर 25/32 हुआ। इसकी लागत closed frontier विकल्पों की तुलना में कम रही।
इससे यह high-volume worker या ensemble के एक हिस्से के रूप में उपयोगी बनता है—खासकर तब, जब संगठन एक महंगे single pass पर निर्भर रहने के बजाय अधिक investigative runs चलाना चाहते हों।
Vulnerability-discovery system को केवल एक leaderboard number से नहीं परखा जाना चाहिए:
Discovery के लिए high recall और विविध investigative behavior उपयोगी हैं। Production alerting के लिए high precision, reproducible evidence, deduplication और सही risk ranking अधिक महत्वपूर्ण हैं। इसलिए जो मॉडल संभावित समस्याएं खोजने में अच्छा हो, वही बिना review के सीधे developers को alerts भेजने के लिए सही विकल्प हो—यह जरूरी नहीं।
इस benchmark का सबसे महत्वपूर्ण systems lesson यह है कि model performance stochastic यानी परिस्थितियों और investigation path के अनुसार बदलने वाली थी। एक रन केवल एक search path sample करता है। कई स्वतंत्र रन अलग hypotheses तलाशने की संभावना बढ़ाते हैं।
इसी वजह से DeepSeek के तीन अपेक्षाकृत सस्ते Pro रन अधिक महंगे frontier मॉडल के single pass के बराबर या उससे बेहतर कुल coverage दे सके। यहां performance की वास्तविक इकाई केवल model call नहीं है। पूरी investigation में मॉडल, tools, prompt, turn budget, memory, reruns और validation process शामिल होते हैं। 3
इन परिणामों पर आधारित deployment में discovery और judgment को अलग रखना बेहतर होगा:
यह model-routing approach open-weight और closed मॉडल को एक-दूसरे का simple drop-in replacement मानने से अधिक मजबूत है।
Aikido का परीक्षण उपयोगी संकेत देता है, लेकिन इसे AI security models की universal ranking नहीं माना जा सकता। इसमें 32 हाल में सार्वजनिक की गई कमजोरियां, हर मॉडल के तीन प्रयास और एक खास agent harness शामिल था। Programming language, repository structure, tool access, threat model, investigation budget और false positives के प्रति संगठन की सहनशीलता बदलने पर परिणाम भी बदल सकते हैं। 3
इसलिए सबसे संतुलित निष्कर्ष यह है कि इस setting में open-weight मॉडल—विशेष रूप से DeepSeek V4 Pro—repetition और orchestration के साथ closed frontier मॉडलों को चुनौती दे सकते हैं या उनसे बेहतर प्रदर्शन कर सकते हैं।
लेकिन बेहतर security product केवल उस मॉडल से नहीं बनता जिसका headline score सबसे ऊंचा हो। मजबूत सिस्टम वह है जो व्यापक discovery, विश्वसनीय validation, कम noise और ऐसा evidence एक साथ दे जिस पर security engineers कार्रवाई कर सकें।
Studio Global AI
इस पृष्ठ में एक स्रोत-समर्थित उत्तर शामिल है जिसे आप Studio Global के अंदर जारी रख सकते हैं।
DeepSeek V4 Pro 0813 ने लगभग 295 डॉलर की लागत में तीन संयुक्त रन के दौरान 32 में से 28 कमजोरियां खोजीं। यह benchmark का सर्वोच्च pooled recall था, लेकिन इसका अर्थ यह नहीं कि एक ही रन में मॉडल भरोसेमंद रूप से 28 कमजोरि...
DeepSeek V4 Pro 0813 ने लगभग 295 डॉलर की लागत में तीन संयुक्त रन के दौरान 32 में से 28 कमजोरियां खोजीं। यह benchmark का सर्वोच्च pooled recall था, लेकिन इसका अर्थ यह नहीं कि एक ही रन में मॉडल भरोसेमंद रूप से 28 कमजोरि... नतीजे एक orchestrated security system के पक्ष में हैं: व्यापक खोज के लिए किफायती एजेंट, सत्यापन और triage के लिए consistent या high precision मॉडल, और गंभीर निष्कर्षों के लिए मानवीय समीक्षा।