Intelligence Indeed ने बताया कि उसके InAgent/Z Agent ने OSWorld के 361 टास्क कॉन्फ़िगरेशन में 90.2% सफलता हासिल की—90% के ऊपर पहुंचने वाला पहला रिपोर्टेड परिणाम। OSWorld में एजेंट वास्तविक डेस्कटॉप वातावरणों में काम करते हैं और सफलता को अंतिम सिस्टम स्टेट की execution based जांच से परखा जाता है, केवल टेक्स्ट उत्तर स...
शोध उत्तर

Create a landscape editorial hero image for this Studio Global article: How did Chinese company Intelligence Indeed’s InAgent become the first computer-use agent to exceed 90% on the OSWorld benchmark—achieving 9. Article summary: The reported result is best understood as a system-level achievement, not evidence that InAgent has a uniquely superior foundation model. InAgent reportedly combined model reasoning with an execution “harness” that plans. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Intelligence Indeed ने अगस्त 2026 में कहा कि उसके कंप्यूटर-यूज़ उत्पाद ने—जिसे उसके अपने ऐलान में Z-Agent और अन्य रिपोर्टों में InAgent कहा गया है—OSWorld पर 90.2% टास्क-सक्सेस रेट हासिल की। कंपनी के अनुसार, यह 90% का आंकड़ा पार करने वाला पहला रिपोर्टेड प्रतिभागी था और एजेंटिक-फ्रेमवर्क सब-लीडरबोर्ड में भी पहले स्थान पर रहा। 18
22
लेकिन इस उपलब्धि का सबसे बड़ा संकेत यह नहीं है कि कोई एक मॉडल अब डेस्कटॉप ऑटोमेशन में सर्वज्ञ हो गया है। अहम बात यह है कि AI एजेंट का प्रदर्शन अब तेजी से उसके हार्नेस पर निर्भर है—यानी मॉडल के चारों ओर बना वह सॉफ्टवेयर ढांचा, जो उसकी योजना को नियंत्रित कार्रवाइयों में बदलता है, नतीजे की जांच करता है और विफलताओं से सुरक्षित ढंग से निपटता है।
रिपोर्टिंग में InAgent के OSWorld मूल्यांकन से ये आंकड़े जोड़े गए हैं:
ये कंपनी/रिपोर्ट में बताए गए परिणाम हैं, स्वतंत्र रूप से ऑडिट किए गए निष्कर्ष नहीं। उपलब्ध सामग्री में ऐसा सार्वजनिक तकनीकी विवरण नहीं है जो यह अलग-अलग स्पष्ट करे कि आधार मॉडल, टूल, प्रॉम्प्ट, मूल्यांकन सेटिंग या हार्नेस के किस हिस्से ने स्कोर में कितना योगदान दिया। यह फर्क महत्वपूर्ण है: किसी एजेंट का बेंचमार्क स्कोर मॉडल और सिस्टम के पूरे कॉन्फ़िगरेशन को मापता है, मॉडल की बुद्धिमत्ता को अकेले नहीं।
किसी एक समय के रिकॉर्ड को स्थायी लीडरबोर्ड स्थिति भी नहीं मानना चाहिए। सितंबर 2026 के एक तृतीय-पक्ष लीडरबोर्ड स्नैपशॉट में Qwen3.8 Max को OSWorld-Verified पर 86.1% के साथ शीर्ष पर बताया गया था। इससे स्पष्ट होता है कि लीडरबोर्ड रैंक और मूल्यांकन कॉन्फ़िगरेशन समय के साथ बदल सकते हैं। 3
OSWorld को ऐसे एजेंटों की जांच के लिए बनाया गया है जो असली कंप्यूटर वातावरणों में काम करें—न कि केवल स्क्रीनशॉट देखकर जवाब दें या नकली वेबपेज पर क्लिक करें। मूल बेंचमार्क में 369 वास्तविक दुनिया के कार्य हैं, जिनमें Chromium, LibreOffice, GIMP, Thunderbird, VLC और Visual Studio Code जैसे ऐप्स के साथ ऑपरेटिंग-सिस्टम और बहु-ऐप कार्य भी शामिल हैं। परिणाम कॉन्फ़िगर की गई शुरुआती स्थिति से अंतिम वातावरण की execution-based जांच द्वारा तय किए जाते हैं। 2
14
प्रचलित 361-टास्क कॉन्फ़िगरेशन में Google Drive के आठ कार्य हटा दिए जाते हैं, क्योंकि उनमें मैनुअल सेटअप की जरूरत पड़ सकती है। 14
इसलिए यह केवल “सही बटन दबाने” की परीक्षा नहीं है। एजेंट को इंटरफेस में रास्ता ढूंढना, कई चरणों में स्थिति बनाए रखना, फाइलों या ऐप की स्थिति बदलना और अंत में मशीन को अपेक्षित अंतिम अवस्था में छोड़ना होता है।
ऐतिहासिक संदर्भ इस 90.2% दावे को उल्लेखनीय बनाता है। OSWorld के मूल प्रकाशित संदर्भ में मनुष्यों ने 72.36% से अधिक कार्य पूरे किए, जबकि सर्वश्रेष्ठ मॉडल की सफलता 12.24% थी। 14 फिर भी, इसे कार्यस्थल की सार्वभौमिक क्षमता का पैमाना नहीं मानना चाहिए। बेंचमार्क नतीजे टास्क चयन, वातावरण की सेटिंग, एक्शन बजट, उपलब्ध टूल और एजेंट हार्नेस पर निर्भर रहते हैं।
प्रॉम्प्ट इंजीनियरिंग मॉडल को निर्देश देती है कि क्या करना है। कॉन्टेक्स्ट इंजीनियरिंग तय करती है कि उसे कौन-सी जानकारी दिखाई जाए। हार्नेस इंजीनियरिंग उस रनटाइम सिस्टम को डिजाइन करती है जो एजेंट के देखने, काम करने, स्थिति बनाए रखने, पूरा होने की पुष्टि करने और गलती से उबरने की प्रक्रिया नियंत्रित करता है।
एजेंट-सिस्टम डिजाइन पर एक सर्वे के अनुसार, execution harness वह इन्फ्रास्ट्रक्चर है जो एजेंट की धारणा, कार्रवाइयों और त्रुटि पहचानने व उससे उबरने की क्षमता को आकार देता है। इसमें ऑब्ज़र्वेशन डिजाइन, एक्शन स्पेस, execution sandboxing, कॉन्टेक्स्ट प्रबंधन और verification loops जैसे घटक शामिल होते हैं। 28
कंप्यूटर-यूज़ एजेंट के लिए एक मजबूत हार्नेस को आम तौर पर छह काम करने होते हैं:
यह परत प्रदर्शन में ठोस फर्क ला सकती है। एक अध्ययन में हार्नेस इंजीनियरिंग के दस चक्रों से Terminal-Bench 2 का pass@1 69.7% से बढ़कर 77.0% हुआ, जो उद्धृत मानव-डिज़ाइन किए हार्नेस के 71.9% बेसलाइन से अधिक था। यह अलग बेंचमार्क है, इसलिए इससे InAgent का OSWorld स्कोर सिद्ध नहीं होता; लेकिन यह व्यापक दावे का समर्थन करता है कि केवल मॉडल बदले बिना भी रनटाइम डिजाइन से बड़ा सुधार हो सकता है। 29
InAgent की रिपोर्टेड रणनीति का व्यावहारिक पहलू हाइब्रिड निष्पादन है: जहां भरोसेमंद प्रोग्रामेटिक इंटरफेस मौजूद हों वहां उनका उपयोग, और उपयुक्त API न होने पर इंसान जैसी GUI कार्रवाई। 22
कंपनियों में बहुत-से वर्कफ़्लो आधुनिक API-युक्त सेवाओं के साथ पुराने डेस्कटॉप सॉफ्टवेयर, वेंडर पोर्टल या आंतरिक सिस्टमों से जुड़े होते हैं। इनमें कभी-कभी स्क्रीन पर उपलब्ध इंटरफेस ही एकमात्र व्यावहारिक रास्ता होता है।
सिद्धांततः एजेंट हर चरण में अधिक भरोसेमंद मार्ग चुन सकता है:
OSWorld-MCP पर शोध भी बताता है कि कुछ परिस्थितियों में टूल इनवोकेशन कंप्यूटर-यूज़ टास्क की सफलता बढ़ा सकता है। रिपोर्टेड प्रयोगों में MCP टूल जोड़ने पर OpenAI o3 का स्कोर 15 स्टेप पर 8.3% से 17.6% और Claude 4 Sonnet का 50 स्टेप पर 38.9% से 45.0% हुआ। 24
हालांकि GUI ऑटोमेशन में इंटरफेस बदलाव, देरी, पॉप-अप, अस्पष्ट लक्ष्य, एक्सेस कंट्रोल, MFA और अपरिवर्तनीय कार्रवाइयों का जोखिम बना रहता है। हाइब्रिड मॉडल इन जोखिमों को कम कर सकता है, खत्म नहीं।
90.2% completion rate का सीधा अर्थ है कि 9.8% बेंचमार्क कार्य सफलतापूर्वक पूरे नहीं हुए। अगर 10,000 मिलते-जुलते कार्यों की काल्पनिक मात्रा लें, तो करीब 980 अपवाद सामने आएंगे—और इसमें वे गलतियां शामिल नहीं हैं जो बाहर से सफल दिखती हैं लेकिन कारोबारी नतीजा गलत पैदा करती हैं।
इससे स्कोर महत्वहीन नहीं हो जाता। इसका अर्थ यह हो सकता है कि सीमित, दोहराए जाने वाले और मजबूत नियंत्रण वाले कार्यों के लिए कंप्यूटर-यूज़ एजेंट उपयोगी स्तर के करीब पहुंच रहे हैं। लेकिन यह भुगतान, कानूनी फाइलिंग, सुरक्षा-महत्वपूर्ण काम या ग्राहक को प्रभावित करने वाले बदलावों को बिना निगरानी सौंपने की अनुमति नहीं है।
प्रोडक्शन में टीमों को केवल headline pass rate से आगे देखना चाहिए:
नया और कठिन OSWorld 2.0 भी सावधानी की जरूरत दिखाता है। इसमें 108 लंबे वर्कफ़्लो हैं और इसके मुख्य 500-स्टेप binary-completion मीट्रिक में रिपोर्टेड सर्वोच्च परिणाम केवल 20.6% था। यह संकेत है कि लंबी और अधिक यथार्थवादी प्रक्रियाओं में एजेंट अभी व्यापक, पेशेवर-स्तर के कंप्यूटर उपयोग से दूर हैं। 17
InAgent का रिपोर्टेड 90.2% परिणाम सबसे बेहतर तरीके से एजेंट-सिस्टम इंजीनियरिंग की उपलब्धि के रूप में देखा जाना चाहिए। बेहतर प्रॉम्प्ट और समृद्ध कॉन्टेक्स्ट अभी भी मायने रखते हैं, लेकिन भरोसेमंद ऑटोमेशन अब तेजी से मॉडल के आसपास की मशीनरी पर टिक रहा है: कार्य-विभाजन, टूल चयन, स्थायी स्टेट, सत्यापित पूर्णता, सीमित अधिकार और रिकवरी पथ।
कंपनियों के लिए उपयोगी सवाल केवल यह नहीं है कि कौन-सा मॉडल बेंचमार्क में शीर्ष पर है। सवाल यह है कि क्या एजेंट किसी खास वर्कफ़्लो को मापी जा सकने वाली शुद्धता, नियंत्रित दुष्प्रभावों और रुकने पर सुरक्षित मानव हस्तांतरण के साथ पूरा कर सकता है। ऊंचा OSWorld स्कोर इस सवाल पर संकेत दे सकता है—लेकिन अकेले इसका प्रमाण नहीं है।
Studio Global AI
इस पृष्ठ में एक स्रोत-समर्थित उत्तर शामिल है जिसे आप Studio Global के अंदर जारी रख सकते हैं।
Intelligence Indeed ने बताया कि उसके InAgent/Z Agent ने OSWorld के 361 टास्क कॉन्फ़िगरेशन में 90.2% सफलता हासिल की—90% के ऊपर पहुंचने वाला पहला रिपोर्टेड परिणाम।
Intelligence Indeed ने बताया कि उसके InAgent/Z Agent ने OSWorld के 361 टास्क कॉन्फ़िगरेशन में 90.2% सफलता हासिल की—90% के ऊपर पहुंचने वाला पहला रिपोर्टेड परिणाम। OSWorld में एजेंट वास्तविक डेस्कटॉप वातावरणों में काम करते हैं और सफलता को अंतिम सिस्टम स्टेट की execution based जांच से परखा जाता है, केवल टेक्स्ट उत्तर से नहीं।
90.2% सफलता का अर्थ फिर भी 9.8% असफल कार्य है; इसलिए संवेदनशील कार्यों में सत्यापन, सीमित अनुमतियां, अपवाद क्यू और मानव अनुमोदन जरूरी रहेंगे।