Alibaba ने Qwen UI Agent को 20 अगस्त 2026 को जारी किया; इसका तकनीकी पेपर 30 जुलाई को arXiv पर प्रकाशित हुआ था। [3] [33] मॉडल स्क्रीन देखकर क्लिक, टैप, टाइप और स्वाइप कर सकता है तथा एक ही एक्शन स्पेस में GUI और कमांड लाइन कार्यों को जोड़ता है। [1] [33] इसे 100 से अधिक असली फोन और 150 से अधिक ऐप वाले वातावरण में विकसि...
शोध उत्तर

Create a landscape editorial hero image for this Studio Global article: What is Alibaba Qwen’s Qwen-UI-Agent, released on August 20, 2026, and how does its GUI-agent foundation model use real-device training acro. Article summary: Qwen-UI-Agent is Alibaba Qwen’s real-world GUI-agent foundation model: it operates phones, desktops, browsers, and DeepSearch environments by interpreting what is displayed on screen and taking actions such as clicks, ke. Topic tags: general, general web, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake num
Alibaba का Qwen-UI-Agent ऐसा GUI-एजेंट फाउंडेशन मॉडल है जिसे सॉफ्टवेयर चलाने के लिए किसी व्यक्ति की तरह स्क्रीन देखने और उस पर कार्रवाई करने के लिए बनाया गया है। यह फोन, डेस्कटॉप कंप्यूटर, वेब ब्राउज़र और DeepSearch वातावरण में दिखाई देने वाले इंटरफेस को समझकर क्लिक, टैप, कीबोर्ड इनपुट, टेक्स्ट टाइपिंग और स्वाइप जैसे कदम उठा सकता है। इसके लिए हर सेवा की अलग API या ऐप के अंदर की विशेष तकनीकी व्यवस्था जरूरी नहीं होती। Alibaba ने इसे 20 अगस्त 2026 को सार्वजनिक किया, जबकि इसका तकनीकी रिपोर्ट 30 जुलाई को arXiv पर आया था। 3
33
इस मॉडल की सबसे अहम बात यह है कि इसे सिर्फ एमुलेटर की स्क्रीन पर नहीं, बल्कि असली डिवाइसों के साथ काम करने के लिए प्रशिक्षित और परखा गया। हालांकि इसके प्रदर्शन को हर क्षेत्र में सर्वश्रेष्ठ बताना सही नहीं होगा। उपलब्ध आंकड़ों में इसकी बढ़त सबसे स्पष्ट रूप से मोबाइल, खासकर वास्तविक फोन पर किए गए कार्यों में दिखाई देती है।
कई पारंपरिक AI एजेंट API, ब्राउज़र ऑटोमेशन हुक या ऐप-विशिष्ट टूल के जरिए सॉफ्टवेयर से जुड़ते हैं। Qwen-UI-Agent इसके बजाय इंटरफेस को ही बातचीत का माध्यम मानता है। यह स्क्रीन पर मौजूद चीजों को पढ़ता है, जरूरी बटन या फील्ड पहचानता है और फिर उपयुक्त कार्रवाई चुनता है—जैसे किसी बटन पर क्लिक करना, मोबाइल स्क्रीन पर टैप करना, टेक्स्ट भरना या पेज को स्क्रॉल करने के लिए स्वाइप करना। 33
मॉडल का एक्शन स्पेस केवल ग्राफिकल इंटरफेस तक सीमित नहीं है। इसमें कमांड-लाइन यानी टर्मिनल के जरिए किए जाने वाले कार्य भी शामिल हैं। इसलिए कोई लंबा वर्कफ़्लो ब्राउज़र से डेस्कटॉप ऐप और फिर टर्मिनल तक जा सकता है। तकनीकी रिपोर्ट में एक मॉडल टर्न के भीतर कई कार्रवाइयों को बैच में करने का भी उल्लेख है, ताकि बहु-चरणीय कार्य अपेक्षाकृत कुशलता से पूरे किए जा सकें। 1
एमुलेटर में सफल दिखने वाला GUI एजेंट असली फोन पर पहुंचते ही लड़खड़ा सकता है। वास्तविक हार्डवेयर में स्क्रीन लेआउट, टच का समय, ऐप की स्थिति, नोटिफिकेशन, डिवाइस सेटिंग और ऐप के व्यवहार में अंतर होता है। यही वजह है कि असली फोन पर प्रशिक्षण और मूल्यांकन, सिमुलेशन से वास्तविक दुनिया तक की दूरी कम करने में मदद कर सकता है।
Alibaba के अनुसार, Qwen-UI-Agent के लिए 100 से अधिक भौतिक फोन और 150 से अधिक ऐप वाला मोबाइल वातावरण तैयार किया गया। इन डिवाइसों का उपयोग केवल अंतिम डेमो के लिए नहीं, बल्कि कार्य बनाने, उपयोग-ट्रैजेक्टरी इकट्ठा करने, मॉडल को प्रशिक्षित करने और मूल्यांकन करने में भी किया गया। 3
5
प्रोजेक्ट ने MobileWorld-Real नाम का एक वास्तविक-डिवाइस बेंचमार्क भी बनाया, जिसमें मोबाइल ऐप से जुड़े 400 से अधिक कार्य हैं। इस बेंचमार्क पर 92.2% का स्कोर असली हार्डवेयर पर प्रदर्शन का उपयोगी संकेत है, लेकिन चूंकि बेंचमार्क उसी प्रोजेक्ट ने तैयार किया है, इसे पूरी तरह स्वतंत्र ऑडिट नहीं माना जाना चाहिए। 1
7
तकनीकी रिपोर्ट में 100 से अधिक टर्न वाली ट्रैजेक्टरी पर ऑनलाइन रिइनफोर्समेंट लर्निंग और 10,000 से अधिक समानांतर रोलआउट वातावरण का वर्णन है। इसमें एक स्वचालित शोध चक्र भी बताया गया है, जिसमें एजेंट कार्य और वातावरण बनाने, असफलताओं का विश्लेषण करने और अगली ट्रेनिंग प्रक्रिया की योजना बनाने में सहायता करते हैं। 1
इसका लक्ष्य केवल किसी एक बटन को सही जगह दबाना नहीं है। लंबे कार्यों में एजेंट को यह याद रखना पड़ता है कि वह अब तक क्या कर चुका है, गलती होने पर उससे उबरना पड़ता है और हर चरण पर सही ऐप या टूल चुनना होता है।
रिपोर्ट में stateful, cross-device workflows के लिए एक हल्के harness और proactive service initiation का भी उल्लेख है। इसका अर्थ ऐसे सहायक की दिशा से है जो उपयोगकर्ता के फोन से कंप्यूटर पर जाने के बाद भी काम जारी रख सके या हर बार अलग निर्देश की प्रतीक्षा करने के बजाय किसी उपयोगी हस्तक्षेप की शुरुआत कर सके। ये उदाहरण मॉडल की लक्षित क्षमताओं को दिखाते हैं; वे यह साबित नहीं करते कि यह हर खुले और अनिश्चित वास्तविक कार्य को बिना निगरानी सुरक्षित रूप से कर सकता है। 1
तकनीकी रिपोर्ट में मोबाइल-उपयोग वाले बेंचमार्क पर इसके सबसे मजबूत परिणाम दर्ज किए गए हैं: 33
उपलब्ध तुलना में MobileWorld पर GPT-5.6 Sol का स्कोर 70.1% और Claude Opus 4.8 का 67.5% बताया गया है। इस आधार पर Qwen-UI-Agent क्रमशः 12.0 और 14.6 प्रतिशत अंक आगे है। 7
फिर भी डेस्कटॉप और ब्राउज़र के परिणामों को सावधानी से पढ़ना चाहिए। OSWorld-Verified का 79.5% मजबूत स्कोर है, लेकिन उपलब्ध तुलनाओं में Claude Opus 4.8 इससे ऊपर है। इसी तरह OSWorld-v2 का 40.0% पूर्ण कार्यों की सफलता दर नहीं, बल्कि partial-progress स्कोर है। इसका मतलब है कि कार्यों को पूरी तरह पूरा करने के बजाय बीच तक हुई प्रगति भी मापी गई है। 33
34
36
WebArena पर 73.6% का स्कोर स्रोतों से समर्थित है, लेकिन उपलब्ध प्रमाण हर तुलना समूह में निर्विवाद प्रथम स्थान साबित नहीं करते। रैंकिंग मॉडल के संस्करण, शामिल किए गए प्रतिस्पर्धी मॉडल, मूल्यांकन पद्धति और बेंचमार्क स्प्लिट के साथ बदल सकती है। 1
8
Qwen-UI-Agent का महत्व केवल यह नहीं है कि वह बटन दबा सकता है। रिपोर्ट में ऐसे वर्कफ़्लो का वर्णन है जिसमें एजेंट ब्राउज़र और डेस्कटॉप इंटरफेस के जरिए वित्तीय जानकारी जुटाता है, विश्लेषण या फाइल ऑपरेशन के लिए कमांड-लाइन टूल का उपयोग करता है और फिर GUI ऐप में दस्तावेज बनाकर सेव करता है। 1
इस मिश्रित तरीके से एजेंट के पास किसी चरण को पूरा करने के लिए एक से अधिक रास्ते होते हैं। जहां दृश्य इंटरफेस जरूरी हो, वहां वह स्क्रीन के जरिए काम कर सकता है; वहीं संरचित फाइल प्रबंधन या विश्लेषण के लिए टर्मिनल अधिक तेज हो सकता है। असली चुनौती इन सभी टूल के बीच तालमेल रखते हुए अलग-अलग ऐप में काम की स्थिति को बरकरार रखना है।
यही ढांचा cross-device assistance की दिशा भी दिखाता है। कोई कार्य फोन पर शुरू होकर कंप्यूटर पर जारी रह सकता है और बीच में कई ऐप इस्तेमाल हो सकते हैं—बिना इस शर्त के कि हर सेवा के लिए अलग API उपलब्ध हो। व्यावहारिक उपयोग में इसकी विश्वसनीयता फिर भी लॉगिन और प्रमाणीकरण, अचानक बदलती स्क्रीन से रिकवरी और वास्तविक असर वाले कार्यों पर नियंत्रण जैसी बातों पर निर्भर करेगी।
जो एजेंट स्क्रीन चला सकता है, वह संवेदनशील डेटा तक पहुंच सकता है, फाइल मिटा सकता है, फॉर्म जमा कर सकता है या कोई लेन-देन शुरू कर सकता है। इसलिए सुरक्षित डिजाइन में अवैध या उच्च-जोखिम वाले अनुरोधों को रोकना, अधूरी जानकारी पर सवाल पूछना और भुगतान, फाइल हटाने या प्राइवेसी अनुमति जैसे संवेदनशील कदमों से पहले उपयोगकर्ता की पुष्टि लेना जरूरी होगा।
हालांकि उपलब्ध प्राथमिक तकनीकी रिपोर्ट से मूल अनुरोध में बताए गए हर अलग refusal और confirmation डेमो की स्वतंत्र पुष्टि नहीं होती। इसलिए इन व्यवहारों को रिपोर्ट की गई या इच्छित सुरक्षा व्यवस्थाओं के रूप में देखना चाहिए, न कि सुरक्षित तैनाती का निर्णायक प्रमाण।
बेंचमार्क स्कोर भी यह साबित नहीं करते कि मॉडल सामान्य उपयोगकर्ताओं के खातों में बिना निगरानी काम करने के लिए तैयार है। वास्तविक तैनाती के लिए स्पष्ट अनुमति सीमाएं, पुष्टि के चरण, ऑडिट लॉग, तुरंत रोकने की सुविधा, त्रुटि से उबरने की क्षमता और अलग-अलग डिवाइस व ऐप पर स्वतंत्र परीक्षण जरूरी होंगे।
Qwen-UI-Agent का सबसे स्पष्ट योगदान असली भौतिक इंटरफेस पर जोर है। 100 से अधिक फोन पर प्रशिक्षण और वास्तविक हार्डवेयर पर मूल्यांकन, मोबाइल नियंत्रण के लिए एमुलेटर-आधारित परीक्षण से अधिक प्रासंगिक तस्वीर देते हैं। GUI और CLI को एक ही एक्शन स्पेस में जोड़ना भी ऐसे लंबे वर्कफ़्लो के लिए व्यावहारिक वास्तुकला का संकेत देता है, जो ऐप, ब्राउज़र, डेस्कटॉप और टर्मिनल के बीच चलते हैं। 1
3
उपलब्ध प्रमाण मोबाइल क्षेत्र में मजबूत निष्कर्ष का आधार देते हैं: Qwen-UI-Agent वास्तविक डिवाइसों पर काम करने वाला उल्लेखनीय GUI एजेंट है और कई मोबाइल बेंचमार्क में इसके रिपोर्टेड परिणाम अग्रणी हैं। डेस्कटॉप और ब्राउज़र के लिए निष्कर्ष अधिक संतुलित है—प्रदर्शन प्रतिस्पर्धी है, लेकिन हर मॉडल और हर बेंचमार्क में यह लगातार सबसे आगे नहीं है।
अगली असली परीक्षा यह नहीं होगी कि एजेंट किसी तयशुदा बेंचमार्क को पूरा कर सकता है या नहीं। सवाल यह होगा कि स्क्रीन बदलने, जानकारी अधूरी होने या किसी कदम के अपरिवर्तनीय परिणाम होने पर भी क्या वह रोजमर्रा के काम को अनुमानित, पारदर्शी, रोके जा सकने वाले और सुरक्षित तरीके से कर सकता है।
Studio Global AI
इस पृष्ठ में एक स्रोत-समर्थित उत्तर शामिल है जिसे आप Studio Global के अंदर जारी रख सकते हैं।
Alibaba ने Qwen UI Agent को 20 अगस्त 2026 को जारी किया; इसका तकनीकी पेपर 30 जुलाई को arXiv पर प्रकाशित हुआ था। [3] [33]
Alibaba ने Qwen UI Agent को 20 अगस्त 2026 को जारी किया; इसका तकनीकी पेपर 30 जुलाई को arXiv पर प्रकाशित हुआ था। [3] [33] मॉडल स्क्रीन देखकर क्लिक, टैप, टाइप और स्वाइप कर सकता है तथा एक ही एक्शन स्पेस में GUI और कमांड लाइन कार्यों को जोड़ता है। [1] [33]
इसे 100 से अधिक असली फोन और 150 से अधिक ऐप वाले वातावरण में विकसित किया गया; मोबाइल बेंचमार्क में इसके प्रमुख स्कोर MobileWorld पर 82.1%, MobileWorld Real पर 92.2% और AndroidDaily पर 97.5% हैं। [3] [5] [33]