Qwen UI Agent 係阿里於 2026 年 8 月 20 日公開發布嘅 GUI 智能體基礎模型,能夠讀取畫面,再執行點擊、鍵盤輸入、文字輸入同滑動等操作。 模型訓練及評測環境涵蓋超過 100 部真實手機同 150 款以上應用程式,並配合超過 400 項任務嘅 MobileWorld Real 真機基準。
研究答案

Create a landscape editorial hero image for this Studio Global article: What is Alibaba Qwen’s Qwen-UI-Agent, released on August 20, 2026, and how does its GUI-agent foundation model use real-device training acro. Article summary: Qwen-UI-Agent is Alibaba Qwen’s real-world GUI-agent foundation model: it operates phones, desktops, browsers, and DeepSearch environments by interpreting what is displayed on screen and taking actions such as clicks, ke. Topic tags: general, general web, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake num
阿里嘅 Qwen-UI-Agent 係一款 GUI 智能體基礎模型。所謂 GUI,即係圖形使用者介面;模型唔係淨係靠應用程式介面(API)或者特定 App 嘅內部工具,而係直接「睇」螢幕,再模仿人嘅操作:撳掣、點擊、打字、輸入文字同滑動。佢覆蓋手機、桌面電腦、瀏覽器,以及 DeepSearch 深度搜尋環境。阿里喺 2026 年 8 月 20 日公開發布模型,而技術報告就喺同年 7 月 30 日登上 arXiv。3
33
呢個方向嘅實際價值好清楚:就算某個網站或者服務冇提供合適 API,智能體仍然可以嘗試透過一般介面完成工作。不過,基準成績唔代表 Qwen-UI-Agent 喺所有場景都係天下無敵。現時最有說服力嘅優勢,主要出現喺手機,尤其係真實手機上面。
傳統軟件智能體通常會連接結構化 API、瀏覽器自動化工具,或者某個 App 專用嘅控制介面。Qwen-UI-Agent 就將「畫面本身」當成操作入口:先辨認螢幕上見到嘅內容,再判斷下一步應該點擊邊度、輸入乜嘢,或者向邊個方向滑動。33
佢嘅動作空間亦唔限於 GUI。模型可以將圖形介面操作同命令列(CLI)指令放喺同一個工作流程入面,即係可以先用瀏覽器搵資料,再轉去桌面應用程式處理文件,期間需要分析檔案時亦可以改用終端機。技術報告提到,模型一個回合內可以批量發出多個動作,目的係減少長流程入面逐步操作嘅成本。1
換句話講,重點唔係 AI 只係學識「撳一下掣」,而係要喺多個 App、瀏覽器頁面同終端機之間保持住任務狀態,知道之前做過乜、下一步要做乜,以及出錯時點樣繼續。
GUI 智能體喺模擬器入面表現好,唔代表一落到真實手機就一樣穩陣。實體裝置會有螢幕比例、版面、載入時間、觸控反應、系統狀態同 App 行為等差異;一個喺模擬環境學識嘅操作,去到真機可能因為畫面稍有不同就失效。
Qwen-UI-Agent 嘅環境據報覆蓋超過 100 部實體手機同 150 款以上 App。呢批硬件唔係只用嚟最後示範,而係用於建立任務、收集操作軌跡、訓練模型,同埋進行評測。3
5
團隊亦建立咗 MobileWorld-Real,當中有超過 400 項跨手機 App 嘅真機任務。由於呢個基準係項目團隊自行建立,所以 92.2% 呢個數字確實反映模型喺實體硬件上嘅表現,但唔應該當成完全獨立嘅第三方審核結果。1
7
技術報告描述咗一套在線強化學習(online reinforcement learning)訓練流程,處理超過 100 個回合嘅操作軌跡,並使用超過 10,000 個同步 rollout 環境。報告亦提到一個自動化研究循環:由智能體協助建立任務同環境、分析失敗原因,再規劃下一輪訓練。1
呢套設計針對嘅唔係單一按鈕任務,而係長流程入面嘅「記性」同「執手尾」能力。實用嘅智能體要記得已經完成咗邊啲步驟,遇到錯誤時可以復原,亦要喺適當時候揀 GUI 或 CLI 工具。
報告另外介紹咗一個支援有狀態、跨裝置工作流程嘅輕量級 harness,以及主動啟動服務嘅能力。理論上,使用者可以由手機開始一項工作,再喺電腦接住做;系統亦可以喺偵測到需要時主動發起有幫助嘅行動,而唔係等用戶每一步逐句落指令。不過,呢啲示範代表項目想發展嘅方向,唔等於已經證明模型可以喺完全開放嘅現實環境安全處理所有任務。1
技術報告列出嘅主要結果包括:33
喺 MobileWorld,提供嘅比較資料顯示,GPT-5.6 Sol 得分 70.1%,Claude Opus 4.8 得分 67.5%;Qwen-UI-Agent 分別高出 12.0 個百分點同 14.6 個百分點。7
但去到桌面同瀏覽器,解讀就要保守啲。Qwen-UI-Agent 喺 OSWorld-Verified 得 79.5%,成績唔弱,但比較資料顯示 Claude Opus 4.8 喺同一基準更高。至於 OSWorld-v2 嘅 40.0%,係「部分進度」分數,唔係話模型完成咗 40% 嘅完整任務。33
34
36
WebArena 嘅 73.6% 有來源支持,但現有資料未足以證明佢喺所有比較組合中都係毫無爭議嘅第一名。實際排名會受參與模型、模型版本、評測流程同 benchmark split 影響。1
8
報告描述嘅示範包括:智能體透過瀏覽器同桌面介面搜尋金融資料,再用命令列工具做分析或者處理檔案,最後喺 GUI 應用程式入面建立同儲存文件。1
呢種做法嘅好處係,模型唔需要凡事都用同一種工具。需要睇畫面、選單或者按鈕時就用 GUI;要處理結構化檔案、跑分析或者整理資料時,就可以轉用終端機。真正困難嘅地方,在於兩邊切換之後仍然記得任務進度,並確保唔會因為一個工具嘅輸出而搞錯另一個 App 嘅狀態。
同一個設計亦指向跨裝置助手:流程可以喺手機開始,之後轉到電腦,再跨越多個 App 完成,而唔需要每項服務都另外提供專用 API。當然,實際可靠程度仍然取決於登入驗證點處理、遇到意外畫面時點樣復原,以及涉及金錢、刪除或者其他不可逆後果嘅動作有冇清晰限制。
一個可以控制螢幕嘅智能體,同時亦可能接觸敏感資料、刪除檔案、提交表格,甚至發起交易。因此,合理嘅安全設計應該包括:拒絕違法或高風險要求、資料不足時主動追問,以及喺付款、刪除檔案、授予私隱權限等敏感操作之前要求用戶確認。
不過,現有主要技術報告資料未有獨立驗證原始要求所提到嘅每一個拒絕及確認示範。因此,呢類行為應該視為項目所報告或者預期加入嘅控制措施,唔可以當成已經充分證明模型適合安全部署嘅證據。
同樣道理,benchmark 分數亦唔代表模型已經可以無人監督咁操作普通用戶嘅帳戶。真正落地之前,仍然需要權限分層、敏感操作確認閘、審計紀錄、隨時中斷機制、錯誤復原,以及喺不同裝置同 App 上進行獨立測試。
Qwen-UI-Agent 最清晰嘅貢獻,係將焦點放返喺實體介面。模型用超過 100 部手機訓練,並喺真實硬件上評測,令手機控制結果比單靠模擬器測試更貼近實際裝置。1
3
另外,將 GUI 同 CLI 放入統一動作空間,亦提供咗一個較實際嘅長流程架構:智能體可以跨越 App、瀏覽器、桌面同終端機,按情況揀最有效率嘅操作方式。
所以,現有證據支持一個較強嘅結論:Qwen-UI-Agent 係一款值得留意、喺多個手機基準取得領先報告成績嘅真機 GUI 智能體。至於桌面同瀏覽器,較準確嘅講法係表現具競爭力,但唔係喺每個前沿模型或每個 benchmark 上都全面勝出。
下一關唔係證明 AI 可以完成一套寫好嘅測試題,而係要睇佢可唔可以喺畫面突然改變、資料唔完整,或者下一步一旦做錯就無法挽回嘅情況下,仍然穩定、透明、可中斷同安全咁幫人處理日常工作。
Studio Global AI
此頁麵包含一個有來源支援的答案,您可以在 Studio Global 內繼續。
Qwen UI Agent 係阿里於 2026 年 8 月 20 日公開發布嘅 GUI 智能體基礎模型,能夠讀取畫面,再執行點擊、鍵盤輸入、文字輸入同滑動等操作。
Qwen UI Agent 係阿里於 2026 年 8 月 20 日公開發布嘅 GUI 智能體基礎模型,能夠讀取畫面,再執行點擊、鍵盤輸入、文字輸入同滑動等操作。 模型訓練及評測環境涵蓋超過 100 部真實手機同 150 款以上應用程式,並配合超過 400 項任務嘅 MobileWorld Real 真機基準。
模型最突出嘅成績集中喺手機端:MobileWorld 得分 82.1%、MobileWorld Real 得分 92.2%、AndroidDaily 得分 97.5%;電腦同瀏覽器表現則屬具競爭力,但唔係每個基準都穩居第一。