阿里巴巴的 Qwen-UI-Agent 是一款面向真實裝置的 GUI(圖形使用者介面)智能體基礎模型。它的操作方式不像傳統軟體代理主要依賴 API、瀏覽器自動化介面或應用程式內部工具,而是先「看懂」螢幕,再像人一樣點擊、輸入文字、按鍵與滑動。模型涵蓋手機、桌面電腦、網頁瀏覽與 DeepSearch 環境。阿里巴巴於 2026 年 8 月 20 日公開發布 Qwen-UI-Agent,相關技術報告則在 7 月 30 日刊登於 arXiv。
3
33
這項技術的實際意義在於:即使某項服務沒有合適的 API,只要人能透過一般介面完成操作,智能體理論上也可能協助自動化。不過,現有數據並不支持「Qwen-UI-Agent 在所有環境都全面勝出」的說法;它最明確的優勢,仍集中在行動裝置,尤其是真實手機上的測試。
Qwen-UI-Agent 能做什麼?
傳統代理程式通常透過結構化 API、瀏覽器自動化工具或應用程式專用介面執行任務。Qwen-UI-Agent 則把螢幕本身當成主要操作入口:它分析目前可見的畫面,找出相關按鈕或欄位,再選擇點擊、點按、輸入、按鍵或滑動等動作。
33
模型的動作空間也不只包含 GUI 操作,還整合了命令列執行。這表示一項較長的任務可以在瀏覽器、桌面應用程式與終端機之間切換,而不必把每一步都交給圖形介面完成。技術報告也描述了在單次模型回合中批次發出多個動作,目的是提升多步驟工作流程的效率。
1
為什麼「在真實手機上訓練」很重要?
GUI 智能體在模擬器中表現良好,不代表它能穩定操作真機。實際硬體會帶來螢幕版面、反應時間、觸控行為、裝置狀態與應用程式運作方式等差異,這也是許多模型從模擬環境轉移到真機後表現下滑的原因。
阿里巴巴表示,Qwen-UI-Agent 使用涵蓋 100 多部實體手機與 150 多款應用程式的真機行動環境。這些手機不只是最後展示成果時才使用,而是被用於建立任務、收集操作軌跡、訓練模型與進行評測。
3
5
專案另外建立了 MobileWorld-Real,包含超過 400 項跨行動應用程式的真機任務。該基準的 92.2% 成績,是評估模型在實體硬體上表現的重要證據;但由於基準由同一專案建立,因此不應視為完全獨立的第三方審核。
1
7
如何支援長時間、多步驟任務?
技術報告描述了超過 100 個回合的軌跡,以及超過 10,000 個並行 rollout 環境中的線上強化學習。報告也提出一套自動化研究迴圈,讓智能體協助建立任務與環境、分析失敗原因,並規劃下一輪訓練。
1
這套設計瞄準的不是單一按鈕能否按對,而是智能體能否在長流程中維持狀態:記住已完成的步驟、從錯誤中恢復,並在不同階段選擇正確的應用程式、介面或工具。
報告還介紹了支援有狀態、跨裝置工作流程與主動啟動服務的輕量級框架。從展示方向來看,未來的助理可能在使用者從手機換到電腦後接續任務,或在偵測到需要協助時主動採取行動,而不必等待使用者逐步下達指令。不過,這些展示反映的是系統的設計目標,不代表它已能在沒有監督的情況下安全處理所有開放世界任務。
1
公開基準成績如何?
技術報告給出的成績顯示,Qwen-UI-Agent 在行動端基準上最具優勢:
33
- MobileWorld:82.1%
- MobileWorld-Real:92.2%
- AndroidDaily:97.5%
- OSWorld-Verified:79.5%,評估桌面電腦操作
- OSWorld-v2:40.0%,為部分進度分數
- WebArena:73.6%,評估瀏覽器任務
- ScreenSpot-Pro:81.5%,評估 GUI 定位能力
在 MobileWorld 的一組公開比較中,GPT-5.6 Sol 得分 70.1%,Claude Opus 4.8 得分 67.5%;Qwen-UI-Agent 分別領先 12.0 與 14.6 個百分點。
7
不過,桌面與瀏覽器的數據需要更仔細解讀。Qwen-UI-Agent 在 OSWorld-Verified 的 79.5% 是相當亮眼的成績,但公開比較資料顯示 Claude Opus 4.8 在該測試中達到更高分數。至於 OSWorld-v2 的 40.0%,它是「部分進度」指標,不能解讀成完成了 40% 的完整任務。
33
34
36
WebArena 的 73.6% 分數有來源支持,但現有資料不足以確認它在所有比較組合中都無爭議地排名第一。實際排名會受到參測模型、模型版本、評估流程與基準切分方式影響。
1
8
GUI 加 CLI:一項任務可以怎樣完成?
Qwen-UI-Agent 的重點不只是「會按按鈕」。報告描述的工作流程包括:透過瀏覽器與桌面介面研究金融資訊,使用命令列工具進行分析或檔案操作,最後再透過 GUI 應用程式建立並儲存文件。
1
這種混合模式讓智能體可以因應不同步驟選擇更合適的工具:需要看見畫面時使用 GUI,需要進行結構化檔案處理或資料分析時切換至終端機。真正困難的地方,在於跨應用程式協調這些工具,同時維持任務狀態不被打亂。
同樣的架構也指向跨裝置助理:工作可以從手機開始,在桌面電腦繼續,並跨越多個應用程式完成,而不必要求每項服務都提供專用 API。實際部署時,能否可靠處理登入驗證、意外畫面與不可逆操作,仍會是關鍵挑戰。
能操作螢幕,也代表安全風險更高
能控制螢幕的智能體,同樣可能接觸敏感資料、刪除檔案、提交表單或發起交易。因此,理想的安全機制應包括拒絕違法或高風險要求、在資訊不足時先提問,並在付款、刪除檔案或授權隱私權限等敏感操作前取得使用者確認。
但目前提供的主要技術報告證據,並未獨立驗證原始要求中提到的每一項拒絕與確認示範。因此,這些行為應視為已報告或預期中的控制措施,而不是已獲充分證明、可直接用於無人監督部署的安全保證。
同樣地,基準分數也不能證明模型已準備好在一般使用者帳戶中自主運作。真正的產品部署還需要細緻的權限邊界、確認關卡、稽核記錄、隨時中斷功能、錯誤復原,以及在不同裝置與應用程式上的獨立測試。
Qwen-UI-Agent 對電腦操作型 AI 意味著什麼?
Qwen-UI-Agent 最清楚的貢獻,是把焦點放在「真實介面」本身。使用 100 多部手機進行訓練,並在實體硬體上評測,讓它的行動端結果比只在模擬器測試的模型更貼近裝置控制情境。統一 GUI 與 CLI 的動作空間,也提供了一種可跨應用程式、瀏覽器、桌面與終端機處理長流程的實用架構。
1
3
現有證據支持一項較強的結論:Qwen-UI-Agent 是值得關注的真機 GUI 智能體,並在多項行動端基準上取得領先的公開成績。至於桌面與瀏覽器,它的表現具競爭力,但不能概括為在每個基準、每種比較中都勝過所有前沿模型。
下一個真正的考驗,不只是智能體能否完成寫好的基準腳本,而是它能否在畫面突然改變、資訊不完整或操作後果不可逆時,仍然可靠地完成日常工作,同時保持可預測、可中斷、透明且安全。