阿里 Qwen 团队于 2026 年 8 月 20 日公开发布了 Qwen-UI-Agent,一款面向真实设备的 GUI(图形用户界面)智能体基础模型。它的目标不是只通过 API 或应用内部接口调用服务,而是像人一样“看”屏幕,再执行点击、键盘输入、文字录入和滑动等操作,覆盖手机、桌面电脑、网页浏览以及 DeepSearch 环境。项目技术报告于 2026 年 7 月 30 日发布在 arXiv。
3
33
这一路线的实际意义很直接:只要人能通过普通界面完成任务,智能体理论上就可能在没有合适 API 的服务中完成自动化。不过,Qwen-UI-Agent 的成绩并不是“所有场景全面碾压”的简单故事。现有证据显示,它最突出的优势集中在移动端,尤其是真实手机上的操作。
Qwen-UI-Agent 到底会做什么?
传统软件智能体通常依赖结构化 API、浏览器自动化接口,或针对某个应用定制的工具。Qwen-UI-Agent 则把屏幕本身作为交互入口:先识别当前界面和控件,再决定在哪里点击、输入什么内容,或者如何滑动。一个模型同时面向手机、电脑、浏览器和 DeepSearch 工作流,而不是为每种环境分别配置一套代理。
33
它的动作空间还把 GUI 操作与命令行执行结合起来。一个较长的任务可以先在浏览器中查资料,再切换到终端进行文件处理或分析,最后回到桌面应用中生成并保存文档。技术报告还介绍了在一次模型调用中批量发出动作的设计,目的是减少多步骤任务中的额外开销。
1
换句话说,它的重点不只是“会点按钮”,而是能否在多个应用和工具之间保持任务状态,并在图形界面与命令行之间选择更合适的完成方式。
为什么要用真实手机训练?
GUI 智能体在模拟器中表现良好,并不意味着它能顺利操作真实设备。现实手机会带来屏幕布局、响应时序、触控行为、设备状态和应用表现等差异,这些因素都可能让智能体在从模拟环境迁移到真机时失效。
阿里介绍的移动环境覆盖 100 多台真实手机和 150 多款应用。这些设备并非只用于发布前的演示,而是被用于任务构建、轨迹采集、模型训练和评测。
3
5
项目还推出了 MobileWorld-Real,这是一个包含 400 多项真实设备任务的移动端基准。由于该基准由项目团队自行构建,92.2% 这一成绩可以作为其在物理设备上表现的有力证据,但不能简单等同于完全独立的第三方审计结果。
1
7
如何支撑超过百步的长任务?
技术报告描述了在线强化学习训练:轨迹长度超过 100 个回合,同时使用超过 10,000 个并发环境进行 rollout(运行采样)。报告还介绍了一套自动化研究循环,由智能体协助构建任务和环境、分析失败原因,并规划下一轮训练。
1
这套设计针对的不是单次点击,而是长链路任务中的持续决策。一个真正有用的智能体需要知道已经完成了什么,在操作出错后尝试恢复,并在每一步判断应该使用哪个应用、哪个界面或哪种工具。
报告还提到用于有状态跨设备工作流和主动发起服务的轻量级工具框架。其设想包括:用户从手机切换到电脑后,智能体继续此前的任务;或者在合适时机主动采取帮助用户的行动,而不是始终等待下一条指令。这样的案例体现了系统的发展方向,并不意味着它已经能够在开放环境中安全、无监督地处理所有任务。
1
公开评测成绩怎么看?
Qwen-UI-Agent 在移动端基准上取得了最强的公开成绩。技术报告列出的主要数字包括:
33
- MobileWorld:82.1%
- MobileWorld-Real:92.2%
- AndroidDaily:97.5%
- OSWorld-Verified:79.5%,用于评估桌面电脑操作
- OSWorld-v2:40.0%,为部分进度指标
- WebArena:73.6%
- ScreenSpot-Pro:81.5%,用于 GUI 定位能力评估
在 MobileWorld 的一组公开对比中,GPT-5.6 Sol 得分为 70.1%,Claude Opus 4.8 得分为 67.5%。Qwen-UI-Agent 分别领先 12.0 个百分点和 14.6 个百分点。
7
但电脑端和浏览器端的结论需要更谨慎。79.5% 的 OSWorld-Verified 成绩具有竞争力,不过现有对比资料显示,Claude Opus 4.8 在该基准上的成绩更高。Qwen-UI-Agent 在 OSWorld-v2 上的 40.0% 是“部分进度分”,不能理解为完成了 40% 的完整任务。
33
34
36
WebArena 的 73.6% 得分有现有资料支持,但提供的证据不足以证明它在所有比较集合中都毫无争议地排名第一。具体名次会随着参评模型、模型版本、评测流程和数据切分的变化而变化。
1
8
一个混合 GUI 与 CLI 的任务会怎样完成?
技术报告展示了这样一类工作流:智能体通过浏览器和桌面界面搜集金融信息,使用命令行工具进行分析或文件操作,然后在 GUI 应用中创建并保存文档。
1
这种架构让智能体拥有不止一种完成步骤的方式。需要依赖可见界面时,它可以像用户一样操作;需要进行结构化文件处理或分析时,则可以切换到终端。真正的难点在于协调不同工具,并让任务状态在多个应用之间持续保持。
同一设计也指向跨设备助手:任务可以从手机开始,在电脑上继续,期间还要穿过多个应用,而不要求每项服务都提供专门 API。实际可靠性仍取决于身份验证、异常页面处理、任务恢复机制,以及对付款等现实后果的操作设置清晰边界。
能控制屏幕,也意味着更高的安全风险
能够操作屏幕的智能体,同样可能接触敏感数据、删除文件、提交表单,甚至发起交易。因此,合理的安全机制应包括:拒绝违法或高风险请求;在信息不足时主动追问;在付款、删除文件或授权隐私权限等敏感操作前要求用户确认。
不过,现有的一手技术报告证据并未独立核实原始请求中提到的每一项拒绝和确认演示。因此,这些行为更适合被视为项目所报告或设想的控制措施,而不是已经充分证明的安全部署能力。
基准分数也不能证明该系统已经适合在普通用户账户中无人值守运行。真正落地还需要权限隔离、敏感操作确认、审计日志、随时中断、错误恢复,以及在不同设备和应用上的独立测试。
Qwen-UI-Agent 对电脑操作型 AI 意味着什么?
Qwen-UI-Agent 最清晰的贡献,在于把真实物理界面放到了训练和评测的中心。使用 100 多台手机进行训练并在真实硬件上验证,让移动端成绩比只在模拟器中测试的结果更接近设备控制的实际问题。它统一 GUI 与 CLI 的动作空间,也为跨应用、浏览器、桌面和终端的长流程提供了一种更实用的架构。
1
3
基于现有证据,可以得出一个较强但有边界的结论:Qwen-UI-Agent 是一款值得关注的真实设备 GUI 智能体,在多个移动端基准上取得了领先的公开成绩。对于桌面和浏览器,则应采取更谨慎的判断——它具有竞争力,但并非在每个前沿模型或每项基准中都占据首位。
接下来的关键考验,不是它能否完成一套预先编排好的测试任务,而是能否在屏幕发生变化、信息不完整或操作不可逆时,仍然稳定、可预测、可中断、透明且安全地完成日常工作。