Alibaba phát hành Qwen UI Agent ngày 20/8/2026, một mô hình GUI agent có thể thao tác trên điện thoại, máy tính, trình duyệt và môi trường DeepSearch. Mô hình được huấn luyện và đánh giá với hơn 100 điện thoại thật, hơn 150 ứng dụng cùng benchmark MobileWorld Real gồm hơn 400 tác vụ.
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: What is Alibaba Qwen’s Qwen-UI-Agent, released on August 20, 2026, and how does its GUI-agent foundation model use real-device training acro. Article summary: Qwen-UI-Agent is Alibaba Qwen’s real-world GUI-agent foundation model: it operates phones, desktops, browsers, and DeepSearch environments by interpreting what is displayed on screen and taking actions such as clicks, ke. Topic tags: general, general web, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake num
Qwen-UI-Agent là mô hình nền tảng dành cho GUI agent của Alibaba, được thiết kế để sử dụng phần mềm gần giống cách con người thao tác: nhìn vào màn hình, xác định nút hoặc trường nhập liệu rồi thực hiện các hành động như nhấp, chạm, gõ phím và vuốt. Mô hình bao phủ điện thoại, máy tính để bàn, trình duyệt web và môi trường DeepSearch, thay vì chỉ dựa vào API hoặc các công cụ được tích hợp riêng cho từng ứng dụng. Alibaba công bố Qwen-UI-Agent ngày 20/8/2026, sau khi đăng báo cáo kỹ thuật lên arXiv ngày 30/7. 3
33
Điểm đáng chú ý nằm ở cách tiếp cận rất thực tế: nếu AI biết sử dụng giao diện thông thường, nó có thể tự động hóa một dịch vụ ngay cả khi dịch vụ đó không cung cấp API phù hợp. Tuy nhiên, bảng thành tích của Qwen-UI-Agent cần được đọc có chừng mực. Lợi thế rõ nhất của mô hình hiện nằm ở các tác vụ trên điện thoại, đặc biệt là khi được đánh giá trên thiết bị thật.
Các tác nhân phần mềm truyền thống thường làm việc thông qua API có cấu trúc, cơ chế tự động hóa trình duyệt hoặc bộ công cụ riêng của ứng dụng. Qwen-UI-Agent lại coi chính giao diện hiển thị là điểm tương tác. Mô hình đọc nội dung trên màn hình, nhận diện các thành phần liên quan rồi chọn hành động như chạm, nhấp, nhập văn bản hoặc vuốt. Một mô hình duy nhất được thiết kế để hoạt động trên điện thoại, máy tính, trình duyệt và quy trình DeepSearch. 33
Không gian hành động của Qwen-UI-Agent còn kết hợp thao tác đồ họa với thực thi dòng lệnh (CLI). Nhờ đó, một quy trình dài có thể chuyển từ trình duyệt sang ứng dụng máy tính rồi sang terminal, thay vì buộc mọi bước phải thực hiện bằng giao diện đồ họa. Báo cáo kỹ thuật cũng mô tả khả năng phát ra nhiều hành động trong cùng một lượt xử lý, nhằm tăng hiệu quả ở các quy trình nhiều bước. 1
Điều này quan trọng vì một tác vụ thực tế hiếm khi chỉ là “bấm một nút”. AI có thể phải tìm thông tin, xử lý tệp, phân tích dữ liệu rồi tạo và lưu một tài liệu trong ứng dụng khác — tất cả trong cùng một chuỗi công việc.
Một agent có thể hoạt động tốt trên trình giả lập nhưng gặp lỗi khi chuyển sang thiết bị vật lý. Điện thoại thật có sự khác biệt về bố cục màn hình, độ trễ, hành vi cảm ứng, trạng thái thiết bị và cách ứng dụng phản hồi. Đây chính là khoảng cách từ mô phỏng đến thực tế mà nhiều hệ thống GUI agent phải đối mặt.
Alibaba cho biết họ xây dựng môi trường di động gồm hơn 100 điện thoại thật và hơn 150 ứng dụng. Các thiết bị này được dùng để xây dựng tác vụ, thu thập quỹ đạo thao tác, huấn luyện và đánh giá mô hình — không chỉ để trình diễn ở bước cuối. 3
5
Dự án cũng giới thiệu MobileWorld-Real, một benchmark gồm hơn 400 tác vụ trên các ứng dụng di động và thiết bị thật. Điểm 92,2% của Qwen-UI-Agent là bằng chứng đáng chú ý về khả năng vận hành trên phần cứng thực tế. Tuy vậy, vì benchmark này do chính dự án xây dựng, kết quả không nên được xem như một cuộc kiểm định hoàn toàn độc lập. 1
7
Báo cáo kỹ thuật mô tả quá trình học tăng cường trực tuyến trên các quỹ đạo dài hơn 100 lượt tương tác, với hơn 10.000 môi trường rollout chạy đồng thời. Báo cáo cũng trình bày một vòng lặp nghiên cứu tự động, trong đó các agent hỗ trợ xây dựng tác vụ và môi trường, chẩn đoán lỗi rồi lên kế hoạch cho các vòng huấn luyện tiếp theo. 1
Mục tiêu không chỉ là giúp AI thực hiện từng cú nhấp riêng lẻ, mà còn duy trì trạng thái trong một chuỗi hành động dài. Một agent hữu ích phải biết mình đã làm gì, có thể phục hồi sau sai sót và chọn đúng giao diện hoặc công cụ ở mỗi giai đoạn.
Dự án còn mô tả một bộ khung nhẹ cho các quy trình có trạng thái, chạy xuyên nhiều thiết bị và chủ động khởi tạo dịch vụ. Về định hướng, điều này có thể giúp trợ lý tiếp tục một tác vụ khi người dùng chuyển từ điện thoại sang máy tính, hoặc chủ động đưa ra hỗ trợ thay vì chờ từng mệnh lệnh riêng lẻ. Dù vậy, các ví dụ này cho thấy hướng phát triển của hệ thống, chưa chứng minh rằng mô hình có thể an toàn xử lý mọi tác vụ trong thế giới mở mà không cần giám sát. 1
Báo cáo kỹ thuật công bố những kết quả mạnh nhất của Qwen-UI-Agent ở nhóm benchmark sử dụng điện thoại. Các điểm số chính gồm: 33
Trên MobileWorld, bộ số liệu so sánh được cung cấp cho thấy Qwen-UI-Agent đạt 82,1%, cao hơn GPT-5.6 Sol ở mức 70,1% và Claude Opus 4.8 ở mức 67,5% — lần lượt hơn 12,0 và 14,6 điểm phần trăm. 7
Kết quả trên máy tính và trình duyệt cần được diễn giải thận trọng hơn. Điểm 79,5% trên OSWorld-Verified là đáng kể, nhưng các bảng so sánh đi kèm báo cáo xếp Claude Opus 4.8 cao hơn trên benchmark này. Con số 40,0% trên OSWorld-v2 cũng là điểm tiến độ một phần, không có nghĩa Qwen-UI-Agent hoàn thành 40% số tác vụ một cách trọn vẹn. 33
34
36
Điểm WebArena 73,6% được các nguồn cung cấp ủng hộ, nhưng chưa đủ để khẳng định mô hình chắc chắn đứng đầu trong mọi tập so sánh. Thứ hạng có thể thay đổi tùy phiên bản mô hình, quy trình đánh giá và cách chia benchmark. 1
8
Ý nghĩa của Qwen-UI-Agent không chỉ nằm ở việc mô hình có thể “bấm nút”. Báo cáo mô tả các quy trình trong đó agent tìm hiểu thông tin tài chính thông qua trình duyệt và ứng dụng máy tính, dùng công cụ dòng lệnh để phân tích hoặc xử lý tệp, sau đó tạo và lưu tài liệu trong một ứng dụng có giao diện đồ họa. 1
Cách kết hợp này cho agent nhiều lựa chọn hơn khi hoàn thành một bước. Nó có thể dùng giao diện trực quan khi bắt buộc, rồi chuyển sang terminal khi thao tác với tệp hoặc phân tích dữ liệu bằng dòng lệnh hiệu quả hơn. Thách thức nằm ở việc phối hợp các công cụ mà vẫn giữ đúng trạng thái của tác vụ giữa nhiều ứng dụng.
Thiết kế thống nhất này cũng mở ra khái niệm trợ lý xuyên thiết bị. Một công việc có thể bắt đầu trên điện thoại, tiếp tục trên máy tính và đi qua nhiều ứng dụng mà không yêu cầu từng dịch vụ phải cung cấp một API chuyên biệt. Trong thực tế, độ tin cậy sẽ còn phụ thuộc vào cách xử lý đăng nhập, các màn hình bất ngờ và những hành động có thể gây hậu quả ngoài đời thực.
Một agent có quyền điều khiển màn hình cũng có thể tiếp cận dữ liệu nhạy cảm, xóa tệp, gửi biểu mẫu hoặc khởi tạo giao dịch. Mô hình an toàn phù hợp cần từ chối yêu cầu bất hợp pháp hoặc rủi ro cao, hỏi lại khi thiếu thông tin và yêu cầu xác nhận trước các hành động nhạy cảm như thanh toán, xóa dữ liệu hoặc cấp quyền riêng tư.
Tuy nhiên, các bằng chứng kỹ thuật chính được cung cấp chưa độc lập xác minh từng màn trình diễn cụ thể về hành vi từ chối và yêu cầu xác nhận được nêu trong yêu cầu ban đầu. Vì vậy, những hành vi này nên được xem là các cơ chế được báo cáo hoặc định hướng thiết kế, chưa phải bằng chứng đầy đủ về khả năng triển khai an toàn.
Điểm benchmark cũng không chứng minh hệ thống đã sẵn sàng hoạt động không giám sát trong tài khoản thông thường của người dùng. Một sản phẩm thực tế sẽ cần ranh giới quyền hạn, bước xác nhận, nhật ký kiểm toán, nút dừng, khả năng khôi phục lỗi và các cuộc kiểm thử độc lập trên nhiều thiết bị cũng như ứng dụng khác nhau.
Đóng góp rõ nhất của Qwen-UI-Agent là nhấn mạnh vào giao diện vật lý. Việc huấn luyện với hơn 100 điện thoại và đánh giá trên phần cứng thật khiến kết quả mobile có ý nghĩa thực tế hơn so với các hệ thống chỉ được kiểm thử trên trình giả lập. Không gian hành động kết hợp GUI và CLI cũng gợi ý một kiến trúc phù hợp cho những quy trình dài, đi qua ứng dụng, trình duyệt, máy tính và terminal. 1
3
Các bằng chứng hiện có cho phép đưa ra kết luận mạnh ở mảng di động: Qwen-UI-Agent là một GUI agent đáng chú ý trên thiết bị thật, với các kết quả được báo cáo ở nhóm dẫn đầu trong nhiều benchmark mobile. Ở các mảng khác, kết luận nên thận trọng hơn: hiệu năng trên máy tính và trình duyệt có tính cạnh tranh, nhưng chưa vượt trội đồng đều so với mọi mô hình tiên phong hoặc mọi benchmark.
Phép thử quan trọng tiếp theo không chỉ là liệu agent có hoàn thành được một benchmark được lập trình sẵn hay không. Câu hỏi lớn hơn là liệu nó có thể xử lý công việc hằng ngày theo cách dễ dự đoán, có thể can thiệp, minh bạch và an toàn — ngay cả khi màn hình thay đổi hoặc hành động sắp thực hiện không thể đảo ngược.
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
Alibaba phát hành Qwen UI Agent ngày 20/8/2026, một mô hình GUI agent có thể thao tác trên điện thoại, máy tính, trình duyệt và môi trường DeepSearch.
Alibaba phát hành Qwen UI Agent ngày 20/8/2026, một mô hình GUI agent có thể thao tác trên điện thoại, máy tính, trình duyệt và môi trường DeepSearch. Mô hình được huấn luyện và đánh giá với hơn 100 điện thoại thật, hơn 150 ứng dụng cùng benchmark MobileWorld Real gồm hơn 400 tác vụ.
Kết quả mạnh nhất nằm ở mobile: 82,1% trên MobileWorld, 92,2% trên MobileWorld Real và 97,5% trên AndroidDaily; thành tích trên máy tính và trình duyệt đáng chú ý nhưng chưa phải lúc nào cũng dẫn đầu.