Qwen UI Agent는 화면을 읽고 클릭, 키 입력, 텍스트 입력, 스와이프를 수행하는 알리바바의 GUI 에이전트 기반 모델로, 2026년 8월 20일 공개됐습니다. 알리바바는 100대가 넘는 실제 스마트폰과 150개 이상의 앱을 활용해 작업 구성, 궤적 수집, 학습, 평가를 진행했으며, 400개가 넘는 실제 기기 작업으로 구성된 MobileWorld Real을 구축했습니다.
연구 답변

Create a landscape editorial hero image for this Studio Global article: What is Alibaba Qwen’s Qwen-UI-Agent, released on August 20, 2026, and how does its GUI-agent foundation model use real-device training acro. Article summary: Qwen-UI-Agent is Alibaba Qwen’s real-world GUI-agent foundation model: it operates phones, desktops, browsers, and DeepSearch environments by interpreting what is displayed on screen and taking actions such as clicks, ke. Topic tags: general, general web, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake num
알리바바의 Qwen-UI-Agent는 사람이 스마트폰이나 컴퓨터를 쓰는 방식에 가까운 GUI(그래픽 사용자 인터페이스) 에이전트 기반 모델이다. 화면에 표시된 내용을 읽고 필요한 버튼을 찾은 뒤 클릭, 키 입력, 텍스트 입력, 스와이프 같은 동작을 수행한다. 특정 앱의 API(애플리케이션 프로그래밍 인터페이스)나 내부 연동 기능에만 의존하지 않고, 휴대전화·데스크톱·웹 브라우저·DeepSearch 환경을 하나의 모델로 다루는 것이 핵심이다. 알리바바는 2026년 8월 20일 이 모델을 공개했으며, 기술 보고서는 7월 30일 arXiv에 게재됐다. 3
33
기존 소프트웨어 에이전트는 API, 브라우저 자동화 도구, 앱별 플러그인처럼 구조화된 통로를 이용하는 경우가 많다. 반면 Qwen-UI-Agent는 화면 자체를 작업 공간으로 본다. 화면을 관찰하고, 관련 요소를 파악하고, 다음 행동을 선택하는 방식이다. 따라서 적절한 API가 없는 서비스에서도 사람이 직접 조작할 수 있는 인터페이스만 있다면 자동화를 시도할 수 있다. 33
행동 공간에는 GUI 조작뿐 아니라 명령줄 실행도 포함된다. 예를 들어 브라우저에서 자료를 찾은 뒤 터미널에서 파일을 정리하거나 분석하고, 다시 데스크톱 문서 편집기에서 결과물을 작성하는 식의 작업이 가능하도록 설계됐다. 한 번의 모델 턴에서 여러 행동을 묶어 내보내는 기능도 장기 작업의 실행 효율을 높이기 위한 요소다. 1
GUI 에이전트는 에뮬레이터에서는 잘 작동하다가 실제 기기에서 성능이 떨어질 수 있다. 화면 비율과 배치, 터치 반응 시간, 기기 상태, 앱의 동작 방식이 실제 환경마다 다르기 때문이다. 실제 스마트폰에서는 알림이 갑자기 나타나거나, 로딩 시간이 달라지거나, 화면 전환이 예상과 다르게 진행되는 일도 생긴다.
알리바바는 이른바 ‘시뮬레이션에서 현실로의 간극’을 줄이기 위해 100대가 넘는 실제 스마트폰과 150개 이상의 앱을 포함한 모바일 환경을 구축했다고 설명한다. 이 기기들은 최종 시연에만 사용된 것이 아니라 작업 구성, 행동 궤적 수집, 모델 학습, 평가 전 과정에 활용됐다. 3
5
또한 400개가 넘는 실제 기기 작업으로 구성된 MobileWorld-Real 벤치마크도 제시했다. 이 평가에서 나온 92.2%는 물리적 하드웨어에서의 성능을 보여주는 중요한 자료다. 다만 같은 프로젝트가 환경과 벤치마크를 함께 만들었다는 점에서, 완전히 독립적인 외부 감사 결과로 해석해서는 안 된다. 1
7
기술 보고서에 따르면 Qwen-UI-Agent는 100턴을 넘는 긴 행동 궤적을 대상으로 온라인 강화학습을 진행했으며, 1만 개가 넘는 롤아웃 환경을 동시에 운용했다. 또 에이전트가 작업과 환경을 만들고, 실패 원인을 분석하고, 다음 학습 단계를 계획하는 자동화된 연구 루프도 소개한다. 1
이 구조가 겨냥하는 문제는 단순히 버튼 하나를 정확히 누르는 일이 아니다. 긴 작업에서는 이미 완료한 단계를 기억하고, 오류가 발생하면 복구하고, 상황에 맞춰 GUI와 명령줄 중 적절한 수단을 골라야 한다.
보고서에는 여러 기기와 상태를 넘나드는 작업을 처리하기 위한 경량 하네스와, 사용자의 직접 지시를 기다리지 않고 서비스를 선제적으로 시작하는 방식도 담겼다. 예컨대 휴대전화에서 시작한 작업을 컴퓨터에서 이어가거나, 특정 상황에서 필요한 조치를 먼저 제안하는 방향이다. 다만 이런 사례는 시스템이 지향하는 기능을 보여주는 시연이지, 모든 개방형 작업을 감독 없이 안전하게 처리한다는 증거는 아니다. 1
공개된 기술 보고서의 주요 수치는 다음과 같다. 33
MobileWorld에서는 제공된 비교 자료 기준으로 GPT-5.6 Sol이 70.1%, Claude Opus 4.8이 67.5%를 기록했다. Qwen-UI-Agent는 각각 12.0%포인트와 14.6%포인트 앞섰다. 7
모바일 영역의 결과는 분명 인상적이다. 특히 실제 기기를 사용한 MobileWorld-Real과 AndroidDaily에서 높은 점수를 냈다는 점은, 에뮬레이터 전용 평가보다 현실적인 기기 제어 능력을 보여주는 자료로 볼 수 있다.
하지만 데스크톱과 웹 결과는 조금 더 신중하게 읽어야 한다. OSWorld-Verified의 79.5%는 높은 수치지만, 제공된 비교 자료에서는 Claude Opus 4.8이 83.4%로 더 높다. OSWorld-v2의 40.0%도 전체 작업의 40%를 완수했다는 뜻이 아니라 부분 진행도 점수다. 33
34
36
WebArena의 73.6%라는 점수 자체는 제공된 자료로 뒷받침된다. 그러나 모든 비교 모델과 평가 분할을 통틀어 이견 없는 1위였다고 단정할 근거는 충분하지 않다. 순위는 모델 버전, 평가 절차, 비교 대상, 벤치마크 분할에 따라 달라질 수 있다. 1
8
Qwen-UI-Agent의 의미는 화면에서 버튼을 누를 수 있다는 데서 끝나지 않는다. 보고서는 에이전트가 브라우저와 데스크톱 인터페이스를 통해 금융 정보를 조사하고, 명령줄 도구로 분석이나 파일 작업을 수행한 다음, GUI 문서 편집기에서 문서를 만들고 저장하는 흐름을 설명한다. 1
이 방식은 작업마다 가장 적합한 수단을 선택할 수 있게 한다. 화면 조작이 필요한 단계에서는 GUI를 사용하고, 구조화된 파일 처리나 계산이 더 효율적인 단계에서는 터미널로 전환하는 식이다. 중요한 과제는 여러 애플리케이션 사이에서 상태를 잃지 않고 이 도구들을 조율하는 것이다.
같은 설계는 기기 간 작업 인계에도 연결된다. 사용자가 휴대전화에서 시작한 작업을 컴퓨터에서 계속하고, 여러 앱을 오가며 업무를 마무리하는 흐름이다. 다만 실제 서비스에 적용하려면 로그인과 인증 정보 처리, 예기치 않은 화면에 대한 복구, 되돌릴 수 없는 행동에 대한 통제가 반드시 필요하다.
화면을 제어할 수 있는 에이전트는 민감한 개인정보에 접근하거나 파일을 삭제하고, 양식을 제출하거나 결제를 실행할 수도 있다. 따라서 불법 또는 고위험 요청을 거부하고, 정보가 부족하면 되묻고, 결제·삭제·개인정보 권한 부여처럼 민감한 행동 전에는 사용자 확인을 받는 구조가 필요하다.
다만 제공된 1차 기술 보고서만으로는 원래 요청에 포함된 각각의 거부 및 확인 시연을 독립적으로 검증하기 어렵다. 따라서 해당 안전 기능은 보고된 기능 또는 설계 목표로 보는 편이 정확하며, 안전한 상용 배포가 이미 입증됐다는 의미로 받아들여서는 안 된다.
벤치마크 점수만으로 일반 사용자의 계정에서 감독 없이 작동할 준비가 됐다고 말할 수도 없다. 실제 배포에는 권한 범위 설정, 민감한 행동 전 확인 단계, 감사 로그, 즉시 중단 기능, 오류 복구, 다양한 기기와 앱을 대상으로 한 독립 평가가 필요하다.
Qwen-UI-Agent의 가장 뚜렷한 기여는 ‘실제 화면’을 중심에 둔다는 점이다. 100대가 넘는 스마트폰에서 학습하고 실제 하드웨어에서 평가했다는 점은 모바일 기기 제어 성능을 에뮬레이터 기반 결과보다 현실에 가깝게 만든다. GUI와 CLI를 하나의 행동 공간으로 묶은 설계 역시 앱, 브라우저, 데스크톱, 터미널을 넘나드는 장기 작업의 실용적인 방향을 제시한다. 1
3
현재 근거가 지지하는 결론은 비교적 분명하다. Qwen-UI-Agent는 모바일 분야에서 여러 벤치마크의 선두권에 오른 주목할 만한 실제 기기 GUI 에이전트다. 반면 데스크톱과 브라우저에서는 경쟁력 있는 성능을 보이지만, 모든 최첨단 모델과 모든 평가에서 일관되게 우세하다고 보기는 어렵다.
앞으로의 진짜 시험대는 정해진 벤치마크를 통과하는지가 아니다. 화면이 바뀌거나 예상치 못한 오류가 발생하고, 결제나 삭제처럼 되돌리기 어려운 결과가 걸린 상황에서도 일상 업무를 예측 가능하고 투명하게, 언제든 중단할 수 있는 방식으로 처리할 수 있는지가 핵심이다.
Studio Global AI
이 페이지에는 Studio Global 내에서 계속할 수 있는 소스 기반 답변이 포함되어 있습니다.
Qwen UI Agent는 화면을 읽고 클릭, 키 입력, 텍스트 입력, 스와이프를 수행하는 알리바바의 GUI 에이전트 기반 모델로, 2026년 8월 20일 공개됐습니다.
Qwen UI Agent는 화면을 읽고 클릭, 키 입력, 텍스트 입력, 스와이프를 수행하는 알리바바의 GUI 에이전트 기반 모델로, 2026년 8월 20일 공개됐습니다. 알리바바는 100대가 넘는 실제 스마트폰과 150개 이상의 앱을 활용해 작업 구성, 궤적 수집, 학습, 평가를 진행했으며, 400개가 넘는 실제 기기 작업으로 구성된 MobileWorld Real을 구축했습니다.
보고된 성능은 모바일에서 가장 두드러집니다. MobileWorld 82.1%, MobileWorld Real 92.2%, AndroidDaily 97.5%를 기록했지만, 데스크톱과 웹 성능은 경쟁력은 있어도 모든 평가에서 일관되게 최고라고 단정하기는 어렵습니다.