Qwen UI Agent es el modelo base de Alibaba para agentes capaces de operar interfaces gráficas en dispositivos reales; se presentó públicamente el 20 de agosto de 2026. Combina acciones visuales —clics, toques, escritura y deslizamientos— con comandos de línea de comandos, y fue entrenado con más de 100 teléfonos fís...
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: What is Alibaba Qwen’s Qwen-UI-Agent, released on August 20, 2026, and how does its GUI-agent foundation model use real-device training acro. Article summary: Qwen-UI-Agent is Alibaba Qwen’s real-world GUI-agent foundation model: it operates phones, desktops, browsers, and DeepSearch environments by interpreting what is displayed on screen and taking actions such as clicks, ke. Topic tags: general, general web, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake num
Alibaba ha presentado Qwen-UI-Agent, un modelo base para agentes de interfaz gráfica —GUI, por sus siglas en inglés— diseñado para manejar programas como lo haría una persona: mirando la pantalla y ejecutando toques, clics, pulsaciones de teclado, escritura y deslizamientos. Su alcance incluye teléfonos móviles, ordenadores de escritorio, navegación web y entornos de búsqueda profunda o DeepSearch, sin depender exclusivamente de interfaces de programación de aplicaciones (API) ni de integraciones internas de cada aplicación. Alibaba lo lanzó públicamente el 20 de agosto de 2026, después de publicar su informe técnico en arXiv el 30 de julio. 3
33
La idea es especialmente relevante para tareas en servicios que no ofrecen una API adecuada. Sin embargo, sus resultados no justifican afirmar que sea el mejor agente en cualquier plataforma. La ventaja más clara aparece en el uso móvil, sobre todo cuando la evaluación se realiza en teléfonos físicos.
Muchos agentes de software trabajan mediante API, herramientas específicas del navegador o funciones internas de una aplicación. Qwen-UI-Agent adopta otro enfoque: convierte la propia interfaz en el punto de interacción. Observa lo que aparece en pantalla, localiza los controles relevantes y decide qué acción ejecutar —tocar, hacer clic, escribir, deslizar o pulsar una tecla—. El mismo modelo está pensado para moverse entre móviles, ordenadores, navegadores y flujos de DeepSearch. 33
Su espacio de acciones también mezcla la interacción gráfica con la ejecución de comandos en terminal. Así, una tarea larga puede pasar del navegador a una aplicación de escritorio y después a la línea de comandos, en lugar de obligar al agente a resolver cada paso mediante la interfaz visual. El informe técnico describe además acciones agrupadas dentro de un mismo turno del modelo, una estrategia orientada a hacer más eficientes los procesos de varios pasos. 1
Un agente puede desenvolverse bien en un emulador y fallar al enfrentarse a un dispositivo físico. Las diferencias de diseño, tiempos de respuesta, comportamiento táctil, estado del dispositivo y funcionamiento de las aplicaciones introducen una brecha entre la simulación y la realidad.
Para reducirla, Alibaba construyó un entorno móvil con más de 100 teléfonos físicos y más de 150 aplicaciones. Según la información disponible, esos dispositivos se utilizaron para crear tareas, recopilar trayectorias de interacción, entrenar el modelo y evaluarlo; no solo para realizar una demostración final. 3
5
El proyecto también presentó MobileWorld-Real, un conjunto de evaluación con más de 400 tareas ejecutadas en dispositivos reales y repartidas entre aplicaciones móviles. El resultado del 92,2 % constituye una señal relevante sobre el rendimiento en hardware físico, pero debe interpretarse con cautela: el benchmark fue creado por el propio proyecto y no equivale a una auditoría completamente independiente. 1
7
El informe técnico describe un entrenamiento mediante aprendizaje por refuerzo en línea sobre trayectorias de más de 100 turnos y con más de 10.000 entornos de ejecución simultáneos. También presenta un ciclo de investigación automatizado en el que los agentes ayudan a construir tareas y entornos, diagnosticar fallos y planificar nuevas iteraciones de entrenamiento. 1
El objetivo va más allá de acertar un botón aislado. Para completar una tarea prolongada, el agente debe conservar el estado del proceso, recordar qué ha hecho, corregir errores y elegir en cada momento la interfaz o herramienta más adecuada.
El sistema incluye asimismo un arnés ligero para flujos con estado entre distintos dispositivos e inicio proactivo de servicios. La dirección propuesta es la de un asistente que pueda continuar una tarea cuando el usuario cambia del móvil al ordenador, o iniciar una intervención útil sin esperar instrucciones detalladas para cada paso. Estas demostraciones muestran la capacidad que se busca desarrollar, pero no prueban que el modelo pueda gestionar de forma segura cualquier tarea abierta y sin supervisión. 1
El informe técnico publicado atribuye a Qwen-UI-Agent sus mejores resultados en evaluaciones de uso móvil. Estas son algunas de las cifras comunicadas: 33
En MobileWorld, la comparación facilitada sitúa a GPT-5.6 Sol en el 70,1 % y a Claude Opus 4.8 en el 67,5 %. Eso coloca a Qwen-UI-Agent 12,0 y 14,6 puntos porcentuales por delante, respectivamente. 7
El panorama cambia cuando se observan los ordenadores y los navegadores. El 79,5 % de OSWorld-Verified es un resultado fuerte, pero las comparaciones disponibles sitúan a Claude Opus 4.8 por encima en esa prueba. Además, el 40,0 % de OSWorld-v2 es una puntuación de progreso parcial: no significa que el modelo haya completado el 40 % de las tareas de principio a fin. 33
34
36
El 73,6 % de WebArena está respaldado por las fuentes proporcionadas, pero estas no permiten establecer sin matices que Qwen-UI-Agent ocupe el primer puesto en todos los conjuntos de comparación. Las posiciones pueden variar según los modelos incluidos, sus versiones, el procedimiento de evaluación y la división del benchmark utilizada. 1
8
La importancia del modelo no está únicamente en que pueda pulsar botones. El informe describe procesos en los que el agente investiga información financiera mediante interfaces web y de escritorio, utiliza herramientas de línea de comandos para analizar datos o manipular archivos y, finalmente, crea y guarda un documento en una aplicación gráfica. 1
Este diseño ofrece más de una vía para resolver cada paso. El agente puede usar una interfaz visible cuando es necesario y cambiar a la terminal cuando el análisis o la manipulación estructurada de archivos resulta más eficiente. El reto consiste en coordinar ambas modalidades sin perder el estado de la tarea al saltar entre aplicaciones.
La misma arquitectura apunta a una asistencia entre dispositivos: un proceso podría empezar en el teléfono, continuar en el ordenador y pasar por varias aplicaciones sin que cada servicio tenga que exponer una API especializada. En un producto real, no obstante, la fiabilidad dependería también de la gestión de credenciales, la recuperación ante pantallas inesperadas y los límites impuestos a las acciones con consecuencias irreversibles.
Un agente con control de pantalla puede acceder a información sensible, borrar archivos, enviar formularios o iniciar operaciones. Por eso necesitaría rechazar solicitudes ilegales o de alto riesgo, pedir los datos que falten y solicitar confirmación antes de acciones delicadas como realizar pagos, borrar archivos o conceder autorizaciones de privacidad.
Las fuentes técnicas principales proporcionadas no verifican de forma independiente cada demostración concreta de rechazo y confirmación mencionada en la solicitud original. Por tanto, esos comportamientos deben entenderse como controles descritos o previstos, no como una prueba definitiva de que el sistema sea seguro para su despliegue general.
Las puntuaciones de los benchmarks tampoco demuestran que Qwen-UI-Agent esté listo para operar sin supervisión en las cuentas cotidianas de los usuarios. Un despliegue responsable exigiría límites de permisos, confirmaciones explícitas, registros de auditoría, controles de interrupción, recuperación ante errores y pruebas independientes en dispositivos y aplicaciones diversos.
La contribución más clara de Qwen-UI-Agent es su énfasis en la interfaz física. Entrenar con más de 100 teléfonos y evaluar en hardware real hace que sus resultados móviles sean más representativos del control de dispositivos que las pruebas basadas únicamente en emuladores. Su espacio unificado de acciones GUI y CLI también sugiere una arquitectura práctica para tareas largas que cruzan aplicaciones, navegadores, escritorios y terminales. 1
3
La evidencia permite extraer una conclusión firme en móviles: Qwen-UI-Agent es un agente GUI destacado para dispositivos reales y obtiene resultados líderes comunicados en varias pruebas móviles. En ordenadores y navegadores, la conclusión debe ser más prudente: su rendimiento es competitivo, pero no supera de manera uniforme a todos los modelos de frontera ni en todos los benchmarks.
La próxima prueba importante no será solo si puede completar una tarea diseñada para un benchmark. Será si puede realizar trabajo cotidiano de forma predecible, interrumpible, transparente y segura cuando cambie la pantalla o cuando una acción ya no pueda deshacerse.
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
Qwen UI Agent es el modelo base de Alibaba para agentes capaces de operar interfaces gráficas en dispositivos reales; se presentó públicamente el 20 de agosto de 2026.
Qwen UI Agent es el modelo base de Alibaba para agentes capaces de operar interfaces gráficas en dispositivos reales; se presentó públicamente el 20 de agosto de 2026. Combina acciones visuales —clics, toques, escritura y deslizamientos— con comandos de línea de comandos, y fue entrenado con más de 100 teléfonos físicos y más de 150 aplicaciones.
Sus resultados más sólidos aparecen en móviles: 82,1 % en MobileWorld, 92,2 % en MobileWorld Real y 97,5 % en AndroidDaily; en ordenadores y navegadores ofrece un rendimiento competitivo, aunque no domina todos los ra...