Qwen UI Agent is Alibaba’s GUI agent voor echte apparaten en werd op 20 augustus 2026 publiek uitgebracht. Het model combineert scherminteractie — klikken, typen en swipen — met opdrachtregelacties en werd getraind met meer dan 100 fysieke telefoons en ruim 150 apps.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Alibaba Qwen’s Qwen-UI-Agent, released on August 20, 2026, and how does its GUI-agent foundation model use real-device training acro. Article summary: Qwen-UI-Agent is Alibaba Qwen’s real-world GUI-agent foundation model: it operates phones, desktops, browsers, and DeepSearch environments by interpreting what is displayed on screen and taking actions such as clicks, ke. Topic tags: general, general web, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake num
Qwen-UI-Agent is een fundamenteel model voor GUI-agents van Alibaba’s Qwen-team. Het is ontworpen om software te bedienen zoals een mens dat doet: door naar schermen te kijken en vervolgens te klikken, typen, tikken of swipen. Het model werkt met mobiele apparaten, desktopcomputers, webbrowsers en DeepSearch-omgevingen. Daarvoor hoeft het niet uitsluitend gebruik te maken van API’s of speciale koppelingen in apps. Alibaba bracht Qwen-UI-Agent op 20 augustus 2026 publiek uit, nadat het op 30 juli een technisch rapport op arXiv had gepubliceerd. 3
33
De praktische belofte is duidelijk: een agent die met een gewone interface overweg kan, zou ook taken kunnen uitvoeren in diensten waarvoor geen geschikte API bestaat. Toch is het te kort door de bocht om te zeggen dat Qwen-UI-Agent overal de beste AI-agent is. De voorsprong is het duidelijkst op mobiel, vooral wanneer de evaluatie op echte telefoons plaatsvindt.
Veel software-agents werken met gestructureerde API’s, browserautomatisering of tools die speciaal voor één app zijn gemaakt. Qwen-UI-Agent behandelt juist de interface zelf als het bedieningspunt. Het model leest wat er op het scherm staat, zoekt de relevante knoppen of velden en kiest vervolgens een actie, zoals tikken, klikken, tekst invoeren of scrollen. Dezelfde agent is bedoeld voor telefoons, desktops, browsers en DeepSearch-workflows. 33
De actieruimte bestaat niet alleen uit grafische bediening. Het model kan die combineren met opdrachten via de terminal of opdrachtregel. Daardoor kan een langere taak schakelen tussen een browser, desktopsoftware en een terminal, zonder elke stap via de GUI te hoeven uitvoeren. Het rapport beschrijft ook gebundelde acties binnen één modelbeurt, bedoeld om meerstapsprocessen efficiënter te maken. 1
Een GUI-agent kan het in een emulator goed doen en toch op een fysieke telefoon de mist ingaan. Echte apparaten brengen verschillen mee in schermindeling, timing, aanraakgedrag, apparaatstatus en de manier waarop apps reageren. Qwen-UI-Agent probeert die kloof tussen simulatie en werkelijkheid kleiner te maken.
Volgens Alibaba omvat de mobiele infrastructuur meer dan 100 fysieke telefoons en ruim 150 apps. Die apparaten werden gebruikt voor het samenstellen van taken, het verzamelen van actietrajecten, de training én de evaluatie — niet alleen voor een einddemo. 3
5
Het project introduceerde daarnaast MobileWorld-Real, een benchmark met meer dan 400 taken op echte mobiele apparaten. Omdat dezelfde projectgroep zowel de benchmark als het model ontwikkelde, is de score van 92,2% relevant bewijs voor prestaties op fysieke hardware. Het is echter geen volledig onafhankelijke audit. 1
7
Het technische rapport beschrijft online reinforcement learning — leren door beloningen tijdens het uitvoeren van taken — over trajecten van meer dan 100 beurten. Daarbij zouden meer dan 10.000 omgevingen gelijktijdig worden gebruikt om uitvoeringen te verzamelen. Het rapport beschrijft ook een geautomatiseerde onderzoeks- en trainingslus waarin agents helpen bij het maken van taken en omgevingen, fouten analyseren en volgende trainingsrondes plannen. 1
Dat is gericht op een moeilijker probleem dan alleen de juiste knop vinden. Een bruikbare agent moet tijdens een lange reeks stappen onthouden wat al is gebeurd, kunnen herstellen van fouten en telkens bepalen welke app, interface of tool het meest geschikt is.
Verder noemt het rapport een lichte infrastructuur voor statusbewuste workflows tussen apparaten en voor het proactief starten van diensten. In theorie kan een assistent een taak voortzetten wanneer iemand van telefoon naar computer overstapt, of zelf een nuttige actie initiëren in plaats van op elk afzonderlijk commando te wachten. Zulke voorbeelden laten vooral zien welke richting het systeem op wil; ze bewijzen niet dat het elke open taak veilig en zonder toezicht kan uitvoeren. 1
In het gepubliceerde technische rapport zijn de sterkste resultaten van Qwen-UI-Agent te zien op benchmarks voor mobiel gebruik. De belangrijkste gerapporteerde scores zijn: 33
Op MobileWorld wordt 70,1% gerapporteerd voor GPT-5.6 Sol en 67,5% voor Claude Opus 4.8. Daarmee ligt Qwen-UI-Agent volgens de aangeleverde vergelijking respectievelijk 12,0 en 14,6 procentpunt hoger. 7
De desktop- en browsercijfers vragen om meer nuance. Een score van 79,5% op OSWorld-Verified is sterk, maar in de meegeleverde vergelijkingen scoort Claude Opus 4.8 hoger op die benchmark. Ook is de 40,0% op OSWorld-v2 een score voor gedeeltelijke voortgang. Het betekent dus niet dat 40% van alle volledige taken succesvol is afgerond. 33
34
36
De score van 73,6% op WebArena wordt door de bronnen ondersteund, maar daaruit volgt geen onbetwiste eerste plaats in elke vergelijking. Ranglijsten kunnen veranderen afhankelijk van de geteste modellen, modelvarianten, evaluatiemethode en gebruikte benchmarkopsplitsing. 1
8
De betekenis van het model zit niet alleen in het kunnen indrukken van knoppen. Het rapport beschrijft workflows waarin een agent financiële informatie onderzoekt via browser- en desktopinterfaces, opdrachtregeltools gebruikt voor analyse of bestandsbewerkingen en daarna een document maakt en opslaat in een grafische applicatie. 1
Die combinatie geeft de agent meerdere manieren om een stap uit te voeren. Waar een zichtbare interface nodig is, gebruikt het model de GUI; voor gestructureerde bestandsbewerkingen of analyses kan het overschakelen naar de terminal. De echte uitdaging is om die tools te coördineren en de taakstatus tussen verschillende apps vast te houden.
Hetzelfde ontwerp past bij het idee van hulp die zich over meerdere apparaten uitstrekt. Een workflow kan op een telefoon beginnen, op een desktop doorgaan en verschillende apps omvatten, zonder dat elke dienst een eigen gespecialiseerde API hoeft aan te bieden. In de praktijk hangt de betrouwbaarheid dan wel af van onder meer authenticatie, herstel na onverwachte schermen en duidelijke grenzen rond acties met onomkeerbare gevolgen.
Een agent die een scherm kan bedienen, kan ook bij gevoelige gegevens komen, bestanden verwijderen, formulieren versturen of transacties starten. Een verantwoord veiligheidsmodel zou daarom illegale of risicovolle verzoeken moeten weigeren, ontbrekende informatie moeten opvragen en bevestiging moeten vragen vóór gevoelige acties, zoals betalingen, verwijderingen of toestemming voor privacygevoelige toegang.
De beschikbare primaire bron — het technische rapport — verifieert niet zelfstandig elk specifiek voorbeeld van weigeren en bevestigen dat in het oorspronkelijke verzoek wordt genoemd. Die gedragingen moeten daarom worden gezien als gerapporteerde of beoogde veiligheidsmaatregelen, niet als bewezen garantie voor een veilige inzet.
Benchmarkscores laten evenmin zien dat het systeem klaar is om zonder toezicht in gewone gebruikersaccounts te werken. Voor echte toepassingen zijn onder meer toegangsbeperkingen, bevestigingsmomenten, auditlogs, onderbreekknoppen, foutafhandeling en onafhankelijke tests op uiteenlopende apparaten en apps nodig.
De duidelijkste bijdrage van Qwen-UI-Agent is de nadruk op de fysieke interface. Doordat Alibaba meer dan 100 telefoons gebruikte voor training en evaluatie op echte hardware, zijn de mobiele resultaten relevanter voor apparaatbediening dan scores uit uitsluitend geëmuleerde omgevingen. De gecombineerde GUI- en CLI-actieruimte wijst bovendien op een praktische architectuur voor langere workflows tussen apps, browsers, desktops en terminals. 1
3
De beschikbare gegevens ondersteunen een stevige conclusie op mobiel: Qwen-UI-Agent is een opvallende GUI-agent voor echte apparaten, met toonaangevende gerapporteerde resultaten op meerdere mobiele benchmarks. Voor desktop en browser is een voorzichtiger conclusie gepast: de prestaties zijn concurrerend, maar niet op elke benchmark en tegenover elk topmodel superieur.
De volgende test is daarom niet alleen of een agent een vooraf geschreven benchmark kan afwerken. De belangrijkere vraag is of hij alledaags werk kan uitvoeren terwijl hij voorspelbaar, onderbreekbaar, transparant en veilig blijft wanneer een scherm verandert — of wanneer een verkeerde klik niet meer kan worden teruggedraaid.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Qwen UI Agent is Alibaba’s GUI agent voor echte apparaten en werd op 20 augustus 2026 publiek uitgebracht.
Qwen UI Agent is Alibaba’s GUI agent voor echte apparaten en werd op 20 augustus 2026 publiek uitgebracht. Het model combineert scherminteractie — klikken, typen en swipen — met opdrachtregelacties en werd getraind met meer dan 100 fysieke telefoons en ruim 150 apps.
De sterkste resultaten zijn mobiel: 82,1% op MobileWorld, 92,2% op MobileWorld Real en 97,5% op AndroidDaily.