Qwen UI Agent er Alibabas grunnmodell for GUI agenter og ble offentlig lansert 20. Modellen kombinerer skjermhandlinger med kommandolinjeverktøy og er trent på mer enn 100 fysiske telefoner og over 150 apper.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Alibaba Qwen’s Qwen-UI-Agent, released on August 20, 2026, and how does its GUI-agent foundation model use real-device training acro. Article summary: Qwen-UI-Agent is Alibaba Qwen’s real-world GUI-agent foundation model: it operates phones, desktops, browsers, and DeepSearch environments by interpreting what is displayed on screen and taking actions such as clicks, ke. Topic tags: general, general web, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake num
Alibaba har utviklet Qwen-UI-Agent som en GUI-agent – en KI-modell som kan bruke programvare omtrent slik et menneske gjør. I stedet for å være avhengig av et programs API eller interne integrasjoner, leser modellen det som vises på skjermen og utfører handlinger som klikk, tastetrykk, tekstinnskriving og sveiping. Den er laget for mobiltelefoner, datamaskiner, nettlesere og DeepSearch-miljøer. Alibaba offentliggjorde modellen 20. august 2026, etter at den tekniske rapporten ble publisert på arXiv 30. juli. 3
33
Det viktigste poenget er praktisk: En agent som kan bruke et vanlig grensesnitt, kan i prinsippet automatisere oppgaver selv når tjenesten ikke har et egnet API. Samtidig er bildet mer nyansert enn at modellen er best overalt. Forspranget er tydeligst på mobil, særlig når testene kjøres på fysiske telefoner.
Tradisjonelle programvareagenter kobler seg ofte til strukturerte API-er, nettleserautomatisering eller spesialverktøy for bestemte apper. Qwen-UI-Agent bruker i stedet selve grensesnittet som arbeidsflate. Den analyserer det som er synlig, finner relevante knapper og felt og velger handlinger som trykk, klikk, skriving eller sveiping. Den samme modellen er utformet for bruk på telefoner, datamaskiner, i nettlesere og i DeepSearch-arbeidsflyter. 33
Handlingsrommet kombinerer grafiske handlinger med kjøring av kommandoer i terminalen. En lengre oppgave kan dermed flytte seg mellom nettleseren, et skrivebordsprogram og kommandolinjen, uten at hvert steg må utføres via grafiske menyer. Rapporten beskriver også grupperte handlinger i én modellrunde, noe som skal gjøre flertrinnsoppgaver mer effektive. 1
En GUI-agent kan fungere godt i en emulator, men likevel få problemer på en fysisk enhet. Skjermoppsett, tidsforsinkelser, berøringsrespons, enhetens tilstand og appenes oppførsel kan være annerledes i virkeligheten. Qwen-UI-Agent er trent og evaluert med et oppsett som skal redusere dette gapet mellom simulering og ekte bruk.
Alibaba beskriver et mobilt testmiljø med mer enn 100 fysiske telefoner og over 150 apper. Maskinvaren ble brukt til å lage oppgaver, samle inn handlingsforløp, trene modellen og evaluere den – ikke bare til en avsluttende demonstrasjon. 3
5
Prosjektet introduserte også MobileWorld-Real, en test med mer enn 400 oppgaver på ekte mobilenheter. Resultatet på 92,2 prosent er derfor relevant dokumentasjon på ytelse i fysisk maskinvare. Men siden testen er utviklet av det samme prosjektet, bør den ikke tolkes som en fullstendig uavhengig revisjon. 1
7
Den tekniske rapporten beskriver nettbasert forsterkningslæring på handlingsforløp som varer i mer enn 100 steg, samt over 10 000 samtidige utrullingsmiljøer. Den presenterer også en automatisert forskningssløyfe der agenter bidrar til å lage oppgaver og miljøer, finne årsaker til feil og planlegge nye treningsrunder. 1
Målet er å løse mer enn enkeltstående knappetrykk. En nyttig agent må holde oversikt over hva som allerede er gjort, kunne hente seg inn etter feil og velge riktig grensesnitt eller verktøy underveis.
Rapporten beskriver dessuten et lettvektsrammeverk for tilstandsbaserte arbeidsflyter på tvers av enheter og for proaktiv oppstart av tjenester. Det peker mot assistenter som kan fortsette en oppgave når brukeren går fra telefon til datamaskin, eller starte en relevant handling uten å vente på en ny instruks. Eksemplene viser imidlertid hvilken retning systemet er utviklet mot – de beviser ikke at det trygt kan håndtere alle åpne oppgaver uten tilsyn. 1
Den publiserte rapporten viser de sterkeste resultatene på tester av mobilbruk. De viktigste tallene er: 33
I MobileWorld viser den oppgitte sammenligningen 70,1 prosent for GPT-5.6 Sol og 67,5 prosent for Claude Opus 4.8. Det plasserer Qwen-UI-Agent henholdsvis 12,0 og 14,6 prosentpoeng foran disse modellene. 7
Datamaskin- og nettleserresultatene bør tolkes med større varsomhet. En score på 79,5 prosent i OSWorld-Verified er sterk, men sammenligningene som følger rapporten, plasserer Claude Opus 4.8 høyere i denne testen. Tallet 40,0 prosent i OSWorld-v2 er dessuten en score for delvis fremdrift – ikke en påstand om at 40 prosent av alle oppgavene ble fullført. 33
34
36
WebArena-resultatet på 73,6 prosent støttes av kildene, men materialet dokumenterer ikke en ubestridt førsteplass på tvers av alle sammenligningsgrunnlag. Rangeringer kan endres avhengig av hvilke modeller, modellvarianter, testprosedyrer og datasettutvalg som brukes. 1
8
Betydningen ligger ikke bare i at modellen kan trykke på knapper. Rapporten beskriver arbeidsflyter der en agent undersøker økonomisk informasjon gjennom nettleser- og skrivebordsgrensesnitt, bruker kommandolinjeverktøy til analyse eller filbehandling og deretter lager og lagrer et dokument i et grafisk program. 1
Denne kombinasjonen gir agenten flere måter å løse samme steg på. Den kan bruke et synlig grensesnitt når det er nødvendig, og bytte til terminalen når strukturert filbehandling eller analyse er mer effektivt. Utfordringen er å koordinere verktøyene og samtidig bevare oppgavens tilstand på tvers av apper.
Den samme utformingen støtter ideen om hjelp på tvers av enheter. En arbeidsflyt kan begynne på telefonen, fortsette på en datamaskin og involvere flere apper uten at hver tjeneste må tilby et eget spesialtilpasset API. I praksis vil påliteligheten avhenge av blant annet innlogging, håndtering av uventede skjermer og tydelige grenser for handlinger med reelle konsekvenser.
En agent som kan styre en skjerm, kan også få tilgang til sensitive opplysninger, slette filer, sende inn skjemaer eller starte transaksjoner. Et forsvarlig sikkerhetsmønster er å avvise ulovlige eller høyrisiko-oppgaver, be om manglende informasjon og kreve bekreftelse før sensitive handlinger som betaling, sletting eller godkjenning av personverninnstillinger.
Det tilgjengelige primærmaterialet fra den tekniske rapporten bekrefter ikke uavhengig hver enkelt demonstrasjon av avvisninger og bekreftelser som er omtalt i den opprinnelige forespørselen. Slike funksjoner bør derfor omtales som rapporterte eller planlagte sikkerhetstiltak – ikke som endelig dokumentasjon på trygg bruk i stor skala.
Testresultater alene viser heller ikke at modellen er klar til å operere uten tilsyn i vanlige brukerkontoer. En reell lansering vil trenge klare tilgangsgrenser, bekreftelser, revisjonslogger, mulighet til å stoppe agenten, feilgjenoppretting og uavhengig testing på mange typer enheter og apper.
Qwen-UI-Agents tydeligste bidrag er fokuset på den fysiske brukerflaten. Trening med mer enn 100 telefoner og testing på ekte maskinvare gjør mobilresultatene mer relevante for faktisk enhetsstyring enn resultater fra emulatorer alene. Den samlede GUI- og CLI-modellen peker også mot en praktisk arkitektur for lengre oppgaver som går på tvers av apper, nettlesere, skrivebord og terminaler. 1
3
Dokumentasjonen støtter en tydelig konklusjon på mobil: Qwen-UI-Agent er en bemerkelsesverdig GUI-agent for ekte enheter, med ledende rapporterte resultater i flere mobiltester. På andre områder er konklusjonen mer forsiktig: Ytelsen på datamaskin og nettleser er konkurransedyktig, men ikke konsekvent bedre enn alle andre ledende modeller eller testresultater.
Den neste avgjørende testen er derfor ikke bare om en agent kan fullføre en forhåndsskrevet oppgave. Spørsmålet er om den kan utføre nyttig hverdagsarbeid på en forutsigbar, avbrytbar, gjennomsiktig og trygg måte – også når skjermen endrer seg eller handlingene ikke kan angres.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Qwen UI Agent er Alibabas grunnmodell for GUI agenter og ble offentlig lansert 20.
Qwen UI Agent er Alibabas grunnmodell for GUI agenter og ble offentlig lansert 20. Modellen kombinerer skjermhandlinger med kommandolinjeverktøy og er trent på mer enn 100 fysiske telefoner og over 150 apper.
De sterkeste resultatene kommer på mobil: 82,1 prosent i MobileWorld, 92,2 prosent i MobileWorld Real og 97,5 prosent i AndroidDaily.