Alibaba julkaisi Qwen UI Agentin 20. elokuuta 2026. Mallin yksi toimintatila yhdistää näytön klikkaukset, tekstinsyötön ja pyyhkäisyt komentorivin käyttöön.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Alibaba Qwen’s Qwen-UI-Agent, released on August 20, 2026, and how does its GUI-agent foundation model use real-device training acro. Article summary: Qwen-UI-Agent is Alibaba Qwen’s real-world GUI-agent foundation model: it operates phones, desktops, browsers, and DeepSearch environments by interpreting what is displayed on screen and taking actions such as clicks, ke. Topic tags: general, general web, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake num
Alibaba julkaisi Qwen-UI-Agentin 20. elokuuta 2026. Kyseessä on graafista käyttöliittymää käyttävä tekoälymalli eli GUI-agentti, joka pyrkii toimimaan ohjelmissa samalla tavalla kuin ihminen: se katsoo näytön sisältöä ja tekee sen perusteella klikkauksia, näppäinpainalluksia, tekstinsyöttöä ja pyyhkäisyjä. Malli on suunniteltu puhelimille, tietokoneille, verkkoselaimille ja DeepSearch-ympäristöihin, eikä se nojaa yksinomaan ohjelmointirajapintoihin eli API-rajapintoihin tai sovelluskohtaisiin taustatyökaluihin. Tekninen raportti julkaistiin arXiv-palvelussa 30. heinäkuuta. 3
33
Ajatus on käytännöllinen: jos tekoäly osaa käyttää tavallista näytöllä näkyvää käyttöliittymää, se voi teoriassa automatisoida tehtäviä myös sellaisissa palveluissa, joille ei ole saatavilla sopivaa API-rajapintaa. Vertailutulokset eivät kuitenkaan tarkoita, että Qwen-UI-Agent olisi paras kaikissa ympäristöissä. Sen selkein etu näkyy mobiilikäytössä – erityisesti silloin, kun tehtävät suoritetaan oikeilla puhelimilla.
Monet perinteiset ohjelmistoagentit käyttävät rakenteisia API-rajapintoja, selainten automaatiotoimintoja tai sovelluskohtaisia työkaluja. Qwen-UI-Agent ottaa käyttöliittymän itsensä toimintapisteeksi. Se tunnistaa näytöllä näkyviä painikkeita, kenttiä ja muita elementtejä ja valitsee seuraavan toiminnon niiden perusteella.
Mallin toimintatila yhdistää graafisen käyttöliittymän ja komentorivin. Pitkä tehtävä voi siis siirtyä selaimesta työpöytäsovellukseen ja sieltä päätelaitteelle ilman, että jokaista vaihetta tarvitsee toteuttaa hiirellä ja näppäimistöllä. Raportissa kuvataan myös useiden toimintojen suorittamista saman mallikierroksen aikana, mikä on tarkoitettu tehostamaan monivaiheisia työnkulkuja. 1
Tällaisen järjestelmän tavoite ei ole vain yksittäisen painikkeen painaminen. Agentin pitäisi pystyä säilyttämään tehtävän tila pitkän toimintoketjun aikana, muistamaan jo tehdyt vaiheet, toipumaan virheistä ja valitsemaan oikea sovellus tai työkalu seuraavaa vaihetta varten.
GUI-agentti voi toimia hyvin emulaattorissa mutta epäonnistua fyysisellä laitteella. Oikeat puhelimet tuovat mukanaan muun muassa erilaisia näyttöasetteluja, viiveitä, kosketuksen käyttäytymistä, laitteen tiloja ja sovellusten poikkeavaa toimintaa.
Alibaban mukaan Qwen-UI-Agentin mobiiliympäristö kattoi yli 100 fyysistä puhelinta ja yli 150 sovellusta. Laitteita käytettiin tehtävien rakentamiseen, toimintaketjujen keräämiseen, koulutukseen ja arviointiin – ei vain viimeiseen esittelyyn. 3
5
Hankkeessa esiteltiin myös MobileWorld-Real, yli 400 oikeilla laitteilla tehtävän mobiilitehtävän vertailutesti. Koska sama projekti rakensi tämän testin, sen 92,2 prosentin tulos on kiinnostavaa näyttöä fyysisten laitteiden suorituskyvystä, mutta sitä ei pidä tulkita täysin riippumattomaksi auditoinniksi. 1
7
Tekninen raportti kuvaa verkossa tapahtuvaa vahvistusoppimista, jossa toimintaketjut voivat olla yli 100 vuoron mittaisia. Koulutuksessa käytettiin yli 10 000:ta samanaikaista suoritusympäristöä. Raportissa kuvataan lisäksi automatisoitu tutkimussilmukka, jossa agentit auttavat tehtävien ja ympäristöjen rakentamisessa, virheiden diagnosoinnissa ja seuraavien koulutuskierrosten suunnittelussa. 1
Tavoitteena on ratkaista ongelma, joka on paljon vaikeampi kuin yksittäiset käyttöliittymätoiminnot: tilan säilyttäminen pitkän tehtävän aikana. Agentin on tiedettävä, mitä se on jo tehnyt, osattava korjata väärästä valinnasta aiheutunut tilanne ja pystyttävä vaihtamaan työkalua kesken prosessin.
Raportissa mainitaan myös kevyt kehys tilallisille, laitteiden välillä kulkeville työnkuluille ja ennakoivalle palvelun käynnistämiselle. Tämä viittaa avustajaan, joka voisi jatkaa tehtävää, kun käyttäjä siirtyy puhelimelta tietokoneelle, tai käynnistää hyödyllisen toimenpiteen ilman jokaista erillistä käskyä. Esimerkit osoittavat järjestelmän tavoitellun suunnan, eivät todista, että se osaisi hoitaa kaikki avoimen maailman tehtävät turvallisesti ilman valvontaa. 1
Teknisessä raportissa Qwen-UI-Agentin parhaat tulokset ovat mobiilikäytössä. Raportoidut luvut ovat seuraavat: 33
MobileWorld-testissä toimitetuissa vertailuissa GPT-5.6 Sol sai 70,1 prosenttia ja Claude Opus 4.8 67,5 prosenttia. Qwen-UI-Agentin etumatka oli siten 12,0 ja 14,6 prosenttiyksikköä. 7
Tietokone- ja selainkäytön luvut vaativat tarkempaa tulkintaa. OSWorld-Verified-testin 79,5 prosentin tulos on vahva, mutta raportin yhteydessä toimitetuissa vertailuissa Claude Opus 4.8 ylsi korkeammalle. OSWorld-v2-testin 40,0 prosenttia puolestaan mittaa osittaista edistymistä – se ei tarkoita, että 40 prosenttia kokonaisista tehtävistä olisi suoritettu loppuun. 33
34
36
WebArena-testin 73,6 prosentin tulos on lähteiden tukema, mutta aineisto ei osoita kiistattomasti, että malli olisi ensimmäinen kaikissa vertailuryhmissä. Sijoitukset voivat muuttua malliversioiden, arviointitapojen ja testijakojen mukaan. 1
8
Qwen-UI-Agentin merkitys ei rajoitu siihen, että se osaa painaa näytön painikkeita. Raportissa kuvataan työnkulkuja, joissa agentti etsii taloustietoa selaimen ja työpöytäohjelmien avulla, käyttää komentorivityökaluja analyysiin tai tiedostojen käsittelyyn ja luo lopuksi asiakirjan graafisessa sovelluksessa. 1
Tämä antaa agentille useamman tavan suorittaa sama vaihe. Näkyvää käyttöliittymää voi käyttää silloin, kun se on välttämätöntä, ja päätelaitteeseen voi siirtyä, kun esimerkiksi tiedostojen käsittely tai laskenta on tehokkaampaa. Haasteena on pitää tehtävän tila koherenttina sovelluksesta ja laitteesta toiseen.
Sama rakenne tukee laajempaa ajatusta laitteiden välisestä avustamisesta. Tehtävä voisi alkaa puhelimella, jatkua tietokoneella ja käyttää useita sovelluksia ilman, että jokaisen palvelun pitäisi tarjota erillinen API-rajapinta. Käytännössä luotettavuus riippuisi kuitenkin muun muassa kirjautumisten käsittelystä, yllättävistä näytöistä palautumisesta ja siitä, miten järjestelmä rajaa seurauksiltaan vakavat toimet.
Näyttöä hallitseva agentti voi päästä käsiksi arkaluonteisiin tietoihin, poistaa tiedostoja, lähettää lomakkeita tai käynnistää rahansiirtoja. Turvallisessa toimintatavassa järjestelmän pitäisi kieltäytyä laittomista tai korkean riskin pyynnöistä, kysyä puuttuvia tietoja ja pyytää vahvistus ennen arkaluonteisia toimia, kuten maksamista, poistamista tai yksityisyyslupien myöntämistä.
Toimitettu ensisijainen tekninen raportti ei kuitenkaan itsenäisesti vahvista jokaista alkuperäisessä pyynnössä mainittua kieltäytymis- ja vahvistusesimerkkiä. Näitä toimintoja on siksi pidettävä raportoituina tai suunniteltuina suojauksina, ei varmana näyttönä turvallisesta käyttöönotosta.
Vertailupisteet eivät myöskään osoita, että järjestelmä olisi valmis toimimaan valvomatta tavallisten käyttäjien tileillä. Todellinen käyttöönotto vaatisi käyttöoikeuksien tarkat rajat, vahvistusvaiheet, lokit, keskeytyspainikkeet, virheistä palautumisen sekä riippumatonta testausta erilaisilla laitteilla ja sovelluksilla.
Qwen-UI-Agentin selkein panos on keskittyminen fyysiseen käyttöliittymään. Kun mallia on koulutettu yli sadalla puhelimella ja arvioitu oikeilla laitteilla, sen mobiilitulokset kertovat enemmän käytännön laitehallinnasta kuin pelkät emulaattoritestit. GUI- ja komentorivitoimintojen yhdistäminen puolestaan tarjoaa arkkitehtuurin pidemmille työnkuluille, jotka ylittävät sovellusten, selainten, työpöytien ja päätelaitteiden rajat. 1
3
Näyttö tukee vahvaa johtopäätöstä mobiilikäytöstä: Qwen-UI-Agent on merkittävä oikeita laitteita käyttävä GUI-agentti, jolla on kärkitasolle yltäviä raportoituja tuloksia useissa mobiilivertailuissa. Tietokone- ja selainkäytöstä johtopäätös on varovaisempi: suorituskyky on kilpailukykyinen, mutta malli ei ole jokaisessa testissä tai jokaista huippumallia vastaan ylivoimainen.
Seuraava todellinen koe ei ole se, pystyykö agentti suorittamaan ennalta käsikirjoitetun vertailutehtävän. Olennaisempaa on, pystyykö se hoitamaan hyödyllisiä arjen töitä ennakoitavasti, keskeytettävästi ja läpinäkyvästi – myös silloin, kun näyttö muuttuu tai toiminnon seuraukset ovat peruuttamattomia.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Alibaba julkaisi Qwen UI Agentin 20. elokuuta 2026.
Alibaba julkaisi Qwen UI Agentin 20. elokuuta 2026. Mallin yksi toimintatila yhdistää näytön klikkaukset, tekstinsyötön ja pyyhkäisyt komentorivin käyttöön.
Parhaat raportoidut tulokset ovat mobiilitesteissä: 82,1 % MobileWorld testissä, 92,2 % oikeilla laitteilla tehdyssä MobileWorld Real testissä ja 97,5 % AndroidDaily testissä.