Qwen UI Agent — базова модель GUI агента Alibaba, оприлюднена 20 серпня 2026 року. Вона поєднує взаємодію з екраном і виконання команд у терміналі; для навчання використовували понад 100 фізичних смартфонів і понад 150 застосунків.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Alibaba Qwen’s Qwen-UI-Agent, released on August 20, 2026, and how does its GUI-agent foundation model use real-device training acro. Article summary: Qwen-UI-Agent is Alibaba Qwen’s real-world GUI-agent foundation model: it operates phones, desktops, browsers, and DeepSearch environments by interpreting what is displayed on screen and taking actions such as clicks, ke. Topic tags: general, general web, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake num
Alibaba представила Qwen-UI-Agent — базову модель GUI-агента, яка взаємодіє із програмами приблизно так само, як людина: аналізує те, що бачить на екрані, а потім натискає кнопки, вводить текст, виконує кліки та свайпи. Вона розрахована на роботу зі смартфонами, настільними комп’ютерами, веббраузерами та середовищами DeepSearch, а не лише з API або спеціальними внутрішніми інструментами застосунків. Публічний реліз відбувся 20 серпня 2026 року, а технічний звіт з’явився на arXiv 30 липня. 3
33
Головна ідея проста: якщо ШІ вміє користуватися звичайним інтерфейсом, він може автоматизувати завдання навіть у сервісах, де немає зручного API. Водночас результати тестів не дають підстав казати, що Qwen-UI-Agent найкращий абсолютно всюди. Найпереконливіше він виглядає саме на мобільних пристроях, особливо під час оцінювання на фізичних телефонах.
Багато програмних агентів взаємодіють зі структурованими API, засобами автоматизації браузера або спеціальними інструментами конкретного застосунку. Qwen-UI-Agent натомість сприймає сам інтерфейс як точку взаємодії: читає видимі елементи, визначає потрібні кнопки та поля й обирає дію — натискання, клік, введення тексту чи свайп. Одна модель має працювати з телефонами, комп’ютерами, браузерами та DeepSearch. 33
Її простір дій не обмежується графічним інтерфейсом. Агент також може виконувати команди в терміналі. Тому тривале завдання може переходити від браузера до десктопної програми, а звідти — до командного рядка, без необхідності виконувати кожен крок через GUI. У звіті також описані пакетні дії в межах одного ходу моделі, що має підвищувати ефективність багатокрокових сценаріїв. 1
Агент може добре працювати в емуляторі, але помилятися на справжньому пристрої. Причини — відмінності в розмітці екрана, затримках, поведінці сенсора, стані телефона та роботі конкретних застосунків. Саме тому Qwen-UI-Agent намагається скоротити розрив між симуляцією та реальним використанням.
За описом Alibaba, мобільне середовище проєкту охоплює понад 100 фізичних смартфонів і понад 150 застосунків. Реальне обладнання використовували для створення завдань, збору траєкторій дій, навчання та оцінювання, а не лише для фінальної демонстрації. 3
5
Команда також створила MobileWorld-Real — бенчмарк із понад 400 завданнями для мобільних застосунків на реальних пристроях. Оскільки цей набір тестів розробила сама команда проєкту, результат 92,2% є важливим свідченням роботи на фізичному обладнанні, але його не варто сприймати як повністю незалежний аудит. 1
7
Технічний звіт описує онлайн-навчання з підкріпленням на траєкторіях довжиною понад 100 ходів, а також понад 10 000 паралельних середовищ для виконання навчальних епізодів. Окремо представлено автоматизований дослідницький цикл: агенти допомагають створювати завдання й середовища, знаходити причини помилок і планувати наступні ітерації навчання. 1
Це важливо не лише для окремого кліку чи свайпу. Під час довгого завдання агент має зберігати стан, пам’ятати вже виконані кроки, виправляти помилки та вчасно перемикатися між інтерфейсом і потрібним інструментом.
У звіті також ідеться про легкий інструментарій для станозалежних сценаріїв між різними пристроями та про проактивний запуск сервісів. У перспективі це може означати, що асистент продовжить завдання після переходу користувача зі смартфона на комп’ютер або сам ініціює корисну дію, а не чекатиме окремої команди. Однак такі приклади демонструють напрям розвитку системи, а не доводять, що вона вже безпечно впорається з будь-яким непередбачуваним завданням без нагляду. 1
Найсильніші показники Qwen-UI-Agent припадають на мобільні бенчмарки. Технічний звіт наводить такі результати: 33
У MobileWorld у наданому порівнянні GPT-5.6 Sol отримав 70,1%, а Claude Opus 4.8 — 67,5%. Таким чином, Qwen-UI-Agent випередив їх на 12,0 і 14,6 процентного пункту відповідно. 7
Десктопні та браузерні результати потребують обережнішого прочитання. Показник 79,5% в OSWorld-Verified є сильним, але в порівняннях, наведених разом зі звітом, Claude Opus 4.8 має вищий результат на цьому тесті. А 40,0% в OSWorld-v2 — це оцінка часткового прогресу, а не твердження, що модель повністю виконала 40% усіх завдань. 33
34
36
Показник 73,6% у WebArena підтверджений наданими джерелами, однак вони не дають достатніх підстав для беззаперечного висновку про перше місце серед усіх можливих порівнянь. Рейтинг може змінюватися залежно від моделей, їхніх варіантів, методики оцінювання та набору завдань. 1
8
Значення моделі не лише в тому, що вона вміє натискати кнопки. У звіті описані сценарії, де агент шукає фінансову інформацію через браузер і десктопні інтерфейси, використовує командний рядок для аналізу або роботи з файлами, а потім створює та зберігає документ у графічній програмі. 1
Такий підхід дає кілька способів виконати один і той самий крок. Коли потрібен видимий інтерфейс, агент працює з ним; коли ефективніше обробити структуровані дані чи файли, переходить до термінала. Найскладніше — узгодити ці інструменти й не втратити стан завдання під час переходу між застосунками.
Ця архітектура також підтримує ідею допомоги між пристроями: робота може початися на телефоні, продовжитися на комп’ютері й охопити кілька застосунків без спеціального API для кожного сервісу. У реальному використанні, однак, надійність залежатиме від роботи з автентифікацією, відновлення після несподіваних екранів і чітких обмежень для дій із реальними наслідками.
Агент, який керує екраном, потенційно може отримати доступ до чутливих даних, видалити файли, надіслати форму або ініціювати транзакцію. Для такої системи потрібні відмова від незаконних чи небезпечних запитів, уточнення відсутньої інформації та підтвердження перед чутливими діями — наприклад оплатою, видаленням даних або наданням дозволу на доступ до приватної інформації.
Надані першоджерела технічного звіту не дають змоги незалежно підтвердити кожну конкретну демонстрацію відмови чи запиту на підтвердження, згадану в початковому описі. Тому такі функції слід сприймати як заявлені або заплановані механізми контролю, а не як доведений доказ безпечної експлуатації.
Самі бенчмарки також не свідчать, що модель готова без нагляду працювати в облікових записах звичайних користувачів. Для реального запуску знадобляться обмеження дозволів, етапи підтвердження, журнали дій, можливість перервати виконання, відновлення після помилок і незалежне тестування на різних пристроях та в різних застосунках.
Найпомітніший внесок Qwen-UI-Agent — акцент на фізичному інтерфейсі. Навчання на понад 100 смартфонах і перевірка на реальному обладнанні роблять мобільні результати релевантнішими для керування пристроями, ніж тести лише в емуляторах. Єдиний простір дій для GUI та CLI також вказує на практичну архітектуру для довгих сценаріїв, що перетинають застосунки, браузери, десктопи й термінали. 1
3
Наявні дані дають підстави для сильного висновку щодо мобільного сегмента: Qwen-UI-Agent є помітним GUI-агентом для реальних пристроїв і демонструє провідні заявлені результати в кількох мобільних бенчмарках. Щодо комп’ютерів і браузерів висновок стриманіший: модель є конкурентною, але не перевершує рівномірно всі провідні системи та всі набори тестів.
Наступне випробування — не те, чи може агент пройти заздалегідь підготовлений бенчмарк. Важливіше, чи зможе він виконувати корисну повсякденну роботу передбачувано, прозоро, з можливістю перерви та безпечно — навіть коли екран змінюється або дія має незворотні наслідки.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Qwen UI Agent — базова модель GUI агента Alibaba, оприлюднена 20 серпня 2026 року.
Qwen UI Agent — базова модель GUI агента Alibaba, оприлюднена 20 серпня 2026 року. Вона поєднує взаємодію з екраном і виконання команд у терміналі; для навчання використовували понад 100 фізичних смартфонів і понад 150 застосунків.
Найкращі заявлені результати модель показала на мобільних тестах: 82,1% у MobileWorld, 92,2% у MobileWorld Real і 97,5% в AndroidDaily.