Qwen UI Agent — базовая GUI модель Alibaba, публично выпущенная 20 августа 2026 года для работы с телефонами, компьютерами, вебом и DeepSearch. Модель использует единое пространство действий для кликов, свайпов, ввода текста и команд командной строки; её обучали на более чем 100 физических смартфонах и 150 приложениях.
Ответ на исследование

Create a landscape editorial hero image for this Studio Global article: What is Alibaba Qwen’s Qwen-UI-Agent, released on August 20, 2026, and how does its GUI-agent foundation model use real-device training acro. Article summary: Qwen-UI-Agent is Alibaba Qwen’s real-world GUI-agent foundation model: it operates phones, desktops, browsers, and DeepSearch environments by interpreting what is displayed on screen and taking actions such as clicks, ke. Topic tags: general, general web, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake num
Alibaba представила Qwen-UI-Agent как базовую модель графического пользовательского интерфейса (GUI), способную работать с программами примерно так же, как человек: «смотреть» на экран, находить нужные элементы и выполнять клики, нажатия клавиш, ввод текста и свайпы. Модель рассчитана на мобильные устройства, настольные компьютеры, браузеры и среды DeepSearch, а не только на сервисы с готовыми API. Публичный релиз состоялся 20 августа 2026 года, а технический отчёт появился на arXiv 30 июля. 3
33
Главная идея проекта практична: если ИИ умеет пользоваться обычным интерфейсом, ему не обязательно ждать, пока разработчик добавит специальный API. Но цифры не означают, что Qwen-UI-Agent безоговорочно лидирует во всех сценариях. Убедительнее всего модель выглядит именно в мобильных задачах, особенно при проверке на настоящих телефонах.
Многие программные агенты взаимодействуют с приложениями через структурированные API, браузерные инструменты или специальную внутреннюю интеграцию. Qwen-UI-Agent выбирает другой подход: интерфейс на экране становится основной точкой взаимодействия. Модель анализирует видимое содержимое, определяет нужные элементы и выбирает действие — например, нажатие, клик, ввод или прокрутку. Один и тот же агент предназначен для работы со смартфонами, компьютерами, веб-страницами и DeepSearch. 33
При этом модель не ограничивается графическим интерфейсом. Её пространство действий объединяет GUI-команды с выполнением команд в терминале. Поэтому длинная задача может переходить из браузера в настольное приложение, а затем в командную строку — без необходимости выполнять каждый шаг исключительно через экран. В отчёте также описаны пакетные действия в рамках одного хода модели, призванные ускорить многошаговые сценарии. 1
Агент может успешно работать в эмуляторе и заметно хуже — на физическом устройстве. В реальности меняются расположение элементов, задержки, состояние телефона, особенности сенсорного ввода и поведение приложений. Именно поэтому переход от симуляции к настоящему устройству считается одной из ключевых проблем для компьютерного зрения и компьютерного управления.
По данным Alibaba, мобильная инфраструктура проекта включает более 100 физических смартфонов и свыше 150 приложений. Эти устройства использовались не только для финальной демонстрации: на них создавали задания, собирали траектории действий, обучали модель и проводили оценку. 3
5
Команда также создала MobileWorld-Real — бенчмарк с более чем 400 заданиями на настоящих мобильных устройствах. Такой тест даёт важные сведения о поведении агента на реальном «железе», однако его результаты не стоит воспринимать как полностью независимый аудит: бенчмарк разработан той же командой. 1
7
Технический отчёт описывает онлайн-обучение с подкреплением на траекториях длиной более 100 ходов и свыше 10 000 параллельных сред для выполнения сценариев. Кроме того, Alibaba рассказывает об автоматизированном цикле исследований: агенты помогают создавать задания и окружения, анализировать ошибки и планировать следующие итерации обучения. 1
Такой подход нацелен не просто на распознавание одной кнопки. В длинной задаче агенту нужно сохранять контекст, помнить уже выполненные шаги, восстанавливаться после ошибки и выбирать подходящий интерфейс или инструмент на каждом этапе.
В отчёте также упоминается облегчённый механизм для состояний, которые сохраняются между устройствами, и для проактивного запуска сервисов. Это указывает на сценарии, в которых помощник продолжает работу после перехода пользователя со смартфона на компьютер или сам инициирует полезное действие, а не ждёт отдельной команды. Однако такие демонстрации показывают направление развития системы, а не доказывают, что она уже безопасно справляется с любой открытой задачей без контроля человека. 1
Сильнее всего Qwen-UI-Agent выглядит в опубликованных мобильных тестах. В техническом отчёте приведены следующие результаты: 33
В MobileWorld опубликованное сравнение даёт GPT-5.6 Sol результат 70,1%, а Claude Opus 4.8 — 67,5%. Таким образом, Qwen-UI-Agent опередила их на 12,0 и 14,6 процентного пункта соответственно. 7
Результаты для компьютеров и браузеров требуют более осторожной трактовки. Показатель 79,5% в OSWorld-Verified выглядит сильным, но в приведённых сравнениях Claude Opus 4.8 получил более высокий результат. А 40,0% в OSWorld-v2 — это показатель частичного прогресса, а не утверждение, что модель полностью завершила 40% всех заданий. 33
34
36
Оценка 73,6% в WebArena подтверждается предоставленными источниками, однако они не дают достаточных оснований говорить о бесспорном первом месте во всех наборах сравнений. Итоговый рейтинг зависит от выбранных моделей, их версий, методики оценки и разбиения теста. 1
8
Значение Qwen-UI-Agent не сводится к тому, что модель умеет нажимать кнопки. В отчёте описаны сценарии, где агент ищет финансовую информацию через браузер и настольные интерфейсы, использует командную строку для анализа или работы с файлами, а затем создаёт и сохраняет документ в графическом приложении. 1
Такой подход даёт несколько способов выполнить один и тот же шаг. Когда требуется взаимодействовать с видимым интерфейсом, агент использует его; если быстрее обработать файлы или данные через терминал, он переключается на командную строку. Основная сложность — координировать инструменты и не терять состояние задачи при переходе между приложениями.
Та же архитектура поддерживает идею межустройственной помощи: сценарий может начаться на телефоне, продолжиться на компьютере и затронуть несколько приложений без специального API для каждого сервиса. В реальном использовании надёжность будет зависеть от работы с авторизацией, восстановления после неожиданных экранов и чётких ограничений для действий с необратимыми последствиями.
Агент, который способен управлять экраном, потенциально получает доступ к чувствительным данным, файлам и формам. Он также может удалить документ, отправить заявку или инициировать транзакцию. Для такой системы необходимы отказ от незаконных и опасных запросов, запрос недостающей информации и подтверждение перед чувствительными действиями — например, оплатой, удалением файлов или выдачей разрешений на доступ к данным.
Однако предоставленные первичные материалы технического отчёта не позволяют независимо подтвердить каждую конкретную демонстрацию отказа и запроса подтверждения, упомянутую в исходном запросе. Поэтому подобные функции следует считать заявленными или предусмотренными мерами контроля, а не доказательством полностью безопасного развёртывания.
Одних результатов бенчмарков также недостаточно, чтобы разрешить агенту работать без присмотра в обычных пользовательских аккаунтах. Для реальных продуктов понадобятся ограничения прав, обязательные подтверждения, журналы действий, возможность немедленно остановить сценарий, восстановление после ошибок и независимое тестирование на разных устройствах и в разных приложениях.
Самый заметный вклад Qwen-UI-Agent — акцент на физическом интерфейсе. Обучение на более чем 100 телефонах и оценка на реальном оборудовании делают мобильные результаты более показательными для управления устройствами, чем тестирование только в эмуляторах. Единое пространство GUI- и CLI-действий, в свою очередь, предлагает практичную основу для длинных сценариев, проходящих через приложения, браузеры, рабочий стол и терминал. 1
3
Доказательств достаточно для осторожного, но сильного вывода: Qwen-UI-Agent — заметный агент для управления реальными мобильными устройствами, показавший лидирующие опубликованные результаты в нескольких мобильных бенчмарках. Для компьютеров и браузеров вывод другой: производительность конкурентная, но модель не превосходит одинаково убедительно все передовые системы и все тесты.
Следующий важный экзамен для таких технологий — не выполнение заранее подготовленного сценария, а полезная повседневная работа. Агент должен оставаться предсказуемым, понятным и прерываемым, когда интерфейс меняется, а ошибка может привести к удалению данных, оплате или другому необратимому результату.
Studio Global AI
На этой странице есть ответ, подтвержденный источником, который вы можете продолжить внутри Studio Global.
Qwen UI Agent — базовая GUI модель Alibaba, публично выпущенная 20 августа 2026 года для работы с телефонами, компьютерами, вебом и DeepSearch.
Qwen UI Agent — базовая GUI модель Alibaba, публично выпущенная 20 августа 2026 года для работы с телефонами, компьютерами, вебом и DeepSearch. Модель использует единое пространство действий для кликов, свайпов, ввода текста и команд командной строки; её обучали на более чем 100 физических смартфонах и 150 приложениях.
Самые сильные результаты Qwen UI Agent показала на мобильных тестах: 82,1% в MobileWorld, 92,2% в MobileWorld Real и 97,5% в AndroidDaily.