Qwen3.7 Plus — это мультимодальная модель агент, выпущенная командой Qwen (Alibaba) 2 июня 2026 года, объединяющая визуальное и языковое восприятие в единую интеллектуальную основу [1][2][3]. Модель способна «видеть»: она понимает изображения, видео и скриншоты, но не генерирует их, а также поддерживает контекстное...

Create a landscape editorial hero image for this Studio Global article: What is Alibaba's Qwen3.7-Plus multimodal AI model, what are its key features and capabilities, how does it compare to the Qwen3.7-Max varia. Article summary: ## What is Qwen3.7-Plus?. Topic tags: general, documentation, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject "# Qwen 3.7 vs Qwen 3.6: What Actually Exists and What to Use in Production. Qwen 3.7-Max launched May 19, 2026 as a proprietary API-only model from Alibaba. Qwen 3.6 remains the op" source context "Qwen 3.7 vs Qwen 3.6: What Actually Exists and What to Use in ..." Reference image 2: visual subject "The company claims the model demonstrates performance comparable to GPT-5.2-Thinking, Claude-Opus-4.5, and Gemini 3 Pro." source context "Alibaba’s Qwen3-Max-Thinking expands enterprise AI model
Компания Alibaba совершила очередной рывок в гонке искусственного интеллекта, представив 2 июня 2026 года новую модель Qwen3.7-Plus. Это не просто обновление, а полноценная мультимодальная агентная система, объединяющая визуальный и языковой интеллект. Новинка вызвала не только ажиотаж в технологическом сообществе, но и оказала прямое влияние на фондовый рынок. Разберемся, что это за модель, чем она отличается от старшего собрата Qwen3.7-Max и какие перспективы открывает.
Qwen3.7-Plus — это мультимодальная модель, созданная как единая интеллектуальная база для ИИ-агентов . В отличие от предшественников, она обучалась не только на тексте, но и на огромных массивах визуально-языковых данных.
Простыми словами, это модель, которая не просто читает и пишет текст, но и понимает, что изображено на картинках, видео и скриншотах (речь идет именно о понимании, а не о генерации изображений) . При этом она удерживает в своей «памяти» до 1 миллиона токенов контекста — этого достаточно, чтобы проанализировать многотомный роман или целый сериал.
Главное преимущество Qwen3.7-Plus — способность превращать визуальную информацию в действия. Вот пять столпов, на которых держится ее агентная мощь :
Доступ к модели уже открыт через платформу Alibaba Cloud Model Studio (Bailian) по API .
Alibaba выпустила две версии модели, каждая со своей специализацией. Чтобы не запутаться, вот их ключевые различия :
Итог: Max — это абсолютный чемпион в работе с текстом и кодом. Plus — это Max, который научили «видеть» и взаимодействовать с визуальным миром, предлагая уникальные возможности для автоматизации пользовательских интерфейсов по более доступной цене .
Еще до официального релиза превью-версии обеих моделей (Qwen3.7-Max-Preview и Qwen3.7-Plus-Preview) прошли «боевое крещение» на независимой арене Arena AI (ранее LMArena) в мае 2026 года .
Результаты закрепили за Alibaba статус одного из мировых лидеров:
Анонс Qwen3.7-Plus стал мощным драйвером для котировок технологического гиганта. Инвесторы позитивно оценили расширение линейки ИИ-продуктов и укрепление позиций Alibaba в гонке мультимодальных агентов:
Этот скачок подтверждает, что рынок видит в мультимодальных агентах Alibaba не просто исследовательский проект, а продукт с огромным коммерческим потенциалом для автоматизации бизнес-процессов.
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Qwen3.7 Plus — это мультимодальная модель агент, выпущенная командой Qwen (Alibaba) 2 июня 2026 года, объединяющая визуальное и языковое восприятие в единую интеллектуальную основу [1][2][3].
Qwen3.7 Plus — это мультимодальная модель агент, выпущенная командой Qwen (Alibaba) 2 июня 2026 года, объединяющая визуальное и языковое восприятие в единую интеллектуальную основу [1][2][3]. Модель способна «видеть»: она понимает изображения, видео и скриншоты, но не генерирует их, а также поддерживает контекстное окно в 1 миллион токенов [4][7].
Ключевые способности включают визуальное понимание GUI интерфейсов, глубокие логические рассуждения, автономное самопрограммирование и автоматическую проверку собственных действий [4][5][8].