Lancé le 2 juin 2026 par l'équipe Qwen, Qwen3.7 Plus est un modèle multimodal qui combine compréhension visuelle et langage au sein d'une seule et même base d'agent intelligent [1][2][3]. Le modèle comprend les images, les vidéos et les captures d'écran (compréhension visuelle, pas de génération) et dispose d'une fe...

Create a landscape editorial hero image for this Studio Global article: What is Alibaba's Qwen3.7-Plus multimodal AI model, what are its key features and capabilities, how does it compare to the Qwen3.7-Max varia. Article summary: ## What is Qwen3.7-Plus?. Topic tags: general, documentation, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject "# Qwen 3.7 vs Qwen 3.6: What Actually Exists and What to Use in Production. Qwen 3.7-Max launched May 19, 2026 as a proprietary API-only model from Alibaba. Qwen 3.6 remains the op" source context "Qwen 3.7 vs Qwen 3.6: What Actually Exists and What to Use in ..." Reference image 2: visual subject "The company claims the model demonstrates performance comparable to GPT-5.2-Thinking, Claude-Opus-4.5, and Gemini 3 Pro." source context "Alibaba’s Qwen3-Max-Thinking expands enterprise AI model
Lancé le 2 juin 2026 par l'équipe Qwen d'Alibaba, Qwen3.7-Plus est ce que l'on appelle un modèle d'agent multimodal. Il ne se contente pas de générer du texte à partir d'une consigne écrite : il est conçu pour voir, raisonner et agir de manière autonome dans un environnement numérique, en combinant vision et langage au sein d'une unique fondation intelligente .
En héritant des puissantes capacités textuelles de Qwen3.7, ce nouveau modèle pousse les curseurs de l'interaction homme-machine bien plus loin. Il peut comprendre des images, des vidéos et des captures d'écran (compréhension visuelle, et non génération) pour naviguer sur des interfaces, déboguer du code ou automatiser des tâches complexes, le tout avec une fenêtre de contexte exceptionnelle d'un million de tokens, soit l'équivalent de plusieurs romans .
La philosophie de Qwen3.7-Plus repose sur un cycle complet : percevoir l'écran, raisonner sur ce qu'il voit, écrire le code nécessaire, exécuter une action puis en vérifier le résultat. Voici ses cinq aptitudes fondamentales :
Le modèle est d'ores et déjà disponible sur Alibaba Cloud Model Studio, la plateforme d'IA générative d'Alibaba (anciennement Bailian), et accessible via API .
Contrairement à ce que leur nom pourrait laisser penser, ces deux modèles ne sont pas en concurrence mais répondent à des besoins radicalement différents. Voici un comparatif clair :
En résumé : Qwen3.7-Max est le fleuron textuel pour les experts en code et en raisonnement pur. Qwen3.7-Plus lui ajoute la vision et une polyvalence d'agent multimodal, pour un tarif à la token bien plus démocratique .
Avant même leur sortie officielle, les versions « Preview » de ces modèles ont été testées anonymement sur Arena AI (anciennement LMArena), la plateforme de classement par préférence humaine. Les résultats ont confirmé la montée en puissance de l'écosystème Qwen :
L'annonce de Qwen3.7-Plus a eu un effet catalyseur sur le cours d'Alibaba, déjà porté depuis des mois par la dynamique de ses innovations en IA :
Cette réaction souligne la confiance des investisseurs dans la capacité d'Alibaba à transformer son avance en intelligence artificielle en un véritable relais de croissance, en particulier via sa division cloud.
Avec Qwen3.7-Plus, Alibaba ne se contente pas de rivaliser sur les grands modèles de langage traditionnels. L'entreprise chinoise défriche un nouveau territoire : celui des agents IA capables d'opérer directement nos écrans et nos logiciels, sans que nous ayons à leur décrire chaque pixel. De l'automatisation du poste de travail au développement logiciel autonome, les cas d'usage sont aussi vastes que les interfaces qui peuplent notre quotidien numérique.
L'écosystème Qwen poursuit son ascension, et la messe n'est sans doute pas dite : la version définitive de ces modèles, encore plus affûtée, est attendue dans les prochains mois.
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Lancé le 2 juin 2026 par l'équipe Qwen, Qwen3.7 Plus est un modèle multimodal qui combine compréhension visuelle et langage au sein d'une seule et même base d'agent intelligent [1][2][3].
Lancé le 2 juin 2026 par l'équipe Qwen, Qwen3.7 Plus est un modèle multimodal qui combine compréhension visuelle et langage au sein d'une seule et même base d'agent intelligent [1][2][3]. Le modèle comprend les images, les vidéos et les captures d'écran (compréhension visuelle, pas de génération) et dispose d'une fenêtre de contexte d'un million de tokens [4][7].
Ses capacités clés incluent la compréhension visuelle et le pilotage d'interfaces graphiques (GUI), le raisonnement profond, l'auto programmation, l'invocation d'outils et l'itération autonome [4][8].