Disponible sur la plateforme Qwen AI depuis septembre 2026, le modèle accepte nativement le texte, les images, l’audio et la vidéo, avec une fenêtre de contexte pouvant atteindre un million de tokens. Alibaba annonce un gain moyen supérieur à 25 % face à Qwen3.5 Omni Plus sur 29 évaluations, ainsi qu’une analyse des...
Publié parModifié avec GPT-6 SolImages générées avec GPT Image 2
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: What is Alibaba’s Qwen3.8 Omni Flash, launched on the Qwen AI platform in September 2026, and how do its native text, image, audio, and vide. Article summary: Alibaba’s Qwen3.8 Omni Flash is a September 2026 model available on the Qwen AI platform that accepts text, images, audio, and video natively in one workflow, with a context window of up to 1 million tokens.. Topic tags: general web, agents, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake
Un agent chargé de retrouver une décision dans l’enregistrement d’une réunion doit écouter, repérer les intervenants, consulter éventuellement l’image, puis produire un compte rendu exploitable. Qwen3.8-Omni-Flash est conçu pour réunir ces étapes dans un même flux de travail. Lancé en septembre 2026 et disponible sur la plateforme Qwen AI, le modèle d’Alibaba accepte nativement le texte, les images, l’audio et la vidéo. Sa fenêtre de contexte peut atteindre un million de tokens — les unités utilisées pour mesurer ce que le modèle peut prendre en compte au cours d’une tâche. Le modèle principal reçoit ces différents formats en entrée et produit du texte en sortie. 1
2
5
Pour les longues vidéos, l’intérêt n’est pas seulement la taille du contexte : un agent peut chercher les séquences pertinentes pour une question au lieu de traiter continuellement chaque image. Alibaba fait état de 51,8 % de tokens en moins que pour une analyse statique dans son évaluation OmniVideoBench. Le groupe annonce aussi un score moyen supérieur de plus de 25 % à celui de Qwen3.5-Omni-Plus sur 29 évaluations. Ces chiffres décrivent des tests rapportés par Alibaba ; ils ne garantissent ni le même gain ni la même économie pour chaque application. 12
16
Le modèle prend notamment en charge des entrées audiovisuelles de réunion allant jusqu’à une heure. Il peut rapprocher les voix des personnes visibles, distinguer les intervenants et transcrire leurs propos. Dans un flux de travail doté d’outils, l’objectif est ensuite d’exploiter ces informations pour faire avancer la tâche, plutôt que de simplement décrire l’enregistrement. 52
16
Les Qwen-MM-Plugins, étendus et publiés en open source, doivent aider les environnements d’agents à accéder aux capacités audio et vidéo du modèle, notamment pour l’analyse à la demande et les tâches en plusieurs étapes. Qwen-Live Harness, également publié en open source, vise les interactions audiovisuelles continues. Ces outils ne signifient pas que les poids du modèle Qwen3.8-Omni-Flash sont eux-mêmes ouverts : celui-ci est proposé comme modèle hébergé. 1
5
52
Une variante distincte, Qwen3.8-Omni-Flash-Realtime, prend en charge des échanges audio et vidéo en direct, avec des réponses en texte et en audio. Sa documentation mentionne aussi l’audio multicanal, l’agrégation vidéo et l’accès à des outils MCP distants — un protocole permettant de connecter un agent à des outils externes. 1
Alibaba annonce une baisse de plus de 98 % du coût API par heure d’entrée audio et de plus de 93 % par heure d’entrée combinant audio et vidéo. Associées à l’analyse ciblée des vidéos, ces réductions peuvent rendre plus envisageables des agents qui examinent régulièrement des contenus et utilisent des outils. Le coût réel d’un déploiement dépend toutefois des médias traités, des tokens consommés, des réponses produites et des outils appelés. 12
16
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
Disponible sur la plateforme Qwen AI depuis septembre 2026, le modèle accepte nativement le texte, les images, l’audio et la vidéo, avec une fenêtre de contexte pouvant atteindre un million de tokens.
Disponible sur la plateforme Qwen AI depuis septembre 2026, le modèle accepte nativement le texte, les images, l’audio et la vidéo, avec une fenêtre de contexte pouvant atteindre un million de tokens. Alibaba annonce un gain moyen supérieur à 25 % face à Qwen3.5 Omni Plus sur 29 évaluations, ainsi qu’une analyse des longues vidéos capable de se concentrer sur les passages utiles.
Des outils destinés aux agents IA, une variante pour le temps réel et des baisses annoncées du coût des entrées audio et audiovisuelles visent à faciliter les usages en production.