Publié le 26 août 2026, Qwen3.8 Flash Next est un aperçu technique multimodal à poids ouverts de l’architecture prévue pour la famille Qwen4 : son réseau principal compte 125 milliards de paramètres, dont environ 6 mi... Son architecture combine Gated DeltaNet et Qwen Sparse Attention, ainsi qu’un module d’embedding...
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: What is Alibaba’s Qwen3.8-Flash—also released as Qwen3.8-Flash-Next—and why is it significant as an open multimodal mixture-of-experts techn. Article summary: Qwen3.8-Flash, released as the open-weight Qwen3.8-Flash-Next, is Alibaba Qwen’s multimodal mixture-of-experts (MoE) technical-preview model for the architecture intended to underpin Qwen4. It matters less as a conventio. Topic tags: general, news, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers
Alibaba a publié Qwen3.8-Flash-Next le 26 août 2026, avec de premières couvertures détaillées le lendemain. Le modèle est proposé avec des poids ouverts et n’est pas présenté comme le futur modèle phare Qwen4 : il s’agit plutôt d’une avant-première inspectable de l’architecture que Qwen prévoit d’utiliser pour cette prochaine famille. 1
2
15
Sa particularité tient à un compromis technique peu courant : un réseau principal de 125 milliards de paramètres, complété par 51 milliards de paramètres d’embeddings N-gram, mais seulement environ 6 milliards de paramètres activés pour chaque jeton. L’objectif est de conserver une grande capacité totale tout en évitant le coût de calcul d’un modèle dense qui traiterait l’ensemble de ses paramètres à chaque étape. 4
15
Le nom Qwen3.8-Flash-Next désigne le modèle ouvert publié par l’équipe Qwen. Le nom Qwen3.8-Flash correspond, lui, à la déclinaison destinée à la production et à l’accès par API. Cette distinction est importante : Qwen3.8-Flash-Next est un prototype technique et un plan de travail pour les développeurs, pas la preuve que toute la gamme Qwen4 a déjà été lancée. 1
2
15
En ouvrant les poids suffisamment tôt, Qwen permet aux chercheurs et aux développeurs d’examiner la conception, d’adapter les outils d’inférence et de tester le modèle sur leurs propres charges de travail avant l’arrivée de la famille Qwen4. 2
3
15
Il faut toutefois distinguer les deux chiffres liés au contexte. La configuration native annoncée est de 262 144 jetons. La fenêtre d’1 million de jetons dépend de l’extension YaRN : elle doit donc être considérée comme une configuration étendue, et non comme la limite native du modèle. 1
4
16
Qwen3.8-Flash-Next associe Gated DeltaNet, ou GDN, à Qwen Sparse Attention, ou QSA. GDN vise à compresser les informations issues du contexte antérieur. QSA s’appuie de son côté sur un index léger pour repérer les micro-blocs pertinents et les sélectionner, au lieu d’appliquer une attention complète et uniforme à tout l’historique. 4
L’idée est de limiter le ralentissement et la hausse des coûts lorsque les séquences deviennent très longues. Qwen annonce jusqu’à 7,6 fois plus de rapidité en préremplissage et 4,9 fois plus en décodage sur des séquences d’un million de jetons. Ces résultats sont communiqués par le fabricant et dépendent du matériel, de l’implémentation, de la séquence et du protocole de test ; ils ne constituent pas une garantie universelle en production. 4
Le module séparé d’embeddings N-gram ajoute de la capacité de représentation sans imposer le traitement actif de l’ensemble des paramètres pour chaque jeton. La conception de Qwen permet également de déporter cette table d’embeddings vers la mémoire de l’hôte et de précharger les données de manière asynchrone, afin de faire coïncider les transferts avec les calculs du modèle. 4
Pour les équipes qui déploient de grands modèles, ce point est particulièrement concret. L’emplacement des données en mémoire et les mouvements entre mémoire et processeur peuvent compter autant que le nombre brut de paramètres, notamment pour l’analyse de documents volumineux ou le traitement de lots importants.
Qwen présente également des changements du côté de l’optimisation et du passage à l’échelle. L’équipe indique avoir utilisé l’optimiseur Muon, ajusté ses interactions avec AdamW et la gestion des paramètres, puis recalibré une loi d’échelle adaptée à cette architecture. 4
La publication ne se limite donc pas à proposer un nouveau point de contrôle avec un mécanisme d’attention différent. Elle met publiquement à l’épreuve une méthode plus large : combiner une forte capacité totale avec une quantité de calcul active relativement faible.
Qwen affirme que l’entraînement de Qwen3.8-Flash a coûté environ un neuvième de celui de Qwen3.7-Plus, tout en améliorant les résultats sur les tâches de programmation et de bureautique. Reuters a également rapporté les déclarations de l’entreprise sur ces progrès et sur la baisse des coûts d’entraînement. 1
4
Les résultats cités sont de 58,7 sur DeepSWE 1.1, 62,5 sur SWE-bench Pro et 84,5 sur AndroidWorld. Qwen présente ces performances comme supérieures à celles de DeepSeek V4 Flash sur le segment des modèles privilégiant le rapport valeur-prix. Ces comparaisons restent toutefois des résultats communiqués par l’entreprise ; les éléments disponibles ne permettent pas d’établir qu’ils ont été reproduits indépendamment dans des conditions parfaitement équivalentes. 4
Pour l’offre de production Qwen3.8-Flash, le tarif d’API annoncé est de 1 yuan par million de jetons en entrée et 3 yuans par million de jetons en sortie, sans distinction entre heures creuses et heures de pointe dans les informations de lancement. Comparer directement ce prix à celui d’autres modèles peut être trompeur : la version utilisée, la mise en cache, la longueur du contexte, le niveau de service et la quantité de sortie peuvent modifier sensiblement l’économie réelle. 1
4
Les poids ouverts font de Qwen3.8-Flash-Next une base d’expérimentation utile avant Qwen4. Les développeurs peuvent commencer à adapter les moteurs d’inférence, tester la quantification et les méthodes de service, puis observer le comportement de l’architecture sur leurs propres données sans attendre une implémentation finale de Qwen4. 2
3
15
Le modèle paraît particulièrement adapté aux usages limités par la taille du contexte ou par le coût de traitement des jetons, notamment :
Ces applications découlent logiquement de la conception publiée, orientée vers le long contexte et le faible nombre de paramètres actifs. Elles ne garantissent pas que le modèle surpassera toutes les solutions denses ou fondées sur une attention complète en production. Le matériel, le logiciel de déploiement, la qualité de la quantification, la stratégie de recherche documentaire et la nature des tâches resteront déterminants.
L’intérêt principal de Qwen3.8-Flash-Next est de rendre visible une direction architecturale avant la sortie de la génération suivante. Le modèle offre à la communauté un moyen concret d’évaluer si l’attention parcimonieuse et compressée, les embeddings auxiliaires de grande taille et le faible nombre de paramètres actifs peuvent améliorer l’économie du très long contexte sans provoquer de compromis de qualité trop importants.
Les chiffres les plus spectaculaires — accélérations, résultats de référence, baisse du coût d’entraînement et promesse de compétitivité — proviennent néanmoins en grande partie de Qwen ou de comptes rendus fondés sur les déclarations de Qwen. Des tests indépendants restent nécessaires sur différents matériels, langues, longueurs de contexte, tâches multimodales et flux de travail avec agents.
La conclusion la plus solide est donc plus nuancée que « Qwen3.8-Flash-Next bat tous ses concurrents ». Il s’agit d’un aperçu technique multimodal à poids ouverts, fondé sur une architecture de type mixture-of-experts (MoE), qui donne très tôt aux développeurs un accès à la conception préparée par Alibaba pour Qwen4 — et à un plan testable pour rendre l’IA à très long contexte plus efficace.
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
Publié le 26 août 2026, Qwen3.8 Flash Next est un aperçu technique multimodal à poids ouverts de l’architecture prévue pour la famille Qwen4 : son réseau principal compte 125 milliards de paramètres, dont environ 6 mi...
Publié le 26 août 2026, Qwen3.8 Flash Next est un aperçu technique multimodal à poids ouverts de l’architecture prévue pour la famille Qwen4 : son réseau principal compte 125 milliards de paramètres, dont environ 6 mi... Son architecture combine Gated DeltaNet et Qwen Sparse Attention, ainsi qu’un module d’embeddings N gram de 51 milliards de paramètres, afin de réduire le coût du traitement des contextes très longs.
Qwen annonce un contexte natif de 262 144 jetons, extensible à 1 million avec YaRN, des gains de vitesse pouvant atteindre 7,6× en préremplissage et 4,9× en décodage, ainsi qu’un coût d’entraînement environ neuf fois...