Qwen 3.8 Flash Next est présenté comme un modèle de test à poids ouverts destiné aux développeurs, et non comme le futur modèle phare d’Alibaba. Son architecture multimodale Mixture of Experts compterait 125 milliards de paramètres, dont 51 milliards d’embeddings N gram, avec seulement 6 milliards activés pour chaqu...
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: What is Alibaba’s planned Qwen 3.8 Flash Next release, how does its multimodal Mixture of Experts architecture (125 billion total parameters. Article summary: Qwen 3.8 Flash Next is being positioned as an early, open weight developer test of the architecture intended for Qwen 4—not as Alibaba’s finished flagship.. Topic tags: general web, agents, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thum
Qwen 3.8-Flash-Next est présenté comme un test développeur à poids ouverts de l’architecture qui devrait alimenter la famille Qwen 4. Alibaba ne le positionne donc pas comme son modèle phare définitif, mais comme une version précoce permettant aux développeurs de se préparer à la prochaine génération. 9
Les performances, le coût d’entraînement et les modalités exactes de publication doivent toutefois être considérés comme des informations communiquées par le fournisseur tant que les poids, la documentation technique complète et des évaluations indépendantes ne sont pas disponibles.
Le modèle annoncé reposerait sur une architecture multimodale Mixture-of-Experts — ou MoE, un système qui répartit le travail entre plusieurs sous-modèles spécialisés. Il totaliserait 125 milliards de paramètres, dont 51 milliards dédiés aux embeddings N-gram, mais n’en activerait qu’environ 6 milliards pour chaque jeton traité. 9
En pratique, le modèle conserve un vaste réservoir de capacités, tout en n’envoyant chaque unité de texte ou de données qu’à un petit groupe d’« experts ». Cette sélection dynamique peut réduire les calculs en virgule flottante, les besoins en bande passante mémoire et le coût du déploiement par rapport à un modèle dense de taille totale comparable.
Les embeddings N-gram constituent une autre pièce du dispositif : ils permettent de représenter rapidement des séquences fréquentes de plusieurs unités, plutôt que de traiter chaque jeton isolément. Leur contribution exacte aux performances et aux économies de calcul devra néanmoins être documentée et mesurée indépendamment.
Le code se prête particulièrement bien à une spécialisation distribuée. Certains experts peuvent apprendre les régularités de langages de programmation, d’autres les structures de dépôts, l’utilisation d’outils, le débogage ou l’analyse de longues bases de code.
Alibaba affirme que cette approche pourrait offrir des performances proches de la frontière avec un coût d’entraînement représentant environ un neuvième de celui de Qwen 3.7-Plus. Cette promesse doit être comprise comme un objectif d’efficacité résultant du routage parcimonieux, des changements d’architecture et du système d’embeddings — pas comme la preuve d’une équivalence avec les meilleurs modèles propriétaires sur tous les benchmarks et dans tous les usages réels.
Les évaluations indépendantes du codage ne sont pas encore suffisantes pour confirmer cette avance.
Le choix d’une publication anticipée répond à une logique d’écosystème. Flash-Next pourrait permettre aux développeurs de tester :
La version finale de Qwen 4 pourra ainsi bénéficier d’un entraînement plus long, d’un post-entraînement plus poussé, d’un travail de sécurité plus complet, de variantes de plus grande taille et d’une validation finale sur les benchmarks. La version Flash-Next ne doit donc pas être interprétée comme le niveau définitif de la famille.
Alibaba a déjà publié Qwen3.8-27B sous licence Apache 2.0. Ce modèle multimodal de 27 milliards de paramètres dispose d’une fenêtre de contexte native de 262 000 jetons, extensible jusqu’à 1 million de jetons. 6
À l’autre extrémité de la gamme, Qwen3.8-Max représente la déclinaison haut de gamme. Les informations disponibles indiquent que ses poids sont distribués sous une licence distincte et plus restrictive, plutôt que sous les conditions Apache 2.0 du modèle 27B. 12
Cette séparation permet à Alibaba de favoriser une adoption large des modèles plus accessibles, tout en conservant davantage de contrôle sur les capacités les plus coûteuses à entraîner et à exploiter.
La disponibilité des poids ne signifie pas automatiquement que toutes les utilisations commerciales sont libres de conditions. Si la licence de Max ou de Flash-Next prévoit des seuils d’activité, un accord séparé ou des obligations de partage de revenus pour les déploiements commerciaux de très grande ampleur, cela limiterait la portée de l’expression « poids ouverts ».
Les éléments disponibles confirment que Max est soumis à des restrictions de licence, mais le seuil précis et les éventuelles obligations financières doivent être vérifiés dans le texte juridique applicable. La possibilité d’un partage de revenus ne peut donc pas être considérée comme établie sur la seule base des informations actuellement disponibles. 12
Qwen 3.8-Flash-Next ne constitue qu’un élément de la stratégie d’Alibaba. Le groupe cherche à diffuser des modèles ouverts ou facilement accessibles afin d’attirer les développeurs, les projets de personnalisation et les charges de travail vers Alibaba Cloud. En parallèle, il investit dans les puces, les centres de données et l’infrastructure nécessaires pour entraîner et servir des modèles de niveau avancé.
Alibaba a indiqué que les fonds levés à Hong Kong serviraient à financer ses capacités d’intelligence artificielle « full-stack », c’est-à-dire l’ensemble de la chaîne, de l’infrastructure aux modèles et aux services. 2
Alibaba a levé 80 milliards de dollars de Hong Kong — soit environ 10,2 milliards de dollars américains — en émettant 710 millions d’actions au prix unitaire de 112,70 dollars de Hong Kong. 3
Le prix représentait une décote de 8,4 % par rapport à la clôture précédente. Le carnet d’ordres aurait néanmoins attiré environ 28 milliards de dollars de demande. 4
Pour les investisseurs, l’arbitrage est direct : cette opération accélère les dépenses d’IA, mais l’émission de nouvelles actions dilue les actionnaires existants. Elle augmente aussi le risque d’exécution si les investissements ne génèrent pas assez rapidement des revenus issus du cloud, des API et des applications d’IA. 4
Dans la compétition chinoise, l’objectif ne se limite pas à obtenir un meilleur score sur un benchmark. Alibaba doit aussi convaincre les développeurs, stimuler les modèles dérivés et les ajustements fins, attirer les charges de travail cloud et faire adopter ses outils avant ses concurrents, notamment DeepSeek.
Les références à d’éventuels systèmes comme « Ox Alpha » restent spéculatives tant qu’elles ne sont pas accompagnées d’une publication attribuable, de poids téléchargeables ou d’un rapport technique.
De même, les chiffres évoquant un écosystème de plus de 460 modèles et 119 langues doivent être lus comme des indicateurs de l’écosystème Alibaba. Ils ne mesurent pas, à eux seuls, les capacités d’un modèle Qwen particulier.
Le pari d’Alibaba est clair : des modèles multimodaux, parcimonieux et moins coûteux à entraîner pourraient lui permettre de jouer sur deux tableaux — une adoption massive des modèles ouverts et des déploiements premium à l’échelle du cloud.
La question décisive reste toutefois ouverte. Les évaluations indépendantes confirmeront-elles la qualité annoncée en programmation et l’avantage de coût ? Et les conditions de licence permettront-elles aux grandes entreprises d’adopter ces modèles sans vider de son sens leur promesse d’ouverture ?
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
Qwen 3.8 Flash Next est présenté comme un modèle de test à poids ouverts destiné aux développeurs, et non comme le futur modèle phare d’Alibaba.
Qwen 3.8 Flash Next est présenté comme un modèle de test à poids ouverts destiné aux développeurs, et non comme le futur modèle phare d’Alibaba. Son architecture multimodale Mixture of Experts compterait 125 milliards de paramètres, dont 51 milliards d’embeddings N gram, avec seulement 6 milliards activés pour chaque jeton.
Alibaba met particulièrement en avant le codage et affirme viser des performances proches de la frontière avec environ un neuvième du coût d’entraînement de Qwen 3.7 Plus — une affirmation qui reste à vérifier.