Qwen3.8 Flash est le modèle multimodal destiné à la production, proposé via QwenCloud à 0,16 dollar par million de tokens d’entrée et 0,47 dollar par million de tokens de sortie. Qwen3.8 Flash Next préfigure l’architecture de Qwen4 : un modèle principal de 125 milliards de paramètres, 51 milliards de paramètres d’em...
Publié parModifié avec GPT-5.6 LunaImages générées avec GPT Image 1.5
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: What did Alibaba announce with the release of the multimodal Qwen3.8-Flash and the open-weight Qwen3.8-Flash-Next prototype for its future Q. Article summary: Alibaba is pairing a low-cost production model with an open-weight architectural preview: it is trying to make Qwen a widely deployed cloud service while seeding the developer ecosystem for the forthcoming Qwen4 generati. Topic tags: general, documentation, general web, user generated, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
Alibaba ne lance pas simplement un nouveau modèle d’intelligence artificielle. Avec Qwen3.8-Flash et Qwen3.8-Flash-Next, le groupe chinois met en place une stratégie à deux volets : proposer une API multimodale extrêmement bon marché pour attirer les usages professionnels, tout en diffusant une préversion ouverte de l’architecture appelée à soutenir la famille Qwen4. 5
15
Le pari est clair : faire de Qwen un service cloud utilisé en volume, mais aussi une technologie familière des développeurs qui pourront la tester, l’adapter et parfois l’héberger eux-mêmes. Les performances et les économies annoncées sont prometteuses, mais une grande partie des chiffres provient d’Alibaba ou de la fiche technique du modèle, et non d’évaluations indépendantes.
Alibaba présente Qwen3.8-Flash comme un modèle multimodal à mélange d’experts — ou MoE, pour mixture of experts — destiné notamment au code, aux tâches bureautiques et aux agents capables de travailler sur plusieurs étapes. Sa fenêtre de contexte par défaut atteint 262 144 tokens, avec une extension possible jusqu’à 1 million de tokens pour traiter de longs documents, des échanges volumineux ou des travaux de recherche. 5
15
Le tarif annoncé sur QwenCloud est de 0,16 dollar par million de tokens d’entrée et 0,47 dollar par million de tokens de sortie. Alibaba a indiqué que l’API de production serait bientôt disponible, tandis que des informations ultérieures ont présenté QwenCloud comme servant effectivement le modèle à ces tarifs. 4
15
Pour les entreprises et les développeurs, l’intérêt est très concret : ce niveau de prix permet d’envisager le traitement de documents, les agents de programmation ou les flux automatisés à fort volume sans supporter les tarifs généralement associés aux modèles les plus puissants.
Qwen3.8-Flash-Next n’est pas une simple formule d’abonnement supplémentaire. Il s’agit d’un modèle à poids ouverts conçu pour donner un aperçu des choix architecturaux prévus pour Qwen4. Son dépôt indique un modèle principal de 125 milliards de paramètres, auquel s’ajoutent 51 milliards de paramètres d’embeddings N-gram. Seuls 6 milliards de paramètres sont activés pour chaque token.
Cette architecture MoE dite parcimonieuse contient donc un vaste ensemble de paramètres, mais n’en mobilise qu’une fraction à chaque étape. En théorie, cela réduit le coût de calcul par token tout en conservant une capacité potentielle supérieure à celle d’un modèle dense de taille comparable.
La fiche technique disponible mentionne une fenêtre de contexte native de 262 144 tokens, extensible jusqu’à 1 million grâce à YaRN. 13 Comme Flash et Flash-Next sont deux versions distinctes, les utilisateurs devront toutefois vérifier les limites exactes, les besoins en mémoire et le comportement du déploiement correspondant à la version choisie.
| Caractéristique | Qwen3.8-Flash | Qwen3.8-Flash-Next |
|---|---|---|
| Rôle principal | Modèle hébergé destiné à la production | Préversion open weight de l’architecture de Qwen4 |
| Usages annoncés | Code multimodal, bureautique et agents | Code multimodal, travail bureautique et tâches autonomes longues |
| Contexte | 262 144 tokens par défaut, extensible à 1 million | 262 144 tokens en natif, extension annoncée à 1 million avec YaRN |
| Prix hébergé | 0,16 $ par million de tokens d’entrée ; 0,47 $ en sortie | Aucun tarif API Alibaba établi pour les poids ouverts |
| Architecture | Modèle multimodal présenté comme un MoE | 125 milliards de paramètres principaux, 51 milliards d’embeddings N-gram, 6 milliards actifs par token |
| Disponibilité | API de production QwenCloud annoncée pour une mise en service prochaine | Poids et informations de fiche technique publiés fin août 2026 |
Le calendrier confirme le lien entre les deux produits. Le dépôt et la fiche technique de Flash-Next ont été rendus disponibles avant ou parallèlement à l’annonce de l’API de production, donnant aux développeurs un aperçu de l’architecture pendant qu’Alibaba préparait son service hébergé. 7
Alibaba affirme que la nouvelle gamme Flash nécessite environ un neuvième du coût d’entraînement de Qwen3.7-Plus, tout en améliorant les performances, en particulier pour le code et les tâches bureautiques. 5
15
C’est une affirmation majeure, mais elle doit être considérée comme une comparaison communiquée par l’entreprise, et non comme une étude de coûts auditée indépendamment. Le coût réel dépend notamment du prix du matériel, de la durée d’entraînement, de la préparation des données, des essais abandonnés et de la méthode comptable retenue.
L’architecture parcimonieuse fournit néanmoins une explication technique cohérente à l’accent mis sur l’efficacité : seule une petite partie des paramètres disponibles est activée pour chaque token. Pour un acheteur, la distinction est simple : le tarif de l’API peut être intégré immédiatement dans un budget, tandis que la promesse d’un coût d’entraînement divisé par neuf doit encore être confirmée par des mesures comparables réalisées par des tiers.
La fiche technique de Flash-Next rapporte les résultats suivants :
Dans le tableau comparatif reproduit par la fiche technique, Flash-Next dépasse le résultat attribué à Claude Opus 4.6 Max sur plusieurs évaluations : 62,5 contre 53,4 sur SWE-bench Pro et 81,0 contre 77,5 sur SWE-bench Multilingual. Les écarts sont également favorables à Qwen sur CoWorkBench, avec 73,9 contre 68,2, et sur JobBench, avec 55,7 contre 36,6.
Ces chiffres signalent un potentiel élevé pour le développement logiciel et les agents destinés au travail de bureau. Ils ne prouvent pas pour autant que Flash-Next soit globalement supérieur à Claude ou à tous les autres modèles de pointe. Les résultats sont publiés par le fournisseur, les protocoles d’évaluation peuvent varier et les performances de Flash-Next ne doivent pas être automatiquement attribuées à chaque déploiement de Qwen3.8-Flash.
Flash-Next est décrit comme un modèle à poids ouverts. Un résumé publié mentionne la licence qwen-community-1.0, mais les développeurs doivent vérifier les conditions en vigueur dans le dépôt et la fiche technique officiels avant toute redistribution commerciale, adaptation ou mise à disposition d’un service hébergé. 6
« Open weight » ne signifie pas nécessairement que tous les usages sont libres de toute contrainte. La licence peut prévoir des conditions concernant la redistribution, l’attribution, les usages autorisés ou les modèles dérivés. Les éléments disponibles ici ne permettent pas de conclure plus largement sur les autorisations commerciales applicables à chaque composant de la release.
Le lancement intervient alors qu’Alibaba investit massivement dans ses infrastructures d’IA. Selon Reuters, les revenus trimestriels du cloud ont progressé de 45 %, tandis que les dépenses d’investissement ont augmenté de 75 % et que le bénéfice net trimestriel a reculé de 75 %. 18
Reuters a également rapporté qu’Alibaba cherchait à lever 10 milliards de dollars via un placement d’actions à Hong Kong pour financer ses ambitions dans l’IA. Ces chiffres illustrent le compromis auquel le groupe consent : la demande de cloud et de calcul pour l’IA progresse, mais le coût de construction des capacités nécessaires pèse immédiatement sur les résultats et la trésorerie.
Dans ce contexte, des prix très bas peuvent avoir une valeur stratégique même s’ils réduisent les marges à court terme. Une inférence peu coûteuse peut augmenter le taux d’utilisation des infrastructures Alibaba, attirer des clients professionnels et faire de Qwen une option naturelle pour les applications traitant de très longs contextes.
La publication de Flash-Next élargit la portée de Qwen au-delà de l’API Alibaba. Les développeurs peuvent télécharger le modèle, l’évaluer, l’adapter et éventuellement l’héberger sur leur propre infrastructure, sans s’engager immédiatement auprès de QwenCloud.
Cette stratégie peut servir Alibaba de plusieurs façons :
Les éléments disponibles étayent cette lecture stratégique, mais ne prouvent pas que Qwen ait déjà conquis l’écosystème chinois des développeurs. Aucune donnée vérifiée sur le nombre d’utilisateurs actifs, les téléchargements ou les déploiements professionnels n’est fournie dans les sources.
Qwen3.8-Flash et Flash-Next sont les deux faces d’une même stratégie. Flash est le service cloud à long contexte et à bas prix ; Flash-Next est à la fois une vitrine technique et un outil de diffusion de l’écosystème qui doit mener à Qwen4.
La combinaison d’un tarif de 0,16 dollar par million de tokens d’entrée, d’un contexte pouvant atteindre 1 million de tokens, d’un chemin d’activation annoncé à 6 milliards de paramètres dans un modèle beaucoup plus vaste et de benchmarks solides publiés par Alibaba rend cette annonce importante pour les développeurs attentifs au coût de l’inférence. 4
Les réserves restent toutefois essentielles : le modèle de production et la préversion ne doivent pas être confondus, la réduction des coûts d’entraînement n’est pas auditée indépendamment, les benchmarks sont communiqués par le fournisseur et l’adoption réelle de Qwen ne peut pas encore être quantifiée à partir des éléments disponibles.
Alibaba apparaît donc comme un concurrent sérieux et bien financé dans la course à l’IA en Chine, mais pas comme un leader incontesté. Sa décision de dépenser massivement montre que Qwen est traité comme un pari de long terme sur le cloud et l’écosystème, plutôt que comme une activité destinée à maximiser rapidement les bénéfices. 18
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
Qwen3.8 Flash est le modèle multimodal destiné à la production, proposé via QwenCloud à 0,16 dollar par million de tokens d’entrée et 0,47 dollar par million de tokens de sortie.
Qwen3.8 Flash est le modèle multimodal destiné à la production, proposé via QwenCloud à 0,16 dollar par million de tokens d’entrée et 0,47 dollar par million de tokens de sortie. Qwen3.8 Flash Next préfigure l’architecture de Qwen4 : un modèle principal de 125 milliards de paramètres, 51 milliards de paramètres d’embeddings N gram et seulement 6 milliards activés par token.
Alibaba affirme avoir réduit les coûts d’entraînement à environ un neuvième de ceux de Qwen3.7 Plus, mais cette comparaison n’a pas fait l’objet d’un audit indépendant.
Qwen3.8 Flash est le modèle multimodal destiné à la production, proposé via QwenCloud à 0,16 dollar par million de tokens d’entrée et 0,47 dollar par million de tokens de sortie. Qwen3.8 Flash Next préfigure l’architecture de Qwen4 : un modèle principal de 125 milliards de paramètres, 51 milliards de paramètres d’em...
Publié parModifié avec GPT-5.6 LunaImages générées avec GPT Image 1.5
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: What did Alibaba announce with the release of the multimodal Qwen3.8-Flash and the open-weight Qwen3.8-Flash-Next prototype for its future Q. Article summary: Alibaba is pairing a low-cost production model with an open-weight architectural preview: it is trying to make Qwen a widely deployed cloud service while seeding the developer ecosystem for the forthcoming Qwen4 generati. Topic tags: general, documentation, general web, user generated, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
Alibaba ne lance pas simplement un nouveau modèle d’intelligence artificielle. Avec Qwen3.8-Flash et Qwen3.8-Flash-Next, le groupe chinois met en place une stratégie à deux volets : proposer une API multimodale extrêmement bon marché pour attirer les usages professionnels, tout en diffusant une préversion ouverte de l’architecture appelée à soutenir la famille Qwen4. 5
15
Le pari est clair : faire de Qwen un service cloud utilisé en volume, mais aussi une technologie familière des développeurs qui pourront la tester, l’adapter et parfois l’héberger eux-mêmes. Les performances et les économies annoncées sont prometteuses, mais une grande partie des chiffres provient d’Alibaba ou de la fiche technique du modèle, et non d’évaluations indépendantes.
Alibaba présente Qwen3.8-Flash comme un modèle multimodal à mélange d’experts — ou MoE, pour mixture of experts — destiné notamment au code, aux tâches bureautiques et aux agents capables de travailler sur plusieurs étapes. Sa fenêtre de contexte par défaut atteint 262 144 tokens, avec une extension possible jusqu’à 1 million de tokens pour traiter de longs documents, des échanges volumineux ou des travaux de recherche. 5
15
Le tarif annoncé sur QwenCloud est de 0,16 dollar par million de tokens d’entrée et 0,47 dollar par million de tokens de sortie. Alibaba a indiqué que l’API de production serait bientôt disponible, tandis que des informations ultérieures ont présenté QwenCloud comme servant effectivement le modèle à ces tarifs. 4
15
Pour les entreprises et les développeurs, l’intérêt est très concret : ce niveau de prix permet d’envisager le traitement de documents, les agents de programmation ou les flux automatisés à fort volume sans supporter les tarifs généralement associés aux modèles les plus puissants.
Qwen3.8-Flash-Next n’est pas une simple formule d’abonnement supplémentaire. Il s’agit d’un modèle à poids ouverts conçu pour donner un aperçu des choix architecturaux prévus pour Qwen4. Son dépôt indique un modèle principal de 125 milliards de paramètres, auquel s’ajoutent 51 milliards de paramètres d’embeddings N-gram. Seuls 6 milliards de paramètres sont activés pour chaque token.
Cette architecture MoE dite parcimonieuse contient donc un vaste ensemble de paramètres, mais n’en mobilise qu’une fraction à chaque étape. En théorie, cela réduit le coût de calcul par token tout en conservant une capacité potentielle supérieure à celle d’un modèle dense de taille comparable.
La fiche technique disponible mentionne une fenêtre de contexte native de 262 144 tokens, extensible jusqu’à 1 million grâce à YaRN. 13 Comme Flash et Flash-Next sont deux versions distinctes, les utilisateurs devront toutefois vérifier les limites exactes, les besoins en mémoire et le comportement du déploiement correspondant à la version choisie.
| Caractéristique | Qwen3.8-Flash | Qwen3.8-Flash-Next |
|---|---|---|
| Rôle principal | Modèle hébergé destiné à la production | Préversion open weight de l’architecture de Qwen4 |
| Usages annoncés | Code multimodal, bureautique et agents | Code multimodal, travail bureautique et tâches autonomes longues |
| Contexte | 262 144 tokens par défaut, extensible à 1 million | 262 144 tokens en natif, extension annoncée à 1 million avec YaRN |
| Prix hébergé | 0,16 $ par million de tokens d’entrée ; 0,47 $ en sortie | Aucun tarif API Alibaba établi pour les poids ouverts |
| Architecture | Modèle multimodal présenté comme un MoE | 125 milliards de paramètres principaux, 51 milliards d’embeddings N-gram, 6 milliards actifs par token |
| Disponibilité | API de production QwenCloud annoncée pour une mise en service prochaine | Poids et informations de fiche technique publiés fin août 2026 |
Le calendrier confirme le lien entre les deux produits. Le dépôt et la fiche technique de Flash-Next ont été rendus disponibles avant ou parallèlement à l’annonce de l’API de production, donnant aux développeurs un aperçu de l’architecture pendant qu’Alibaba préparait son service hébergé. 7
Alibaba affirme que la nouvelle gamme Flash nécessite environ un neuvième du coût d’entraînement de Qwen3.7-Plus, tout en améliorant les performances, en particulier pour le code et les tâches bureautiques. 5
15
C’est une affirmation majeure, mais elle doit être considérée comme une comparaison communiquée par l’entreprise, et non comme une étude de coûts auditée indépendamment. Le coût réel dépend notamment du prix du matériel, de la durée d’entraînement, de la préparation des données, des essais abandonnés et de la méthode comptable retenue.
L’architecture parcimonieuse fournit néanmoins une explication technique cohérente à l’accent mis sur l’efficacité : seule une petite partie des paramètres disponibles est activée pour chaque token. Pour un acheteur, la distinction est simple : le tarif de l’API peut être intégré immédiatement dans un budget, tandis que la promesse d’un coût d’entraînement divisé par neuf doit encore être confirmée par des mesures comparables réalisées par des tiers.
La fiche technique de Flash-Next rapporte les résultats suivants :
Dans le tableau comparatif reproduit par la fiche technique, Flash-Next dépasse le résultat attribué à Claude Opus 4.6 Max sur plusieurs évaluations : 62,5 contre 53,4 sur SWE-bench Pro et 81,0 contre 77,5 sur SWE-bench Multilingual. Les écarts sont également favorables à Qwen sur CoWorkBench, avec 73,9 contre 68,2, et sur JobBench, avec 55,7 contre 36,6.
Ces chiffres signalent un potentiel élevé pour le développement logiciel et les agents destinés au travail de bureau. Ils ne prouvent pas pour autant que Flash-Next soit globalement supérieur à Claude ou à tous les autres modèles de pointe. Les résultats sont publiés par le fournisseur, les protocoles d’évaluation peuvent varier et les performances de Flash-Next ne doivent pas être automatiquement attribuées à chaque déploiement de Qwen3.8-Flash.
Flash-Next est décrit comme un modèle à poids ouverts. Un résumé publié mentionne la licence qwen-community-1.0, mais les développeurs doivent vérifier les conditions en vigueur dans le dépôt et la fiche technique officiels avant toute redistribution commerciale, adaptation ou mise à disposition d’un service hébergé. 6
« Open weight » ne signifie pas nécessairement que tous les usages sont libres de toute contrainte. La licence peut prévoir des conditions concernant la redistribution, l’attribution, les usages autorisés ou les modèles dérivés. Les éléments disponibles ici ne permettent pas de conclure plus largement sur les autorisations commerciales applicables à chaque composant de la release.
Le lancement intervient alors qu’Alibaba investit massivement dans ses infrastructures d’IA. Selon Reuters, les revenus trimestriels du cloud ont progressé de 45 %, tandis que les dépenses d’investissement ont augmenté de 75 % et que le bénéfice net trimestriel a reculé de 75 %. 18
Reuters a également rapporté qu’Alibaba cherchait à lever 10 milliards de dollars via un placement d’actions à Hong Kong pour financer ses ambitions dans l’IA. Ces chiffres illustrent le compromis auquel le groupe consent : la demande de cloud et de calcul pour l’IA progresse, mais le coût de construction des capacités nécessaires pèse immédiatement sur les résultats et la trésorerie.
Dans ce contexte, des prix très bas peuvent avoir une valeur stratégique même s’ils réduisent les marges à court terme. Une inférence peu coûteuse peut augmenter le taux d’utilisation des infrastructures Alibaba, attirer des clients professionnels et faire de Qwen une option naturelle pour les applications traitant de très longs contextes.
La publication de Flash-Next élargit la portée de Qwen au-delà de l’API Alibaba. Les développeurs peuvent télécharger le modèle, l’évaluer, l’adapter et éventuellement l’héberger sur leur propre infrastructure, sans s’engager immédiatement auprès de QwenCloud.
Cette stratégie peut servir Alibaba de plusieurs façons :
Les éléments disponibles étayent cette lecture stratégique, mais ne prouvent pas que Qwen ait déjà conquis l’écosystème chinois des développeurs. Aucune donnée vérifiée sur le nombre d’utilisateurs actifs, les téléchargements ou les déploiements professionnels n’est fournie dans les sources.
Qwen3.8-Flash et Flash-Next sont les deux faces d’une même stratégie. Flash est le service cloud à long contexte et à bas prix ; Flash-Next est à la fois une vitrine technique et un outil de diffusion de l’écosystème qui doit mener à Qwen4.
La combinaison d’un tarif de 0,16 dollar par million de tokens d’entrée, d’un contexte pouvant atteindre 1 million de tokens, d’un chemin d’activation annoncé à 6 milliards de paramètres dans un modèle beaucoup plus vaste et de benchmarks solides publiés par Alibaba rend cette annonce importante pour les développeurs attentifs au coût de l’inférence. 4
Les réserves restent toutefois essentielles : le modèle de production et la préversion ne doivent pas être confondus, la réduction des coûts d’entraînement n’est pas auditée indépendamment, les benchmarks sont communiqués par le fournisseur et l’adoption réelle de Qwen ne peut pas encore être quantifiée à partir des éléments disponibles.
Alibaba apparaît donc comme un concurrent sérieux et bien financé dans la course à l’IA en Chine, mais pas comme un leader incontesté. Sa décision de dépenser massivement montre que Qwen est traité comme un pari de long terme sur le cloud et l’écosystème, plutôt que comme une activité destinée à maximiser rapidement les bénéfices. 18
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
Qwen3.8 Flash est le modèle multimodal destiné à la production, proposé via QwenCloud à 0,16 dollar par million de tokens d’entrée et 0,47 dollar par million de tokens de sortie.
Qwen3.8 Flash est le modèle multimodal destiné à la production, proposé via QwenCloud à 0,16 dollar par million de tokens d’entrée et 0,47 dollar par million de tokens de sortie. Qwen3.8 Flash Next préfigure l’architecture de Qwen4 : un modèle principal de 125 milliards de paramètres, 51 milliards de paramètres d’embeddings N gram et seulement 6 milliards activés par token.
Alibaba affirme avoir réduit les coûts d’entraînement à environ un neuvième de ceux de Qwen3.7 Plus, mais cette comparaison n’a pas fait l’objet d’un audit indépendant.