Le 28 septembre 2026, Huawei a publié du code destiné à entraîner et adapter openPangu 2.0 sur son écosystème Ascend. La publication comprend openPangu 2.0 Training pour le préentraînement et le réglage fin supervisé, ainsi que openPangu 2.0 RL pour l’apprentissage par renforcement après entraînement.
Publié parModifié avec GPT-6 LunaImages générées avec GPT Image 2
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: What did Huawei open-source for openPangu-2.0 on September 28, 2026, and how does the new Ascend-native pretraining, supervised fine-tuning. Article summary: On September 28, 2026, Huawei open-sourced **Ascend-native code for openPangu-2.0 pretraining, supervised fine-tuning (SFT), and post-training reinforcement learning (RL)**. That is a training-stack release: the earlier . Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
Le 28 septembre 2026, Huawei a publié du code pour le préentraînement, le réglage fin supervisé (SFT) et l’apprentissage par renforcement (RL) après entraînement de la famille openPangu 2.0. La différence avec les versions Pro et Flash déjà diffusées est importante : celles-ci permettaient surtout de récupérer les poids des modèles et les outils pour les faire fonctionner en inférence. Les nouveaux projets couvrent des étapes d’entraînement et d’adaptation, dans l’écosystème de calcul Ascend de Huawei. 1
2
27
Le projet openPangu-2.0-Training prend en charge le préentraînement et le SFT. openPangu-2.0-RL est consacré au post-entraînement par apprentissage par renforcement. Les deux sont conçus pour l’environnement d’entraînement Ascend. 1
Il s’agit donc de code d’entraînement, et pas simplement d’un nouveau point de contrôle du modèle. L’annonce précise les grandes fonctions des projets, mais ne suffit pas à établir les ressources de calcul, les données ou les configurations nécessaires pour reproduire les entraînements d’origine. 1
Les fiches des deux modèles les présentent comme des modèles à mélange d’experts (MoE). Voici leurs caractéristiques publiées : 19
27
| Modèle | Paramètres au total | Paramètres activés par token | Fenêtre de contexte | Tokens de préentraînement indiqués |
|---|---|---|---|---|
| openPangu-2.0-Pro | Environ 505 milliards | Environ 18 milliards | 512 000 tokens | Environ 34 000 milliards |
| openPangu-2.0-Flash | Environ 92 milliards | Environ 6 milliards | 512 000 tokens | Environ 34 000 milliards |
Les quelque 34 000 milliards de tokens correspondent à chacun des modèles, et non à un total combiné. 19
27
Les fiches de Pro et Flash décrivent une étape de SFT conçue pour réunir des capacités de raisonnement « lent » et « rapide », suivie de plusieurs phases de RL spécialisées et d’une distillation de politique en ligne (OPD). Ces indications décrivent l’approche de post-entraînement rapportée pour les modèles ; la publication du 28 septembre met, elle, du code d’entraînement et de RL à disposition. 19
27
1
Les fiches indiquent une combinaison d’attention latente multi-têtes (MLA) et de couches DSA/SWA, dans une proportion de 1 pour 2. L’attention à fenêtre glissante (SWA) traite le contexte local, tandis que les couches DSA clairsemées agrègent des informations à plus longue portée. 19
27
Elles mentionnent également une architecture mHC à quatre flux, un module de prédiction multi-token (MTP) à trois têtes et l’optimiseur Muon. Ces éléments sont présentés dans les fiches comme des caractéristiques de conception des modèles, et non comme de nouvelles fonctionnalités annoncées avec la publication du code en septembre. 19
27
Avec les poids et le code d’inférence précédemment publiés, les développeurs pouvaient exécuter les modèles Pro ou Flash disponibles. Les nouveaux projets étendent les outils aux étapes de préentraînement, de SFT et de RL après entraînement. Les développeurs travaillant sur Ascend peuvent donc explorer davantage le cycle de vie des modèles, au-delà de leur simple utilisation en inférence. Les sources indiquent les grands objectifs des projets, sans détailler tous les flux de travail compatibles ni leurs exigences matérielles. 1
2
27
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
Le 28 septembre 2026, Huawei a publié du code destiné à entraîner et adapter openPangu 2.0 sur son écosystème Ascend.
Le 28 septembre 2026, Huawei a publié du code destiné à entraîner et adapter openPangu 2.0 sur son écosystème Ascend. La publication comprend openPangu 2.0 Training pour le préentraînement et le réglage fin supervisé, ainsi que openPangu 2.0 RL pour l’apprentissage par renforcement après entraînement.
Les fiches des modèles Pro et Flash indiquent respectivement 505 et 92 milliards de paramètres, une fenêtre de contexte de 512 000 tokens et environ 34 000 milliards de tokens de préentraînement chacun.