El 28 de septiembre de 2026, Huawei publicó código para preentrenar openPangu 2.0, hacer ajuste fino supervisado (SFT) y aplicar aprendizaje por refuerzo (RL) en su ecosistema Ascend. Pro y Flash ya contaban con pesos e inferencia; los nuevos proyectos permiten explorar también etapas de entrenamiento y adaptación.
Publicado porEditado con GPT-6 LunaImágenes generadas con GPT Image 2
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: What did Huawei open-source for openPangu-2.0 on September 28, 2026, and how does the new Ascend-native pretraining, supervised fine-tuning. Article summary: On September 28, 2026, Huawei open-sourced **Ascend-native code for openPangu-2.0 pretraining, supervised fine-tuning (SFT), and post-training reinforcement learning (RL)**. That is a training-stack release: the earlier . Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
La diferencia principal de la nueva entrega de Huawei no está en otro modelo descargable, sino en el código para entrenar y adaptar openPangu-2.0. El 28 de septiembre de 2026, la compañía publicó herramientas para preentrenamiento, ajuste fino supervisado (SFT) y aprendizaje por refuerzo (RL) posterior al entrenamiento, diseñadas para su ecosistema de cómputo Ascend. 1
Hasta ahora, las versiones Pro y Flash habían puesto a disposición sus pesos y código de inferencia: recursos para ejecutar los modelos ya entrenados. Con los nuevos proyectos, el foco se amplía a distintas etapas del trabajo que permite entrenar o ajustar modelos. 1
2
27
El proyecto openPangu-2.0-Training abarca el preentrenamiento y el SFT; openPangu-2.0-RL se centra en el aprendizaje por refuerzo posterior al entrenamiento. Ambos están pensados para el entorno de entrenamiento de Huawei Ascend. 1
La publicación describe el alcance general de estos proyectos, pero no detalla por sí sola todos los pasos necesarios para reproducir el entrenamiento original, ni sus requisitos completos de cómputo, datos o configuración. 1
Las fichas de ambos modelos los describen como modelos de mezcla de expertos (MoE). En este tipo de arquitectura, los parámetros activos por token son una parte del total. Estas son las cifras informadas para cada versión: 19
27
| Modelo | Parámetros totales | Parámetros activos por token | Ventana de contexto | Tokens de preentrenamiento |
|---|---|---|---|---|
| openPangu-2.0-Pro | Aproximadamente 505.000 millones | Aproximadamente 18.000 millones | 512.000 tokens | Aproximadamente 34 billones |
| openPangu-2.0-Flash | Aproximadamente 92.000 millones | Aproximadamente 6.000 millones | 512.000 tokens | Aproximadamente 34 billones |
La cifra de preentrenamiento es de unos 34 billones de tokens para cada modelo; no es un total combinado de Pro y Flash. 19
27
Las fichas de Pro y Flash señalan una etapa de SFT que busca integrar capacidades de razonamiento «lento» y «rápido». Después describen varias etapas de RL especializadas y destilación de políticas en línea (OPD). Estas son características informadas para el proceso de ajuste de los modelos; la publicación del 28 de septiembre, por separado, pone a disposición código de entrenamiento y RL. 19
27
1
Las fichas técnicas describen una combinación de atención latente multi-cabeza (MLA) y capas de atención DSA/SWA, con una proporción de 1:2. La atención de ventana deslizante (SWA) trabaja con el contexto local, mientras que las capas dispersas DSA agregan información de mayor alcance. 19
27
También mencionan una arquitectura mHC de cuatro flujos, un módulo de predicción de múltiples tokens (MTP) con tres cabezas y el optimizador Muon. Son características descritas en las fichas de los modelos, no novedades anunciadas como parte de la publicación de código de septiembre. 19
27
Con los pesos y el código de inferencia, los desarrolladores podían ejecutar los modelos Pro o Flash publicados. La nueva entrega amplía las herramientas disponibles para trabajar también con preentrenamiento, SFT y RL posterior al entrenamiento. En otras palabras, permite explorar más etapas del ciclo de vida de los modelos en hardware Ascend, aunque las fuentes no especifican todos los flujos de trabajo compatibles ni sus requisitos de hardware. 1
2
27
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
El 28 de septiembre de 2026, Huawei publicó código para preentrenar openPangu 2.0, hacer ajuste fino supervisado (SFT) y aplicar aprendizaje por refuerzo (RL) en su ecosistema Ascend.
El 28 de septiembre de 2026, Huawei publicó código para preentrenar openPangu 2.0, hacer ajuste fino supervisado (SFT) y aplicar aprendizaje por refuerzo (RL) en su ecosistema Ascend. Pro y Flash ya contaban con pesos e inferencia; los nuevos proyectos permiten explorar también etapas de entrenamiento y adaptación.
Las fichas técnicas describen dos modelos MoE con ventanas de contexto de 512.000 tokens y unos 34 billones de tokens de preentrenamiento cada uno.