Il rilascio del 28 settembre 2026 aggiunge codice per pretraining, fine tuning supervisionato (SFT) e reinforcement learning (RL) post training su hardware Ascend. In precedenza erano disponibili i pesi e il codice d’inferenza dei modelli Pro e Flash: il nuovo stack apre anche le fasi di addestramento e adattamento.
Pubblicato daModificato con GPT-6 LunaImmagini generate con GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Huawei open-source for openPangu-2.0 on September 28, 2026, and how does the new Ascend-native pretraining, supervised fine-tuning. Article summary: On September 28, 2026, Huawei open-sourced **Ascend-native code for openPangu-2.0 pretraining, supervised fine-tuning (SFT), and post-training reinforcement learning (RL)**. That is a training-stack release: the earlier . Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
Huawei ha pubblicato il 28 settembre 2026 il codice per il pretraining, il fine-tuning supervisionato (SFT) e il reinforcement learning (RL) post-training della famiglia openPangu-2.0. La novità è il passaggio dai modelli già pronti da eseguire ai componenti software per addestrarli e adattarli nell’ecosistema di calcolo Ascend. 1
2
27
Il progetto openPangu-2.0-Training copre pretraining e SFT, mentre openPangu-2.0-RL è dedicato al reinforcement learning nella fase successiva all’addestramento. Entrambi sono pensati per la piattaforma di training Huawei Ascend. 1
Si tratta quindi di codice per il processo di addestramento, non di un nuovo checkpoint del modello. L’annuncio descrive gli ambiti coperti dai progetti, ma non specifica da solo quali risorse di calcolo, dati o configurazioni siano necessarie per riprodurre gli addestramenti originali. 1
Le schede dei modelli descrivono Pro e Flash come modelli a miscela di esperti (Mixture of Experts, MoE): la maggior parte dei parametri resta inattiva per ciascun token elaborato. Ecco le specifiche riportate: 19
27
| Modello | Parametri totali | Parametri attivi per token | Finestra di contesto | Token di pretraining dichiarati |
|---|---|---|---|---|
| openPangu-2.0-Pro | Circa 505 miliardi | Circa 18 miliardi | 512.000 token | Circa 34.000 miliardi |
| openPangu-2.0-Flash | Circa 92 miliardi | Circa 6 miliardi | 512.000 token | Circa 34.000 miliardi |
Il dato sul pretraining è circa 34.000 miliardi di token per ciascun modello, non la somma dei due. 19
27
Le schede di Pro e Flash indicano una fase SFT pensata per unificare modalità di ragionamento “lenta” e “veloce”, seguita da più fasi di RL specializzate e dalla distillazione online della policy (OPD). Sono le tecniche descritte per i modelli: la loro presenza nelle schede non coincide con la pubblicazione del codice, annunciata separatamente a settembre. 19
27
1
Le schede riportano una combinazione di attenzione latente multi-head (MLA) e livelli di attenzione DSA e SWA, con un rapporto di 1:2. La sliding-window attention (SWA) lavora sul contesto locale, mentre i livelli DSA aggregano informazioni più distanti in modo sparso. 19
27
Tra gli altri elementi elencati figurano un’architettura mHC a quattro flussi, un modulo di predizione multi-token (MTP) a tre teste e l’ottimizzatore Muon. Sono caratteristiche riportate nelle schede dei modelli, non funzioni annunciate come parte del nuovo rilascio di codice. 19
27
I pesi e il codice d’inferenza pubblicati in precedenza permettevano di eseguire i modelli Pro e Flash. Con i nuovi progetti, gli sviluppatori che lavorano su Ascend possono accedere anche a codice per il pretraining, l’SFT e il post-training RL, ed esplorare queste fasi del ciclo di vita del modello. Le fonti ne indicano l’ambito generale, ma non dettagliano tutti i flussi di lavoro supportati né i relativi requisiti hardware. 1
2
27
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Il rilascio del 28 settembre 2026 aggiunge codice per pretraining, fine tuning supervisionato (SFT) e reinforcement learning (RL) post training su hardware Ascend.
Il rilascio del 28 settembre 2026 aggiunge codice per pretraining, fine tuning supervisionato (SFT) e reinforcement learning (RL) post training su hardware Ascend. In precedenza erano disponibili i pesi e il codice d’inferenza dei modelli Pro e Flash: il nuovo stack apre anche le fasi di addestramento e adattamento.
Le schede tecniche indicano 505 miliardi di parametri per Pro e 92 miliardi per Flash; entrambi supportano un contesto di 512.000 token e riportano circa 34.000 miliardi di token di pretraining.