Huawei publiserte 28. september 2026 Ascend tilpasset kode for fortrening, veiledet finjustering (SFT) og forsterkende læring etter trening (RL).
Publisert avRedigert med GPT-6 LunaBilder generert med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Huawei open-source for openPangu-2.0 on September 28, 2026, and how does the new Ascend-native pretraining, supervised fine-tuning. Article summary: On September 28, 2026, Huawei open-sourced **Ascend-native code for openPangu-2.0 pretraining, supervised fine-tuning (SFT), and post-training reinforcement learning (RL)**. That is a training-stack release: the earlier . Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
Huaweis publisering 28. september 2026 er først og fremst en utgivelse av treningskode: Den omfatter kode for fortrening, veiledet finjustering (SFT) og forsterkende læring etter trening (RL), tilpasset selskapets Ascend-økosystem. Det skiller seg fra de tidligere Pro- og Flash-utgivelsene, som gjorde modellvekter og verktøy for inferens tilgjengelige. 1
2
27
Prosjektet openPangu-2.0-Training støtter fortrening og SFT, mens openPangu-2.0-RL retter seg mot RL i ettertreningsfasen. Begge er laget for trening på Huaweis Ascend-plattform. 1
Dermed får utviklere kode til å arbeide med flere trinn i modellutviklingen, ikke bare ferdigtrente modeller som kan kjøres for å lage svar. Publiseringen beskriver hovedbruksområdene, men gir ikke i seg selv grunnlag for å si at alle nødvendige data, maskinvareressurser eller innstillinger for å gjenskape de opprinnelige treningsløpene følger med. 1
Modellkortene beskriver begge variantene som blandingsmodeller med eksperter (MoE). Her er de oppgitte nøkkeltallene: 19
27
| Modell | Totalt antall parametere | Aktive parametere per token | Kontekstvindu | Oppgitte treningstokens |
|---|---|---|---|---|
| openPangu-2.0-Pro | Ca. 505 milliarder | Ca. 18 milliarder | 512 000 tokens | Ca. 34 billioner |
| openPangu-2.0-Flash | Ca. 92 milliarder | Ca. 6 milliarder | 512 000 tokens | Ca. 34 billioner |
Tallene for treningstokens gjelder hver modell for seg; de skal ikke legges sammen til én felles treningsmengde. 19
27
Ifølge modellkortene gjennomgår Pro og Flash først en SFT-fase som skal samle «langsom» og «rask» tenkning. Deretter følger flere spesialiserte RL-faser og såkalt online policy distillation (OPD), en metode for å samle ferdigheter fra ulike modeller eller strategier. Dette er beskrivelser av modellens oppgitte ettertreningsløp; koden som nå er publisert, er en egen del av utgivelsen. 19
27
1
Modellkortene oppgir en kombinasjon av multi-head latent attention (MLA) og DSA- og SWA-lag i forholdet 1:2. Sliding-window attention (SWA) behandler nærliggende kontekst, mens de sparsomme DSA-lagene samler informasjon over lengre avstander. 19
27
Kortene beskriver også en mHC-arkitektur med fire strømmer, en MTP-modul med tre prediksjonshoder og Muon-optimalisatoren. Dette er oppgitte egenskaper ved modellene, ikke funksjoner som først ble annonsert med kodeutgivelsen i september. 19
27
Med modellvekter og inferenskode kunne utviklere allerede ta i bruk de publiserte Pro- og Flash-modellene. Den nye koden utvider verktøykassen til å omfatte fortrening, SFT og RL-ettertrening, slik at Ascend-utviklere også kan utforske disse delene av modellens livssyklus. Kildene beskriver prosjektenes overordnede formål, men ikke alle støttede arbeidsflyter eller maskinvarekrav. 1
2
27
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Huawei publiserte 28. september 2026 Ascend tilpasset kode for fortrening, veiledet finjustering (SFT) og forsterkende læring etter trening (RL).
Huawei publiserte 28. september 2026 Ascend tilpasset kode for fortrening, veiledet finjustering (SFT) og forsterkende læring etter trening (RL). Pro har rundt 505 milliarder parametere, mens Flash har rundt 92 milliarder. Begge modellkortene oppgir et kontekstvindu på 512 000 tokens og rundt 34 billioner treningstokens.
Utgivelsen gir utviklere kode for flere deler av modelltreningen, mens tidligere publiseringer først og fremst gjorde vektene og inferensverktøy tilgjengelige.