Huawei 28. září 2026 zveřejnila kód pro předtrénování, supervised fine tuning (SFT) a následné posilované učení (RL) modelů openPangu 2.0 určený pro ekosystém Ascend.
PublikovalUpraveno pomocí GPT-6 LunaObrázky vytvořeny pomocí GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Huawei open-source for openPangu-2.0 on September 28, 2026, and how does the new Ascend-native pretraining, supervised fine-tuning. Article summary: On September 28, 2026, Huawei open-sourced **Ascend-native code for openPangu-2.0 pretraining, supervised fine-tuning (SFT), and post-training reinforcement learning (RL)**. That is a training-stack release: the earlier . Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
Huawei 28. září 2026 zveřejnila kód pro předtrénování, supervised fine-tuning (SFT) a následné posilované učení (RL) modelové řady openPangu-2.0. Jde o důležitý rozdíl oproti dřívějším vydáním: váhy modelů Pro a Flash a inferenční kód umožňovaly modely spouštět, zatímco nové projekty míří na jejich trénování a další úpravy v prostředí Huawei Ascend. 1
2
27
Projekt openPangu-2.0-Training podporuje předtrénování a SFT, tedy doladění modelu na příkladech a instrukcích. Projekt openPangu-2.0-RL se zaměřuje na následné posilované učení. Oba jsou navržené pro trénovací ekosystém čipů Ascend. 1
Nejde tedy jen o další vydanou sadu vah, ale o kód pro další fáze práce s modelem. Samotné oznámení však nepopisuje veškeré potřebné výpočetní zdroje, data ani konfiguraci, které by byly nutné k zopakování původního trénování. 1
Obě varianty jsou podle svých modelových karet modely typu mixture of experts (MoE), tedy architektury, která pro zpracování tokenu aktivuje jen část parametrů. 19
27
| Model | Celkový počet parametrů | Aktivní parametry na token | Kontextové okno | Uváděný počet trénovacích tokenů |
|---|---|---|---|---|
| openPangu-2.0-Pro | přibližně 505 mld. | přibližně 18 mld. | 512 000 tokenů | přibližně 34 bilionů |
| openPangu-2.0-Flash | přibližně 92 mld. | přibližně 6 mld. | 512 000 tokenů | přibližně 34 bilionů |
Jde o hodnoty uváděné u každého modelu zvlášť: přibližně 34 bilionů trénovacích tokenů se vztahuje na Pro i Flash, nikoli na jejich společný součet. 19
27
Karty Pro a Flash uvádějí společný postup: nejprve SFT, které má spojit „pomalé“ a „rychlé“ uvažování, poté několik specializovaných fází posilovaného učení a nakonec online policy distillation (OPD), tedy průběžné předávání schopností mezi modely či specializovanými komponentami. 19
27
Tyto informace popisují postupy použité podle modelových karet. Jejich zveřejnění je třeba odlišit od nového vydání trénovacího a RL kódu. 19
27
1
Karty zmiňují kombinaci multi-head latent attention (MLA) a vrstev DSA/SWA v poměru 1:2. Sliding-window attention (SWA) pracuje s místním kontextem, zatímco řídké vrstvy DSA mají zachycovat informace z větší vzdálenosti. 19
27
Mezi další popsané prvky patří čtyřproudová architektura mHC, tříhlavý modul multi-token prediction (MTP) a optimalizátor Muon. Jde o vlastnosti uvedené v modelových kartách, nikoli o novinky představené samotným zářijovým vydáním kódu. 19
27
Dříve zpřístupněné váhy a inferenční kód umožňovaly spouštět zveřejněné modely Pro a Flash. Nové projekty rozšiřují dostupné nástroje o předtrénování, SFT a následné RL, takže vývojáři pracující s Ascendem mohou zkoumat i další fáze životního cyklu modelu. Zdroje popisují hlavní zaměření projektů, ale neuvádějí podrobnosti ke všem podporovaným postupům ani jejich hardwarovým požadavkům. 1
2
27
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Huawei 28. září 2026 zveřejnila kód pro předtrénování, supervised fine tuning (SFT) a následné posilované učení (RL) modelů openPangu 2.0 určený pro ekosystém Ascend.
Huawei 28. září 2026 zveřejnila kód pro předtrénování, supervised fine tuning (SFT) a následné posilované učení (RL) modelů openPangu 2.0 určený pro ekosystém Ascend. Pro má podle modelové karty přibližně 505 miliard parametrů, z nichž se na jeden token aktivuje asi 18 miliard; Flash má 92 miliard parametrů a aktivuje zhruba 6 miliard.
Obě varianty uvádějí kontextové okno 512 000 tokenů a přibližně 34 bilionů trénovacích tokenů.