28 września 2026 r. Huawei udostępniła kod openPangu 2.0 do pretreningu, dostrajania nadzorowanego (SFT) i potreningowego uczenia przez wzmacnianie (RL), przygotowany z myślą o platformie Ascend.
Opublikowane przezEdytowane za pomocą GPT-6 LunaObrazy wygenerowane za pomocą GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Huawei open-source for openPangu-2.0 on September 28, 2026, and how does the new Ascend-native pretraining, supervised fine-tuning. Article summary: On September 28, 2026, Huawei open-sourced **Ascend-native code for openPangu-2.0 pretraining, supervised fine-tuning (SFT), and post-training reinforcement learning (RL)**. That is a training-stack release: the earlier . Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
Huawei udostępniła 28 września 2026 r. kod openPangu-2.0 do pretreningu, dostrajania nadzorowanego (SFT) i potreningowego uczenia przez wzmacnianie (RL). Najważniejsza zmiana dotyczy tego, co mogą zrobić deweloperzy: wcześniejsze wydania Pro i Flash obejmowały wagi modeli oraz kod do ich uruchamiania, a nowa publikacja otwiera narzędzia związane z trenowaniem i dostrajaniem modeli w ekosystemie Huawei Ascend. 1
2
27
Projekt openPangu-2.0-Training obejmuje kod do pretreningu i SFT, czyli dostrajania modelu na przykładach z przygotowanymi odpowiedziami. Z kolei openPangu-2.0-RL koncentruje się na potreningowym uczeniu przez wzmacnianie. Oba projekty są przeznaczone do pracy z platformą treningową Ascend. 1
To zatem nie tylko kolejny zestaw wag do pobrania, ale kod obejmujący dalsze etapy pracy nad modelem. Samo ogłoszenie opisuje zakres projektów, nie podaje jednak wszystkich danych, konfiguracji ani wymagań obliczeniowych potrzebnych do odtworzenia pierwotnych treningów. 1
Karty modeli opisują Pro i Flash jako modele typu mixture of experts (MoE), czyli architekturę, w której do obsługi danego tokenu aktywowana jest tylko część parametrów. 19
27
| Model | Łączna liczba parametrów | Aktywne parametry na token | Długość kontekstu | Podana liczba tokenów pretreningowych |
|---|---|---|---|---|
| openPangu-2.0-Pro | ok. 505 mld | ok. 18 mld | 512 tys. tokenów | ok. 34 bln |
| openPangu-2.0-Flash | ok. 92 mld | ok. 6 mld | 512 tys. tokenów | ok. 34 bln |
Są to wartości podane osobno dla każdego modelu — około 34 bln tokenów pretreningowych dotyczy zarówno Pro, jak i Flash, a nie obu łącznie. 19
27
Według kart Pro i Flash modele przechodzą etap SFT, który ma łączyć tryby określane jako „wolne” i „szybkie” myślenie. Następnie stosowane są wyspecjalizowane etapy RL oraz destylacja polityki online (OPD), służąca połączeniu uzyskanych zdolności. To opis deklarowanego procesu potreningowego modeli; osobną częścią wrześniowej publikacji jest udostępnienie kodu do trenowania i RL. 19
27
1
Karty wymieniają wielogłowicową uwagę latentną (MLA) oraz mieszankę warstw DSA i SWA w proporcji 1:2. Sliding-window attention (SWA) obsługuje lokalny kontekst, a warstwy DSA mają agregować informacje z większych odległości w sposób rzadki. 19
27
Wśród pozostałych opisanych elementów są architektura mHC z czterema strumieniami, moduł przewidywania wielu tokenów (MTP) z trzema głowicami oraz optymalizator Muon. To cechy wymienione w kartach modeli, a nie nowości ogłoszone w ramach wrześniowego udostępnienia kodu. 19
27
Wagi i kod wnioskowania pozwalały wcześniej uruchamiać opublikowane modele Pro i Flash. Nowe projekty rozszerzają dostępne narzędzia o pretrening, SFT i potreningowe RL. Deweloperzy pracujący z Ascend mogą więc sięgnąć po kod dotyczący kolejnych etapów cyklu życia modelu, zamiast ograniczać się do uruchamiania gotowych wag. Źródła określają ogólny zakres projektów, ale nie opisują szczegółowo wszystkich obsługiwanych scenariuszy ani wymagań sprzętowych. 1
2
27
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
28 września 2026 r. Huawei udostępniła kod openPangu 2.0 do pretreningu, dostrajania nadzorowanego (SFT) i potreningowego uczenia przez wzmacnianie (RL), przygotowany z myślą o platformie Ascend.
28 września 2026 r. Huawei udostępniła kod openPangu 2.0 do pretreningu, dostrajania nadzorowanego (SFT) i potreningowego uczenia przez wzmacnianie (RL), przygotowany z myślą o platformie Ascend. Wcześniej opublikowane modele Pro i Flash udostępniono wraz z wagami i kodem wnioskowania; nowa publikacja obejmuje etapy trenowania i dostrajania modeli.
Według kart modeli Pro ma ok. 505 mld parametrów, a Flash ok.