Huawei hat am 28. September 2026 Ascend orientierten Code für Vortraining, überwachte Feinabstimmung (SFT) und nachgelagertes Reinforcement Learning (RL) veröffentlicht.
Veröffentlicht vonBearbeitet mit GPT-6 LunaBilder erstellt mit GPT Image 2
Forschungsantwort

Create a landscape editorial hero image for this Studio Global article: What did Huawei open-source for openPangu-2.0 on September 28, 2026, and how does the new Ascend-native pretraining, supervised fine-tuning. Article summary: On September 28, 2026, Huawei open-sourced **Ascend-native code for openPangu-2.0 pretraining, supervised fine-tuning (SFT), and post-training reinforcement learning (RL)**. That is a training-stack release: the earlier . Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
Huawei hat am 28. September 2026 Code für Vortraining, überwachte Feinabstimmung (SFT) und Reinforcement Learning (RL) nach dem Training für openPangu 2.0 veröffentlicht. Der entscheidende Unterschied zu den früheren Pro- und Flash-Veröffentlichungen: Damals ging es vor allem um Modellgewichte und Inferenz – also darum, die fertigen Modelle auszuführen. Die neuen Projekte richten sich an Entwickler, die Modelle auf Ascend-Hardware trainieren oder weiter anpassen möchten. 1
2
27
Das Projekt openPangu-2.0-Training umfasst Code für Vortraining und SFT. openPangu-2.0-RL konzentriert sich auf Reinforcement Learning nach dem Training. Beide Projekte sind für Huaweis Ascend-Trainingsumgebung ausgelegt. 1
Es handelt sich damit um Trainingscode und nicht bloß um einen weiteren Modell-Checkpoint. Die Ankündigung beschreibt den Zweck der Projekte, legt aber nicht für sich allein offen, welche Rechenleistung, Daten oder Konfiguration nötig wären, um die ursprünglichen Trainingsläufe zu reproduzieren. 1
Laut den veröffentlichten Modellkarten sind beide Varianten Mixture-of-Experts-Modelle (MoE). Die Karten nennen folgende Eckdaten: 19
27
| Modell | Parameter insgesamt | Pro Token aktive Parameter | Kontextfenster | Angegebene Vortrainingstoken |
|---|---|---|---|---|
| openPangu-2.0-Pro | rund 505 Milliarden | rund 18 Milliarden | 512.000 Token | rund 34 Billionen |
| openPangu-2.0-Flash | rund 92 Milliarden | rund 6 Milliarden | 512.000 Token | rund 34 Billionen |
Die Angabe von rund 34 Billionen Vortrainingstoken gilt für jedes Modell einzeln – sie ist keine gemeinsame Gesamtsumme. 19
27
Die Modellkarten beschreiben zunächst eine gemeinsame SFT-Phase, die „langsames“ und „schnelles“ Denken zusammenführen soll. Darauf folgen mehrere spezialisierte RL-Phasen und Online Policy Distillation (OPD). Das sind Angaben zum beschriebenen Nachtrainingsverfahren der Modelle; davon zu unterscheiden ist die nun erfolgte Veröffentlichung von Trainings- und RL-Code. 19
27
1
Für beide Modelle nennen die Karten Multi-Head Latent Attention (MLA) sowie eine Kombination aus DSA- und Sliding-Window-Attention (SWA) im Verhältnis 1:2. SWA verarbeitet lokale Kontextfenster, während die dünn besetzten DSA-Schichten Informationen über größere Distanzen zusammenführen. 19
27
Zu den weiteren aufgeführten Merkmalen zählen eine mHC-Architektur mit vier Datenströmen, ein Multi-Token-Prediction-Modul (MTP) mit drei Köpfen und der Muon-Optimierer. Diese Angaben stammen aus den Modellkarten und sind keine erstmals mit der Code-Veröffentlichung angekündigten Funktionen. 19
27
Mit den zuvor veröffentlichten Gewichten und dem Inferenzcode konnten Entwickler die fertigen Pro- oder Flash-Modelle ausführen. Die neuen Projekte erweitern das verfügbare Werkzeugangebot um Vortraining, SFT und RL nach dem Training. Damit können Entwickler, die auf Ascend aufbauen, auch diese Phasen des Modelllebenszyklus untersuchen und bearbeiten. Die Quellen skizzieren den Zweck der Projekte, führen aber nicht jeden unterstützten Arbeitsablauf oder die nötigen Hardwareanforderungen im Detail auf. 1
2
27
Studio Global AI
Diese Seite enthält eine quellengestützte Antwort, die Sie in Studio Global fortsetzen können.
Huawei hat am 28. September 2026 Ascend orientierten Code für Vortraining, überwachte Feinabstimmung (SFT) und nachgelagertes Reinforcement Learning (RL) veröffentlicht.
Huawei hat am 28. September 2026 Ascend orientierten Code für Vortraining, überwachte Feinabstimmung (SFT) und nachgelagertes Reinforcement Learning (RL) veröffentlicht. Die Modelle Pro und Flash haben laut Modellkarten rund 505 beziehungsweise 92 Milliarden Parameter; beide unterstützen 512.000 Token Kontext und wurden mit jeweils rund 34 Billionen Token vortrainiert.
Bisher standen vor allem Gewichte und Inferenzcode im Fokus. Die neuen Projekte geben Ascend Entwicklern Code an die Hand, um auch Trainings und Anpassungsschritte zu bearbeiten.