Pada 28 September 2026, Huawei merilis kode openPangu 2.0 untuk prapelatihan, supervised fine tuning (SFT), dan reinforcement learning (RL) pascapelatihan di ekosistem Ascend. Pro memiliki sekitar 505 miliar parameter total dan 18 miliar parameter aktif per token; Flash memiliki 92 miliar total dan 6 miliar aktif.
Diterbitkan olehDiedit dengan GPT-6 LunaGambar dibuat dengan GPT Image 2
Jawaban penelitian

Create a landscape editorial hero image for this Studio Global article: What did Huawei open-source for openPangu-2.0 on September 28, 2026, and how does the new Ascend-native pretraining, supervised fine-tuning. Article summary: On September 28, 2026, Huawei open-sourced **Ascend-native code for openPangu-2.0 pretraining, supervised fine-tuning (SFT), and post-training reinforcement learning (RL)**. That is a training-stack release: the earlier . Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
Huawei pada 28 September 2026 merilis kode untuk prapelatihan, supervised fine-tuning (SFT), dan reinforcement learning (RL) pascapelatihan pada keluarga model openPangu-2.0. Perbedaan utamanya terletak pada tahap yang bisa dijajal pengembang: rilis Pro dan Flash sebelumnya menyediakan bobot model serta kode inferensi, sedangkan proyek baru mencakup bagian dari proses melatih dan menyesuaikan model. 1
2
27
Proyek openPangu-2.0-Training mendukung prapelatihan dan SFT, sementara openPangu-2.0-RL berfokus pada RL pascapelatihan. Keduanya dirancang untuk ekosistem pelatihan Huawei Ascend. 1
Jadi, ini merupakan rilis kode untuk pelatihan, bukan sekadar tambahan checkpoint model yang sudah dilatih. Pengumuman tersebut menjelaskan fokus proyek, tetapi belum merinci sumber daya komputasi, data, maupun konfigurasi yang diperlukan untuk mereproduksi proses pelatihan aslinya. 1
Kartu model yang dipublikasikan menyebut Pro dan Flash sebagai model mixture of experts (MoE). Berikut angka yang dicantumkan: 19
27
| Model | Parameter total | Parameter aktif per token | Jendela konteks | Token prapelatihan yang dilaporkan |
|---|---|---|---|---|
| openPangu-2.0-Pro | Sekitar 505 miliar | Sekitar 18 miliar | 512 ribu token | Sekitar 34 triliun |
| openPangu-2.0-Flash | Sekitar 92 miliar | Sekitar 6 miliar | 512 ribu token | Sekitar 34 triliun |
Angka token prapelatihan sekitar 34 triliun berlaku untuk masing-masing model, bukan jumlah gabungan Pro dan Flash. 19
27
Kartu model Pro dan Flash menggambarkan tahap SFT terpadu untuk menyatukan kemampuan berpikir “lambat” dan “cepat”, kemudian beberapa tahap RL khusus. Keduanya juga menyebut online policy distillation (OPD). Uraian tersebut menjelaskan pendekatan pascapelatihan model; kode RL yang dirilis pada September merupakan bagian terpisah dari ketersediaan kode pelatihan. 19
27
1
Kartu model mencantumkan gabungan multi-head latent attention (MLA) dengan lapisan perhatian DSA dan SWA dalam rasio 1:2. Sliding-window attention (SWA) menangani konteks lokal, sementara lapisan DSA yang bersifat sparse merangkum informasi dari rentang yang lebih jauh. 19
27
Fitur lain yang disebutkan adalah arsitektur mHC empat aliran, modul multi-token prediction (MTP) tiga kepala, dan optimizer Muon. Ini merupakan fitur desain yang dilaporkan pada kartu model, bukan kemampuan baru yang diumumkan sebagai bagian dari rilis kode September. 19
27
Bobot dan kode inferensi yang dirilis sebelumnya memungkinkan pengembang menjalankan model Pro atau Flash yang tersedia. Proyek baru memperluas perangkat yang tersedia ke tahap prapelatihan, SFT, dan RL pascapelatihan, sehingga pengembang yang bekerja dengan Ascend dapat mengeksplorasi lebih banyak bagian dari siklus hidup model. Namun, sumber hanya menjelaskan fokus umum proyek dan belum memerinci semua alur kerja yang didukung atau kebutuhan perangkat kerasnya. 1
2
27
Studio Global AI
Halaman ini berisi jawaban yang didukung sumber yang dapat Anda lanjutkan di dalam Studio Global.
Pada 28 September 2026, Huawei merilis kode openPangu 2.0 untuk prapelatihan, supervised fine tuning (SFT), dan reinforcement learning (RL) pascapelatihan di ekosistem Ascend.
Pada 28 September 2026, Huawei merilis kode openPangu 2.0 untuk prapelatihan, supervised fine tuning (SFT), dan reinforcement learning (RL) pascapelatihan di ekosistem Ascend. Pro memiliki sekitar 505 miliar parameter total dan 18 miliar parameter aktif per token; Flash memiliki 92 miliar total dan 6 miliar aktif.
Rilis kode pelatihan ini melengkapi bobot model dan kode inferensi yang sudah tersedia, tetapi sumber belum menjelaskan semua alur kerja atau kebutuhan perangkat kerasnya.