หัวเว่ยประกาศเปิดโค้ด openPangu 2.0 สำหรับ pretraining, supervised fine tuning (SFT) และ post training reinforcement learning (RL) เมื่อวันที่ 28 กันยายน 2026 [1] Pro มีพารามิเตอร์รวมราว 505 พันล้านและเปิดใช้งานราว 18 พันล้านต่อโทเคน ส่วน Flash มีราว 92 พันล้านและเปิดใช้งานราว 6 พันล้าน ทั้งคู่รองรับบริบท 512,000 โท...
เผยแพร่โดยแก้ไขด้วย GPT-6 Lunaรูปภาพสร้างด้วย GPT Image 2
คำตอบการวิจัย

Create a landscape editorial hero image for this Studio Global article: What did Huawei open-source for openPangu-2.0 on September 28, 2026, and how does the new Ascend-native pretraining, supervised fine-tuning. Article summary: On September 28, 2026, Huawei open-sourced **Ascend-native code for openPangu-2.0 pretraining, supervised fine-tuning (SFT), and post-training reinforcement learning (RL)**. That is a training-stack release: the earlier . Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
หัวเว่ยประกาศเปิดซอร์สโค้ดสำหรับ การพรีเทรน การปรับแต่งแบบมีผู้ดูแล (SFT) และการฝึกเสริมกำลังหลังการฝึก (RL) ของตระกูล openPangu-2.0 เมื่อวันที่ 28 กันยายน 2026 โดยโค้ดออกแบบมาสำหรับระบบฝึกโมเดลที่ใช้ชิป Ascend ของหัวเว่ย 1
ประเด็นสำคัญคือสิ่งที่นักพัฒนาเข้าถึงได้เปลี่ยนจากการนำโมเดลที่ฝึกเสร็จแล้วไปรัน มาเป็นการทำงานกับขั้นตอนฝึกและปรับแต่งโมเดลด้วย ก่อนหน้านี้หัวเว่ยเปิดเวตโมเดล Pro และ Flash พร้อมโค้ดสำหรับ inference ส่วนการเปิดตัวล่าสุดเพิ่มโค้ดในส่วน training stack 1
2
27
โครงการ openPangu-2.0-Training รองรับการพรีเทรนและ SFT ขณะที่ openPangu-2.0-RL มุ่งเน้นการฝึก RL ในขั้น post-training ทั้งสองโครงการพัฒนาสำหรับระบบฝึกบน Ascend 1
ดังนั้น นี่คือการเปิดโค้ดสำหรับขั้นตอนฝึก ไม่ใช่เพียงการเพิ่ม checkpoint ของโมเดล อย่างไรก็ตาม แหล่งข่าวที่ประกาศโครงการระบุขอบเขตการใช้งานในภาพรวม แต่ไม่ได้ยืนยันว่ามีข้อมูล ทรัพยากรประมวลผล หรือการตั้งค่าครบถ้วนสำหรับทำซ้ำการฝึกเดิมได้ทุกขั้นตอน 1
Model card ระบุว่า openPangu-2.0-Pro และ Flash เป็นโมเดลแบบ mixture of experts (MoE) โดยมีสเปกดังนี้ 19
27
| รุ่น | พารามิเตอร์รวม | พารามิเตอร์ที่เปิดใช้งานต่อโทเคน | ความยาวบริบท | โทเคนที่ใช้พรีเทรนตามที่รายงาน |
|---|---|---|---|---|
| openPangu-2.0-Pro | ประมาณ 505 พันล้าน | ประมาณ 18 พันล้าน | 512,000 โทเคน | ประมาณ 34 ล้านล้าน |
| openPangu-2.0-Flash | ประมาณ 92 พันล้าน | ประมาณ 6 พันล้าน | 512,000 โทเคน | ประมาณ 34 ล้านล้าน |
ตัวเลขโทเคนพรีเทรนประมาณ 34 ล้านล้านเป็นตัวเลขที่ระบุสำหรับ แต่ละรุ่น ไม่ใช่ยอดรวมของ Pro และ Flash 19
27
Model card ของทั้ง Pro และ Flash อธิบายกระบวนการ SFT ที่รวมความสามารถด้านการคิดแบบ “ช้า” และ “เร็ว” จากนั้นจึงฝึก RL หลายขั้นโดยแยกตามความเชี่ยวชาญ และใช้ online policy distillation (OPD) เพื่อรวมความสามารถจากผู้เชี่ยวชาญเหล่านั้นเข้าด้วยกัน 19
27
รายละเอียดดังกล่าวเป็นคำอธิบายแนวทาง post-training ของโมเดล ส่วนการเปิดโค้ดเมื่อวันที่ 28 กันยายนเป็นการประกาศให้เข้าถึงโครงการฝึกและ RL แยกต่างหาก 19
27
1
Model card อธิบายการผสมผสาน multi-head latent attention (MLA) กับชั้น attention แบบ DSA และ SWA ในอัตราส่วน 1:2 โดย SWA ใช้จัดการบริบทในหน้าต่างระยะใกล้ ส่วนชั้น DSA ทำหน้าที่รวบรวมข้อมูลระยะไกลแบบ sparse 19
27
นอกจากนี้ยังระบุสถาปัตยกรรม mHC แบบสี่สาย โมดูล multi-token prediction (MTP) แบบสามหัว และการใช้ตัวปรับแต่งแบบ Muon ข้อมูลเหล่านี้เป็นคุณสมบัติด้านการออกแบบที่ระบุใน model card ไม่ใช่ความสามารถใหม่ที่ประกาศพร้อมการเปิดโค้ดเดือนกันยายน 19
27
เวตโมเดลและโค้ด inference ที่เปิดไว้ก่อนหน้านี้ช่วยให้นักพัฒนานำ Pro หรือ Flash ไปรันได้ ส่วนโครงการใหม่เพิ่มโค้ดสำหรับพรีเทรน SFT และ RL post-training ทำให้ผู้พัฒนาที่ทำงานบน Ascend มีเครื่องมือสำหรับทดลองกับขั้นตอนต่าง ๆ ของวงจรการฝึกและปรับแต่งโมเดล ไม่ได้จำกัดอยู่แค่การโหลดโมเดลที่ฝึกเสร็จแล้วมาใช้งาน 1
2
27
แหล่งข้อมูลที่ประกาศระบุขอบเขตหลักของแต่ละโครงการ แต่ยังไม่ได้แจกแจงเวิร์กโฟลว์ที่รองรับทั้งหมดหรือข้อกำหนดด้านฮาร์ดแวร์โดยละเอียด 1
Studio Global AI
หน้านี้รวมคำตอบที่ได้รับการสนับสนุนจากแหล่งที่มาซึ่งคุณสามารถดำเนินการต่อภายใน Studio Global
หัวเว่ยประกาศเปิดโค้ด openPangu 2.0 สำหรับ pretraining, supervised fine tuning (SFT) และ post training reinforcement learning (RL) เมื่อวันที่ 28 กันยายน 2026 [1]
หัวเว่ยประกาศเปิดโค้ด openPangu 2.0 สำหรับ pretraining, supervised fine tuning (SFT) และ post training reinforcement learning (RL) เมื่อวันที่ 28 กันยายน 2026 [1] Pro มีพารามิเตอร์รวมราว 505 พันล้านและเปิดใช้งานราว 18 พันล้านต่อโทเคน ส่วน Flash มีราว 92 พันล้านและเปิดใช้งานราว 6 พันล้าน ทั้งคู่รองรับบริบท 512,000 โทเคน [19][27]
การเปิดโค้ดครั้งนี้ขยายจากเวตโมเดลและเครื่องมือ inference ที่มีอยู่ ให้ผู้พัฒนาบน Ascend เข้าถึงโค้ดสำหรับช่วงฝึกและปรับแต่งโมเดลด้วย [1][2][27]