Ngày 28/9/2026, Huawei công bố mã nguồn cho tiền huấn luyện, tinh chỉnh có giám sát (SFT) và học tăng cường (RL) hậu huấn luyện của openPangu 2.0, hướng đến hệ sinh thái Ascend. Trước đó, các bản Pro và Flash đã cung cấp trọng số mô hình và mã suy luận; đợt này bổ sung mã cho những giai đoạn huấn luyện và điều chỉnh...
Đăng bởiBiên tập bằng GPT-6 LunaHình ảnh được tạo bằng GPT Image 2
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: What did Huawei open-source for openPangu-2.0 on September 28, 2026, and how does the new Ascend-native pretraining, supervised fine-tuning. Article summary: On September 28, 2026, Huawei open-sourced **Ascend-native code for openPangu-2.0 pretraining, supervised fine-tuning (SFT), and post-training reinforcement learning (RL)**. That is a training-stack release: the earlier . Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
Điểm đáng chú ý trong thông báo ngày 28/9/2026 của Huawei không chỉ là thêm một mô hình AI vào danh sách mã nguồn mở. Hãng công bố mã cho tiền huấn luyện, tinh chỉnh có giám sát (SFT) và học tăng cường (RL) hậu huấn luyện của openPangu-2.0, dành cho hệ sinh thái huấn luyện Ascend. 1
Khác với các đợt phát hành Pro và Flash trước đó, vốn tập trung vào trọng số mô hình đã huấn luyện và mã suy luận để chạy mô hình, bộ công cụ mới hướng đến các bước tạo ra và điều chỉnh mô hình. 1
2
27
Huawei cho biết dự án openPangu-2.0-Training hỗ trợ tiền huấn luyện và SFT; dự án openPangu-2.0-RL tập trung vào RL hậu huấn luyện. Cả hai được thiết kế cho môi trường huấn luyện dựa trên bộ xử lý Ascend của Huawei. 1
Nói cách khác, đây là mã cho quy trình huấn luyện, chứ không đơn thuần là một bộ trọng số mới để tải về và chạy. Thông báo nêu phạm vi chính của các dự án, nhưng chưa đủ để kết luận rằng chỉ cần có mã là có thể tái tạo nguyên vẹn quá trình huấn luyện ban đầu: phần cứng, dữ liệu và cấu hình cần thiết không được xác định đầy đủ trong thông báo. 1
Thẻ mô hình mô tả cả Pro lẫn Flash là mô hình ngôn ngữ MoE (mixture of experts, hay kiến trúc hỗn hợp chuyên gia). Với loại mô hình này, tổng số tham số lớn hơn số tham số được kích hoạt để xử lý mỗi token. 19
27
| Phiên bản | Tổng tham số | Tham số kích hoạt mỗi token | Cửa sổ ngữ cảnh | Token tiền huấn luyện được công bố |
|---|---|---|---|---|
| openPangu-2.0-Pro | Khoảng 505 tỷ | Khoảng 18 tỷ | 512.000 token | Khoảng 34 nghìn tỷ |
| openPangu-2.0-Flash | Khoảng 92 tỷ | Khoảng 6 tỷ | 512.000 token | Khoảng 34 nghìn tỷ |
Con số 34 nghìn tỷ token là mức được nêu cho mỗi phiên bản, không phải tổng cộng của cả Pro và Flash. 19
27
Theo thẻ của Pro và Flash, quy trình hậu huấn luyện bắt đầu bằng SFT nhằm kết hợp khả năng suy nghĩ theo hướng “chậm” và “nhanh”. Tiếp đó là nhiều giai đoạn RL chuyên biệt, rồi đến chưng cất chính sách trực tuyến (OPD) để kết hợp các năng lực. Đây là mô tả về cách các phiên bản được công bố đã được hậu huấn luyện; việc công bố mô tả đó không đồng nghĩa với việc mã huấn luyện mới chỉ bao gồm những phương pháp này. 19
27
1
Thẻ mô hình nêu sự kết hợp giữa chú ý tiềm ẩn đa đầu (MLA) và các lớp chú ý DSA/SWA theo tỷ lệ 1:2. Chú ý cửa sổ trượt (SWA) xử lý ngữ cảnh cục bộ, còn các lớp DSA thưa giúp tổng hợp thông tin ở phạm vi xa hơn. 19
27
Một số đặc điểm khác được liệt kê gồm kiến trúc mHC bốn luồng, mô-đun dự đoán nhiều token (MTP) ba đầu và bộ tối ưu Muon. Đây là các thiết kế được nêu trong thẻ mô hình, không phải những tính năng mới được công bố riêng trong đợt mở mã ngày 28/9. 19
27
Với trọng số và mã suy luận đã phát hành, nhà phát triển có thể triển khai các mô hình Pro hoặc Flash được công bố. Các dự án mới mở rộng phần công cụ có sẵn sang tiền huấn luyện, SFT và RL hậu huấn luyện, giúp người xây dựng trên Ascend có mã để tìm hiểu và làm việc với nhiều giai đoạn hơn trong vòng đời mô hình. 1
2
27
Tuy vậy, nguồn hiện có chỉ mô tả trọng tâm tổng quát của các dự án, chưa nêu chi tiết mọi quy trình được hỗ trợ hay yêu cầu phần cứng cụ thể. 1
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
Ngày 28/9/2026, Huawei công bố mã nguồn cho tiền huấn luyện, tinh chỉnh có giám sát (SFT) và học tăng cường (RL) hậu huấn luyện của openPangu 2.0, hướng đến hệ sinh thái Ascend.
Ngày 28/9/2026, Huawei công bố mã nguồn cho tiền huấn luyện, tinh chỉnh có giám sát (SFT) và học tăng cường (RL) hậu huấn luyện của openPangu 2.0, hướng đến hệ sinh thái Ascend. Trước đó, các bản Pro và Flash đã cung cấp trọng số mô hình và mã suy luận; đợt này bổ sung mã cho những giai đoạn huấn luyện và điều chỉnh mô hình.
Theo thẻ mô hình, Pro có khoảng 505 tỷ tham số, Flash khoảng 92 tỷ; cả hai hỗ trợ ngữ cảnh 512.000 token và được huấn luyện trên khoảng 34 nghìn tỷ token mỗi phiên bản.