화웨이가 2026년 9월 28일 openPangu-2.0의 사전학습, 지도 미세조정(SFT), 강화학습(RL) 후속 학습 코드를 공개했습니다. 이번 발표의 핵심은 공개 범위가 넓어졌다는 점입니다. 앞서 공개된 Pro·Flash 가중치와 추론 코드가 이미 학습된 모델을 실행하는 데 초점을 뒀다면, 이번에는 모델을 학습하고 성능을 조정하는 단계의 코드가 추가됐습니다.
1
2
27
이번에 공개된 코드는 무엇인가
새 프로젝트인 openPangu-2.0-Training은 사전학습과 SFT를 지원하고, openPangu-2.0-RL은 강화학습을 이용한 후속 학습에 초점을 둡니다. 두 프로젝트 모두 화웨이의 Ascend 학습 생태계를 겨냥합니다.
1
따라서 이번 공개는 새 모델 가중치만 추가한 것이 아니라 학습용 코드 저장소를 공개한 것입니다. 다만 공개 소식만으로는 원래 학습 과정을 재현하는 데 필요한 연산 자원, 데이터, 세부 설정까지 모두 확인할 수 없습니다.
1
Pro와 Flash 사양 비교
모델 카드에 따르면 Pro와 Flash는 모두 전문가 혼합(MoE) 구조를 사용합니다. 공개된 주요 사양은 다음과 같습니다.
19
27
| 모델 |
전체 파라미터 |
토큰당 활성 파라미터 |
문맥 길이 |
공개된 사전학습 토큰 수 |
| openPangu-2.0-Pro |
약 505B |
약 18B |
512K 토큰 |
약 34T |
| openPangu-2.0-Flash |
약 92B |
약 6B |
512K 토큰 |
약 34T |
각 모델 카드에 제시된 사전학습 규모는 모델별로 약 34조 토큰입니다. 두 모델 수치를 합산한 값이 아닙니다.
19
27
모델 카드에 소개된 후속 학습 방식
Pro와 Flash의 모델 카드는 ‘느린 사고’와 ‘빠른 사고’를 아우르는 통합 SFT를 거친 뒤, 여러 전문 분야별 RL 단계를 진행하고 온라인 정책 증류(OPD)를 적용하는 방식으로 후속 학습했다고 설명합니다. 이는 모델 카드가 소개하는 기존 학습 방식이며, 이번에 공개한 SFT·RL 코드와 구분해서 볼 필요가 있습니다.
19
27
1
모델 카드에 기재된 구조적 특징
두 모델 카드에는 다중 헤드 잠재 어텐션(MLA)과 DSA/SWA 어텐션 계층을 1:2 비율로 결합한 구성이 소개돼 있습니다. 슬라이딩 윈도우 어텐션(SWA)은 가까운 문맥을 처리하고, 희소 DSA 계층은 더 긴 범위의 정보를 모읍니다.
19
27
그 밖에 4개 스트림으로 구성된 mHC 구조, 3개 헤드의 다중 토큰 예측(MTP) 모듈, Muon 옵티마이저도 모델 카드에 기재돼 있습니다. 이는 9월 코드 공개에서 새로 발표된 기능이라기보다, 모델 카드에 설명된 설계 특징입니다.
19
27
Ascend 개발자에게 달라지는 점
기존 가중치와 추론 코드는 공개된 Pro·Flash 모델을 실행하는 데 활용할 수 있었습니다. 이번 프로젝트가 추가되면서 Ascend 개발자는 사전학습과 SFT, RL 후속 학습 단계도 다룰 수 있는 코드에 접근하게 됐습니다. 다만 공개된 자료는 프로젝트의 큰 방향을 밝힌 수준이며, 가능한 모든 작업 흐름이나 구체적인 하드웨어 요구 사항까지 상세히 설명하지는 않습니다.
1
2
27