openPangu 2.0 Pro는 총 505B 파라미터, 토큰당 약 18B 활성 파라미터의 MoE 모델이다. 180B가 아니다.[21] 화웨이는 모델 가중치, 기본 추론 코드, 기술 보고서를 공개했다. 이는 Ascend 환경에서의 평가·서빙·실험에는 의미가 크지만 원 학습의 완전한 재현을 보장하지는 않는다.[12] DSA+SWA 혼합 어텐션, 4 스트림 mHC 잔차 구조, 3 헤드 MTP, Muon 옵티마이저는 장문맥 처리와 추론·학습 효율을 겨냥한 설계다.[21]
연구 답변

Create a landscape editorial hero image for this Studio Global article: How does Huawei’s open-sourcing of openPangu-2.0-Pro—a 505B-parameter MoE model with roughly 180B active parameters, 512K context, 34T-token. Article summary: One correction: openPangu-2.0-Pro has about 505B total parameters but roughly 18B—not 180B—activated per token. The release is significant because it makes an Ascend-native, non-NVIDIA path inspectable from model design . Topic tags: general, general web, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
화웨이의 openPangu-2.0-Pro 공개는 단순히 모델 체크포인트를 내려받을 수 있게 된 사건보다 의미가 크다. 다만 이를 곧바로 ‘완전 재현 가능한 학습 스택’이라고 부르기는 이르다. 현재 공개된 자료는 대형 모델을 Ascend 환경에서 살펴보고, 평가하고, 추론 배포하는 경로를 제공한다. 반면 원래의 초대규모 학습을 처음부터 다시 만들어 내는 데 필요한 모든 조건이 공개됐다는 뜻은 아니다.
핵심 수치부터 바로잡을 필요가 있다. Pro는 총 약 5,050억(505B) 파라미터의 Mixture-of-Experts(MoE) 모델이며, 토큰 하나를 처리할 때 활성화되는 파라미터는 약 **180억(18B)**이다. 지원 컨텍스트 길이는 512K 토큰, 사전학습 데이터 규모는 약 34조 토큰으로 제시됐다.21
화웨이는 2026년 7월 31일 openPangu-2.0-Pro의 모델 가중치, 기본 추론 코드, 기술 보고서를 공개했다고 밝혔다. openPangu 2.0 관련 구성 요소도 오픈소스 채널을 통해 순차적으로 제공 중이라고 설명했다.12
각 산출물의 실무적 역할은 다르다.
화웨이는 HDC 2026에서 사전학습 코드, 후학습 코드, 학습 연산자 등을 포함한 7개 구성 요소를 단계적으로 공개하겠다는 계획도 제시했다.2
10 이 요소들이 실제로 사용할 수 있는 형태로 제공된다면, 가중치만 내놓는 공개 방식보다 학습부터 추론까지 이어지는 스택에 한층 가까워진다.
오픈 웨이트 모델과 학습 규모의 재현 가능성은 별개의 문제다. 내려받을 수 있는 가중치는 공개된 체크포인트를 시험할 수 있음을 뜻하지만, 해당 체크포인트를 다시 만들어 낸 모든 조건을 알려주지는 않는다.
34조 토큰 사전학습을 재현하려면 적어도 정확한 데이터 또는 재현 가능한 데이터 생성 명세, 완전한 학습·후학습 구현, 하이퍼파라미터, 클러스터 토폴로지, 소프트웨어와 컴파일러 버전, 분산학습 설정, 커스텀 연산자, 평가 환경, 그리고 충분한 호환 하드웨어가 필요하다. 현재 확인되는 공개물은 가중치·기본 추론 코드·보고서이며, 추가 구성 요소는 순차 제공 계획으로 설명된다.12
21
따라서 현시점에서 가장 정확한 표현은 **‘Ascend 우선의 오픈 모델 공개와, 더 넓은 스택 투명성으로 향하는 로드맵’**이다. 외부 조직이 지금 당장 원래 학습을 독자적으로 재현할 수 있다는 증거는 아니다.
openPangu-2.0-Pro는 매우 큰 전체 파라미터 규모와 함께, 생성 및 장문맥 처리 비용을 낮추려는 구조를 결합했다.
MoE는 토큰마다 전체 파라미터를 모두 거치지 않고 일부 전문가(expert)만 선택해 처리한다. Pro의 경우 총 파라미터는 약 505B이지만 토큰당 활성 파라미터는 약 18B이다.21
물론 이것이 모델을 가볍게 만든다는 뜻은 아니다. 505B 모델을 저장·서빙·분산 통신하려면 여전히 대규모 인프라가 필요하다. 다만 총규모가 같은 조밀(dense) 모델과 비교하면, 개별 토큰 처리에 투입되는 파라미터 연산량은 줄일 수 있다.
모델은 MLA를 유지하면서 DSA와 슬라이딩 윈도 어텐션(SWA)을 1:2 레이어 비율로 결합한다. 화웨이는 SWA가 근거리 윈도 모델링을 맡고, DSA가 희소한 전역 문맥을 포착한다고 설명한다. 목표는 장문맥 추론에서 계산량·메모리 사용량·메모리 접근 비용을 낮추면서 정확도를 유지하는 것이다.21
512K 컨텍스트에서 가장 큰 난점은 모든 토큰 쌍을 전부 연결하는 풀 어텐션의 비용이다. 국소 어텐션은 인접 정보를 비교적 저렴하게 처리하고, 희소 전역 메커니즘은 멀리 떨어진 관련 정보에 닿으려는 방식이다.
화웨이는 표현의 다양성과 일반화 성능을 높이기 위한 4-스트림 mHC 잔차 토폴로지도 설명한다. 3-헤드 다중 토큰 예측(MTP) 모듈은 추가 미래 토큰을 예측해 추론 가속을 겨냥하며, 학습 옵티마이저로는 더 빠른 수렴을 목표로 Muon을 사용했다고 밝혔다.21
이는 화웨이 공개 자료의 아키텍처 및 최적화 주장이다. 모든 배포 환경에서 동일한 속도 향상을 보장하는 독립 검증 결과로 해석해서는 안 된다. 처리량과 지연시간은 가속기 구성, 정밀도, 배치 크기, 컨텍스트 길이, 트래픽 패턴, 서빙 소프트웨어에 크게 좌우된다.
512K 컨텍스트는 매뉴얼, 정책 문서, 로그, 기존 도구 호출 결과, 기술 명세처럼 많은 자료를 하나의 에이전트 세션에 함께 넣을 여지를 준다. 과도한 청킹을 줄일 수는 있지만, 검색, 권한 관리, 출처 검증, 사람의 승인 절차까지 불필요해지는 것은 아니다.
가능성이 있는 활용 사례는 다음과 같다.
대부분의 소규모 조직에는 희소 활성화 구조라 해도 Pro를 직접 호스팅하기가 어렵다. 화웨이가 공개한 openPangu-2.0-Flash는 총 92B, 토큰당 6B 활성 파라미터 모델로, 평가와 배포 측면에서 더 현실적인 선택지가 될 수 있다.15
20
화웨이는 Thinking 버전의 openPangu-2.0-Pro가 SWE-bench Verified에서 68.5점을 기록했다고 보고했다.24 주목할 만한 벤치마크 결과지만, 복잡한 운영 환경의 소프트웨어 업무를 신뢰성 있게 독자 수행할 수 있다는 증거는 아니다.
실제 저장소 작업에는 환경 구성, 의존성 관리, 테스트 실행, 보안 검토, 아키텍처 판단, 계속 바뀌는 제품 요구사항, 장기적인 디버깅이 얽혀 있다. 현실적인 운영 방식은 저장소 범위 권한, 샌드박스 실행, 자동 테스트, 정적 분석, 코드 리뷰, 롤백 절차를 갖춘 감독형 코딩 에이전트다. 자동 병합을 맡기는 방식과는 거리가 있다.
전략적 가치는 모델 가중치 자체에만 있지 않다. Ascend 네이티브 레퍼런스 모델은 개발자가 Ascend에서 워크로드를 만들고 시험하고 최적화하도록 유도할 수 있다. 이렇게 늘어난 워크로드는 런타임, 연산자, 개발 도구, 관리형 서비스 개선 수요로 이어질 수 있다. 화웨이는 개발자·기업 파트너·연구자에게 Ascend Tribe 커뮤니티와 화웨이 클라우드 MaaS(Model as a Service)를 통해 내려받기, 사용, 피드백 제공을 요청했다.12
Flash와 Pro를 서로 다른 규모로 제공하면 참여 가능한 사용자층을 넓힐 수 있다. 계획된 학습·후학습·연산자 구성 요소는 모델 개발자가 실제로 플랫폼을 활용할 수 있는지를 좌우하는 소프트웨어 계층을 겨냥한다.10
15
결국 openPangu 2.0은 Ascend와 Pangu를 함께 쓰는 개발 생태계를 강화하려는 시도로 보는 편이 타당하다. 공개는 이미 배포, 구조 점검, 실험 측면에서 의미가 있다. 다만 ‘완전 재현 가능’이라는 평가는 남은 코드·설정·데이터 관련 세부 정보가 공개되고, 독립 조직들이 실제로 어디까지 재구축할 수 있는지 검증한 뒤에 내려야 한다.
Studio Global AI
이 페이지에는 Studio Global 내에서 계속할 수 있는 소스 기반 답변이 포함되어 있습니다.
openPangu 2.0 Pro는 총 505B 파라미터, 토큰당 약 18B 활성 파라미터의 MoE 모델이다. 180B가 아니다.[21]
openPangu 2.0 Pro는 총 505B 파라미터, 토큰당 약 18B 활성 파라미터의 MoE 모델이다. 180B가 아니다.[21] 화웨이는 모델 가중치, 기본 추론 코드, 기술 보고서를 공개했다. 이는 Ascend 환경에서의 평가·서빙·실험에는 의미가 크지만 원 학습의 완전한 재현을 보장하지는 않는다.[12]
DSA+SWA 혼합 어텐션, 4 스트림 mHC 잔차 구조, 3 헤드 MTP, Muon 옵티마이저는 장문맥 처리와 추론·학습 효율을 겨냥한 설계다.[21]