딥시크는 2026년 9월 30일 화웨이 어센드 플랫폼용 AI 기반 소프트웨어 구성요소 6종을 공개했다. 커널 프로그래밍부터 연산, 어텐션, 데이터 선택, 분산 통신까지 모델 구동에 필요한 여러 층을 아우르는 구성이다. 다만 현재 공개된 자료만으로는 엔비디아와 성능을 일대일로 비교하기 어렵고, 딥시크가 어센드에서 V4 전체 규모의 학습을 마쳤다고 확인할 수도 없다.
2
5
공개된 구성요소 6종은 무엇인가
이번 구성요소들은 딥시크의 기존 엔비디아 중심 소프트웨어와 기능상 대응하도록 만들어졌다. 다만 대응 관계가 내부 구현까지 같거나 기능과 성능이 완전히 동등하다는 뜻은 아니다.
2
5
- TileLang은 AI 연산에 쓰이는 커널을 작성하고 컴파일하는 고수준 도구다. 어센드 지원이 추가돼 개발자가 화웨이 하드웨어용 커널을 만들 수 있지만, 엔비디아용 커널과 구현이 동일하다는 의미는 아니다.
2
5
- DeepGEMM은 행렬 곱셈 라이브러리다. 어센드판은 기존 DeepGEMM API와 호환되며 BF16·FP8·FP4 연산, MQA 로짓, MegaMoE를 지원한다. 희소 데이터 로딩과 코루틴 기반 파이프라이닝 등 어센드에 맞춘 최적화도 적용했다고 프로젝트 측은 설명한다.
17
- TileKernels는 범용 커널을, FlashMLA는 어센드 950용 희소 어텐션 프리필·디코딩 커널을 제공한다. DeepSelect는 데이터 선택이나 필터링을 담당한다.
9
14
44
- DeepEP는 분산 통신 라이브러리로, 전문가 병렬 처리에서 데이터를 보내고(dispatch) 결과를 합치는(combine) 작업 등을 지원한다. 외부에 공개된 버퍼 API는 엔비디아 버전과 맞춰져 있지만, 어센드판은 해당 플랫폼의 소프트웨어·하드웨어 인터페이스를 사용한다.
19
개발자가 기존 코드를 옮기는 데 API 호환성이 도움이 될 수는 있다. 하지만 API나 기능의 대응만으로 두 플랫폼의 내부 구현, 지원 범위, 처리 속도가 같다고 볼 수는 없다.
어센드 950 성능 수치, 어떻게 읽어야 하나
DeepEP 저장소에 보고된 어센드 통신 테스트 수치는 dispatch 375GB/s, combine 347GB/s다. 이는 어센드에서 측정한 통신 성능이지, 엔비디아 장비와 맞붙여 비교한 결과는 아니다.
19
47
추론 수치는 DeepSeek-V4.1-Flash를 어센드 950 UBL128 시스템에서 실행한 오프라인 테스트를 기준으로 한다. 보고된 설정은 EP32 배치 전략과 128K 컨텍스트였다. 출력 토큰당 시간(TPOT)을 5ms로 설정했을 때 카드당 초당 출력량은 2,469토큰, TPOT가 10ms일 때는 5,102토큰으로 제시됐다. 이 수치에는 서빙 스케줄링과 프레임워크의 부하 분산 오버헤드가 포함되지 않았다.
47
따라서 이 결과는 특정 구성에서 얻은 수치이지, 다른 모델이나 작업에서도 보장되는 처리량은 아니다. DeepEP 저장소는 측정에 수동 구성한 개념검증(PoC) 하드웨어 개발 패키지를 사용했다고 밝힌다. 별도 보도는 해당 수치가 PoC 펌웨어 기반이며 상용 버전은 10월 15일 전후 출시 예정이라고 전했다. 재현하거나 해석할 때 펌웨어와 장비 구성이 중요한 이유다.
12
19
공개된 보도만으로는 모든 추론 설정을 독립적으로 재현하기에 정보가 충분하지 않으며, 대규모 제3자 검증 결과도 제시되지 않았다. 따라서 이 수치를 엔비디아 시스템과 검증된 성능 비교 결과로 받아들여서는 안 된다.
47
화웨이가 공개한 SuperPoD Flex·UBL128 설계
화웨이와 딥시크는 어센드 950을 기반으로 공동 정의한 SuperPoD Flex·UBL128 설계를 소개했다. 보도에 따르면 이 설계는 카드 128개를 연결하는 3.2Tbps 단일 단계 스케일업 네트워크와, 최대 25만 6,000개 카드 규모를 목표로 하는 2단계 스케일아웃 설계를 제시한다. 이는 설계상 확장 능력에 대한 설명이지, 그 규모의 시스템에서 딥시크 학습 작업을 실제로 수행했다는 증거는 아니다.
10
47
49
화웨이는 공동 개발 결과를 CANN 커뮤니티를 통해 공유한다고 밝혔다. 보도에서 언급한 범위에는 모델 배포, 대규모 학습, 긴 컨텍스트에서의 KV 캐시 풀링, 에이전트형 강화학습이 포함된다.
14
아직 확인되지 않은 것
이번 공개로 어센드용 소프트웨어 구성이 넓어졌고, 특정 조건에서의 오프라인 추론 결과도 제시됐다. 그러나 구성요소 간 대응 관계나 확장 가능한 네트워크 설계만으로 딥시크가 어센드에서 V4 전체 규모의 학습을 마쳤다고 결론 내릴 수는 없다. 공개된 벤치마크 역시 서로 다른 하드웨어에서 나온 수치이며, 동일 조건의 교차 플랫폼 테스트가 제시되지 않아 엔비디아와 성능이 같다는 점을 입증하지 않는다.
2
5
19
47
현재까지 확인되는 내용은 딥시크가 어센드용 소프트웨어를 공개했고, 화웨이가 시스템 설계와 일부 테스트 결과를 설명했다는 것이다. 이 결과가 다른 작업에서도 그대로 재현되는지, 통제된 조건에서 엔비디아 시스템과 어떤 차이가 나는지는 아직 검증이 더 필요하다.