알리바바의 Qwen2.5-Max 출시는 미국의 소수 AI 연구소가 최첨단 모델 개발을 독점한다는 인식에 도전한 사건이었다. 2025년 1월 28~29일 공개된 이 모델은 전 세계의 관심을 끈 DeepSeek-V3 직후 등장했고, 야심 찬 성능 주장과 Alibaba Cloud의 유통망을 동시에 앞세웠다. 29
다만 Qwen2.5-Max가 모든 경쟁 모델을 모든 작업에서 앞섰다는 뜻은 아니다. 더 오래 남은 의미는 전략에 있다. 알리바바는 주요 중국 클라우드 기업이 준(準)최첨단 수준의 모델을 시장에 내놓는 동시에, 다운로드 가능한 모델과 개발 도구, 관리형 API를 아우르는 생태계를 운영할 수 있음을 보여줬다.
Qwen2.5-Max는 어떤 모델이었나
Qwen2.5-Max는 알리바바가 대규모 혼합 전문가 모델(MoE·Mixture of Experts) 기반의 대규모 언어 모델이라고 설명한 시스템이다. MoE에서는 입력에 따라 서로 다른 ‘전문가’ 네트워크가 선택된다. 따라서 모든 구성 요소를 매 토큰마다 활성화하지 않고도 전체 모델의 용량을 크게 유지할 수 있다. 이는 성능과 추론 비용 사이의 균형을 개선할 가능성이 있지만, 공개된 출시 자료만으로는 전체 파라미터 수나 실제 활성 파라미터 수를 정확히 확인하기 어렵다. 9
알리바바는 Qwen2.5-Max가 2조 개가 아니라 20조 개가 넘는 토큰으로 사전 학습됐으며, 이후 선별한 **지도 미세조정(SFT·Supervised Fine-Tuning)**과 **인간 피드백 기반 강화학습(RLHF·Reinforcement Learning from Human Feedback)**을 거쳤다고 밝혔다. 사전 학습이 언어와 지식의 기반을 만드는 단계라면, SFT와 RLHF는 지시 이행, 답변 품질, 정렬 수준을 높이는 후속 과정이다. 259
Qwen2.5-Max는 다운로드 가능한 Qwen2.5 체크포인트와 구분해야 한다. 기존 Qwen2.5 제품군에는 5억 개부터 720억 개 파라미터까지 다양한 기본 모델과 지시 조정 모델, 양자화 버전이 포함됐고, Hugging Face·ModelScope·Kaggle 등을 통해 배포됐다. 132 반면 Max는 또 하나의 공개 체크포인트라기보다 호스팅되는 플래그십 모델로 자리 잡았으며, 당시 분석에서는 Alibaba Cloud의 Model Studio가 주요 접점으로 지목됐다. 13
공개 모델과 호스팅 모델을 함께 가져간 전략
이 구분은 알리바바의 투트랙 전략을 드러낸다.
- 고성능 호스팅 모델: 가장 강력한 시스템은 Model Studio와 Qwen 관련 인터페이스를 통해 통제된 방식으로 제공한다.
- 오픈 웨이트 모델: 개발자는 Qwen 제품군의 다른 모델을 내려받아 수정·양자화하고 직접 배포할 수 있다.
Qwen2.5 기술 보고서는 Hugging Face, ModelScope, Kaggle 등을 통해 접근할 수 있는 100개 이상의 모델과 변형을 소개했다. 보고서에는 Alibaba Cloud Model Studio에서 이용할 수 있는 호스팅 Qwen2.5 MoE 모델도 포함됐다. 132
개발자 입장에서는 편의성과 통제권 사이에서 선택할 수 있다. 관리형 API를 이용하면 인프라 구축 부담이 줄어들지만, 오픈 웨이트는 배포 방식과 맞춤화, 데이터 저장 위치를 더 세밀하게 통제할 수 있다. 알리바바는 오픈 모델로 개발자 유입을 늘리고, Model Studio를 통해 모델 사용을 클라우드 수요로 연결하는 구조를 만들 수 있었다.
벤치마크 성적과 신중하게 읽어야 할 주장
알리바바는 Qwen2.5-Max가 여러 평가에서 Claude 3.5 Sonnet과 대체로 비슷한 수준이며, GPT-4o·DeepSeek-V3·Llama 3.1 405B보다 앞섰다고 주장했다. 회사가 강조한 평가 항목은 지식, 고난도 추론, 코딩, 종합 능력, 인간 선호도에 가까운 응답 품질을 측정하는 MMLU-Pro, GPQA-Diamond, LiveCodeBench, LiveBench, Arena-Hard 등이었다. 29
그러나 모델 개발사가 직접 수행한 벤치마크는 특정 조건에서 측정한 결과이지, 실제 서비스 환경에서의 보편적인 우위를 증명하는 것은 아니다. 벤치마크 버전, 프롬프트, 모델 설정, 평가 데이터의 노출 여부에 따라 결과가 달라질 수 있다. 당시 보도 역시 알리바바의 성능 주장을 신중하게 해석해야 한다고 지적했다. 254
보다 독립적인 참고 지표로는 2025년 2월 초 보도된 이용자 참여형 Chatbot Arena 순위가 있다. Qwen2.5-Max는 1332점을 받아 전체 7위에 올랐고, 수학과 코딩 부문에서는 1위, 고난도 프롬프트 부문에서는 2위였다는 보도가 나왔다. 1012
이는 Qwen2.5-Max가 준최첨단급 경쟁 모델이었다는 판단을 뒷받침한다. 하지만 모든 작업에서 최고의 모델이었다는 뜻은 아니다. 신뢰성, 안전성, 도구 사용, 지연 시간, 데이터 거버넌스, 기업 지원 같은 실제 도입 요소까지 종합적으로 측정한 결과도 아니다.
GPT-4o·Claude·DeepSeek와의 비교
따라서 가장 방어적으로 말할 수 있는 결론은 다음과 같다.
- GPT-4o와 비교하면, 알리바바는 여러 벤치마크에서 우세하다고 보고했지만, 그 결과는 알리바바의 주장으로 특정 평가 항목과 함께 제시해야 한다. 29
- Claude 3.5 Sonnet과 비교하면, Qwen2.5-Max는 여러 평가에서 대체로 비슷한 수준으로 제시됐으며, 전 영역에서 앞섰다는 증거가 제시된 것은 아니다. 29
- DeepSeek-V3와 비교하면, 새롭게 주목받은 중국 경쟁자에 대응해 알리바바가 빠르게 출발했고, 여러 평가에서 우세하다고 주장한 점이 특히 중요했다. 25
결국 논점은 ‘중국 모델도 경쟁할 수 있는가’에서 ‘어떤 업무와 배포 방식, 언어, 예산에 어떤 모델이 가장 적합한가’로 이동했다.
기존 Qwen2.5 제품군과의 관계
Qwen2.5-Max는 Qwen2.5 세대를 확장했지만, 제품군 안에서 맡은 역할은 달랐다. 기존 제품군은 실험과 경량 배포에 적합한 소형 모델부터 720억 개 파라미터의 플래그십까지 다양한 오픈 웨이트 선택지를 제공하는 데 초점을 맞췄다. 132
Max는 여기에 고성능 호스팅 옵션을 더했다. 알리바바는 플래그십 모델의 가중치와 정확한 구조, 학습 산출물을 모두 공개하지 않고도 최첨단 경쟁 의지를 보여줄 수 있었다. 이는 단순한 ‘오픈 소스 대 폐쇄형’ 구도가 아니라, 공개성이 개발자를 끌어들이고 호스팅 모델이 상업적 유통을 담당하는 포트폴리오 전략에 가깝다.
Qwen 생태계는 중국어와 영어를 중심으로 스페인어·프랑스어·일본어 등 여러 언어와 코딩 활용 사례도 강조했다. 40 아시아와 글로벌 시장을 함께 상대하는 기업에는 영어 벤치마크에서의 작은 점수 차이보다 실제 다국어 처리와 현지화가 더 중요한 판단 기준이 될 수 있다.
Qwen3가 더 분명하게 보여준 방향
알리바바는 2025년 4월 Qwen3를 오픈 웨이트 제품군으로 출시했다. 초기 제품에는 0.6B부터 32B까지 6개의 밀집형 모델과 2개의 MoE 모델이 포함됐으며, 그중 하나는 전체 235B 파라미터와 22B 활성 파라미터를 갖췄다. 모델은 Hugging Face, GitHub, ModelScope 등을 통해 전 세계에 공개됐다. 171831
Qwen3는 Qwen 포트폴리오의 논리를 더 선명하게 보여줬다. 알리바바는 프리미엄 또는 특화 기능을 관리형 서비스로 제공하면서도, 개발자가 직접 실행하고 조정할 수 있는 다양한 모델을 공개할 수 있었다. Model Studio는 실험 단계에서 관리형 배포 단계로 넘어가는 클라우드 측 경로가 됐다. 1718
생태계 확장은 가중치 공개에만 그치지 않았다. 알리바바는 이후 Apple 하드웨어에서 구동할 수 있는 양자화 Qwen3 변형, AMD Instinct MI300X GPU에서의 대형 Qwen3 모델 지원, Arm 기반 모바일 기기를 위한 경량 모델도 소개했다. 22 모델 경쟁은 사전 학습 규모만으로 결정되지 않는다. 클라우드, 가속기, 노트북, 엣지 기기에서 얼마나 쉽게 실행할 수 있는지도 경쟁력의 일부다.
왜 글로벌 최첨단 모델 경쟁이 더 치열해졌나
Qwen2.5-Max 출시는 세 가지 측면에서 경쟁 압력을 높였다.
1. 중국의 경쟁이 한 기업의 돌풍이 아님을 보여줬다
DeepSeek-V3는 이미 중국이 고성능 모델을 만들 수 있다는 기존 가정에 도전했다. 알리바바의 대응은 DeepSeek만이 중국에서 준최첨단 모델을 개발할 수 있는 주체가 아니라는 점을 보여줬다. 기존 모델 제품군과 클라우드 플랫폼을 보유한 대형 기업이 빠르게 대응하고, 강한 성능을 내세우며, 기존 유통망을 통해 모델을 공급할 수 있었던 것이다. 2
2. 모델의 유통과 배포가 품질의 일부가 됐다
모델의 상업적 가치는 벤치마크 점수만으로 결정되지 않는다. 개발자는 API 접근성, 배포 선택지, 다국어 성능, 하드웨어 지원, 통합 도구, 미세조정과 자체 호스팅 가능성도 고려한다. 알리바바는 Qwen 제품군과 Model Studio를 통해 이 여러 경로를 결합했다. 11722
3. 더 저렴하고 유연한 대안의 설득력이 커졌다
코딩 보조, 번역, 검색증강생성, 고객 지원, 사내 업무용 코파일럿에 충분히 쓸 수 있는 모델이라면, 구매자는 모든 최첨단 평가에서 절대적인 1위를 차지한 모델을 반드시 선택할 필요가 없다. 오픈 웨이트, 효율적인 MoE 구조, 클라우드 접근성은 모델이 시장 전체를 압도하지 않더라도 도입 장벽을 낮출 수 있다.
이는 Anthropic을 비롯한 고가의 폐쇄형 모델 제공업체가 ‘최첨단’이라는 표현만으로 가격을 정당화하기 어렵게 만든다. 앞으로는 신뢰성, 안전성, 도구 사용, 긴 컨텍스트 처리, 기업용 통제 기능, 서비스 품질에서 측정 가능한 우위를 입증해야 한다. 당시 보도 역시 중국 모델이 성능 격차를 좁히는 동시에 비용과 접근성에서 공격적으로 경쟁하고 있다고 전했다. 47
가장 가능성 높은 결과는 즉각적인 대체보다 시장 세분화다. 가장 까다로운 사용자는 여전히 최고 성능의 폐쇄형 모델에 비용을 지불할 수 있다. 반면 비용과 데이터 통제, 현지화가 중요한 기업은 중국계 호스팅 모델이나 오픈 웨이트 대안을 선택할 가능성이 커진다.
‘Ox Alpha’는 어떻게 봐야 하나
제공된 근거만으로는 Ox Alpha라는 중국 최첨단 모델이 DeepSeek-V3나 Qwen2.5-Max에 필적하는 공식 출시 시스템이었다고 확인하기 어렵다. 따라서 이는 중국 AI 역량을 평가하는 증거라기보다 검증되지 않은 명칭이나 추측으로 다뤄야 한다.
그 불확실성이 더 큰 결론을 바꾸지는 않는다. Qwen2.5-Max가 중요했던 이유는 DeepSeek와 다른 중국 개발사들과 함께 AI 최전선을 다극화했기 때문이다. 경쟁의 무기는 더 큰 모델 하나에만 있지 않았다. 효율적인 MoE 구조, 오픈 웨이트, 다국어 지원, 클라우드 API, 하드웨어 이식성, 그리고 모델을 글로벌 개발자 생태계로 확장하는 능력이 모두 경쟁 요소가 됐다.