Qwen 3.8 Flash Next는 완성형 플래그십이 아니라, 차세대 Qwen 4 아키텍처를 미리 시험하는 오픈 웨이트 개발자용 프리뷰로 소개되고 있다. 전체 파라미터는 1250억 개지만 토큰당 약 60억 개만 활성화하는 멀티모달 Mixture of Experts(MoE) 구조를 채택한 것으로 알려졌다.
연구 답변

Create a landscape editorial hero image for this Studio Global article: What is Alibaba’s planned Qwen 3.8 Flash Next release, how does its multimodal Mixture of Experts architecture (125 billion total parameters. Article summary: Qwen 3.8 Flash Next is being positioned as an early, open weight developer test of the architecture intended for Qwen 4—not as Alibaba’s finished flagship.. Topic tags: general web, agents, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thum
Qwen 3.8-Flash-Next는 알리바바가 완성된 차세대 대표 모델로 내놓는 제품이라기보다, 향후 Qwen 4에 적용할 아키텍처를 개발자들이 먼저 시험해보도록 공개하는 초기 오픈 웨이트 모델로 보는 편이 정확하다. 핵심 메시지는 거대한 모델 용량을 유지하면서도 실제 연산량은 크게 줄여, 특히 코딩 작업에서 높은 성능 대비 효율을 달성하겠다는 것이다. 다만 가중치와 상세 기술 문서, 독립 평가가 모두 확인되기 전까지 성능과 비용 관련 수치는 알리바바 측의 보고로 받아들여야 한다. 9
보고된 설계는 네이티브 멀티모달 Mixture-of-Experts(MoE) 모델이다. 전체 파라미터 규모는 1250억 개이며, 이 가운데 510억 개가 N-gram 임베딩 파라미터로 구성된다. 하지만 각 토큰을 처리할 때 실제로 활성화되는 파라미터는 약 60억 개에 그친다. 9
MoE는 모든 파라미터를 매번 사용하는 일반적인 밀집형 모델과 달리, 입력 토큰의 특성에 따라 일부 전문가 네트워크만 선택해 통과시키는 방식이다. 따라서 모델 전체로는 다양한 전문 능력을 보유하면서도, 추론 과정에서는 필요한 부분만 계산할 수 있다. 이론적으로는 비슷한 총 규모의 밀집형 모델보다 부동소수점 연산량과 메모리 대역폭 부담, 서비스 비용을 줄이는 데 유리하다.
여기에 대규모 N-gram 임베딩 테이블을 결합하면 자주 등장하는 토큰이나 패턴을 빠르게 조회하는 데 도움이 될 수 있다. 다만 이 구조가 실제 학습 비용과 응답 속도를 얼마나 줄이는지는 하드웨어 구성, 라우팅 방식, 배치 크기, 문맥 길이에 따라 달라진다.
희소한 전문가 분화는 코딩 작업과 궁합이 좋을 수 있다. 서로 다른 전문가가 프로그래밍 언어의 문법, 대규모 저장소 구조, 디버깅, 도구 호출, 장문 코드 문맥 등을 나눠 학습할 여지가 있기 때문이다.
알리바바가 말하는 ‘Qwen 3.7-Plus 학습 비용의 약 9분의 1로 최전선에 가까운 성능’이라는 주장은, 희소 라우팅과 새로운 아키텍처, 임베딩 설계를 통해 달성하려는 효율성 목표로 해석하는 것이 안전하다. 이것만으로 모든 벤치마크나 실제 개발 환경에서 최고 수준의 폐쇄형 모델과 동등하다는 뜻은 아니다. 특히 코딩 에이전트의 장시간 작업, 오류 수정, 도구 사용 능력은 독립적인 평가가 나와야 판단할 수 있다.
Flash-Next라는 이름과 공개 방식은 호환성과 생태계 확장을 염두에 둔 출시라는 인상을 준다. 개발자는 Qwen 4가 정식으로 등장하기 전에 차세대 모델의 미세 조정 방식, 추론 프레임워크, 멀티모달 파이프라인을 점검할 수 있다. 9
반대로 최종 플래그십 모델에는 더 많은 학습, 강화된 사후 학습, 폭넓은 안전성 검토, 추가 변형 모델, 최종 벤치마크 검증이 들어갈 가능성이 있다. 따라서 Flash-Next의 초기 결과가 곧 Qwen 4의 최종 성능을 의미한다고 보기는 어렵다.
알리바바는 최근 Qwen3.8-27B도 공개했다. 이 모델은 270억 개 파라미터급 네이티브 멀티모달 모델로, 기본 26만 2144토큰의 문맥 창을 지원하며 최대 100만 토큰까지 확장할 수 있다고 소개됐다. 또한 Apache 2.0 라이선스로 제공돼 상대적으로 폭넓은 상업적 활용을 겨냥한다. 6
반면 고성능 제품군인 Qwen3.8-Max의 가중치에는 일반적인 Apache 2.0이 아닌 별도의 더 제한적인 라이선스가 적용된 것으로 보도됐다. 12 이는 한쪽에서는 소형·중형 모델의 광범위한 채택을 유도하고, 다른 쪽에서는 가장 많은 컴퓨팅 자원이 필요한 플래그십급 모델에 대한 상업적 통제력을 유지하려는 구도로 읽힌다.
모델 가중치를 공개했다고 해서 모든 기업이 아무 조건 없이 사용할 수 있다는 뜻은 아니다. Max 또는 Flash-Next 라이선스에 일정 규모 이상의 사용자 수나 매출 기준, 별도 계약 조항, 대규모 상업 서비스에 대한 수익 공유 의무가 포함돼 있다면 이는 ‘오픈’이라는 표현의 실질적 범위를 제한할 수 있다.
현재 확인 가능한 보도는 Max에 라이선스 제한이 있다는 점을 뒷받침하지만, 수익 공유가 언제 발동되는지와 정확한 계약 조건은 실제 라이선스 원문을 확인해야 한다. 따라서 대형 상업 이용자에게 수익 공유가 반드시 요구된다는 주장은 현 단계에서 확정된 사실로 단정하기 어렵다. 12
Qwen 모델 공개는 단순한 연구 성과 발표를 넘어 알리바바의 ‘풀스택’ AI 전략과 연결된다. 개발자들이 접근하기 쉬운 Qwen 모델을 널리 보급해 생태계를 키우고, 그 위에서 알리바바 클라우드의 API·컴퓨팅·데이터센터 수요를 확대하겠다는 구상이다. 알리바바는 홍콩 주식 배치로 조달한 자금을 ‘풀스택’ AI 역량에 투입하겠다고 밝혔다. 2
알리바바는 7100만 주가 아니라 7억 1000만 주를 주당 112.70홍콩달러에 발행해 총 800억 홍콩달러, 약 102억 달러를 조달했다. 3 발행가는 직전 종가보다 8.4% 낮았고, 주문 규모는 약 280억 달러에 달한 것으로 전해졌다. 4
투자자 입장에서 계산은 간단하다. 신주 발행은 AI 인프라 투자를 빠르게 늘릴 자금을 제공하지만, 기존 주주의 지분 가치를 희석한다. 동시에 막대한 AI 지출이 클라우드, API, 애플리케이션 매출로 충분히 빠르게 전환되지 않으면 투자 회수와 실행 능력에 대한 부담이 커진다. 4
중국의 오픈 웨이트 AI 경쟁에서 중요한 것은 단순히 특정 벤치마크에서 경쟁 모델을 앞서는 일이 아니다. 개발자, 파생 모델 미세 조정, 클라우드 작업량, 추론 도구와 개발 프레임워크 지원을 먼저 확보하는 것이 핵심이다. 알리바바는 DeepSeek 같은 경쟁자보다 넓은 생태계를 구축하려는 셈이다.
‘Ox Alpha’처럼 아직 출처가 분명한 출시 발표나 가중치, 기술 보고서가 없는 시스템에 대한 언급은 추측으로 남겨둬야 한다. 마찬가지로 Qwen 생태계가 460개가 넘는 모델과 119개 언어를 지원한다는 수치는 알리바바가 제시하는 생태계 지표로 봐야 하며, 단일 Qwen 모델의 성능을 측정하는 수치로 해석해서는 안 된다.
알리바바의 전략적 베팅은 분명하다. 학습과 추론 비용이 낮은 희소 멀티모달 모델을 통해 한편으로는 오픈 모델의 대중적 채택을 끌어내고, 다른 한편으로는 프리미엄 클라우드 서비스 시장에서 경쟁력을 확보하려는 것이다.
그러나 Qwen 3.8-Flash-Next가 실제 코딩 품질과 학습 비용 절감 효과를 입증할지는 아직 열려 있다. 독립 벤치마크와 실제 개발 워크플로 평가가 필요하며, 대기업이 모델을 도입할 때 적용되는 라이선스 조건도 함께 확인해야 한다. 결국 이 모델의 진짜 가치는 파라미터 수 자체보다, 적은 활성 연산량으로 어느 수준의 결과를 내고 어떤 조건으로 배포할 수 있느냐에 달려 있다.
Studio Global AI
이 페이지에는 Studio Global 내에서 계속할 수 있는 소스 기반 답변이 포함되어 있습니다.
Qwen 3.8 Flash Next는 완성형 플래그십이 아니라, 차세대 Qwen 4 아키텍처를 미리 시험하는 오픈 웨이트 개발자용 프리뷰로 소개되고 있다.
Qwen 3.8 Flash Next는 완성형 플래그십이 아니라, 차세대 Qwen 4 아키텍처를 미리 시험하는 오픈 웨이트 개발자용 프리뷰로 소개되고 있다. 전체 파라미터는 1250억 개지만 토큰당 약 60억 개만 활성화하는 멀티모달 Mixture of Experts(MoE) 구조를 채택한 것으로 알려졌다.
알리바바는 Qwen 3.7 Plus 대비 약 9분의 1 수준의 학습 비용으로 최전선에 가까운 성능을 목표로 한다고 주장하지만, 아직 독립적인 검증이 충분하지 않다.