Qwen3.8 Flash는 입력 토큰 100만 개당 0.16달러, 출력 토큰 100만 개당 0.47달러를 내세운 멀티모달 호스팅 모델이며, Qwen3.8 Flash Next는 Qwen4 아키텍처를 미리 보여주는 오픈 웨이트 모델이다. Flash Next는 1,250억 개의 주 모델 파라미터와 510억 개의 N 그램 임베딩을 갖추면서도 토큰당 60억 개의 파라미터만 활성화하는 희소 혼합 전문가 구조를 사용한다.
연구 답변

Create a landscape editorial hero image for this Studio Global article: What did Alibaba announce with the release of the multimodal Qwen3.8-Flash and the open-weight Qwen3.8-Flash-Next prototype for its future Q. Article summary: Alibaba is pairing a low-cost production model with an open-weight architectural preview: it is trying to make Qwen a widely deployed cloud service while seeding the developer ecosystem for the forthcoming Qwen4 generati. Topic tags: general, documentation, general web, user generated, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
알리바바의 Qwen 팀이 서로 닮았지만 역할은 다른 두 모델을 내놨다. Qwen3.8-Flash는 QwenCloud에서 제공될 상용 멀티모달 모델이고, Qwen3.8-Flash-Next는 향후 Qwen4 제품군의 아키텍처를 미리 보여주는 오픈 웨이트 프리뷰다. 515
이번 발표의 핵심은 단순한 신제품 추가가 아니다. 알리바바는 저렴한 API로 기업용 추론 수요를 끌어들이는 동시에, 오픈 웨이트로 개발자들이 Qwen의 구조와 도구에 익숙해지도록 만들려 한다. 다만 성능과 비용에 관한 주요 수치는 알리바바 또는 모델 카드가 제시한 자료에 기반하며, 독립적인 검증 결과와는 구분해 봐야 한다.
알리바바는 Qwen3.8-Flash를 코딩, 문서·사무 작업, 긴 문맥 처리에 적합한 멀티모달 혼합 전문가(MoE) 모델로 설명한다. 기본 컨텍스트 창은 26만 2,144토큰이며, 대용량 파일이나 긴 대화, 연구 자료를 다룰 때는 최대 100만 토큰까지 확장할 수 있다고 밝혔다. 515
QwenCloud에 발표된 가격은 입력 토큰 100만 개당 0.16달러, 출력 토큰 100만 개당 0.47달러다. 알리바바는 생산용 API가 곧 제공될 것이라고 밝혔고, 이후 보도에서는 QwenCloud가 이 가격으로 모델을 서비스한다고 전했다. 415
이 가격은 Flash를 단순한 모델 출시가 아니라 클라우드 인프라 상품으로 보게 만든다. 문서 처리, 코딩 에이전트, 대량 자동화처럼 토큰 사용량이 많은 작업도 기존 최첨단 모델보다 낮은 비용으로 시험할 수 있기 때문이다.
Flash-Next는 단순히 API 요금제가 다른 모델이 아니다. Qwen4에 적용될 아키텍처 아이디어를 미리 공개하는 오픈 웨이트 모델이다. 모델 저장소에는 주 모델 파라미터 1,250억 개, 별도의 N-그램 임베딩 510억 개, 토큰당 실제로 활성화되는 파라미터 60억 개가 기재돼 있다.
이는 희소 혼합 전문가 구조다. 모델 전체에는 대규모 파라미터 풀이 있지만, 각 토큰을 처리할 때는 그중 일부만 사용한다. 이론적으로는 조밀한 대형 모델보다 토큰당 연산량을 낮추면서도 더 큰 모델 용량을 유지할 수 있다.
공개된 모델 카드에 따르면 기본 컨텍스트 창은 26만 2,144토큰이며, YaRN을 활용하면 100만 토큰까지 확장할 수 있다. 다만 Flash와 Flash-Next는 별개의 릴리스인 만큼, 실제 배포를 계획하는 개발자는 해당 버전의 정확한 한도와 메모리 요구량, 서비스 방식을 별도로 확인해야 한다. 13
| 항목 | Qwen3.8-Flash | Qwen3.8-Flash-Next |
|---|---|---|
| 주된 역할 | 운영 환경용 호스팅 모델 | Qwen4 아키텍처를 보여주는 오픈 웨이트 프리뷰 |
| 용도 | 멀티모달 코딩, 사무 업무, 에이전트 워크플로 | 멀티모달 코딩, 사무 업무, 장기 에이전트 작업 |
| 컨텍스트 | 기본 26만 2,144토큰, 최대 100만 토큰으로 확장 가능 | 기본 26만 2,144토큰, YaRN으로 최대 100만 토큰으로 확장 가능하다고 보고됨 |
| 호스팅 가격 | 입력 100만 토큰당 0.16달러, 출력 100만 토큰당 0.47달러 | 오픈 웨이트에 대한 알리바바 API 가격은 정해지지 않음 |
| 핵심 구조 수치 | 멀티모달 MoE 모델로 소개됨 | 주 모델 1,250억 개, N-그램 임베딩 510억 개, 토큰당 60억 개 활성화 |
| 이용 가능 시점 | 2026년 8월 26일 발표, 생산용 API 출시 예정 | 2026년 8월 하순 저장소와 모델 카드 공개 |
Flash-Next의 저장소와 모델 카드가 생산용 API 발표 전후에 등장한 점도 두 제품의 관계를 보여준다. 개발자에게 아키텍처를 먼저 공개한 뒤, 알리바바가 관리형 클라우드 서비스를 제공하는 순서다. 7
알리바바는 새 Flash 라인의 훈련 비용이 Qwen3.7-Plus의 약 9분의 1에 불과하면서도 코딩과 사무 작업을 중심으로 성능이 향상됐다고 주장한다. 515
상당히 큰 폭의 절감이지만, 이는 독립적으로 감사된 비용 연구가 아니라 회사가 제시한 비교 수치다. 실제 훈련 비용은 하드웨어 가격, 훈련 기간, 데이터 준비, 실패한 실험, 비용 산정 방식 등에 따라 달라질 수 있다.
다만 희소 구조는 알리바바가 낮은 추론·훈련 비용을 강조하는 데 기술적 근거를 제공한다. 매 토큰마다 전체 파라미터가 아니라 일부만 활성화되기 때문이다. 사용자 입장에서 직접 확인할 수 있는 것은 API 가격이고, ‘9분의 1’이라는 수치는 외부의 동일 조건 측정 결과가 나오기 전까지는 전략적 신호로 보는 편이 안전하다.
알리바바의 Flash-Next 모델 카드에는 다음과 같은 결과가 제시됐다.
모델 카드의 비교표에서 Flash-Next는 Claude Opus 4.6 Max의 기재된 결과보다 SWE-bench Pro, SWE-bench Multilingual, CoWorkBench, JobBench에서 높은 점수를 기록했다. 예를 들어 SWE-bench Pro는 62.5 대 53.4, SWE-bench Multilingual은 81.0 대 77.5로 제시됐다.
이 수치는 소프트웨어 엔지니어링과 업무형 에이전트 작업에서 강한 성능을 보일 가능성을 시사한다. 그러나 Flash-Next가 모든 영역에서 Claude나 다른 최첨단 모델보다 우수하다는 뜻은 아니다. 수치는 공급업체가 공개한 결과이고, 평가 방식과 실행 환경이 다를 수 있다. 또한 Flash-Next의 벤치마크를 모든 운영용 Qwen3.8-Flash 배포 환경의 성능으로 그대로 간주해서도 안 된다.
자료는 Flash-Next를 오픈 웨이트 모델로 설명한다. 한 공개 모델 요약에는 라이선스가 qwen-community-1.0으로 기재돼 있지만, 상업적 재배포나 파인튜닝, 자체 호스팅을 계획하는 개발자는 공식 저장소와 모델 카드의 최신 라이선스를 직접 확인해야 한다. 6
‘오픈 웨이트’라는 표현이 모든 사용을 제한 없이 허용한다는 의미는 아니다. 재배포, 저작자 표시, 허용되는 사용 방식, 파생 모델과 관련한 조건이 라이선스에 포함될 수 있다. 현재 자료만으로는 릴리스의 모든 구성 요소에 대한 상업적 권한을 단정하기 어렵다.
이번 모델 출시는 알리바바가 AI 인프라 확대에 대규모 자금을 투입하는 시점에 나왔다. 로이터에 따르면 알리바바의 분기 클라우드 매출은 45% 증가했지만, 자본 지출은 75% 늘었고 분기 순이익은 75% 감소했다. 18
로이터는 알리바바가 AI 사업 자금을 마련하기 위해 홍콩에서 100억 달러 규모의 주식 배치를 추진한다고도 보도했다. 클라우드와 AI 컴퓨팅 수요는 커지고 있지만, 설비를 구축하는 비용이 당장의 이익과 현금흐름을 압박하는 구조다.
이런 환경에서는 낮은 가격이 단기적인 모델 마진을 줄이더라도 전략적으로 의미가 있다. 저렴한 추론 비용은 알리바바 클라우드의 이용률을 높이고, 기업 워크로드를 끌어오며, 긴 문맥 애플리케이션을 만드는 개발자에게 Qwen을 기본 선택지로 제시할 수 있다.
Flash-Next는 알리바바 API 바깥으로 Qwen의 영향력을 넓힌다. 개발자는 모델을 내려받아 시험하고 수정하거나 자체 서버에서 운영할 수 있다. 당장 QwenCloud를 사용하지 않더라도 Qwen의 도구와 아키텍처에 익숙해지는 셈이다.
이 전략은 알리바바에 여러 이점을 줄 수 있다.
다만 현재 자료는 이것이 알리바바의 전략적 방향이라는 점을 뒷받침할 뿐, Qwen이 중국 개발자 생태계에서 이미 선두를 확정했다는 증거는 제공하지 않는다. 활성 개발자 수, 다운로드 수, 기업 배포 건수와 같은 검증된 최신 수치도 확인되지 않는다.
Qwen3.8-Flash와 Flash-Next는 하나의 제품 전략을 두 방향으로 나눈 결과에 가깝다. Flash는 저렴한 가격과 긴 컨텍스트를 앞세운 클라우드 서비스이고, Flash-Next는 Qwen4를 향한 오픈 생태계와 아키텍처 실험이다.
입력 토큰 100만 개당 0.16달러의 가격, 최대 100만 토큰 컨텍스트, 더 큰 모델 안에서 토큰당 60억 개 파라미터만 활성화하는 구조, 그리고 코딩·에이전트 작업에서 공개된 강한 벤치마크는 추론 비용을 주시하는 개발자에게 중요한 신호다. 4
그러나 생산용 모델과 프리뷰 모델은 구분해야 한다. 훈련 비용 9분의 1이라는 주장은 독립 검증을 거치지 않았고, 벤치마크 비교도 공급업체가 공개한 결과다. Qwen의 개발자 채택 규모 역시 현재 자료만으로 수치화할 수 없다.
현재 알리바바는 중국 AI 경쟁에서 자금력과 클라우드 사업을 갖춘 유력 경쟁자로 보인다. 하지만 독보적인 승자로 단정할 단계는 아니다. AI 인프라에 대한 대규모 지출로 단기 수익성이 악화되고 자금 조달 필요성까지 커지는 가운데, 알리바바는 Qwen을 당장의 수익원이 아니라 장기적인 클라우드·개발자 생태계 사업으로 키우는 선택을 하고 있다. 18
Studio Global AI
이 페이지에는 Studio Global 내에서 계속할 수 있는 소스 기반 답변이 포함되어 있습니다.
Qwen3.8 Flash는 입력 토큰 100만 개당 0.16달러, 출력 토큰 100만 개당 0.47달러를 내세운 멀티모달 호스팅 모델이며, Qwen3.8 Flash Next는 Qwen4 아키텍처를 미리 보여주는 오픈 웨이트 모델이다.
Qwen3.8 Flash는 입력 토큰 100만 개당 0.16달러, 출력 토큰 100만 개당 0.47달러를 내세운 멀티모달 호스팅 모델이며, Qwen3.8 Flash Next는 Qwen4 아키텍처를 미리 보여주는 오픈 웨이트 모델이다. Flash Next는 1,250억 개의 주 모델 파라미터와 510억 개의 N 그램 임베딩을 갖추면서도 토큰당 60억 개의 파라미터만 활성화하는 희소 혼합 전문가 구조를 사용한다.
이번 출시는 클라우드 매출이 45% 늘어난 가운데 자본 지출이 75% 증가하고 분기 순이익이 75% 감소한 알리바바의 장기 AI·클라우드 전략과 맞물려 있다.