2026년 8월 26일 공개된 Qwen3.8 Flash Next는 Qwen4 최종 제품이 아니라, 차세대 아키텍처를 미리 공개한 오픈 웨이트 멀티모달 MoE 모델입니다. Gated DeltaNet과 Qwen Sparse Attention을 결합한 구조는 긴 문맥에서 필요한 정보만 선택하도록 설계됐으며, 기본 문맥 길이는 26만2144토큰, YaRN 확장 시 최대 100만 토큰으로 제시됩니다.
연구 답변

Create a landscape editorial hero image for this Studio Global article: What is Alibaba’s Qwen3.8-Flash—also released as Qwen3.8-Flash-Next—and why is it significant as an open multimodal mixture-of-experts techn. Article summary: Qwen3.8-Flash, released as the open-weight Qwen3.8-Flash-Next, is Alibaba Qwen’s multimodal mixture-of-experts (MoE) technical-preview model for the architecture intended to underpin Qwen4. It matters less as a conventio. Topic tags: general, news, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers
알리바바의 AI 연구팀 Qwen은 2026년 8월 26일 Qwen3.8-Flash-Next를 공개했습니다. 관련 보도는 다음 날인 8월 27일 이어졌습니다. 이 모델은 Qwen4 최종 플래그십이 아니라, Qwen이 향후 Qwen4 제품군에 적용할 예정이라고 밝힌 아키텍처를 연구자와 개발자가 직접 살펴볼 수 있도록 공개한 초기 프리뷰입니다. 1
2
15
이 모델의 핵심은 규모와 실제 연산량의 간극입니다. 메인 네트워크에는 1250억 개 파라미터가 들어가고, 여기에 510억 개 규모의 N-gram 임베딩 구성요소가 추가됩니다. 하지만 토큰을 처리할 때 실제로 활성화되는 파라미터는 약 60억 개에 그칩니다. 모든 파라미터를 매번 계산하는 고밀도 모델보다 큰 용량은 유지하면서도 토큰당 연산 부담을 줄이려는 설계입니다. 4
15
이름이 비슷해 혼동하기 쉽지만 Qwen3.8-Flash와 Qwen3.8-Flash-Next는 같은 형태의 공개물이 아닙니다. Qwen3.8-Flash는 서비스와 API를 염두에 둔 production 모델을 가리키고, Qwen3.8-Flash-Next는 그와 연관된 아키텍처를 공개한 오픈 웨이트 모델입니다. 보도에 따르면 이 모델은 Qwen4에 적용될 차세대 기술을 바탕으로 한 멀티모달 혼합 전문가, 즉 MoE 모델입니다. 1
2
15
따라서 이번 공개를 Qwen4 정식 출시로 해석해서는 안 됩니다. 현재 공개된 것은 완성된 Qwen4 제품군의 성능을 입증하는 결과라기보다, 개발자들이 미리 추론 도구와 지원 생태계를 준비하고 실제 작업에서 설계를 검증할 수 있도록 한 기술 프리뷰이자 개발 청사진에 가깝습니다. 2
3
15
여기서 100만 토큰이라는 수치는 기본 문맥 길이와 구분해야 합니다. 일반적인 서빙 설정의 네이티브 문맥 한도는 26만2144토큰이며, 100만 토큰은 YaRN 확장을 적용한 구성입니다. 즉 모든 환경에서 기본적으로 100만 토큰을 지원한다는 뜻으로 받아들이기보다는, 별도의 확장 설정으로 이해하는 편이 정확합니다. 1
4
16
Qwen3.8-Flash-Next는 **Gated DeltaNet(GDN)**과 **Qwen Sparse Attention(QSA)**을 결합합니다. GDN은 이전 문맥의 정보를 압축해 유지하도록 설계됐고, QSA는 전체 대화나 문서에 동일한 방식으로 어텐션을 적용하는 대신 가벼운 인덱스를 이용해 관련성이 높은 작은 문맥 블록을 골라냅니다. 4
문맥이 길어질수록 과거의 모든 토큰을 매번 정밀하게 비교하는 방식은 계산량과 지연시간을 크게 늘립니다. Qwen은 100만 토큰 시퀀스에서 이 하이브리드 구조가 프리필 최대 7.6배, 디코딩 최대 4.9배 빠른 결과를 냈다고 밝혔습니다. 다만 이 수치는 특정 하드웨어와 구현, 시퀀스 구성 및 벤치마크 조건에 따른 업체 측 결과이므로 모든 배포 환경에 그대로 적용되는 보편적 수치로 보기는 어렵습니다. 4
별도의 N-gram 임베딩 구성요소는 토큰마다 전체 파라미터를 동일하게 처리하지 않고도 모델의 표현 용량을 늘리는 역할을 합니다. Qwen의 설계는 이 임베딩 테이블을 호스트 메모리로 오프로드하고, 필요한 데이터를 비동기 방식으로 미리 가져와 전송과 모델 계산을 겹쳐 수행하는 방식도 지원합니다. 4
대규모 모델을 운영하는 입장에서는 단순한 파라미터 수만큼이나 메모리 배치와 데이터 이동이 중요합니다. 특히 긴 문서 처리나 대량 배치 작업에서는 GPU 메모리 사용량, 메모리 대역폭, 전송 지연이 실제 비용과 처리량을 좌우할 수 있습니다.
이번 프리뷰는 어텐션 블록만 바꾼 체크포인트가 아닙니다. Qwen은 Muon 옵티마이저를 사용하고, AdamW와의 상호작용 및 파라미터 처리 방식을 조정했으며, 해당 모델 설계에 맞춘 새로운 스케일링 법칙도 도출했다고 설명했습니다. 4
이는 전체 모델 용량은 크게 유지하되 실제 토큰 처리 비용은 낮추는 모델을 어떻게 학습하고 확장할지에 관한 더 넓은 설계 레시피를 공개적으로 시험하는 시도라고 볼 수 있습니다.
Qwen은 Qwen3.8-Flash의 학습 비용이 이전 모델인 Qwen3.7-Plus의 약 9분의 1 수준이었다고 주장하면서, 코딩과 오피스 업무 성능도 개선됐다고 밝혔습니다. 로이터 역시 Qwen이 학습 비용 절감과 코딩·오피스 작업 성능 향상을 함께 내세웠다고 보도했습니다. 1
4
공개 자료에는 다음과 같은 벤치마크 점수가 제시돼 있습니다.
Qwen은 이 결과가 가성비 영역에서 DeepSeek V4 Flash보다 앞선다고 설명합니다. 그러나 해당 비교는 업체가 공개한 수치에 기반한 것으로, 동일한 하드웨어와 평가 조건에서 독립적으로 재현됐다는 근거는 제공된 자료만으로 확인하기 어렵습니다. 4
API 형태의 production 모델인 Qwen3.8-Flash에는 입력 토큰 100만 개당 1위안, 출력 토큰 100만 개당 3위안이라는 가격이 제시됐습니다. 공개 자료에는 피크·비피크 시간대에 따른 별도 가격 구분은 언급되지 않았습니다. 다른 모델과의 가격을 직접 비교할 때는 모델 버전, 캐시 할인, 문맥 길이, 서비스 등급, 필요한 출력 품질이 다를 수 있다는 점을 고려해야 합니다. 1
4
오픈 웨이트 공개의 가장 큰 의미는 Qwen4가 정식으로 등장하기 전에 개발자들이 아키텍처 변화에 대응할 시간을 얻는다는 데 있습니다. 개발자는 추론 도구를 미리 수정하고, 양자화와 서빙 방식을 시험하며, 자신의 데이터와 업무 흐름에서 모델이 실제로 어떻게 작동하는지 점검할 수 있습니다. 2
3
15
특히 다음과 같은 작업에서 설계의 장점이 시험될 가능성이 큽니다.
다만 이는 긴 문맥과 낮은 활성 파라미터 수라는 공개 설계에서 예상할 수 있는 활용 분야이지, 모든 실무 환경에서 다른 모델보다 우수하다는 보장은 아닙니다. 실제 비용과 성능은 하드웨어, 서빙 소프트웨어, 양자화 품질, 검색증강 방식, 작업의 입력·출력 구성에 따라 달라집니다.
Qwen3.8-Flash-Next가 중요한 이유는 Qwen이 아키텍처 방향을 비교적 이른 시점에 외부에 공개했다는 점입니다. 희소·압축 어텐션, 대규모 보조 임베딩, 낮은 활성 파라미터 수를 결합했을 때 품질 저하를 감수하지 않고 초장문 문맥 처리 비용을 낮출 수 있는지 개발자 커뮤니티가 직접 시험할 수 있게 됐습니다.
반면 속도 향상, 벤치마크 우위, 학습 비용 절감, 경쟁 모델 대비 가치와 관련한 강한 주장은 대부분 Qwen 또는 Qwen의 발표를 바탕으로 한 보도에서 나왔습니다. 하드웨어, 언어, 문맥 길이, 멀티모달 작업, 실제 에이전트 워크플로를 아우르는 독립 평가가 더 필요합니다.
가장 신중한 결론은 이렇습니다. Qwen3.8-Flash-Next는 모든 경쟁 모델을 능가한다고 단정할 제품이 아니라, 알리바바가 Qwen4를 위해 준비 중인 시스템 아키텍처를 개발자에게 먼저 공개한 멀티모달 MoE 기술 프리뷰입니다. 동시에 매우 긴 문맥을 더 효율적으로 처리하려는 접근법을 실제로 검증할 수 있는 공개 청사진이기도 합니다.
Studio Global AI
이 페이지에는 Studio Global 내에서 계속할 수 있는 소스 기반 답변이 포함되어 있습니다.
2026년 8월 26일 공개된 Qwen3.8 Flash Next는 Qwen4 최종 제품이 아니라, 차세대 아키텍처를 미리 공개한 오픈 웨이트 멀티모달 MoE 모델입니다.
2026년 8월 26일 공개된 Qwen3.8 Flash Next는 Qwen4 최종 제품이 아니라, 차세대 아키텍처를 미리 공개한 오픈 웨이트 멀티모달 MoE 모델입니다. Gated DeltaNet과 Qwen Sparse Attention을 결합한 구조는 긴 문맥에서 필요한 정보만 선택하도록 설계됐으며, 기본 문맥 길이는 26만2144토큰, YaRN 확장 시 최대 100만 토큰으로 제시됩니다.
학습 비용과 토큰당 추론 비용을 낮추는 것이 핵심 방향이지만, 속도 향상·벤치마크 우위·비용 절감 수치는 주로 Qwen이 공개한 결과인 만큼 독립적인 재검증이 필요합니다.