Qwen3.8 2.4T A95B는 총 2.4조 파라미터 가운데 토큰당 약 950억 개를 활성화하는 알리바바의 맥스급 오픈 웨이트 텍스트 MoE 모델이다. 기본 컨텍스트 길이는 262,144토큰이며, 일부 서빙 구성에서는 100만 토큰 컨텍스트가 문서화돼 있다.
게시자GPT-5.6 Terra로 편집GPT Image 2로 이미지 생성
연구 답변

Create a landscape editorial hero image for this Studio Global article: What is Alibaba’s Qwen3.8-2.4T-A95B, and what do its open-weight release, Qwen-Max-class status, 2.4-trillion-parameter/95-billion-active-pa. Article summary: Alibaba’s Qwen3.8-2.4T-A95B is an open-weight, text-generation release of its Qwen3.8-Max/“Max-class” flagship: a very large sparse Mixture-of-Experts (MoE) model rather than a model that can realistically be run like an. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
알리바바의 Qwen3.8-2.4T-A95B는 Qwen3.8-Max 플래그십 계열의 오픈 웨이트 모델이다. 핵심은 ‘2.4조 파라미터 모델을 누구나 쉽게 돌릴 수 있게 됐다’는 데 있지 않다. 기업과 연구팀이 초대형 모델의 가중치를 내려받아 직접 배포하고, 데이터 위치와 서빙 방식, 후속 학습을 통제할 선택지를 얻었다는 데 있다. 1
18
21
다만 이 선택지는 주로 클라우드 사업자, 대기업, 규제 산업, 대형 연구 조직처럼 분산 추론 역량을 갖춘 곳을 위한 것이다. 파라미터 수가 2.4조 개인 모델을 다룬다는 사실 자체는 오픈 웨이트가 됐어도 달라지지 않는다.
Qwen3.8-2.4T-A95B는 텍스트 생성용 희소 Mixture-of-Experts(MoE) 모델이다. 총 파라미터 수는 2.4조 개지만, 토큰 하나를 처리할 때 활성화되는 파라미터는 약 950억 개다. NVIDIA 문서에는 92개 레이어, 512개 라우팅 전문가, 상위 10개 전문가 선택 방식이 기재돼 있다. 18
21
MoE는 매 토큰마다 전체 파라미터를 모두 연산하지 않고 일부 전문가만 선택한다. 따라서 동급 총규모의 밀집형(dense) 모델보다 토큰당 연산량을 낮출 여지가 있다. 그러나 이는 가중치 전체를 저장하거나 여러 장비에 나눠 배치해야 하는 부담, 전문가 병렬화, 고속 네트워크, KV 캐시 메모리 문제를 없애지는 않는다.
아키텍처는 Gated DeltaNet과 게이트드 어텐션을 결합한다. 긴 컨텍스트 텍스트 작업을 겨냥한 구성이나, 실제 운영에서 중요한 것은 프롬프트 길이, 동시 요청 수, 정밀도 형식, 서빙 엔진을 포함한 엔드투엔드 성능이다. 1
19
네이티브 컨텍스트 길이는 262,144토큰이다. NVIDIA는 특정 배포 환경에서 100만 토큰 컨텍스트 윈도를 문서화했으며, 최대 출력은 약 131K 토큰으로 제시한다. 1
19
21
하지만 이 수치를 ‘100만 토큰 문서를 언제나 빠르고 저렴하게 처리한다’는 보장으로 읽어서는 안 된다. 긴 입력은 프리필(prefill) 연산량과 KV 캐시 부담을 크게 늘린다. 대규모 문서 검색, 장문 분석, 에이전트 실행 이력 처리에 쓰려는 팀이라면 실제 입력 길이와 동시성 패턴을 기준으로 벤치마크해야 한다.
이 모델은 reasoning_effort를 low, medium, xhigh로 설정할 수 있다. 속도·비용과 더 깊은 숙고 사이의 균형을 조절하기 위한 옵션이며, 공개 기본 설정은 사고 내용 보존을 강조한다. 1
따라서 코딩, 리서치 종합, 긴 문서 분석, 도구를 쓰는 에이전트 워크플로처럼 난도가 높은 텍스트 작업의 후보가 될 수 있다. 다만 에이전트는 모델 하나만으로 완성되지 않는다. 실제 서비스에는 애플리케이션 쪽의 도구 정의, 권한 경계, 실행 격리, 재시도, 관측성, 평가 체계가 필요하다.
공개 체크포인트의 분명한 제약도 있다. 텍스트 전용이며 사고 기능을 끌 수 없다고 알려져 있다. 이미지·영상 입력, 매우 낮은 지연시간의 비사고 경로, 관리형 내장 도구가 필요한 조직은 내려받는 A95B 체크포인트와 호스팅형 Qwen3.8-Max를 구분해야 한다. 3
8
21
오픈 웨이트는 데이터가 어디에 머무는지, 어떤 토폴로지로 배포하는지, 어떻게 맞춤화하고 후속 학습하는지를 더 직접적으로 통제하게 해 준다. NVIDIA NeMo AutoModel은 FSDP2, 전문가 병렬화, 파이프라인 병렬화를 이용한 전체 파라미터 파인튜닝 경로를 제공한다. 18
반대로 운영 난도는 매우 높다. NVIDIA NIM 문서의 지원 경로는 GB300-NVL72 전용이며 최소 4개 노드와 Kubernetes를 요구한다. NVIDIA Dynamo 레시피는 vLLM 또는 SGLang, FP8 가중치와 KV 캐시, 텐서 병렬화, KV 인지 라우팅을 사용한다. 문서화된 한 구성은 4개 노드에 걸친 GB300 GPU 16개를 사용한다. 19
21
이는 모든 배포의 절대적 최소 사양이 아니라 벤더가 지원하는 레시피다. 그래도 모델이 의도한 운영 환경이 일반 노트북·워크스테이션·보통의 단일 서버가 아니라는 점은 분명히 보여준다.
이 정도 크기의 모델은 인프라 설계가 사용 가능 여부를 결정한다.
NVIDIA는 Day-0 FP8 GB300 NVL72 구성에서 GPU당 초당 4,000토큰 이상, 사용자당 초당 350토큰 이상을 보고했다. 이는 특정 하드웨어·소프트웨어 구성에서 나온 벤더 측정치일 뿐, 모든 업무에 적용되는 프로덕션 성능 기대치는 아니다.
모델은 Apache-2.0이나 MIT가 아니라 맞춤형 Qwen3.8-Max License로 배포된다. 이 라이선스는 조건에 따라 사용, 수정, 배포, 호스팅, 파인튜닝, 파생물 제작 등 폭넓은 권리를 부여한다.
공개된 요약에 따르면 일정 매출 기준을 넘는 일부 Model-as-a-Service(MaaS) 및 AI 업무 보조 서비스에는 추가 의무가 적용될 수 있다. 상용 배포와 하위 배포에 영향을 줄 수 있으므로, 제품 출시 전 최신 라이선스 원문을 검토하고 필요하면 법률 자문을 받아야 한다. 3
10
호스팅형 Qwen3.8-Max는 A95B를 기반으로 하되, 비전 입력, 비사고 모드, 기본 100만 토큰 컨텍스트, 공식 내장 도구 같은 추가 기능을 제공하는 것으로 설명된다. 8
12
선택 기준은 비교적 명확하다.
즉, 공개 체크포인트는 호스팅 제품과 기능 대 기능으로 맞바꾸는 대체재가 아니다. 강력한 텍스트 기반 모델을 제공하지만, 제품 계층과 운영 인프라는 도입 조직이 직접 마련해야 한다.
Qwen은 A95B를 맥스급 모델로 포지셔닝하며 코딩·리서치·추론 중심 벤치마크에서 강한 결과를 제시한다. 이는 유용한 신호이지만, 모든 업무와 배포 환경에서 최선이라는 증거는 아니다. 6
도입 판단은 목표 언어, 도구 호출 순서, 검색·입력 길이, 출력 형식, 안전 요구사항, 지연시간 목표, 비용 한도를 포함한 자체 평가에서 나와야 한다. 대부분의 팀에 더 중요한 질문은 ‘950억 활성 파라미터가 얼마나 인상적인가’가 아니라, 그 능력 향상이 2.4조 파라미터 모델을 운영하는 비용과 복잡성을 상쇄하는가다.
Qwen3.8-2.4T-A95B는 Qwen 맥스급 2.4조 파라미터 MoE 텍스트 모델의 가중치를 직접 통제할 수 있게 했다는 점에서 중요한 오픈 웨이트 공개다. 희소 아키텍처는 비슷한 규모의 밀집형 모델보다 연산 부담을 낮출 수 있지만, 여전히 고도의 분산 시스템 프로젝트다.
충분한 자원을 가진 조직에는 맞춤형·주권형·플래그십급 텍스트 추론과 후속 학습의 경로가 될 수 있다. 반면 간단한 로컬 배포를 원하는 소규모 팀에는 더 작은 모델이나 관리형 엔드포인트가 대체로 현실적인 선택이다. 18
19
21
Studio Global AI
이 페이지에는 Studio Global 내에서 계속할 수 있는 소스 기반 답변이 포함되어 있습니다.
Qwen3.8 2.4T A95B는 총 2.4조 파라미터 가운데 토큰당 약 950억 개를 활성화하는 알리바바의 맥스급 오픈 웨이트 텍스트 MoE 모델이다.
Qwen3.8 2.4T A95B는 총 2.4조 파라미터 가운데 토큰당 약 950억 개를 활성화하는 알리바바의 맥스급 오픈 웨이트 텍스트 MoE 모델이다. 기본 컨텍스트 길이는 262,144토큰이며, 일부 서빙 구성에서는 100만 토큰 컨텍스트가 문서화돼 있다. 최대 출력 길이는 약 131K 토큰으로 제시된다.
오픈 웨이트라고 해서 가벼운 로컬 모델은 아니다. NVIDIA의 지원 구성은 최소 4개 노드, 16개 GB300 GPU, Kubernetes 등 대규모 분산 운영 환경을 보여준다.