Qwen3.8 2.4T A95Bは、AlibabaのQwen Max級モデルをオープンウェイトで提供するテキスト生成用MoE。総パラメータ数は2.4兆、各トークンで有効になるのは約950億で、512のエキスパートを使う。 ネイティブのコンテキスト長は26万2,144トークン。特定の提供構成では100万トークンのコンテキストも文書化され、最大出力は約13万1,000トークンとされる。ただし長文処理の速度・費用は別途検証が必要。
公開者GPT-5.6 Terra で編集GPT Image 2 で画像を生成
研究の答え

Create a landscape editorial hero image for this Studio Global article: What is Alibaba’s Qwen3.8-2.4T-A95B, and what do its open-weight release, Qwen-Max-class status, 2.4-trillion-parameter/95-billion-active-pa. Article summary: Alibaba’s Qwen3.8-2.4T-A95B is an open-weight, text-generation release of its Qwen3.8-Max/“Max-class” flagship: a very large sparse Mixture-of-Experts (MoE) model rather than a model that can realistically be run like an. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
AlibabaのQwen3.8-2.4T-A95Bは、同社の最上位「Qwen3.8-Max」系に位置づけられるオープンウェイトのテキスト生成モデルです。重要なのは、2.4兆パラメータ級のモデルが急に容易に動かせるようになった、という話ではありません。大規模な組織が、マネージドAPIだけに依存せず、この規模の重みを入手し、配置や追加学習を制御できるようになった点にあります。主な対象はクラウド事業者、大企業、規制対応が必要な環境、そして本格的な分散推論基盤を持つ研究チームでしょう。1
18
21
Qwen3.8-2.4T-A95Bは、スパース(疎)なMixture-of-Experts(MoE)方式を採用しています。総パラメータ数は2.4兆ですが、1トークンを処理する際に実際に有効化されるのは約950億パラメータです。NVIDIAの文書では、92層、ルーティング対象のエキスパート512個、top-10ルーティングとされています。18
21
MoEでは、入力に応じて一部の「専門家」だけを選んで計算するため、同じ総規模の密なモデル(dense model)と比べ、トークン当たりの計算量を抑えられる可能性があります。ただし、これは「2.4兆パラメータ分の重みを保持・分散配置しなくてよい」ことを意味しません。重みのメモリー、エキスパート並列化、高速ネットワーク、さらに長文時のKVキャッシュを含め、運用負荷は依然として非常に大きいままです。
アーキテクチャはGated DeltaNetとゲート付きアテンションを組み合わせたハイブリッド型です。長い文脈を扱う設計ですが、実運用で問うべきなのは、想定するプロンプト長、同時接続数、精度形式、推論スタックでのエンドツーエンド性能です。1
19
ネイティブのコンテキスト長は26万2,144トークンです。NVIDIAは、対応するデプロイ構成で100万トークンのコンテキストウィンドウを記載しており、最大出力長は約13万1,000トークンとされています。1
19
21
この数字を、そのまま「100万トークンの入力を速く安く処理できる」という意味に受け取るべきではありません。入力が長くなるほど、プロンプトを読み込むprefill処理とKVキャッシュの負担は増えます。大規模な社内文書検索、長大な契約書・報告書の分析、エージェントの長い実行履歴を扱うなら、実際の入力長と同時リクエスト数で必ずベンチマークを取る必要があります。
Qwen3.8-2.4T-A95Bは、reasoning_effortとしてlow、medium、xhighを指定でき、応答速度・コストと、より深い推論のトレードオフを調整できます。公開設定では思考内容を保持する挙動が重視されています。1
そのため、コーディング、調査内容の統合、長文分析、ツールを使うエージェント型ワークフローなど、難度の高いテキスト作業には候補になり得ます。一方で、優れたモデル単体が、そのまま実用的なエージェントになるわけではありません。ツール定義、権限の境界、実行環境の隔離、リトライ、監視、評価は、アプリケーション側で整備する必要があります。
注意点として、オープンのチェックポイントはテキスト専用です。また、公開情報では思考モードをオフにできないとされています。画像・動画の入力、非推論の低遅延パス、管理された組み込みツールが必要な場合は、ダウンロード可能なA95Bと、ホステッド版のQwen3.8-Maxを同一視しないことが重要です。3
8
21
オープンウェイトには、データの置き場所、デプロイ構成、カスタマイズ、追加学習を組織側で制御しやすい利点があります。NVIDIAのNeMo AutoModelは、FSDP2、エキスパート並列、パイプライン並列を使ったフルパラメータのファインチューニングをサポートしており、高度な適応学習の経路を用意しています。18
ただし、その自由度には高い運用要件が伴います。NVIDIA NIMの文書には、GB300-NVL72専用で最低4ノード、Kubernetesでのデプロイを要する構成が記されています。NVIDIA Dynamoのレシピでは、vLLMまたはSGLang、FP8の重みとKVキャッシュ、テンソル並列、KVキャッシュを意識したルーティングを用い、構成例の一つとして4ノード・GB300 GPU 16基を挙げています。19
21
これはあくまでベンダーがサポートする構成例で、あらゆる環境における最低要件ではありません。それでも、想定される運用規模を示す材料にはなります。少なくとも、ノートPC、一般的なワークステーション、通常の単一サーバーで気軽に動かすモデルではありません。
このクラスでは、モデル性能と同じくらいインフラ設計が重要になります。
NVIDIAは、GB300 NVL72上のDay-0 FP8構成において、GPU当たり毎秒4,000トークン超、ユーザー当たり毎秒350トークン超を報告しています。ただし、これは特定のハードウェアとソフトウェア構成で得られたベンダー測定値であり、すべての本番ワークロードで再現される性能保証ではありません。
本モデルはApache-2.0やMITではなく、独自のQwen3.8-Max Licenseで配布されています。ライセンス本文は、利用、改変、配布、ホスティング、ファインチューニング、派生物の作成などについて広範な権利を認めていますが、条件が付きます。
公開されたリリース要約によると、一定の収益規模を超えるModel-as-a-Service(MaaS)やAIワークアシスタント事業者には追加の義務が生じます。商用提供や派生物の配布に影響し得るため、製品化の前に必ず最新のライセンス原文を確認し、必要に応じて法務の助言を得るべきです。3
10
ホステッド版のQwen3.8-Maxは、A95Bを基にした公式版として説明され、ビジョン入力、非思考モード、標準での100万トークン・コンテキスト、公式の組み込みツールなどが追加されています。8
12
実務上は、次のように分けて考えるのが分かりやすいでしょう。
オープンのチェックポイントは、ホステッド製品を機能単位で置き換えるものではありません。強力なテキスト基盤を手に入れる代わりに、その周辺の製品機能とインフラは利用者側が用意する、という位置づけです。
QwenはA95BをMax級モデルとして位置づけ、コーディング、調査、推論関連のベンチマークで強い結果を報告しています。これは有用なシグナルではありますが、あらゆるタスクや運用環境で最適だと証明するものではありません。6
選定は、対象言語、ツール実行の連鎖、検索・参照する文書の長さ、出力形式、安全要件、許容遅延、コスト上限で評価して決めるべきです。核心は「950億のアクティブパラメータがどれほど大きいか」ではなく、得られる能力向上が、2.4兆パラメータ級を動かす費用と複雑さに見合うかどうかです。
Qwen3.8-2.4T-A95Bの意義は、Qwen-Max級の2.4兆パラメータMoEテキストモデルを、重みと配置を自ら制御したい組織に開放したことです。スパース設計は、同規模の密なモデルと比べて計算量の面で有利になり得ます。しかし、実態は依然として高度な分散システムのプロジェクトです。
十分な資金・人材・GPU基盤を持つ組織にとっては、カスタマイズ可能でデータ主権を確保しやすい、最上位級テキスト推論と追加学習の選択肢になります。一方、手軽なローカル運用を求める小規模チームには、より小さなモデル、またはマネージドエンドポイントの方が、多くの場合で現実的です。18
19
21
Studio Global AI
このページにはソースに裏付けされた回答が含まれており、Studio Global 内で続行できます。
Qwen3.8 2.4T A95Bは、AlibabaのQwen Max級モデルをオープンウェイトで提供するテキスト生成用MoE。総パラメータ数は2.4兆、各トークンで有効になるのは約950億で、512のエキスパートを使う。
Qwen3.8 2.4T A95Bは、AlibabaのQwen Max級モデルをオープンウェイトで提供するテキスト生成用MoE。総パラメータ数は2.4兆、各トークンで有効になるのは約950億で、512のエキスパートを使う。 ネイティブのコンテキスト長は26万2,144トークン。特定の提供構成では100万トークンのコンテキストも文書化され、最大出力は約13万1,000トークンとされる。ただし長文処理の速度・費用は別途検証が必要。
重みは公開されているが、ライセンスはApache 2.0やMITではなく独自のQwen3.8 Max License。大規模な商用サービスでは追加条件が問題になり得る。