Ling 3.0 flashは総パラメータ124B、トークン当たりの有効化パラメータ約5.1BのMoEモデル。大きな学習容量を保ちつつ、推論時の計算量を抑える設計だ。[17] 256Kトークンのネイティブコンテキスト(最大1Mへ拡張可能)と、コーディング・ツール利用・エージェント処理への注力は、大量の実行ワークロードで特に検証する価値がある。[1][17] Antは自社の1T級モデルとの比較で多くのベンチマークにおいて同等以上と主張する。ただし、これは開発元の評価であり、実運用での独立検証が欠かせない。[18][32]
研究の答え

Create a landscape editorial hero image for this Studio Global article: How did Ant Group Bailing’s July 30, 2026 release of the open-source Ling-3.0-flash execution model—coinciding with Jensen Huang’s first X p. Article summary: The release is evidence for a “sparse execution-model” strategy, not proof that parameter count has ceased to matter. Ling-3.0-flash concentrates computation on roughly 5.1B parameters per token while retaining 124B para. Topic tags: general, general web, user generated, documentation, education. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text,
AIモデルを選ぶとき、「パラメータ数が最大か」だけでは判断しにくくなっている。コード修正、検索、関数・ツール呼び出し、出力の検証と再試行――こうした処理を何度も繰り返すAIエージェントでは、品質に加えて応答遅延とトークン当たりの推論コストが運用を左右するからだ。
Ant GroupのLing-3.0-flashは、その変化を端的に表すモデルだ。総パラメータ数は124B(1240億)だが、各トークンの生成で有効化されるのは約5.1B(51億)。Antはこれを、高頻度タスク向けのコスト効率重視ハイブリッド推論モデルと位置付け、ネイティブのコンテキスト長は256Kトークン、最大1Mトークンへの拡張に対応するとしている。
Ling-3.0-flashの中核は、**Mixture of Experts(MoE、専門家混合)**だ。すべてのパラメータを各トークンの処理に使うのではなく、入力に応じて専門家(expert)の一部を選び、計算を振り分ける。
これにより、モデルは大きなパラメータ群に蓄えた表現力を利用しながら、各生成時にはより小さな計算規模で動かせる。Antによれば、Ling-3.0-flashの総パラメータは自社の1T級Ring-2.6-1Tの約12.4%、有効化パラメータは約8.1%に当たる。さらに、KDAとMLAの層を交互に配置するハイブリッド線形アテンションと、疎なMoEルーティングを採用している。
もちろん、総パラメータ数が無意味になるわけではない。モデルが何を表現できるかには全体の容量が関わり、MoEでは「どの専門家に振り分けるか」の精度も性能を左右する。ただし、実際の提供コストや速度は、保存されている全パラメータ数より、1トークン当たりに有効化するパラメータとアテンション計算量により直接的に影響される。
Antは、公開した比較の大半でLing-3.0-flashがRing-2.6-1Tと同等以上の結果を出したとしている。AntのLingアカウントも、総パラメータがおよそ8分の1、有効化パラメータがおよそ12分の1でありながら、掲載したベンチマークの多くで1T級フラッグシップに並ぶ、または上回ったと説明した。
これは、製品投入を意識したエージェント向けモデルとしては注目すべき内部比較だ。一方で、「あらゆる大型の汎用モデルを、すべてのタスクで上回る」という証拠ではない。
評価時には、少なくとも次の点を分けて考える必要がある。
導入を考える組織が確認すべきなのは、汎用ランキングではなく、自社の代表的な負荷だ。実際のツール定義、リポジトリの文脈、許容遅延、失敗時の再試行、そして誤った操作のコストまで含めて測るべきである。
モデルカードでは、SWE-Bench Pro、SWE-Bench Multilingual、Tau3-banking-AA、MCP-Atlas、SkillsBenchなどでの評価に言及している。また、Claude Code、Kilo Code、Qwen Code、Hermes Agent、OpenClawといったエージェント指向の環境での利用も掲げる。1
こうした領域ではトークン消費が膨らみやすい。エージェントはファイルを読み、ツールを呼び、結果を受け取り、計画を修正し、必要なら再試行する。1回のチャット応答よりはるかに多くのトークンを使うことがある。
そのため、定型的な実行ステップを安定してこなせる低コストモデルは、「毎ターン最強の汎用モデルを使う」構成より実用的になり得る。現実的な設計は、次のような段階制だ。
Antは256Kトークンのネイティブコンテキストと、1Mトークンまでの拡張を案内している。 OpenRouterで提供されるコンテキスト長は262,144トークンと記載されている。6
長いコードベース、長大なツール実行ログ、継続的な作業状態を扱う際には有用になり得る。ただし、長コンテキスト対応だけで、マルチエージェント運用での優位性が実証されるわけではない。
複数エージェントを安定運用するには、オーケストレーション、記憶の設計、ツール権限、引き継ぎ、評価方法も必要だ。現時点の資料は長コンテキスト仕様とエージェント用途を裏付ける一方、競合を上回るマルチエージェント性能を定量的に示すものではない。
Ling-3.0-flashは2026年7月24日に発表された。Antの発表では、OpenRouterと自社プラットフォームで8月3日まで期間限定の無料API利用を提供したとしている。 Hugging Faceでも公開され、ベンチマークおよびエージェントフレームワークへの注力が説明されている。1
OpenRouterの掲載価格は、入力100万トークン当たり0.021ドル、出力100万トークン当たり0.063ドル。提供コンテキスト長は262,144トークンである。6 大量ワークロードで試験しやすい水準ではあるが、実際の費用、遅延、可用性、出力品質は、利用プロバイダーや配備条件で変動する。
OpenRouterのモデル一覧では、Ling-3.0-flashのインテリジェンス、コーディング、エージェントの各パーセンタイルはそれぞれ49、56、54とされる。12 この数字も、実行特化モデルを単一の総合順位だけで判断することの限界を示している。
発表と同じ日、NVIDIAのジェンスン・フアンCEOはXへの初投稿で、オープンモデルが安全性とサイバーセキュリティを強め、技術革新と普及を加速し、主権性を支えるとする書簡を共有した。
この同時性は、オープンウェイトAIをめぐる議論の象徴としては印象的だ。重みが利用可能なら、開発者はより直接的にモデルを検証し、ホスティングし、調整し、システムへ統合できる。ただし、この二つの出来事からNVIDIAとAnt Groupの提携や技術的な結び付きを読み取ることはできない。
Ling-3.0-flashが示すのは、コストを織り込んだ実行モデル戦略の可能性だ。疎なMoEは、大きな保存容量と小さなトークン当たりの有効化規模を両立させ、反復回数の多いエージェント処理を、より安く・速くできる可能性がある。
性能の主張には独立した再現検証が必要であり、最大級の汎用モデルを全面的に置き換える存在とみなすべきではない。それでも、エージェント指向の評価対象、長いコンテキスト、低い掲載API価格という条件は、推論コストと遅延が制約になる場面で、こうした特化型の疎モデルを試す十分な理由になる。1
6
Studio Global AI
このページにはソースに裏付けされた回答が含まれており、Studio Global 内で続行できます。
Ling 3.0 flashは総パラメータ124B、トークン当たりの有効化パラメータ約5.1BのMoEモデル。大きな学習容量を保ちつつ、推論時の計算量を抑える設計だ。[17]
Ling 3.0 flashは総パラメータ124B、トークン当たりの有効化パラメータ約5.1BのMoEモデル。大きな学習容量を保ちつつ、推論時の計算量を抑える設計だ。[17] 256Kトークンのネイティブコンテキスト(最大1Mへ拡張可能)と、コーディング・ツール利用・エージェント処理への注力は、大量の実行ワークロードで特に検証する価値がある。[1][17]
Antは自社の1T級モデルとの比較で多くのベンチマークにおいて同等以上と主張する。ただし、これは開発元の評価であり、実運用での独立検証が欠かせない。[18][32]