ZDTaichu5.0 9Bは、約90億パラメータのQwen3.5 9B言語デコーダーとC RADIOv4 H視覚エンコーダーを組み合わせた、TaichuAIのオープンな視覚言語モデルです。 不確実性が高いトークンにだけ追加計算を振り分ける「Entropy Gated Adaptive Recurrent Reasoning」を特徴とし、難しい空間推論への計算配分を狙います。
公開者GPT-5.6 Terra で編集GPT Image 2 で画像を生成
研究の答え

Create a landscape editorial hero image for this Studio Global article: What is TaichuAI’s open-sourced ZDTaichu5.0-9B multimodal model, including its approximately 9-billion-parameter Qwen3.5-9B and C-RADIOv4-H. Article summary: ZDTaichu5.0-9B is TaichuAI’s open multimodal vision-language model for general visual understanding, spatial/embodied reasoning, and agentic tool-use research. It combines a roughly 9B-parameter Qwen3.5-9B language decod. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
ZDTaichu5.0-9Bは、TaichuAIが公開したマルチモーダル基盤モデルです。一般的な画像理解にとどまらず、視点が変わったときの位置関係、複数画像の照合、長い動画からの情報抽出といった空間的な推論を主眼に置いています。具身AI(ロボットなどが現実空間を認識し、行動を計画するAI)や、ツール利用を伴うエージェントの研究用途も想定されています。2
モデルは、約90億パラメータのQwen3.5-9B言語デコーダーと、C-RADIOv4-H視覚エンコーダーで構成されます。テキスト、1枚または複数枚の画像、動画を入力でき、任意解像度の視覚入力と最大128Kトークンのコンテキスト長をサポートするとされています。2
用途としては、文書・グラフ・図表の理解、OCR、視覚質問応答、視覚的な数学問題のほか、場面全体の把握が挙げられています。2
TaichuAIが強調するのは、汎用的な視覚言語モデルでは難しくなりやすい空間・具身タスクです。公表されている能力には、次のようなものがあります。
また、エージェント向けのやり取りもサポートします。ただし、これはモデルがツール呼び出しを計画し、複数ステップ・複数ターンのワークフローに参加できるという意味です。ツールの実行、結果の検証、権限管理やセキュリティは、利用側のホストアプリケーションが担う必要があります。2
中核となる技術的な主張が、Entropy-Gated Adaptive Recurrent Reasoningです。日本語にすれば「エントロピーで制御する適応型の反復推論」に近い考え方です。
仕組みは、出力中のすべてのトークンに同じ追加計算をかけるのではなく、予測の不確実性を手掛かりに、難しいトークンにだけ潜在空間での追加的な洗練処理を行うというものです。2
平易に言えば、簡単な判断は通常どおり進め、曖昧さの大きい判断だけを内部で追加検討する設計です。全体に一律で計算量を増やさず、難所で実効的な計算深度を増やすことを狙っています。2
例えば、カメラの向きが変わった後の左右関係や、2つの物体の前後関係といった問いでは、ひとつの曖昧な空間判断が最終回答を左右します。このようなケースが、この機構の想定する対象です。
TaichuAIは、モデル資料で以下のスコアを報告しています。
| 評価領域 | ベンチマーク | 公表スコア |
|---|---|---|
| 空間・具身 | ViewSpatial | 62.50 |
| 空間・具身 | MMSI-Bench | 47.20 |
| 空間・具身 | MindCube-tiny | 78.27 |
| 空間・具身 | ERQA | 48.00 |
| 空間・具身 | RoboSpatial | 56.00 |
| エージェント・指示追従 | TAU2-Bench | 87.70 |
| エージェント・指示追従 | Claw-Eval | 71.40 |
| エージェント・指示追従 | IFEval | 93.70 |
プロジェクトは、比較対象に含めた約100億パラメータ規模の汎用VLM(視覚言語モデル)の中で、空間・具身推論をリードするモデルとして位置付けています。一方で、文書、OCR、図表、動画などの一般的な視覚能力も維持するという説明です。2
ただし、これらは提供元が報告した結果です。比較対象のモデル版、プロンプト、前処理、デコード設定、評価手順によって結果は変わり得ます。実務での採用判断では有力な参考材料になりますが、普遍的な順位とみなす前に、詳細を開示した第三者による再現検証が求められます。2
ZDTaichu5.0-9Bは、TaichuAIのHugging Faceリポジトリで公開されています。カスタムコードを用いるモデルとして提供され、反復推論とデプロイに関するプロジェクト資料へのリンクも案内されています。2
公開済みモデル資料のライセンスはNVIDIA Open Model License、Qwen3.5由来のコンポーネントにはApache-2.0の通知が付くとされています。再配布や商用利用を検討する場合は、必ずリポジトリにある最新のライセンスファイルと通知を直接確認すべきです。2
推論サーバー向けには、独自のvLLM 0.26.0とDockerを使う導入経路が文書化されています。空間グラウンディング向けと一般タスク向けで、異なるサンプリング設定も案内されています。2
ZDTaichu5.0-9Bは、単に画像の内容を説明するだけでなく、画像間・視点間・シーン内・動画内の関係を推論することに重点を置いた、約90億パラメータ規模のオープンなマルチモーダルモデルです。128Kトークンのコンテキスト、任意解像度の視覚入力、難所に計算を寄せる適応型反復推論は、空間VLM、具身AI、ホスト側で制御するエージェントの研究・開発にとって注目点です。2
とりわけ空間ベンチマークの公表値は期待を持たせます。ただし現時点ではベンダー報告の証拠であり、透明な条件下で第三者が再現するまでは、確立済みの比較性能としてではなく、検証すべき有望な結果として扱うのが妥当です。2
Studio Global AI
このページにはソースに裏付けされた回答が含まれており、Studio Global 内で続行できます。
ZDTaichu5.0 9Bは、約90億パラメータのQwen3.5 9B言語デコーダーとC RADIOv4 H視覚エンコーダーを組み合わせた、TaichuAIのオープンな視覚言語モデルです。
ZDTaichu5.0 9Bは、約90億パラメータのQwen3.5 9B言語デコーダーとC RADIOv4 H視覚エンコーダーを組み合わせた、TaichuAIのオープンな視覚言語モデルです。 不確実性が高いトークンにだけ追加計算を振り分ける「Entropy Gated Adaptive Recurrent Reasoning」を特徴とし、難しい空間推論への計算配分を狙います。
重みと導入資料はHugging Faceで公開され、独自版vLLM 0.26.0およびDockerでのサービング手順も案内されています。