NVIDIAは、Jetson AGX ThorとAGX OrinでNemotron 3.5 LightningおよびQwen3.8 27Bをローカル実行できると説明。ThorではNVFP4と投機的デコーディングの組み合わせにより、BF16比で最大6.28倍のデコードスループットを報告した。[1] Nemotron 3.5 Lightningは総計300億パラメータのMoEモデルで、トークンごとの有効パラメータは30億。Qwen3.8 27Bは毎トークン270億パラメータすべてを使う密モデルで、用途により適性が異なる。 ローカル推論はネットワーク遅延や接続断の影響を抑えられるが、実運用ではプロンプト、ツール呼び出し、コンテキスト...
公開者GPT-5.6 Terra で編集GPT Image 2 で画像を生成
研究の答え

Create a landscape editorial hero image for this Studio Global article: How does NVIDIA’s September 4 developer guide show that Jetson AGX Thor and AGX Orin modules can run compact reasoning and agentic AI models. Article summary: NVIDIA’s September 4 guide argues that recent compact open models, combined with Jetson-optimized serving and decoding techniques, make multi-step reasoning and agent loops practical on-device rather than requiring a rou. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
クラウドに問い合わせなければ動けないAIエージェントは、ロボット、車両、現場設備では扱いにくい場合があります。通信の遅れや圏外が、そのまま応答不能につながり得るためです。
NVIDIAが2026年9月4日に公開した開発者向けガイドは、こうしたエッジ側での多段推論・エージェントAIを現実的にする道筋として、Jetson AGX OrinとJetson AGX Thorでのローカル実行を示しました。対象モデルとして挙げられたのはNemotron 3.5 LightningとQwen3.8-27Bです。1
注目すべき数値は、Jetson AGX ThorにおいてNVFP4量子化と投機的デコーディングを組み合わせ、BF16比で最大6.28倍のデコードスループット向上を報告した点です。1 ただし、これは特定のモデル・設定・ワークロードで得られた最大値であり、すべてのモデルやプロンプトで同じ倍率が出るという意味ではありません。
NVIDIAのガイドでは、Jetson上でvLLMを使ってモデルをサービングし、主に2つの最適化を組み合わせます。1
NVFP4は4ビット浮動小数点表現を使う量子化方式です。モデル演算に必要な計算量とメモリ量を減らせます。組み込み環境では演算性能だけでなく、重みや活性値を生成中にどれだけ速くメモリから移動できるかがボトルネックになりやすいため、この削減は重要です。1
Jetson AGX Thorは、Blackwell GPUのTransformer EngineによるネイティブFP4対応を備えるため、この手法と特に親和性があります。3
投機的デコーディングでは、小型のドラフトモデルが複数の次トークン候補を提案し、メインモデルがまとめて検証します。最終判断をするのはメインモデルです。複数候補が受け入れられれば、1トークンずつ進める代わりに、1回の検証で生成を複数トークン進められます。1
効果はドラフトモデルの提案がどの程度受理されるかに左右されます。したがって、モデル、プロンプト、デコード設定によって性能は変わり、固定の高速化倍率として扱うべきではありません。
Nemotron 3.5 Lightningは、総計300億パラメータのMixture of Experts(MoE)モデルですが、各トークンで有効になるのは30億パラメータです。NVIDIAはこれを、長時間・常時稼働するエージェントの実行レイヤー向けモデルとして位置付けています。2
たとえば、イベントを解釈し、許可されたツールを呼び出し、結果を確認して、継続かエスカレーションかを判断する――こうした反復的な処理では、総パラメータ数だけでなく、トークンごとの有効パラメータ数と持続的な生成速度が効いてきます。
Qwen3.8-27Bは密(dense)モデルで、各トークンで270億パラメータすべてが計算に参加します。NVIDIAはNemotron 3.5 Lightningと並ぶJetson向けの有力な選択肢として挙げています。1
応答回数は少なくても、1回ごとの判断により高い重みを置く用途では、密モデルが適する可能性があります。一方で、毎トークンでネットワーク全体を有効化する分、疎なMoEモデルより計算負荷が大きくなり得ます。
結局は、「30B」や「27B」といった見出しの数字だけで決められません。入力と出力の長さ、ツール利用、許容遅延、搭載メモリ、判断頻度を、実際の製品ワークフローで測ることが重要です。1
NVIDIAはAGX Thorで、NVFP4量子化と投機的デコーディングを併用した場合、BF16と比べて最大6.28倍のデコードスループット向上を報告しました。最適な投機的デコーディング構成はモデルごとに異なり、Nemotron 3.5 LightningではDSpark、Qwen3.8-27BではDFlash2が最適だったとしています。1
対話型エージェントでは、出力トークンを順に作るデコード処理が、利用者が感じる応答性を大きく左右します。ただし実スループットは、候補トークンの受理率、バッチサイズ、コンテキスト長、ランタイム設定などで変動します。1 この数値は「どのアプリでも6.28倍」という宣伝文句ではなく、適切な最適化の余地を示すベンチマークとして読むべきです。
端末内で推論を完結できれば、推論のたびに遠隔データセンターとの通信を必須にしなくて済みます。物理的なシステムでは、ネットワーク由来の遅延を抑え、接続が断続的でも動作を続け、センサーストリームや運用ログを端末側にとどめられることに価値があります。NVIDIAも、データのローカリティとリアルタイム応答が重要な場面で、エッジ推論・エージェントAIの意義を強調しています。1
これはクラウドが不要になるという話ではありません。学習、フリート管理、大規模分析、端末のメモリや演算能力を超える処理には、中央集約型の基盤が引き続き必要です。変化は、すべての判断でデータセンター接続をクリティカルパスに置かなくてもよくなる点にあります。
NVIDIAは、車内アシスタント、リアルタイムの異常検知、過酷・遠隔環境で動くロボットを例示しています。1
共通するのは、現場の文脈を理解し、使える時間内に応答しなければならないことです。具体的には次のような用途が考えられます。
有望なのは、単にLLMを載せられる端末ではありません。応答時間、データの端末内保持、オフライン耐性が、業務上の直接的な価値になるシステムです。
Jetson AGX Thorは、高負荷のフィジカルAI向け上位プラットフォームです。NVIDIAによると、Blackwell GPUと128GBメモリを搭載し、130Wの電力枠内で最大2,070 FP4 TFLOPSを提供します。3
この構成は、NVFP4、大規模なローカル推論モデル、高スループットのデコードという今回のテーマに合致します。AGX Orinは成熟した組み込み用途で引き続き重要で、Thorはより要求の高い生成AI・マルチモーダルAIを狙う位置付けです。
エントリー層では、NVIDIAはロボット、配送・点検ドローン、ビジョンAI向けにJetson Orin Nano 2を発表しています。モジュールと開発者キットは2027年前半の提供開始予定です。1
つまりJetsonは、小型システム向けのエントリー層、既存組み込み展開を担うAGX Orin、より多くのメモリと計算能力を必要とするローカル生成推論向けのAGX Thorという、段階的な構成を広げようとしています。
NVIDIAのガイドは、あらゆる最先端モデルがすべての組み込みモジュールで快適に動く、と主張しているわけではありません。より実務的なメッセージは、コンパクトな推論モデル、vLLM、NVFP4、投機的デコーディングの組み合わせにより、Jetson級ハードウェアで能力のあるローカルAIエージェントを実現できる可能性が高まった、ということです。1
開発者に必要なのは理論上の比較ではなく、対象Jetson上で、実際のプロンプト、ツール、コンテキストウィンドウ、応答時間要件を用いた検証です。最大6.28倍という結果は最適化の可能性を示しますが、それが製品で使えるエッジAIになるかどうかは、個別アプリケーションのベンチマークで決まります。1
Studio Global AI
このページにはソースに裏付けされた回答が含まれており、Studio Global 内で続行できます。
NVIDIAは、Jetson AGX ThorとAGX OrinでNemotron 3.5 LightningおよびQwen3.8 27Bをローカル実行できると説明。ThorではNVFP4と投機的デコーディングの組み合わせにより、BF16比で最大6.28倍のデコードスループットを報告した。[1]
NVIDIAは、Jetson AGX ThorとAGX OrinでNemotron 3.5 LightningおよびQwen3.8 27Bをローカル実行できると説明。ThorではNVFP4と投機的デコーディングの組み合わせにより、BF16比で最大6.28倍のデコードスループットを報告した。[1] Nemotron 3.5 Lightningは総計300億パラメータのMoEモデルで、トークンごとの有効パラメータは30億。Qwen3.8 27Bは毎トークン270億パラメータすべてを使う密モデルで、用途により適性が異なる。
ローカル推論はネットワーク遅延や接続断の影響を抑えられるが、実運用ではプロンプト、ツール呼び出し、コンテキスト長、メモリ、応答時間の条件で検証する必要がある。