スタンフォード大の研究(2025年11月プレプリント)は、200億パラメータ以下の小規模言語モデルが消費者向けハードウェア上で、100万件の実世界シングルターンクエリ(チャット・推論)の88.7%を正確に処理できることを実証した。 ローカルモデルが対応可能なクエリの割合は、2023年の23.2%から2025年には71.3%へと3.1倍に急増。エネルギー効率指標IPWは、モデル改良とハードウェア進化により2年間で5.3倍向上した。
研究の答え

Create a landscape editorial hero image for this Studio Global article: What did the Stanford University study published as a preprint in November 2025 find about the performance, accuracy, "intelligence per watt. Article summary: ## Key Findings from the Stanford "Intelligence Per Watt" Study (November 2025 Preprint). Topic tags: general, academic, education, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual,
人工知能の経済性が、大きな転換点を迎えようとしている。2025年11月にプレプリントとして公開されたスタンフォード大学の大規模研究は、消費者向けのノートPCやデスクトップ上で動作する小規模言語モデルが、かつて高価なクラウドベースAIシステムに依存していたタスクの大部分を、すでに十分な能力で処理できることを明らかにした。
Jon Saad-Falcon氏、Avanika Narayan氏らスタンフォード大学Hazy ResearchグループとTogether AIによるこの研究は、Intelligence Per Watt(IPW:ワットあたりの知能) と呼ばれる新しい指標を導入した。これは「タスクの平均正解率 ÷ 推論時の平均消費電力」で定義され、ローカルAIとクラウドAIを統一的に比較するためのものだ。
研究チームは、Apple、AMD、NVIDIA製の8種類のアクセラレータ上で20以上のローカル言語モデルを、100万件の実世界のシングルターンチャット・推論クエリを用いて徹底的にベンチマークした。主な結果は以下の通りだ。
IPW指標は非常にシンプルだ。モデルが特定のタスクで達成した精度を、その推論時に消費する電力で割る。これは、AIモデルをエネルギーコストやハードウェア要件を無視して単独で評価する一般的な手法とは対照的だ。
この指標が捉える重要な洞察は、「最も高性能なモデルが必ずしも最も効率的または実用的であるとは限らない」ということだ。ノートPC上で動作する小規模モデルが、巨大なクラウドモデルの精度の95%を提供しながら、消費エネルギーはそのごく一部で済む可能性がある。
この研究で経済的に最も重要な発見の一つは、ローカルとクラウドを「二者択一」ではなく、「両方をインテリジェントに使い分ける」場合の効果だ。
オラクルルーティングと呼ばれる、各クエリを処理可能な最小のモデルに割り当てる理想的なシステムは、クラウドのみの運用と比較して、エネルギー消費を80.4%、計算リソースを77.3%、コストを73.8%削減できる可能性がある。
関連研究でテストされた、より現実的なルーターでも同様の結果を示した。実世界のトラフィック分布において、同等のタスク精度を維持しながら、エネルギーを77.1%、計算リソースを67.1%、コストを60.2%削減したのだ。
これは遠い未来の話ではない。研究は、ハイブリッドなローカル・クラウドアーキテクチャがすでに実用可能であり、AI推論の提供コストを劇的に引き下げられることを実証している。
このスタンフォード研究は、特定の企業に対する財務予測を明示的に行っているわけではない。しかし、研究が示す軌跡は、クラウドAPIに依存したAI企業にとって明確かつ構造的な意味合いを持つ。
ローカルモデルは、劇的に低いコストで、シングルターンクエリの約89%をすでにカバーしている。IPWはわずか2年で5.3倍向上し、そのペースは加速し続けている
。スマートルーティングは、クラウドに送られる残りのクエリのコストを60%以上削減できる
。
このトレンドが大規模に運用されるようになれば、顧客はクラウドAPIクエリの大部分を、ほぼゼロコストのローカル推論に置き換え、クラウドはローカルモデルがまだ扱えない難易度の高い約11%のタスクだけに予約するというモデルが現実となる。
この研究を解説する論評では、フロンティアAI企業にとってのAIの未来は「小さく、安く、儲からない」ものになるかもしれないと指摘されている。経済的インセンティブは、クラウドAPIの価格を下回るローカルでオープンな軽量モデルへとシフトする。この力学は、OpenAI、Anthropic、xAIといった企業のビジネスモデルを根本から変える可能性を秘めている。
この研究は、より大きなトレンドの中の一つのデータ点に過ぎない。スタンフォードHAIの「2025 AI Index Report」によると、GPT-3.5レベルの性能を持つシステムの推論コストは、2022年11月から2024年10月までの間に280分の1以上に低下した。ハードウェアレベルでは、コストは年間30%ずつ低下し、エネルギー効率は年間40%ずつ改善している
。
また、オープンウェイトモデルとクローズドモデルの性能差も縮まっており、あるベンチマークではわずか1年で8%から1.7%にまで縮小している。
結果は印象的だが、その適用範囲を理解することが重要だ。研究はシングルターンクエリのみをテストしている。すなわち、単純なチャット応答と自己完結型の推論タスクだ。マルチターン会話、長文コンテキスト推論、複雑なエージェント的ワークフローは評価対象外であり、これらの領域では今なおクラウドモデルが大きな優位性を持つ。
また、テストされたローカルモデル(200億パラメータ以下)は、最も難しい問題において、最高峰のクラウドモデルに匹敵することはできない。研究著者らはこの点を明確にしており、精度は分野によって大きく異なり、88.7%という数字は技術的・科学的な分野での低いパフォーマンスを隠していると指摘している。
スタンフォード大学の「Intelligence Per Watt」研究は、ローカルAIが重要な閾値を超えたという強力な実証的証拠を提供している。日常的なクエリの大半——クリエイティブタスク、管理、営業、エンターテイメント——においては、ノートPC上の小規模モデルで既に十分なのだ。急速な改善ペースは、このカバレッジが今後さらに拡大することを示唆している。
企業にとっての含意は明確だ。最も費用対効果の高いAIインフラは、ますますハイブリッドなものになりつつある。単純なクエリはローカルモデルにルーティングし、最も難しいタスクのためにクラウドキャパシティを温存する。あらゆるクエリをトークン単位の課金で巨大なクラウドモデルに送る時代は、終わりに近づいているのかもしれない。
Studio Global AI
このページにはソースに裏付けされた回答が含まれており、Studio Global 内で続行できます。
スタンフォード大の研究(2025年11月プレプリント)は、200億パラメータ以下の小規模言語モデルが消費者向けハードウェア上で、100万件の実世界シングルターンクエリ(チャット・推論)の88.7%を正確に処理できることを実証した。
スタンフォード大の研究(2025年11月プレプリント)は、200億パラメータ以下の小規模言語モデルが消費者向けハードウェア上で、100万件の実世界シングルターンクエリ(チャット・推論)の88.7%を正確に処理できることを実証した。 ローカルモデルが対応可能なクエリの割合は、2023年の23.2%から2025年には71.3%へと3.1倍に急増。エネルギー効率指標IPWは、モデル改良とハードウェア進化により2年間で5.3倍向上した。
理想的な「オラクルルーティング」では、クラウドのみの運用と比較し、エネルギー消費80.4%、計算リソース77.3%、コスト73.8%を削減可能。現実的なルーターでも、精度を維持しつつコストを60.2%削減できる。