UberはAIエージェントの週次リクエストが2月から9.4倍に増えたにもかかわらず、4月以降のAI支出をおおむね横ばいに維持しました。 同じAIモデルを使った場合でも、1,000リクエストあたりのコストは4月のピークから約34%、1セッションあたりのコストは6月のピークから52%低下しました。
研究の答え

Create a landscape editorial hero image for this Studio Global article: How did Uber stabilize its AI spending after exceeding its 2026 AI budget in the first quarter, despite weekly AI-agent requests increasing. Article summary: Uber stabilized spending by treating AI usage as an engineering-cost optimization problem rather than simply limiting adoption. After exceeding its 2026 AI budget in the first quarter, it kept total AI spend roughly flat. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
Uberでは当初、AI関連の支出が2026年予算を上回りました。しかし同社は、単純に利用を制限するのではなく、AIを「エンジニアリングコストを最適化する対象」として捉え直しました。業務ごとに適切なモデルを割り当て、過剰なコンテキストを抑え、キャッシュしたプロンプトを再利用し、エンジニア自身がセッションの費用を確認できるようにしたのです。1
その結果、AIエージェントの週次リクエスト数が2月から9.4倍に増えた一方、UberのAI総支出は4月以降おおむね安定しました。同じAIモデルを使った場合、1,000リクエストあたりのコストは4月のピークから約34%低下し、1セッションあたりのコストは6月のピークから52%下がっています。1
コスト改善は、AIの利用が縮小した結果ではありません。むしろ導入は拡大しています。AIエージェントはコード変更の提出の70%以上に関与し、エンジニアは1日に3万件を超えるエージェントタスクを実行。AIツールを使う従業員数も4倍超に増えました。1
利用量が大幅に増えたのに支出がほぼ横ばいになったということは、1リクエストや1セッションあたりの単価が下がったことを意味します。処理が無料になったのではなく、トークンとモデルの計算資源の使い方を変えた、ということです。
Uberは、すべての処理で最も高性能、かつ高価なモデルを使うのではなく、業務を十分に処理できるモデルへ振り分けています。単純な作業は低コストのモデルに任せ、難しい処理にはより大きなモデル能力を割り当てる考え方です。特定の用途に向けて、オープンウェイトモデルを含む代替モデルの検証も進めています。1
つまりモデル選択を、全社共通の初期設定ではなく、ワークロード(処理内容)ごとの判断に変えたわけです。大量の定型リクエストを扱う場合、1件あたりの小さな節約でも、全体の平均コストには大きな差が生まれます。
Uberは、モデルが最大100万トークンのコンテキストウィンドウに対応している場合でも、対話型セッションを40万トークンまでに制限しています。1
コーディングエージェントのセッションには、ソースコード、ツールの実行結果、指示、過去のやり取りなどが次々に蓄積されます。制限がなければ、試行錯誤が続くセッションほど、処理対象となるコンテキストが膨らみます。
トークン上限は、エージェントの利用そのものを止めるものではありません。特にコンテキストが肥大化しやすいセッションに予測可能な上限を設け、利用量を管理するための明確な制御点になります。
Uberは、プロンプトキャッシュの保持期間を5分から1時間に延長しました。エンジニアの作業では、AIセッションを5分以上中断してから再開することもあるため、実際の利用パターンに合わせた変更です。1
キャッシュを長く再利用できれば、同じコンテキストを繰り返し処理する必要が減ります。AIエージェントによる開発では、同じリポジトリや指示をセッション中に何度も参照することがあるため、作業内容を変えずに不要なトークン処理を削減できます。
Uberは、AIセッションの費用をリアルタイムで端末上に表示しています。1
これにより、AI利用は即時のエンジニアリング上のフィードバックになります。高コストなワークフローを後から経理レポートで知るのではなく、実験中に費用を確認し、必要に応じてセッションの進め方やモデル、コンテキストを調整できます。
コスト意識を製品の利用画面に組み込むことも重要です。プロンプト、再試行、コンテキストの量、モデルの選択といった判断は、財務報告書を見る場ではなく、実際にツールを操作している場で行われるからです。
Uberの事例は、企業のAI支出を抑えることが単なる予算管理ではなく、システム設計の問題でもあることを示しています。
特に有効な管理手法は次の通りです。
こうした対策は、とりわけAIエージェントで重要です。エージェントは、1回の質問に1度だけ答えるのではなく、計画、ツール呼び出し、結果の確認、修正を何度も繰り返します。そのため、単発のチャットよりもトークン消費量を予測しにくくなります。
Uberの成果は、AI利用を急拡大しても財務リスクがなくなることを示すものではありません。支出をおおむね安定させられたのは、リクエストとセッション単位のコスト構造を変えたからです。企業がAI導入を拡大するなら、利用の拡大とコスト管理を別々に考えるのではなく、最初から計測機能をツールに組み込んで同時に進める必要があります。
Studio Global AI
このページにはソースに裏付けされた回答が含まれており、Studio Global 内で続行できます。
UberはAIエージェントの週次リクエストが2月から9.4倍に増えたにもかかわらず、4月以降のAI支出をおおむね横ばいに維持しました。
UberはAIエージェントの週次リクエストが2月から9.4倍に増えたにもかかわらず、4月以降のAI支出をおおむね横ばいに維持しました。 同じAIモデルを使った場合でも、1,000リクエストあたりのコストは4月のピークから約34%、1セッションあたりのコストは6月のピークから52%低下しました。
企業のAI導入を持続可能にするには、業務に応じたモデル選択と、エージェントの反復処理を把握する組み込み型のコスト可視化が重要です。