Uber嘅AI總開支自4月起大致穩定,但AI代理每週請求量較2月增加9.4倍。 沿用同一AI模型計算,每1,000次請求嘅成本較4月高位下降接近34%,每個工作階段成本亦較6月高位下降52%。 Uber透過按工作配對模型、限制Token用量、延長提示快取,以及向工程師即時顯示成本,控制企業AI尤其係代理式工作流程嘅開支。
研究答案

Create a landscape editorial hero image for this Studio Global article: How did Uber stabilize its AI spending after exceeding its 2026 AI budget in the first quarter, despite weekly AI-agent requests increasing. Article summary: Uber stabilized spending by treating AI usage as an engineering-cost optimization problem rather than simply limiting adoption. After exceeding its 2026 AI budget in the first quarter, it kept total AI spend roughly flat. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
Uber早前嘅AI支出一度超出2026年預算,但公司冇有簡單粗暴咁收緊使用權限。相反,Uber將問題當成一個工程成本優化課題:唔同工作配對合適模型、限制過長上下文、重用已快取嘅提示內容,同時畀工程師睇到自己每次工作階段嘅實際成本。1
呢套做法令Uber自4月起可以維持AI總開支大致穩定;與此同時,AI代理每週請求量由2月起增加9.4倍。以同一個AI模型計算,每1,000次請求嘅成本較4月高位下降接近34%,每個工作階段嘅成本亦較6月高位下降52%。1
Uber嘅成本改善並唔係靠縮減採用,而係發生喺使用範圍不斷擴大嘅同一時間。AI代理目前負責超過70%嘅程式碼變更提交,工程師每日執行超過30,000項代理任務,而使用AI工具嘅員工人數亦增加超過4倍。1
即係話,使用量大幅上升之餘,總開支仍然大致持平,反映每項工作嘅單位成本下降。呢個唔代表AI工作變成免費,而係Uber改變咗Token同模型算力嘅使用方式。
Uber會將工作分配畀最適合、同時成本較合理嘅模型,而唔係預設所有任務都使用能力最強或者最昂貴嘅模型。較簡單嘅工作可以交畀成本較低嘅模型,較複雜嘅任務就提供更高模型能力。公司亦正評估包括開放權重模型在內嘅其他選擇,應用於特定使用場景。1
呢個做法將模型選擇由「一刀切」變成按工作負載決定。當使用規模夠大,即使每個日常請求只節省少量成本,累積落嚟都可以明顯拉低平均每項任務嘅成本。
即使模型支援最多100萬個Token嘅上下文視窗,Uber仍然將互動式工作階段上限設為400,000個Token。1
呢個上限針對嘅,係程式碼代理其中一個主要成本風險:一個工作階段可以不斷累積檔案、工具回傳結果、指示同過往對話紀錄。如果冇清晰界線,探索性較強或者控制不佳嘅工作階段,就可能持續處理愈來愈龐大嘅上下文。
Token上限唔係完全禁止使用代理,而係為最消耗上下文嘅工作階段設下一個可預測嘅天花板,畀工程團隊有清晰控制點去管理用量。
Uber將提示快取(prompt cache)有效期由5分鐘延長至1小時,以配合工程師實際工作習慣:AI工作階段可能閒置超過5分鐘,之後先再繼續工作。1
延長快取重用時間,可以避免系統重複處理同一批上下文。對代理式程式碼工作流程嚟講,同一個程式碼庫或者同一套指示往往會喺一個工作階段內多次被重新讀取,提升快取重用率就可以減少冇必要嘅Token處理,而唔使改變任務本身。
Uber會喺工程師使用嘅終端機內,實時顯示AI工作階段嘅成本。1
咁樣就將用量變成即時工程反饋。工程師唔使等到財務報告出現,先知道某個工作流程好昂貴;佢哋可以喺測試期間睇到成本,必要時調整工作階段、模型或者上下文內容。
更重要係,成本意識被放入產品工作流程入面——而真正影響開支嘅決定,例如提示寫法、重試次數、上下文長度同模型選擇,正正就係喺呢個流程發生。
Uber嘅經驗顯示,控制企業AI開支唔只係做預算管理,亦係一個系統設計問題。
今次個案入面較具持續性嘅控制措施包括:
呢啲措施對AI代理尤其重要,因為代理式工作通常係反覆進行:一次使用者指令,可能引發多輪規劃、工具操作、結果驗證同修正,令總Token消耗比一次性問答更加難預測。
因此,Uber嘅結果應該理解為一個營運效率案例,而唔係證明AI使用量快速增加就冇財務風險。Uber之所以可以令開支大致穩定,係因為佢重新調整咗每次請求同每個工作階段嘅成本結構。對其他企業嚟講,最直接嘅啟示係:擴大AI採用嘅同時,亦要同步建立成本治理,而且由一開始就將用量同成本監察整合入工具之中。
Studio Global AI
此頁麵包含一個有來源支援的答案,您可以在 Studio Global 內繼續。
Uber嘅AI總開支自4月起大致穩定,但AI代理每週請求量較2月增加9.4倍。
Uber嘅AI總開支自4月起大致穩定,但AI代理每週請求量較2月增加9.4倍。 沿用同一AI模型計算,每1,000次請求嘅成本較4月高位下降接近34%,每個工作階段成本亦較6月高位下降52%。
Uber透過按工作配對模型、限制Token用量、延長提示快取,以及向工程師即時顯示成本,控制企業AI尤其係代理式工作流程嘅開支。