自2月以来,Uber每周AI代理请求量增长9.4倍,但AI总开支自4月起基本保持稳定。[1] 在使用同一AI模型的情况下,每1000次请求的成本较4月峰值下降近34%,单次会话成本较6月高点下降52%。[1] Uber将超过70%的代码变更提交交给AI代理处理,工程师每天执行超过3万项代理任务,使用AI工具的员工数量增长超过4倍。[1]
研究答案

Create a landscape editorial hero image for this Studio Global article: How did Uber stabilize its AI spending after exceeding its 2026 AI budget in the first quarter, despite weekly AI-agent requests increasing. Article summary: Uber stabilized spending by treating AI usage as an engineering-cost optimization problem rather than simply limiting adoption. After exceeding its 2026 AI budget in the first quarter, it kept total AI spend roughly flat. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
Uber的AI投入一度超过了2026年的预算,但公司的应对方式并不是简单地收紧权限或限制使用量。相反,Uber把问题当作一个工程成本优化课题:让不同工作负载匹配合适的模型、限制过长上下文、重复利用缓存中的提示词,并让工程师实时看到每次AI会话的成本。1
这套做法帮助Uber在AI使用量持续扩大的情况下,将总AI开支自4月起基本维持稳定。与此同时,自2月以来,公司每周AI代理请求量增长了9.4倍。使用同一AI模型时,每1000次请求的成本较4月峰值下降近34%,单次会话成本较6月高点下降52%。1
成本下降发生在使用量增长的同时,而不是因为员工减少了使用AI。Uber表示,AI代理目前参与了超过70%的代码变更提交;工程师每天执行超过3万项代理任务,使用AI工具的员工数量也增长了4倍以上。1
这组数据说明,Uber降低的不是AI工作的规模,而是每项工作消耗Token和模型算力的方式。换句话说,AI并没有变成免费服务,而是每次请求和每个会话的单位成本下降了。
Uber会根据任务需求,把工作分配给性价比更合适的模型,而不是默认使用能力最强、价格最高的模型。较简单的任务可以交给成本更低的模型,复杂工作则获得更强的模型能力。公司也在针对特定场景评估包括开放权重模型在内的替代方案。1
这让模型选择从“一刀切”的默认设置,变成了基于工作负载的决策。对于大规模企业应用而言,即使每项日常请求只节省一小部分成本,累计后也可能显著降低平均任务成本。
Uber将互动式会话限制在40万Token以内,即使相关模型支持最高100万Token的上下文窗口。1
这项限制针对的是编码代理的典型成本风险:一个会话可能不断累积代码文件、工具返回结果、操作指令以及此前的交互记录。如果没有边界,试验性或控制不佳的会话就可能持续处理越来越多的上下文。
Token上限并不等于停止使用AI代理,而是为最消耗上下文的会话设置了可预测的成本天花板,也为工程团队提供了明确的使用管理抓手。
Uber把提示词缓存的有效时间从5分钟延长到1小时,以更贴合工程师的实际工作节奏。工程师在继续工作前,可能会让一个AI会话闲置超过5分钟;更长的缓存时间有助于避免相同上下文被反复处理。1
在代理式编码流程中,同一个代码仓库、操作指令或任务背景可能在一个会话中被多次调用。提高缓存复用率,可以在不改变任务本身的情况下,减少重复的Token处理。
Uber在工程师的终端中提供AI会话的实时成本信息。1
这相当于把成本管理变成了即时的工程反馈。工程师不必等到财务报告出炉后才发现某个工作流过于昂贵,而是可以在试验过程中看到开支,并根据需要调整会话、模型或上下文。
更重要的是,成本意识被放到了真正发生决策的地方:提示词、重试次数、上下文规模和模型选择,都发生在产品与开发工具的工作流中,而不是事后报表里。
Uber的案例说明,控制企业AI开支不只是预算部门的工作,也是一项系统设计问题。
其中几项更具普适性的做法包括:
这些措施对AI代理尤其重要。与一次性问答不同,代理式工作通常会经历规划、调用工具、验证结果和反复修改等多个环节。一次用户请求可能触发多轮模型调用,Token消耗也因此更难预测。
因此,Uber的结果应被理解为运营效率提升的案例,而不是“AI使用量增长不会带来财务风险”的证明。公司之所以能在使用量快速增长时保持开支基本稳定,是因为它重新设计了每次请求和每个会话的成本结构。
对其他企业而言,最直接的启示是:AI推广与成本治理必须同步推进,并且要从一开始就把成本测量嵌入工具和工作流。只有这样,AI代理的规模化使用才更有可能从短期热潮转变为可持续的企业能力。
Studio Global AI
此页面包含一个有来源支持的答案,您可以在 Studio Global 内继续。
自2月以来,Uber每周AI代理请求量增长9.4倍,但AI总开支自4月起基本保持稳定。[1]
自2月以来,Uber每周AI代理请求量增长9.4倍,但AI总开支自4月起基本保持稳定。[1] 在使用同一AI模型的情况下,每1000次请求的成本较4月峰值下降近34%,单次会话成本较6月高点下降52%。[1]
Uber将超过70%的代码变更提交交给AI代理处理,工程师每天执行超过3万项代理任务,使用AI工具的员工数量增长超过4倍。[1]