A Uber manteve os gastos totais com IA praticamente estáveis desde abril, embora as solicitações semanais de agentes tenham crescido 9,4 vezes desde fevereiro. Usando o mesmo modelo de IA, a empresa reduziu em quase 34% o custo por 1.000 solicitações em relação ao pico de abril e em 52% o custo por sessão desde o pi...
Resposta de pesquisa

Create a landscape editorial hero image for this Studio Global article: How did Uber stabilize its AI spending after exceeding its 2026 AI budget in the first quarter, despite weekly AI-agent requests increasing. Article summary: Uber stabilized spending by treating AI usage as an engineering-cost optimization problem rather than simply limiting adoption. After exceeding its 2026 AI budget in the first quarter, it kept total AI spend roughly flat. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
A Uber chegou a ultrapassar o orçamento de IA previsto para 2026, mas não respondeu simplesmente restringindo o acesso às ferramentas. Em vez disso, tratou o problema como uma questão de eficiência de engenharia: cada tarefa passou a ser direcionada ao modelo mais adequado, o excesso de contexto foi limitado, prompts puderam ser reutilizados e os engenheiros passaram a acompanhar quanto suas sessões custavam. 1
Esse modelo operacional ajudou a manter os gastos totais com IA praticamente estáveis desde abril, enquanto o número semanal de solicitações a agentes cresceu 9,4 vezes desde fevereiro. Usando o mesmo modelo de IA, a Uber informou que o custo por 1.000 solicitações caiu quase 34% em relação ao pico de abril, enquanto o custo por sessão recuou 52% ante o máximo registrado em junho. 1
A redução de custos aconteceu junto com a expansão da adoção — e não por causa de uma retração no uso. Os agentes já respondiam por mais de 70% dos envios de alterações de código, os engenheiros executavam mais de 30 mil tarefas com agentes por dia e o número de funcionários que utilizavam ferramentas de IA havia mais que quadruplicado. 1
A combinação de uso muito maior com gastos relativamente estáveis indica uma queda no custo unitário. Isso não significa que as cargas de trabalho tenham se tornado gratuitas. O que mudou foi a maneira como tokens e capacidade dos modelos passaram a ser consumidos.
A Uber envia cada tarefa ao modelo que consegue realizá-la com a melhor relação entre capacidade e custo, em vez de usar automaticamente o modelo mais avançado — e mais caro — disponível. Tarefas simples podem ser encaminhadas a modelos de menor custo, enquanto trabalhos mais complexos recebem mais capacidade. A empresa também avalia alternativas, incluindo modelos de pesos abertos, para casos de uso específicos. 1
Na prática, a escolha do modelo deixa de ser uma configuração única para toda a empresa e passa a depender da carga de trabalho. Em grande escala, pequenas economias em solicitações rotineiras podem alterar significativamente o custo médio por tarefa.
A Uber estabeleceu um teto de 400 mil tokens para sessões interativas, mesmo quando o modelo utilizado aceita uma janela de contexto de até 1 milhão de tokens. 1
O limite enfrenta um dos principais riscos de custo dos agentes de programação: ao longo de uma sessão, podem se acumular arquivos, resultados de ferramentas, instruções e histórico repetido de interações. Sem uma barreira, sessões exploratórias ou mal controladas podem continuar processando quantidades cada vez maiores de contexto.
Um teto de tokens não elimina o uso de agentes. Ele cria um limite previsível para as sessões mais intensivas em contexto e oferece às equipes de engenharia um ponto de controle para administrar o consumo.
A Uber ampliou a duração do cache de prompts de cinco minutos para uma hora. A mudança foi desenhada para refletir melhor a rotina dos engenheiros, já que uma sessão de IA pode ficar parada por mais de cinco minutos antes de ser retomada. 1
Manter o cache por mais tempo permite reutilizar um contexto já processado, em vez de submetê-lo novamente ao modelo. Em fluxos de programação com agentes — nos quais o mesmo repositório ou conjunto de instruções pode ser revisitado — isso reduz o processamento desnecessário de tokens sem alterar a tarefa em si.
A Uber mostra aos engenheiros, diretamente em seus terminais, o custo acumulado de uma sessão de IA em tempo real. 1
A medida transforma o uso em um ciclo imediato de feedback. Em vez de descobrir que um fluxo ficou caro apenas em um relatório financeiro posterior, o profissional consegue acompanhar o gasto enquanto experimenta e ajustar a sessão, o modelo ou o volume de contexto quando necessário.
Essa abordagem coloca a preocupação com custos dentro do fluxo de desenvolvimento — justamente onde são tomadas decisões sobre prompts, novas tentativas, contexto e escolha de modelos.
A experiência da Uber aponta para um princípio mais amplo: controlar os gastos corporativos com IA não é apenas uma tarefa de orçamento. Também é um problema de arquitetura e operação de sistemas.
Os controles mais importantes do caso são:
Esses controles são especialmente relevantes para agentes de IA porque seu trabalho é iterativo. Uma única solicitação pode desencadear várias rodadas de planejamento, uso de ferramentas, verificação e revisão. Por isso, o consumo total de tokens tende a ser menos previsível do que em uma interação única de chatbot.
Os resultados divulgados pela Uber devem ser lidos como um exemplo de eficiência operacional — não como uma prova de que o crescimento acelerado do uso de IA não oferece risco financeiro. A empresa só conseguiu manter os gastos relativamente estáveis depois de mudar a economia de cada solicitação e de cada sessão.
Para outras empresas, a lição é direta: adoção e governança de custos precisam crescer juntas, com métricas incorporadas às próprias ferramentas desde o início.
Studio Global AI
Esta página inclui uma resposta baseada na fonte que você pode continuar em Studio Global.
A Uber manteve os gastos totais com IA praticamente estáveis desde abril, embora as solicitações semanais de agentes tenham crescido 9,4 vezes desde fevereiro.
A Uber manteve os gastos totais com IA praticamente estáveis desde abril, embora as solicitações semanais de agentes tenham crescido 9,4 vezes desde fevereiro. Usando o mesmo modelo de IA, a empresa reduziu em quase 34% o custo por 1.000 solicitações em relação ao pico de abril e em 52% o custo por sessão desde o pico de junho.
A estratégia combinou escolha de modelos conforme a tarefa, limite de 400.000 tokens por sessão, cache de prompts por mais tempo e exibição do custo em tempo real para engenheiros.