El gasto total de Uber en IA se mantuvo prácticamente estable desde abril, mientras las solicitudes semanales de agentes aumentaron 9,4 veces desde febrero. Con el mismo modelo de IA, el coste por cada 1.000 solicitudes cayó casi un 34% desde el máximo de abril y el coste por sesión se redujo un 52% desde el pico de...
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: How did Uber stabilize its AI spending after exceeding its 2026 AI budget in the first quarter, despite weekly AI-agent requests increasing. Article summary: Uber stabilized spending by treating AI usage as an engineering-cost optimization problem rather than simply limiting adoption. After exceeding its 2026 AI budget in the first quarter, it kept total AI spend roughly flat. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
Uber superó inicialmente su presupuesto de IA para 2026, pero no respondió simplemente restringiendo el acceso a las herramientas. En su lugar, trató la IA como un problema de optimización de costes de ingeniería: asignar cada tarea al modelo adecuado, limitar el contexto excesivo, reutilizar prompts almacenados en caché y mostrar a los ingenieros cuánto cuesta cada sesión. 1
Este enfoque ayudó a mantener el gasto total en IA prácticamente estable desde abril, mientras las solicitudes semanales de agentes se multiplicaban por 9,4 desde febrero. Con el mismo modelo de IA, Uber informó de que el coste por cada 1.000 solicitudes cayó casi un 34% desde su máximo de abril y que el coste por sesión bajó un 52% desde el máximo registrado en junio. 1
La mejora de costes se produjo mientras aumentaba la adopción, no porque la empresa redujera el uso. Los agentes de IA ya participaban en más del 70% de los envíos de cambios de código, los ingenieros ejecutaban más de 30.000 tareas de agentes al día y el número de empleados que utilizaban herramientas de IA se había multiplicado por más de cuatro. 1
La combinación de mucho más uso y un gasto prácticamente estable apunta a una reducción del coste unitario. Esto no significa que las cargas de trabajo fueran gratuitas, sino que Uber modificó la forma en que consumía tokens y capacidad de los modelos.
Uber dirige cada trabajo al modelo que puede resolverlo con el mejor equilibrio entre capacidad y coste, en lugar de utilizar por defecto el modelo más potente o caro. Las tareas sencillas pueden enviarse a modelos de menor coste, mientras que los trabajos más exigentes reciben una mayor capacidad de razonamiento. La empresa también está evaluando alternativas, incluidos modelos de pesos abiertos, para casos de uso concretos. 1
Así, la elección del modelo deja de ser una configuración única para convertirse en una decisión basada en la carga de trabajo. A gran escala, incluso pequeños ahorros en solicitudes rutinarias pueden reducir de forma significativa el coste medio por tarea.
Uber establece un límite de 400.000 tokens para las sesiones interactivas, incluso cuando el modelo admite una ventana de contexto de hasta un millón de tokens. 1
El límite aborda uno de los principales riesgos de coste de los agentes de programación: una sesión puede acumular archivos, resultados de herramientas, instrucciones e historial de interacciones repetidas. Sin una frontera clara, las sesiones exploratorias o poco controladas pueden terminar procesando cantidades cada vez mayores de contexto.
Un límite de tokens no elimina el uso de agentes. Establece un techo predecible para las sesiones que consumen más contexto y ofrece a los equipos de ingeniería un punto de control para gestionar el consumo.
Uber amplió la duración de la caché de prompts de cinco minutos a una hora. El cambio buscaba adaptarse mejor a la forma de trabajar de los ingenieros, cuyas sesiones de IA pueden permanecer inactivas más de cinco minutos antes de reanudarse. 1
Reutilizar la caché durante más tiempo evita procesar repetidamente el mismo contexto. En los flujos de programación con agentes, donde un repositorio o unas instrucciones pueden consultarse varias veces durante una sesión, esto reduce el procesamiento innecesario de tokens sin cambiar la tarea.
Uber ofrece a los ingenieros visibilidad en tiempo real sobre el coste de una sesión de IA directamente en sus terminales. 1
La medida convierte el consumo en un bucle de retroalimentación inmediato. En vez de descubrir que un flujo de trabajo fue caro al revisar posteriormente un informe financiero, el ingeniero puede ver el coste mientras experimenta y ajustar la sesión, el modelo o el contexto cuando sea necesario.
También sitúa la conciencia de costes dentro del propio flujo de desarrollo, justo donde se toman las decisiones sobre prompts, reintentos, contexto y selección de modelos.
La experiencia de Uber muestra un principio operativo más amplio: controlar el gasto empresarial en IA no consiste únicamente en elaborar un presupuesto. También es un problema de diseño de sistemas.
Los controles más duraderos de este caso son:
Estos controles son especialmente relevantes para los sistemas agénticos porque su trabajo es iterativo. Una sola petición puede desencadenar varias rondas de planificación, uso de herramientas, verificación y revisión, lo que hace que el consumo total de tokens sea menos predecible que en una interacción puntual de chatbot.
Por eso, los resultados de Uber deben interpretarse como un ejemplo de eficiencia operativa, no como una prueba de que un uso de IA en rápido crecimiento no implique riesgos financieros. La empresa mantuvo el gasto prácticamente estable después de cambiar la economía de cada solicitud y cada sesión. Para otras compañías, la lección es clara: la adopción y el control de costes deben escalar juntos, con la medición integrada en las herramientas desde el principio.
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
El gasto total de Uber en IA se mantuvo prácticamente estable desde abril, mientras las solicitudes semanales de agentes aumentaron 9,4 veces desde febrero.
El gasto total de Uber en IA se mantuvo prácticamente estable desde abril, mientras las solicitudes semanales de agentes aumentaron 9,4 veces desde febrero. Con el mismo modelo de IA, el coste por cada 1.000 solicitudes cayó casi un 34% desde el máximo de abril y el coste por sesión se redujo un 52% desde el pico de junio.
La estrategia combinó selección de modelos según la tarea, límites de tokens, caché de prompts durante más tiempo y visibilidad de costes para los ingenieros.