Uber holdt de samlede AI kostnadene omtrent stabile fra april, selv om ukentlige forespørsler til AI agenter økte 9,4 ganger siden februar. Med samme AI modell falt kostnaden per 1 000 forespørsler med nær 34 prosent fra april toppen, mens kostnaden per økt sank 52 prosent fra juni toppen.
Research answer

Create a landscape editorial hero image for this Studio Global article: How did Uber stabilize its AI spending after exceeding its 2026 AI budget in the first quarter, despite weekly AI-agent requests increasing. Article summary: Uber stabilized spending by treating AI usage as an engineering-cost optimization problem rather than simply limiting adoption. After exceeding its 2026 AI budget in the first quarter, it kept total AI spend roughly flat. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
Uber brukte i utgangspunktet mer på AI enn budsjettet for 2026 la opp til. Selskapet svarte imidlertid ikke bare med å strupe tilgangen. I stedet behandlet Uber AI som et problem innen teknisk kostnadsoptimalisering: Hver oppgave skulle sendes til en passende modell, overdreven kontekst skulle begrenses, gjenbruk av bufrede instrukser skulle økes, og utviklerne skulle få se hva øktene deres kostet. 1
Denne arbeidsmåten bidro til å holde de samlede AI-kostnadene omtrent stabile fra april, samtidig som antallet ukentlige forespørsler til AI-agenter økte 9,4 ganger fra februar. Med samme AI-modell rapporterte Uber at kostnaden per 1 000 forespørsler falt nær 34 prosent fra toppen i april, mens kostnaden per økt sank 52 prosent fra toppnivået i juni. 1
Kostnadsforbedringen kom ikke fordi bruken gikk ned. Tvert imot sto AI-agenter for mer enn 70 prosent av alle innsendinger av kodeendringer, utviklerne kjørte over 30 000 agentoppgaver daglig, og antallet ansatte som brukte AI-verktøy, ble mer enn firedoblet. 1
Kombinasjonen av langt høyere bruk og omtrent stabile kostnader peker mot lavere enhetskostnad. Det betyr ikke at arbeidsoppgavene ble gratis. Det betyr at Uber endret hvordan tokens og modellkapasitet ble brukt.
Uber sender oppgaver til den modellen som kan løse dem til en god kostnad, i stedet for å bruke den kraftigste eller dyreste modellen som standard. Enklere oppgaver kan sendes til rimeligere modeller, mens mer krevende arbeid får tilgang til større modellkapasitet. Selskapet vurderer også alternativer, blant annet modeller med åpne vekter, for bestemte bruksområder. 1
Dermed blir modellvalget et spørsmål om arbeidsbelastning, ikke en standardinnstilling som brukes på alt. Når volumet er høyt, kan selv små besparelser på rutineoppgaver få stor betydning for gjennomsnittskostnaden per oppgave.
Uber begrenser interaktive økter til 400 000 tokens, selv når modellen støtter en kontekstvindu på opptil én million tokens. 1
Grensen håndterer en av kostnadsrisikoene ved kodeagenter: En økt kan samle filer, verktøyresultater, instrukser og historikk fra mange runder med samhandling. Uten en grense kan utforskende eller dårlig styrte økter fortsette å behandle stadig større mengder kontekst.
En token-grense fjerner ikke agentbruken. Den setter et forutsigbart tak for de mest konteksttunge øktene og gir utviklingsteamene et konkret styringspunkt.
Uber økte levetiden for prompt-cachen fra fem minutter til én time. Endringen skulle passe bedre med utviklernes faktiske arbeidsmønster, der en AI-økt kan stå ubrukt i mer enn fem minutter før arbeidet fortsetter. 1
Lengre gjenbruk av cache kan hindre at den samme konteksten behandles på nytt. I agentbaserte kodeprosesser, der det samme kodearkivet eller de samme instruksene kan hentes frem flere ganger i løpet av en økt, kan dette redusere unødvendig tokenbehandling uten å endre selve oppgaven.
Uber viser utviklerne den løpende kostnaden for en AI-økt direkte i terminalen. 1
Det gjør bruken til en umiddelbar tilbakemeldingssløyfe. I stedet for å oppdage en dyr arbeidsflyt først i en senere økonomirapport, kan utvikleren se kostnaden mens han eller hun eksperimenterer – og justere økten, modellen eller konteksten ved behov.
Tiltaket flytter også kostnadsbevisstheten inn i selve arbeidsflyten. Det er der beslutningene om instrukser, nye forsøk, kontekst og modellvalg faktisk tas.
Ubers erfaring illustrerer et bredere prinsipp: Å kontrollere AI-kostnader i større virksomheter handler ikke bare om budsjettering. Det handler også om systemdesign.
De mest varige kontrollene i dette eksempelet er:
Dette er særlig relevant for AI-agenter fordi arbeidet er iterativt. Én forespørsel kan føre til flere runder med planlegging, verktøybruk, kontroll og revisjon. Det gjør det totale tokenforbruket mindre forutsigbart enn ved en enkel chatforespørsel.
Ubers resultater bør derfor leses som et eksempel på operasjonell effektivisering – ikke som et bevis på at raskt økende AI-bruk er uten økonomisk risiko. Selskapet holdt kostnadene omtrent stabile først etter at det endret økonomien i hver forespørsel og økt. For andre virksomheter er lærdommen tydelig: Skal AI-bruken skaleres, må kostnadsstyringen skaleres samtidig, med måling bygget inn i verktøyene fra starten.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Uber holdt de samlede AI kostnadene omtrent stabile fra april, selv om ukentlige forespørsler til AI agenter økte 9,4 ganger siden februar.
Uber holdt de samlede AI kostnadene omtrent stabile fra april, selv om ukentlige forespørsler til AI agenter økte 9,4 ganger siden februar. Med samme AI modell falt kostnaden per 1 000 forespørsler med nær 34 prosent fra april toppen, mens kostnaden per økt sank 52 prosent fra juni toppen.
Erfaringen viser hvorfor virksomheter trenger kostnadsstyring innebygd i AI verktøyene – særlig når AI agenter kan generere mange modellkall og store kontekster.