Celkové výdaje Uberu na AI zůstaly od dubna přibližně stabilní, přestože počet týdenních požadavků AI agentů od února vzrostl 9,4násobně. Při použití stejného modelu klesla cena za 1 000 požadavků téměř o 34 % oproti dubnovému maximu a cena jedné relace o 52 % oproti červnovému maximu.
Research answer

Create a landscape editorial hero image for this Studio Global article: How did Uber stabilize its AI spending after exceeding its 2026 AI budget in the first quarter, despite weekly AI-agent requests increasing. Article summary: Uber stabilized spending by treating AI usage as an engineering-cost optimization problem rather than simply limiting adoption. After exceeding its 2026 AI budget in the first quarter, it kept total AI spend roughly flat. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
Uber se po překročení rozpočtu na AI pro rok 2026 nerozhodl jednoduše přiškrtit přístup k nástrojům. K problému přistoupil jako k optimalizaci nákladů na úrovni vývoje: každou úlohu směruje k vhodnému modelu, omezuje příliš rozsáhlý kontext, znovu využívá uložené prompty a vývojářům ukazuje, kolik jejich relace právě stojí. 1
Tento přístup pomohl udržet celkové výdaje na AI od dubna přibližně stabilní, zatímco počet týdenních požadavků AI agentů vzrostl od února 9,4násobně. Při použití stejného modelu Uber uvádí, že cena za 1 000 požadavků klesla téměř o 34 % oproti dubnovému maximu a cena jedné relace se snížila o 52 % oproti červnovému maximu. 1
Úspory nevznikly tím, že by adopce AI klesla. Naopak: AI agenti se podíleli na více než 70 % odevzdaných změn kódu, vývojáři spouštěli přes 30 000 úloh agentů denně a počet zaměstnanců používajících AI nástroje se více než zečtyřnásobil. 1
Kombinace výrazně vyššího využití a přibližně stabilních výdajů ukazuje na pokles jednotkových nákladů. Neznamená to, že práce AI se stala bezplatnou. Uber změnil způsob, jakým spotřebovává tokeny a kapacitu modelů.
Uber neposílá všechny požadavky automaticky k nejvýkonnějšímu a nejdražšímu modelu. Úlohy směruje k modelu, který zvládne požadovanou práci za co nejlepší cenu. Jednodušší úkoly tak mohou připadnout levnějším modelům, zatímco složitější práce dostane větší výpočetní kapacitu. Firma zároveň zkoumá alternativy včetně modelů s otevřenými vahami pro konkrétní případy použití. 1
Výběr modelu se tím mění z univerzálního výchozího nastavení na rozhodnutí podle typu úlohy. Ve velkém měřítku mohou i malé úspory u rutinních požadavků výrazně snížit průměrnou cenu jedné operace.
Uber omezuje interaktivní relace na 400 000 tokenů, i když použitý model podporuje kontext dlouhý až jeden milion tokenů. 1
Jde o reakci na jedno z hlavních nákladových rizik programovacích agentů. Během relace se mohou hromadit soubory, výsledky nástrojů, instrukce i historie opakovaných interakcí. Bez pevné hranice by experimentální nebo špatně řízená relace mohla postupně zpracovávat stále větší množství kontextu.
Limit tokenů používání agentů nezastavuje. Vytváří předvídatelný strop pro relace s nejvyšší spotřebou kontextu a dává vývojovým týmům konkrétní nástroj pro řízení nákladů.
Uber prodloužil dobu uchování prompt cache z pěti minut na jednu hodinu. Změna lépe odpovídá tomu, jak vývojáři pracují: relace může být déle než pět minut pozastavená, než se k ní uživatel vrátí. 1
Delší využití cache může zabránit opakovanému zpracování stejného kontextu. U programovacích agentů, kteří se během jedné práce opakovaně vracejí ke stejnému repozitáři nebo instrukcím, tak lze snížit zbytečnou spotřebu tokenů, aniž by se měnila samotná úloha.
Uber vývojářům zobrazuje aktuální náklady AI relace přímo v terminálu. 1
Z nákladů se tak stává okamžitá zpětná vazba. Vývojář nemusí na drahý pracovní postup přijít až z pozdějšího finančního reportu. Náklady vidí při experimentování a může podle nich upravit relaci, zvolený model nebo množství kontextu.
Tento přístup přesouvá kontrolu nákladů přímo do pracovního prostředí, kde skutečně vznikají rozhodnutí o promptech, opakování požadavků, kontextu a volbě modelu.
Zkušenost Uberu ukazuje širší princip: řízení výdajů na podnikovou AI není jen otázkou rozpočtu. Je také problémem návrhu a provozu systémů.
Nejdůležitější opatření v tomto případě jsou:
Tato opatření jsou obzvlášť důležitá u AI agentů, protože jejich práce je iterativní. Jeden požadavek může vést k několika kolům plánování, používání nástrojů, ověřování a oprav. Celková spotřeba tokenů je proto méně předvídatelná než u jednorázové konverzace.
Výsledky Uberu je proto vhodné chápat jako příklad provozní efektivity, nikoli jako důkaz, že rychlý růst využití AI nepředstavuje finanční riziko. Firma udržela výdaje přibližně stabilní až poté, co změnila ekonomiku jednotlivých požadavků a relací. Pro ostatní podniky je závěr jednoduchý: pokud chtějí AI rozšiřovat, musí s jejím využitím od začátku škálovat i kontrolu nákladů a měření zabudovat přímo do používaných nástrojů.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Celkové výdaje Uberu na AI zůstaly od dubna přibližně stabilní, přestože počet týdenních požadavků AI agentů od února vzrostl 9,4násobně.
Celkové výdaje Uberu na AI zůstaly od dubna přibližně stabilní, přestože počet týdenních požadavků AI agentů od února vzrostl 9,4násobně. Při použití stejného modelu klesla cena za 1 000 požadavků téměř o 34 % oproti dubnovému maximu a cena jedné relace o 52 % oproti červnovému maximu.
Uber využívá výběr modelu podle typu úlohy, limit 400 000 tokenů na interaktivní relaci, delší prompt cache a zobrazení průběžných nákladů přímo v terminálu.