Uberin tekoälyn kokonaiskulut pysyivät suunnilleen ennallaan huhtikuusta lähtien, vaikka AI agenttien viikoittaiset pyynnöt kasvoivat helmikuusta 9,4 kertaisiksi. Samaa tekoälymallia käytettäessä tuhannen pyynnön hinta laski lähes 34 prosenttia huhtikuun huipusta ja istuntokohtainen kustannus 52 prosenttia kesäkuun...
Research answer

Create a landscape editorial hero image for this Studio Global article: How did Uber stabilize its AI spending after exceeding its 2026 AI budget in the first quarter, despite weekly AI-agent requests increasing. Article summary: Uber stabilized spending by treating AI usage as an engineering-cost optimization problem rather than simply limiting adoption. After exceeding its 2026 AI budget in the first quarter, it kept total AI spend roughly flat. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
Uberin tekoälykulut karkasivat alun perin vuoden 2026 budjetin yli, mutta yhtiö ei ratkaissut tilannetta yksinkertaisesti rajoittamalla käyttöä. Sen sijaan se käsitteli tekoälyä ennen kaikkea ohjelmistosuunnittelun kustannusoptimoinnin ongelmana: jokainen työ ohjataan sopivalle mallille, liian pitkää kontekstia rajoitetaan, toistuvia prompteja hyödynnetään välimuistista ja insinööreille näytetään, mitä heidän AI-istuntonsa maksaa. 1
Tämän toimintamallin ansiosta tekoälyn kokonaiskulut pysyivät pääosin vakaina huhtikuusta lähtien, vaikka AI-agenttien viikoittaisten pyyntöjen määrä kasvoi helmikuusta 9,4-kertaiseksi. Samaa tekoälymallia käytettäessä Uber raportoi tuhannen pyynnön kustannuksen laskeneen lähes 34 prosenttia huhtikuun huipusta. Yhden istunnon kustannus puolestaan oli 52 prosenttia alempi kuin kesäkuun korkeimmalla tasolla. 1
Kustannusparannukset syntyivät samaan aikaan, kun käyttö laajeni, eivätkä ne johtuneet käyttöönoton hidastumisesta. AI-agentit vastasivat yli 70 prosentista koodimuutosten lähetyksistä, insinöörit suorittivat yli 30 000 agenttitehtävää päivässä ja tekoälytyökaluja käyttävien työntekijöiden määrä yli nelinkertaistui. 1
Yhdistelmä kertoo yksikkökustannusten laskusta. Työkuormat eivät muuttuneet ilmaisiksi, vaan Uber muutti tapaa, jolla tokeneita ja mallien laskentakapasiteettia käytetään.
Uber ei käytä oletuksena tehokkainta tai kalleinta mallia jokaiseen tehtävään. Työ ohjataan mallille, joka pystyy hoitamaan sen vaaditulla tasolla mahdollisimman edullisesti. Yksinkertaisemmat tehtävät voidaan antaa edullisemmille malleille, kun taas vaativammat työt saavat käyttöönsä enemmän mallikapasiteettia. Yhtiö arvioi myös vaihtoehtoja, kuten avoimilla painoilla julkaistuja malleja, tiettyihin käyttötarkoituksiin. 1
Mallin valinnasta tulee näin työkuormaan perustuva ratkaisu yhden kaikille sopivan oletusasetuksen sijaan. Suuressa mittakaavassa jo pienet säästöt rutiinipyyntöä kohden voivat vaikuttaa merkittävästi organisaation keskimääräiseen tehtäväkohtaiseen kustannukseen.
Uber rajoittaa vuorovaikutteiset istunnot 400 000 tokeniin, vaikka käytetty malli tukisi jopa miljoonan tokenin konteksti-ikkunaa. 1
Rajoitus puuttuu yhteen koodausagenttien kustannusriskiin: istuntoon voi kertyä tiedostoja, työkalujen palautteita, ohjeita ja toistuvaa keskusteluhistoriaa. Ilman ylärajaa kokeileva tai huonosti hallittu istunto voi käsitellä jatkuvasti suurempaa määrää kontekstia.
Tokeniraja ei poista agenttien käyttöä. Se luo ennakoitavan katon kaikkein kontekstiraskaimmille istunnoille ja antaa kehitystiimeille selkeän keinon hallita kulutusta.
Uber pidensi prompt-välimuistin kestoa viidestä minuutista yhteen tuntiin. Muutos vastaa paremmin insinöörien työskentelyä, jossa AI-istunto saattaa olla käyttämättä yli viiden minuutin ajan ennen työn jatkumista. 1
Kun samaa välimuistissa olevaa kontekstia voidaan hyödyntää pidempään, sitä ei tarvitse käsitellä toistuvasti alusta lähtien. Koodausagenteissa sama repositorio tai samat ohjeet voivat tulla vastaan useita kertoja yhden työskentelyjakson aikana. Välimuistin tehokkaampi hyödyntäminen vähentää tällöin turhaa tokenien käsittelyä muuttamatta itse tehtävää.
Uber näyttää insinööreille AI-istunnon reaaliaikaiset kustannukset päätelaitteen komentorivillä. 1
Näin käytöstä syntyy välitön suunnittelun palautesilmukka. Kallista työnkulkua ei tarvitse huomata vasta myöhemmästä talousraportista, vaan insinööri voi nähdä hinnan kokeilun aikana ja muuttaa tarvittaessa istuntoa, mallia tai käytettävää kontekstia.
Kustannustietoisuus tuodaan siten osaksi tuotteen käyttökokemusta – juuri siihen vaiheeseen, jossa päätetään prompteista, uusintayrityksistä, kontekstista ja mallin valinnasta.
Uberin esimerkki havainnollistaa laajempaa periaatetta: yritysten tekoälykulujen hallinta ei ole vain budjetointia. Se on myös järjestelmäsuunnittelua.
Esimerkissä keskeiset hallintakeinot ovat:
Nämä keinot ovat erityisen tärkeitä AI-agenteissa, koska niiden työskentely on iteratiivista. Yksi käyttäjän pyyntö voi käynnistää useita suunnittelu-, työkalu-, tarkistus- ja korjauskierroksia. Siksi tokenien kokonaiskulutus on vaikeammin ennakoitavissa kuin kertaluonteisessa chatbot-keskustelussa.
Uberin tulosta ei pidä tulkita todisteeksi siitä, ettei nopeasti kasvava tekoälyn käyttö aiheuta taloudellista riskiä. Kulut pysyivät vakaana vasta sen jälkeen, kun yhtiö muutti pyyntöjen ja istuntojen taloudellista rakennetta. Muille yrityksille opetus on selkeä: tekoälyn käyttöönottoa ja kustannusten hallintaa on kasvatettava rinnakkain, ja mittarit kannattaa rakentaa työkaluihin alusta alkaen.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Uberin tekoälyn kokonaiskulut pysyivät suunnilleen ennallaan huhtikuusta lähtien, vaikka AI agenttien viikoittaiset pyynnöt kasvoivat helmikuusta 9,4 kertaisiksi.
Uberin tekoälyn kokonaiskulut pysyivät suunnilleen ennallaan huhtikuusta lähtien, vaikka AI agenttien viikoittaiset pyynnöt kasvoivat helmikuusta 9,4 kertaisiksi. Samaa tekoälymallia käytettäessä tuhannen pyynnön hinta laski lähes 34 prosenttia huhtikuun huipusta ja istuntokohtainen kustannus 52 prosenttia kesäkuun huipusta.
Uber ohjasi tehtäviä tarkoitukseen sopiville malleille, rajoitti istunnot 400 000 tokeniin, pidensi prompt välimuistin käyttöaikaa ja toi kulut näkyviin insinöörien päätelaitteille.