우버는 2월 이후 주간 AI 에이전트 요청이 9.4배 늘었지만, 4월 이후 전체 AI 지출을 대체로 안정적으로 유지했습니다. 같은 AI 모델을 기준으로 요청 1,000건당 비용은 4월 최고점보다 약 34%, 세션당 비용은 6월 고점보다 52% 낮아졌습니다.
연구 답변

Create a landscape editorial hero image for this Studio Global article: How did Uber stabilize its AI spending after exceeding its 2026 AI budget in the first quarter, despite weekly AI-agent requests increasing. Article summary: Uber stabilized spending by treating AI usage as an engineering-cost optimization problem rather than simply limiting adoption. After exceeding its 2026 AI budget in the first quarter, it kept total AI spend roughly flat. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
우버는 2026년 AI 예산이 초기에 예상치를 넘어섰지만, 사용량을 단순히 제한하는 방식으로 대응하지 않았습니다. 대신 AI를 엔지니어링 비용을 최적화해야 하는 시스템 문제로 보고, 업무에 맞는 모델을 선택하고 과도한 컨텍스트를 제한하며 반복 프롬프트를 캐시하고 엔지니어에게 세션 비용을 실시간으로 보여주는 방식을 택했습니다. 1
그 결과 2월 이후 주간 AI 에이전트 요청은 9.4배 증가했지만, 전체 AI 지출은 4월 이후 대체로 안정적으로 유지됐습니다. 같은 AI 모델을 사용했을 때 요청 1,000건당 비용은 4월 최고점보다 약 34% 낮아졌고, 세션당 비용은 6월 고점 대비 52% 감소했습니다. 1
비용 개선은 AI 도입을 위축시킨 결과가 아니었습니다. AI 에이전트는 코드 변경 제출의 70% 이상에 관여했고, 엔지니어들은 매일 3만 건이 넘는 에이전트 작업을 실행했습니다. AI 도구를 사용하는 직원 수도 4배 이상 늘었습니다. 1
즉, 훨씬 많은 작업을 처리하면서도 총지출은 비슷한 수준에 머문 셈입니다. 이는 AI 작업이 무료가 됐다는 뜻이 아니라, 토큰과 모델 연산 능력을 소비하는 방식이 바뀌면서 작업 단위 비용이 낮아졌다는 의미입니다.
우버는 모든 요청에 가장 강력하고 비싼 모델을 기본으로 적용하지 않습니다. 필요한 성능을 충족하면서 비용이 가장 적절한 모델로 업무를 보내는 방식입니다. 단순한 작업은 저비용 모델로 처리하고, 더 높은 추론 능력이 필요한 작업에는 그에 맞는 모델 용량을 배정합니다. 특정 용도에 사용할 수 있는 오픈 웨이트 모델도 검토하고 있습니다. 1
이 방식에서는 모델 선택이 일괄적인 기본 설정이 아니라 업무별 비용·성능 판단이 됩니다. 규모가 커질수록 반복적인 요청에서 조금씩 절감한 비용도 전체 평균 비용을 크게 낮출 수 있습니다.
우버는 모델이 최대 100만 토큰의 컨텍스트 창을 지원하더라도 대화형 세션을 40만 토큰으로 제한합니다. 1
코딩 에이전트의 세션에는 파일, 도구 실행 결과, 지시사항, 이전 대화 기록이 계속 쌓일 수 있습니다. 별도 경계가 없으면 탐색적인 작업이나 관리되지 않은 세션이 점점 더 많은 컨텍스트를 처리하게 됩니다.
토큰 상한은 에이전트 사용 자체를 막는 조치가 아닙니다. 컨텍스트가 특히 많이 쌓이는 세션에 예측 가능한 상한선을 두고, 엔지니어링 조직이 사용량을 관리할 수 있는 통제 지점을 만드는 방법입니다.
우버는 프롬프트 캐시의 유지 시간을 5분에서 1시간으로 늘렸습니다. 엔지니어가 작업을 잠시 중단했다가 5분 이상 지난 뒤 같은 AI 세션으로 돌아오는 실제 업무 패턴을 반영한 조치입니다. 1
프롬프트 캐시는 이미 처리한 컨텍스트를 일정 시간 재사용하는 방식입니다. 같은 저장소나 지시사항을 반복해서 확인하는 에이전트 코딩 과정에서 동일한 내용을 매번 처음부터 처리하지 않도록 해, 업무 내용은 바꾸지 않으면서 불필요한 토큰 처리를 줄일 수 있습니다.
우버는 엔지니어가 터미널에서 AI 세션의 누적 비용을 실시간으로 확인할 수 있도록 했습니다. 1
이렇게 하면 비용 관리가 사후 재무 보고가 아니라 개발 과정의 즉각적인 피드백으로 바뀝니다. 엔지니어는 실험적인 에이전트 루프가 예상보다 비싸지는 순간 세션을 중단하거나, 모델과 컨텍스트를 조정할 수 있습니다.
프롬프트, 재시도, 컨텍스트, 모델 선택에 관한 결정이 실제로 이뤄지는 제품 사용 화면 안에 비용 정보를 배치했다는 점도 중요합니다.
우버의 사례는 기업 AI 비용 관리가 단순한 예산 편성 문제가 아니라 시스템 설계 문제이기도 하다는 점을 보여줍니다.
주요 통제 수단은 다음과 같습니다.
이런 통제는 특히 AI 에이전트에 중요합니다. 에이전트 작업은 한 번의 질문과 한 번의 답변으로 끝나지 않고, 계획 수립과 도구 호출, 결과 확인, 수정 작업을 반복합니다. 그만큼 일반적인 일회성 챗봇 대화보다 전체 토큰 사용량을 예측하기 어렵습니다.
따라서 우버의 성과를 AI 사용량이 빠르게 늘어도 재정적 위험이 사라진 사례로 해석해서는 안 됩니다. 우버는 요청과 세션 각각의 비용 구조를 바꾼 뒤에야 지출을 안정화할 수 있었습니다. 다른 기업이 얻을 수 있는 교훈은 분명합니다. AI 도입을 확대하려면 처음부터 업무별 모델 선택, 토큰·컨텍스트 관리, 캐싱, 단위 비용 측정을 도구 안에 함께 설계해야 합니다.
Studio Global AI
이 페이지에는 Studio Global 내에서 계속할 수 있는 소스 기반 답변이 포함되어 있습니다.
우버는 2월 이후 주간 AI 에이전트 요청이 9.4배 늘었지만, 4월 이후 전체 AI 지출을 대체로 안정적으로 유지했습니다.
우버는 2월 이후 주간 AI 에이전트 요청이 9.4배 늘었지만, 4월 이후 전체 AI 지출을 대체로 안정적으로 유지했습니다. 같은 AI 모델을 기준으로 요청 1,000건당 비용은 4월 최고점보다 약 34%, 세션당 비용은 6월 고점보다 52% 낮아졌습니다.
핵심은 업무별 모델 선택, 토큰·컨텍스트 제한, 프롬프트 캐시 확대, 실시간 비용 가시화였습니다. 이는 반복 호출과 긴 컨텍스트로 비용이 커지기 쉬운 AI 에이전트 운영에 중요한 시사점을 줍니다.